6月12日
09:25
09:25官方账号arXiv cs.AI@Jiwen Liu, Shujuan Li, Zhixue Fang, Xiaohan Li, Yan Zhou, Zijie Meng, Zhimin Zhang, Yawen Luo, Guoxin Zhang, Yu-Shen Liu, Pengfei Wan
OmniDirector 提出了一种通用相机运动表示方法,将相机参数编码为网格运动视频,从而支持多镜头视频生成。该框架在百万级相机网格-视频对上训练,能够协调角色、动作和相机,提供导演级别的控制。它设计了一种分层提示扩展代理,通过理解信号关系系统描述相机运动和视觉内容,实现不同控制信号的和谐集成。实验表明,OmniDirector 在复杂相机运动克隆任务上表现优异,解决了现有方法依赖配对数据且性能不佳的问题。
推荐理由:做视频生成和相机运动控制的团队终于有了一个无需配对数据就能克隆多镜头相机运动的方案——OmniDirector 用网格运动视频统一了相机表示,直接在百万级数据上训练,效果比依赖合成配对数据的方法好很多,做视频编辑和影视制作的开发者值得关注。
6月10日
6月9日
13:11
13:11官方账号arXiv cs.LG@Wayne King, Zeyue Xue, Yuxuan Bian, Jie Huang, Haoran Li, Yaowei Li, Yaofeng Su, Yuming Li, Haoyu Wang, Shiyi Zhang, Songchun Zhang, Yuwei Niu, Sihan Xu, Junhao Zhuang, Haoyang Huang, Nan Duan
Echo-Memory 是一项针对动作条件世界模型中记忆机制的受控研究。这类模型根据首帧、文本提示和相机动作序列生成多段视频,但其主要失败点往往是记忆而非局部图像合成:当相机离开再返回时,场景或关键物体可能悄然改变。现有记忆设计难以比较,因为增益与骨干网络、训练、检索和评估差异纠缠不清。Echo-Memory 固定了动作到视频的接口,仅改变历史信息的存储和读取方式,在共享的视频扩散骨干、优化器、相机动作表示、采样器和评估流程下,比较了原始上下文、基于压缩的记忆、不同读取路径的空间摘要以及状态空间循环。研究通过三分支协议(回放质量、域内循环重访和开放域返回探测)评估记忆,发现回放保真度不足以作为记住世界的代理指标。主要结论包括:原始上下文是强大的容量基线,能显著提升开放域返回性能;紧凑性不能替代容量;块状状态空间循环是最强的开放域返回机制。
推荐理由:做视频生成或世界模型研究的团队,这篇论文帮你拆解了记忆机制中容量、压缩、读取和循环四个关键维度,看完能直接指导你的模型设计。
6月6日
6月5日
6月4日
16:30
6月3日
16:11
16:11IT之家博客/媒体
字节跳动火山引擎的 MaaS 业务营收目标在 2026 年已上调至 150 亿元,是 2025 年实际营收的 10 倍。其中,视频生成模型 Seedance 2.0 单月营收已超过 10 亿元,且仍在增长,而该模型 API 尚未在海外全量上线。Seedance 2.0 在多项指标上超越海外顶尖视频模型,字节还计划发布质量提升 20% 的 2.1 版本。这一数据表明,字节在 AI 视频生成领域的商业化能力正在快速释放。
事件专题

推荐理由:视频生成模型商业化迎来里程碑——Seedance 2.0 单月营收超 10 亿,说明 AI 视频 API 已从概念走向真金白银。做视频生成、内容创作或云服务的团队值得关注,字节的定价和增长策略可能成为行业风向标。
6月2日
11:11
11:11官方账号arXiv cs.AI@Jingyun Liang, Min Wei, Shikai Li, Yizeng Han, Hangjie Yuan, Lei Sun, Weihua Chen, Fan Wang
该研究提出一种无需渲染的框架,通过将3D人体网格压缩为token,直接输入DiT架构的视频扩散模型,实现精确的人体运动控制。相比依赖2D渲染引导的现有方法,该方法避免了视角依赖伪影和轨迹-姿态不匹配问题。实验表明,该框架在人体运动控制基准上表现优异,证明视频扩散模型通过网格token化能更好地理解3D结构。这项工作为3D感知视频生成提供了新思路。
推荐理由:做视频生成或3D人体动画的团队终于有了不依赖渲染的精准控制方案——直接压缩3D网格token,避免2D引导的伪影问题,建议做运动控制或虚拟人应用的开发者点开看看。
6月1日
5月31日
09:03
09:03lmarena.ai@lmarena_ai
72°
xAI 的 Grok-Imagine-Video-1.5-Preview 在图像转视频竞技场中排名第一,相比前代 Grok-Imagine-Video 提升了 52 分,超越了 Seedance-2.0 和 HappyHorse 等顶级模型。该模型支持 720p 分辨率输出,标志着 xAI 在视频生成领域的重大突破。这一进展表明 AI 视频生成竞争正加速,xAI 已跻身第一梯队。

推荐理由:做视频生成或关注多模态模型的开发者值得关注——Grok 视频模型首次超越主流竞品,意味着又多了一个高性价比选择,建议去竞技场实测对比效果。
5月30日
02:18
5月29日