8月25日
8月23日
17:03
17:03量子位@量子位的朋友们
无界动力在WRC主论坛及多场同期活动中深度参与,展示其世界模型技术,强调其在现实生产力中的应用潜力。活动涵盖技术研讨、产品展示等环节,旨在推动行业交流与合作。
推荐理由:无界动力在WRC活动中展示世界模型技术,了解其在现实生产力中的应用前景,值得行业关注。
8月21日
10:08
10:08官方账号arXiv cs.LG@Taoyong Cui, Pheng Ann Heng, Wanli Ouyang
精选
Meta AI 提出一种名为 Orthogonal JEPA 的新框架。该框架通过正交预测分解来学习潜在世界模型。它使用正交基矩阵将目标状态分解为多个组件,并为每个组件设置专用预测分支。实验在受控视觉、单细胞转录组学、纵向健康记录、连续控制和分子动力学等多个领域进行。
推荐理由:Meta AI 推出了 Orthogonal JEPA,它能把复杂系统拆分成多个部分来预测,比标准 JEPA 更高效。
8月17日
17:06
17:06量子位@思邈
该世界模型支持24FPS视频画面的实时生成。该模型还能以48kHz采样率输出立体声音频。这一24FPS与48kHz的组合,让世界模型具备了同步音画能力。官方宣布模型即将完全开源,开发者可获得24FPS视频与48kHz音频的生成能力。
推荐理由:这个新模型能同时生成24帧视频和48kHz立体声,比之前无声的世界模型多了一路声音,而且马上开源,可以自己跑一跑。
8月14日
12:03
12:03官方账号arXiv cs.AI@ AlayaWorld Team, Kaipeng Zhang, Chuanhao Li, Yifan Zhan, Yongtao Ge, Yuanyang Yin, Jiaming Tan, Kang He, Liaoyuan Fan, Mingliang Zhai, Ruicong Liu, Xiaojie Xu, Xuangeng Chu, Zhen Li, Zhengyuan Lin, Zhixiang Wang, Zian Meng, Zihui Gao
AlayaWorld v1.1技术报告发布,提出改进版交互式长时程世界建模。新版本将空间记忆由深度扭曲法改为流式3D点缓存渲染器。视觉条件被编码到与生成视频一致的因果VAE潜空间中。具体包括六处修改:采用运动感知潜条件、因果编码重渲染空间记忆等。报告未改变主干架构与分块自回归生成方案。
推荐理由:AlayaWorld v1.1报告出来了,空间记忆换成了3D点缓存渲染,条件编码统一到因果VAE,做世界模型的值得瞄一眼。
8月12日
8月11日
10:34
8月10日
7月31日
11:49
11:49官方账号arXiv cs.AI@Zexuan Yan, Yuzhou Wu, Yue Ma, Zonghang He, Kaibo Yin, Xiaobing Tu, Yinggui Wang, Jinkui Ren, Xiantao Zhang, Shijian Wang, Jinghong Liu, Linfeng Zhang
EgoGenesis是一个基于预训练视频生成先验的自我中心世界动作模拟器,用于合成可控的操作视频。它通过在线锚定投影记忆(OAPM)保留第一帧3D场景锚点,并用Action-3D RoPE编码末端执行器运动。将400条真实轨迹与400条EgoGenesis生成轨迹合并后,单臂任务真实机器人成功率从77%提升至84%。双臂任务成功率从53%提升至70%,说明合成数据能显著改善下游世界动作模型的泛化。
推荐理由:EgoGenesis是个能生成机器人操作视频的工具,用400条合成数据就把单臂成功率从77%提到84%,双臂从53%提到70%,挺厉害。
7月30日
01:57
01:57官方账号NVIDIA AI@NVIDIAAI
81°
在SIGGRAPH2026上,NVIDIA Cosmos Lab副总裁刘明宇宣布了Cosmos-Dreams,一种神经闭环模拟器。他展示了该模拟器的完整演示,并阐述了世界模型作为物理AI数据引擎的理念。Cosmos-Dreams旨在将数据从被动收集转变为主动计算生成。
事件专题

推荐理由:NVIDIA在SIGGRAPH上发布了Cosmos-Dreams,一个能主动计算生成训练数据的模拟器。物理AI开发不再只靠收集数据了,看看演示视频吧。
7月29日
19:20
19:20官方一手pandaily@contact@pandaily.com (Pandaily)
比亚迪AI团队首次公开HyWorldVLA混合世界模型,采用像素-潜在混合世界建模与VLA架构,在NAVSIM v1基准上取得90.59 PDMS,达到SOTA。该模型由比亚迪与哈尔滨工业大学机器人研究人员合作开发。这一成绩标志着比亚迪正式进入自动驾驶基础模型赛道。

推荐理由:比亚迪悄悄拿出的HyWorldVLA,在NAVSIM上直接以90.59分拿下SOTA,这是他们首次秀自动驾驶基础模型肌肉。
11:36
11:36官方账号arXiv cs.LG@Gaspard Lambrechts, Adrien Bolland, Daniel Ebi, Damien Ernst
论文提出Reinformed Dreamer算法,通过潜在引导改进不对称表示学习,解决了Informed Dreamer在特权信息表示上的局限。在多个强化学习基准测试中,相比Dreamer基线,Reinformed Dreamer表现出更一致的性能提升。该方法利用训练期间的额外监督信息学习更好的观察和特权信息表示。
推荐理由:如果你做强化学习,特别关注世界模型,这篇论文提出Reinformed Dreamer,用潜在引导训练不对称表示,比Informed Dreamer更稳定地超越Dreamer。
7月28日
15:35
15:35量子位@henry
精选72°
研究人员利用50万小时视频数据训练出首个隐式触觉世界动作模型。该模型能够根据视觉输入生成对应触觉信号。在机器人操作任务中,它实现了比纯视觉模型更精准的动作预测。这项研究将触觉感知融入了世界模型框架。
推荐理由:团队用50万小时视频让模型学会预测触觉,这在之前没人做到过。它能帮机器人提前感知物体触感,操作更稳。