7月1日
16:59
16:59量子位@思邈
Loop世界模型论文在Hugging Face热门榜登顶,该模型由中国初创公司研发,允许AI通过反复推演世界状态进行推理。模型获得360创始人周鸿祎和奇绩创坛陆奇等投资,引发关注。论文展示了世界模型在复杂推理任务上的潜力。
推荐理由:中国初创搞的世界模型火了,能反复推演不同情境,Hugging Face上热度第一,周鸿祎和陆奇都投了,做推理模型的朋友可以看看。
6月30日
14:30
14:30AI Will@FinanceYF5
Christopher Manning(GloVe词向量、Transformer注意力机制联合发明人)将于Stanford HAI发表演讲。他曾获2024年IEEE John von Neumann Medal。演讲主题聚焦世界模型,探讨语言模型遇上具身智能。他是Stanford NLP Group创始人及CS224N课程创建者。

推荐理由:GloVe和Transformer的创造者Manning要讲语言模型怎么和机器人结合了,想了解具身智能世界模型的可以听听。
6月27日
12:06
12:06官方账号World Labs (李飞飞)@theworldlabs
World Labs在SIGGRAPH 2026期间举办Worlds in Action黑客马拉松,地点为洛杉矶,时间为2026年7月18日至19日。活动聚焦于使用世界模型进行游戏、VFX、AR/VR及互动体验的开发。参与者将在两天内协作构建基于世界模型的应用项目。

推荐理由:World Labs要在SIGGRAPH 2026搞黑客马拉松,两天用世界模型做游戏和VFX,有兴趣的可以去看看。
6月25日
02:37
6月24日
6月18日
02:30
02:30官方账号Decoder@Matthias Bastian
73°
Amazon、Nvidia、AMD向世界模型初创公司Odyssey ML投资3.1亿美元,该公司估值达14.5亿美元。CIA关联基金IQT和谷歌首席科学家Jeff Dean也参与本轮融资。世界模型被业界视为语言模型后的下一个AI重点方向。
事件专题

推荐理由:亚马逊、英伟达、AMD都砸钱进这家3D世界模型公司,连Jeff Dean都跟投了,看来世界模型是下一波风口。
6月17日
10:45
10:45官方账号arXiv cs.AI@Hongyuan Adam Lu, Z. L. Victor Wei, Qun Zhang, Jinrui Zeng, Bowen Cao, Lingwei Meng, Mocheng Li, Zezhong Wang, Haonan Yin, Naifu Xue, Minyu Chen, Cenyuan Zhang, Zefan Zhang, Hao Wei, Jiawei Zhou, Haoran Xu, Hao Yang, Ronglai Zuo, Tongda Xu, Yonghao Li, Jian Chen, Hebin Wang, Zeyu Gao, Yang Li, Wei Zhao, Qimin Zhong, Siqi Liu, Yumeng Zhang, Leyan Cui, Zhangyu Wang, Wai Lam
精选
Looped World Models(LoopWM)首次将循环架构引入世界建模,通过参数共享的transformer块迭代细化潜在环境状态。相比传统方法,LoopWM在参数效率上提升多达100倍,并能根据预测复杂度自动调整计算深度。该方法将迭代潜在深度确立为世界仿真的新扩展轴,独立于模型规模和训练数据规模。
推荐理由:这篇论文用循环架构解决了世界模型长程预测的计算瓶颈,参数省了100倍还能自适应深度,做仿真和规划的研究者值得看。
04:33
04:33官方账号World Labs (李飞飞)@theworldlabs
World Labs联合创始人李飞飞在FastCompany采访中阐述AI愿景,强调未来AI应扎根于人类能动性、创造力和理解。她将世界模型的发展比作一场持久的模拟,一旦建立就稳定不变。该观点体现了World Labs以人为本的AI发展理念。

推荐理由:李飞飞说AI未来要围着人转,不是机器。World Labs要做持久的世界模型,挺有远见。
6月16日
11:43
11:43官方账号arXiv cs.AI@Jialei Chen, Kai Wang, Kang Chen, Shuaihang Chen, Feng Gao, Wenhao Tang, Zhiyuan Li, Weilin Liu, Zhuyu Yao, Boxun Li, Yuanbo Xu, Chao Yu
LaWAM通过潜在视觉子目标替代重建未来视频,在LIBERO基准上达到98.6%的成功率,在RoboTwin上达到91.22%,并在真实世界操作任务中取得竞争性表现。该模型每次动作块预测仅需187毫秒,延迟比像素空间世界行动模型低24倍。LaWAM的核心是潜在动作条件潜在世界模型(LaWM),利用预训练视觉基础模型的潜在空间预测未来观测特征。
推荐理由:机器人策略新框架LaWAM,不用生成视频就能预测场景变化,又快又准,成功率98.6%还低延迟,推荐做机器人控制的看看。
6月10日
6月9日
13:11
13:11官方账号arXiv cs.LG@Wayne King, Zeyue Xue, Yuxuan Bian, Jie Huang, Haoran Li, Yaowei Li, Yaofeng Su, Yuming Li, Haoyu Wang, Shiyi Zhang, Songchun Zhang, Yuwei Niu, Sihan Xu, Junhao Zhuang, Haoyang Huang, Nan Duan
Echo-Memory 是一项针对动作条件世界模型中记忆机制的受控研究。这类模型根据首帧、文本提示和相机动作序列生成多段视频,但其主要失败点往往是记忆而非局部图像合成:当相机离开再返回时,场景或关键物体可能悄然改变。现有记忆设计难以比较,因为增益与骨干网络、训练、检索和评估差异纠缠不清。Echo-Memory 固定了动作到视频的接口,仅改变历史信息的存储和读取方式,在共享的视频扩散骨干、优化器、相机动作表示、采样器和评估流程下,比较了原始上下文、基于压缩的记忆、不同读取路径的空间摘要以及状态空间循环。研究通过三分支协议(回放质量、域内循环重访和开放域返回探测)评估记忆,发现回放保真度不足以作为记住世界的代理指标。主要结论包括:原始上下文是强大的容量基线,能显著提升开放域返回性能;紧凑性不能替代容量;块状状态空间循环是最强的开放域返回机制。
推荐理由:做视频生成或世界模型研究的团队,这篇论文帮你拆解了记忆机制中容量、压缩、读取和循环四个关键维度,看完能直接指导你的模型设计。
13:07
13:07官方账号arXiv cs.AI@Jisong Cai, Long Ling, Shiwei Chu, Zhongshan Liu, Jiayue Kang, Zhixuan Liang, Wenjie Xu, Yinan Mao, Weinan Zhang, Xiaokang Yang, Ru Ying, Ran Zheng, Yao Mu
AHA-WAM是一种基于双扩散Transformer(DiT)架构的异步世界-动作模型,用于机器人操控。它通过将世界预测和动作执行解耦到不同时间分辨率,解决了传统模型在近端帧建模上的冗余问题。视频DiT作为低频世界规划器,维护滚动键值记忆并编码长期场景演化;动作DiT作为高频执行器,通过层间联合注意力查询世界上下文。实验在RoboTwin和真实世界任务中达到92.80%和78.3%的成功率,闭环控制频率达24.17 Hz,速度提升4.59倍,且无需机器人数据预训练。
推荐理由:机器人操控研究者终于有了一个能高效解耦世界建模与动作执行的方案——AHA-WAM在速度和成功率上双赢,做具身智能的团队可以直接参考其异步架构设计。
6月4日