17:03量子位@量子位的朋友们无界动力在WRC主论坛及多场同期活动中深度参与,展示其世界模型技术,强调其在现实生产力中的应用潜力。活动涵盖技术研讨、产品展示等环节,旨在推动行业交流与合作。行业无界动力WRC主论坛世界模型推荐理由:无界动力在WRC活动中展示世界模型技术,了解其在现实生产力中的应用前景,值得行业关注。原文稍后读已读值得跟进有用关注 无界动力
10:08官方账号arXiv cs.LG@Taoyong Cui, Pheng Ann Heng, Wanli Ouyang精选Meta AI 提出一种名为 Orthogonal JEPA 的新框架。该框架通过正交预测分解来学习潜在世界模型。它使用正交基矩阵将目标状态分解为多个组件,并为每个组件设置专用预测分支。实验在受控视觉、单细胞转录组学、纵向健康记录、连续控制和分子动力学等多个领域进行。AI模型Orthogonal JEPAJEPAMeta AI推荐理由:Meta AI 推出了 Orthogonal JEPA,它能把复杂系统拆分成多个部分来预测,比标准 JEPA 更高效。原文稍后读已读值得跟进有用关注 Orthogonal JEPA
10:22官方账号arXiv cs.LG@Jonathan Sadeghi, Jenny Seidenschwarz, Jesse Allardice, Sirish Srinivasan, Benjamin Graham, Jeffrey HawkeCaliBench 提出用物理可解释的离散空间(如骰子点数、纸牌花色、轮盘颜色)来评估视频世界模型,而不是像 FID 那样的学习特征空间。该基准覆盖九种场景和六个模型(WAN-2.7、SeeDance-2.0、HappyHorse-1.0、Veo 3.1、Runway Gen-4.5、Cosmos3-Super),每个模型生成32次。测试发现模型普遍把概率质量集中在少数结果上,而非复现参考分布;多数场景-模型组合显著失准,Veo 3.1 在骰子场景甚至坍缩到单一结果。在轮盘场景中,生成视频常让球位置含糊不清,导致多个模型的可评分性(scorability)很低。研究者将协议和指标 mnTV(平均归一化总变差)开源,供新模型对比。论文CaliBenchVeo 3.1视频生成推荐理由:CaliBench 新基准专测视频模型的物理随机效果靠不靠谱,六个模型里 Veo 3.1 在骰子上翻车。想对比可以参考。原文稍后读已读值得跟进有用关注 CaliBench
17:06量子位@思邈该世界模型支持24FPS视频画面的实时生成。该模型还能以48kHz采样率输出立体声音频。这一24FPS与48kHz的组合,让世界模型具备了同步音画能力。官方宣布模型即将完全开源,开发者可获得24FPS视频与48kHz音频的生成能力。AI模型世界模型视频生成音频生成推荐理由:这个新模型能同时生成24帧视频和48kHz立体声,比之前无声的世界模型多了一路声音,而且马上开源,可以自己跑一跑。原文稍后读已读值得跟进有用关注 世界模型
12:42AI Will@FinanceYF5据估算,以色列世界模型创业公司 Decart 若以70亿美元被收购,Sequoia 跨多轮投入约7000万美元,对应回报约9亿美元。Sequoia 的综合回报倍数预计在11–14倍之间。Benchmark 同样被视为这场交易中的大赢家。若交易成行,这笔投资将成为 Sequoia 合伙人 Shaun Maguire 的代表作之一。行业DecartSequoiaBenchmark推荐理由:Sequoia 投了 Decart 大概7000万美元,如果真按70亿美元卖掉,能翻到9亿美元,这回报够吹一阵子了。原文稍后读已读值得跟进有用关注 Decart
10:44官方账号arXiv cs.AI@Alexy Skoutnev, Kirill Acharya, Gaston Longhitano, Madeleine Udell, Kevin Ellis, Iddo Drori精选Twin 系统让前沿编程智能体在测试时编写可执行世界模型,用来完成 ARC-AGI-3 等持续学习任务,全程只靠模拟与交互推断游戏规则和目标。它在 183 个关卡中通过 179 个,成功率 97.8%,其中 158 个关卡的效率高于人类玩家(88.3%)。系统在 156 个已通关关卡中于任何奖励前就推断出目标(87.2%),其余关卡则靠搜索自动发现目标。直接用基础模型玩得分仅 7.8%,加现成 harness 升至 61.1%,而 Twin 世界模型把同一基础模型提升到 93.3%,打通 25 个游戏中的 23 个。论文TwinARC-AGI-3世界模型推荐理由:Twin 让智能体边玩边写世界模型,ARC-AGI-3 得分从 7.8% 提到 93.3%,效率还超过人类。看看它怎么猜规则。原文稍后读已读值得跟进有用关注 Twin
10:31官方账号arXiv cs.AI@Zian Meng, Zhen Li, Chuanhao Li, Qiang Li, Kaipeng Zhang精选Marionette将游戏世界建模拆成三步:两阶段自回归模型预测276维的显式3D世界状态,零参数渲染器用闭式解计算几何与遮挡,视频扩散模型生成逼真RGB画面。实验中,强制注入错误动作使关节误差改变31%;状态层加两条规则后,地面穿透减少66%,角色间距从漂移到21.2米恢复至5米附近。生成视频的FVD为831,与基于真实姿态的799相比无明显损失。论文Marionette世界模型视频生成推荐理由:想让游戏世界模型长时间不崩?Marionette把状态、几何、外观分开处理,加规则就能修穿模,实测穿透降66%。原文稍后读已读值得跟进有用关注 Marionette
13:50IT之家(博客/媒体)凯迪拉克全新 XT5 PHEV 将于 8 月 21 日成都车展预售,成为首款量产搭载 Momenta R7 世界模型的豪华混动 SUV。新车采用奥特能 5C 三元锂电池,配 1.5T 发动机(最大功率 115kW)和前后双电机(160kW/110kW)。电池容量 35.5kWh,WLTC 纯电续航 155km,综合油耗 6.05L/100km。Momenta R7 世界模型于 2026 年 4 月发布,通过三层架构实现对物体物理特性和运动因果的解析,可应对开门杀、滚落苹果等突发场景。AI产品凯迪拉克XT5Momenta R7推荐理由:凯迪拉克把 Momenta R7 世界模型装进 XT5 PHEV,8月21日成都车展预售,能处理滚落苹果、开门杀这种突发状况,还带城区 NOA。原文稍后读已读值得跟进有用关注 凯迪拉克
22:50Gary Marcus@GaryMarcus精选Gary Marcus 在推文中表示,神经符号世界模型正是他在2020年《Next Decade in AI》中主张的方向。他引用 François Chollet 和 Jeremy 的工作,认为 LLM 引导的即时符号世界模型综合很强大。目前 ARC-AGI-3 上所有顶级 harness 都采用这种方法。他提到这是基准发布时推荐的做法,并高兴 ARC 3 推动了该领域研究。AI模型ARC-AGI-3神经符号模型世界模型推荐理由:Gary Marcus 说 ARC-AGI-3 上跑得最好的都用了神经符号世界模型,想看这方向为什么牛,可以读这条。原文稍后读已读值得跟进有用关注 ARC-AGI-3
12:03官方账号arXiv cs.AI@ AlayaWorld Team, Kaipeng Zhang, Chuanhao Li, Yifan Zhan, Yongtao Ge, Yuanyang Yin, Jiaming Tan, Kang He, Liaoyuan Fan, Mingliang Zhai, Ruicong Liu, Xiaojie Xu, Xuangeng Chu, Zhen Li, Zhengyuan Lin, Zhixiang Wang, Zian Meng, Zihui GaoAlayaWorld v1.1技术报告发布,提出改进版交互式长时程世界建模。新版本将空间记忆由深度扭曲法改为流式3D点缓存渲染器。视觉条件被编码到与生成视频一致的因果VAE潜空间中。具体包括六处修改:采用运动感知潜条件、因果编码重渲染空间记忆等。报告未改变主干架构与分块自回归生成方案。AI模型AlayaWorld世界模型视频生成推荐理由:AlayaWorld v1.1报告出来了,空间记忆换成了3D点缓存渲染,条件编码统一到因果VAE,做世界模型的值得瞄一眼。原文稍后读已读值得跟进有用关注 AlayaWorld
11:52官方账号arXiv cs.AI@Avinash Kori, Fabrizio Russo这篇论文从因果视角研究世界模型,提出超越生成能力、捕捉实体属性及其交互的因果世界模型(CWM)正式定义。作者将世界建模与因果表示学习、目标中心学习、因果发现、结构因果模型及基于模型的决策制定等工作联系起来。论文还探讨了可识别性文献,澄清世界模型组件何时能从数据中恢复以及等价性边界。论文世界模型因果推理因果表示学习推荐理由:如果你在搞世界模型或因果推理,这篇把概念理清了,还连上了因果发现的现有工作,值得一看。原文稍后读已读值得跟进有用关注 世界模型
10:31官方账号arXiv cs.AI@Gehan Zheng, Matthew Johnson-Roberson, Weiming ZhiContactGuard 是一种用于分块视觉运动策略的接触前执行监控方法。它根据策略规划的动作块,在潜在视觉空间预测短期后果,若预测失败则中止执行。其潜在世界模型由未标注机器人轨迹训练,预测多视角视觉嵌入,避免像素级视频预测。在真实接触密集操作任务中,ContactGuard 比直接预测和破坏动作消融的失败预测更准确。该方法可作为真机预接触中止信号,无需修改底层策略。论文ContactGuard世界模型机器人操作推荐理由:接触密集操作总在碰坏了才发现问题?ContactGuard 在接触前看潜在视觉嵌入提前判断,能直接发中止信号,不用改策略。原文稍后读已读值得跟进有用关注 ContactGuard
18:15IT之家(博客/媒体)71°据彭博社报道,Anthropic PBC 正洽谈以约 60 亿美元(约合 405.41 亿元人民币)收购 AI 初创公司 Decart AI。知情人士称,双方尚未最终敲定这笔 60 亿美元的交易,谈判仍有破裂可能。Decart 主要帮助 AI 开发者提升不同芯片的性能,同时专注生成式视频领域。该公司使用世界模型(world models),可对实时视频画面进行即时修改。行业AnthropicDecart AI视频生成8 个信源在谈事件专题推荐理由:Anthropic 花 60 亿美元买 Decart,这家公司做实时视频修改和芯片适配。原文稍后读已读值得跟进有用关注 Anthropic
18:12官方一手marktechpost@Asif RazzaqDyna Robotics推出世界动作模型Dyna-2,预训练数据超过100万小时的第一人称人类视频。技术报告展示了在人类数据上至1M小时的缩放定律,并首次将该定律迁移到未见过的机器人数据。实验还表明,视频联合训练能推动跨实体泛化。该模型旨在让机器人从人类行为中学习动作执行。AI模型Dyna-2Dyna Robotics世界模型推荐理由:Dyna Robotics把100万小时人类视频喂给机器人模型,搞出了Dyna-2,还验证了缩放定律能跨界到机器人数据,看它怎么做到跨实体泛化挺有意思。原文稍后读已读值得跟进有用关注 Dyna-2
16:26IT之家(博客/媒体)凯迪拉克全新XT5 PHEV成为首款量产搭载Momenta R7世界模型的豪华混动SUV,展车已登陆全国经销商门店。Momenta R7于2026年4月发布,采用三层架构,可解析物体物理特性与运动因果关系,生成符合物理规律的车速调节与路径规划。该系统能应对早高峰通勤、复杂路口、自动泊车及突发状况,配合激光雷达与蜂鸟底盘实现高速及城区NOA领航辅助。新车搭载奥特能5C三元锂电池,WLTC纯电续航155km,综合油耗6.05L/100km。AI产品Momenta R7凯迪拉克XT5 PHEV推荐理由:凯迪拉克把Momenta R7世界模型塞进XT5 PHEV,不用等OTA就能用,带激光雷达和蜂鸟底盘,能应对开门杀和滚落苹果,想买豪华混动SUV的可以看看。原文稍后读已读值得跟进有用关注 Momenta R7
01:16AI Will@FinanceYF5精选Dyna Robotics推出Dyna-2,这是一个世界动作模型,预训练数据超过100万小时的人类视频,相当于约170年不间断的清醒经验。该模型的核心在于其背后的扩展定律,目前仍在持续攀升,尚未显现天花板。Dyna-2的发布标志着机器人领域在数据规模上的新突破,为机器人行为学习提供了更丰富的先验知识。AI模型Dyna-2Dyna Robotics机器人推荐理由:Dyna Robotics出了个新模型Dyna-2,用100万小时人类视频训练,相当于170年经验,机器人学习的新路子,值得看看。原文稍后读已读值得跟进有用关注 Dyna-2
16:29IT之家(博客/媒体)韩媒ZDNet Korea报道,三星电子正集结全公司力量加快人形机器人研发,除子公司Rainbow Robotics外,三星也在独立开发人形机器人,水平或已超过韩国主要同类产品。三星拥有家电、移动设备、半导体等众多制造基地,可获取真实生产数据,并拥有自研AI模型Samsung Gauss。三星还在开发世界模型,通过视频数据学习物理规律,让机器人行动前先预测模拟结果。执行器也由三星自主开发,预计用上家电电机技术。上月三星成立RX事业推进室,直接归代表理事卢泰文领导,并计划在龟尾事业场建设数据工厂用于机器人训练。AI产品三星人形机器人Rainbow Robotics推荐理由:三星这次是动真格了,除了子公司Rainbow,自己也在搞人形机器人,还挖了波士顿动力背景的人来带队,想看看它能不能靠家电底子做出差异化。原文稍后读已读值得跟进有用关注 三星
10:34量子位@允中五大高校联合发布了首份机器人三视角世界模型评测。评测聚焦三视角世界模型的稳定性表现,回答"谁更稳"这一核心问题。五大高校表示榜单将持续更新。AI模型世界模型机器人三视角推荐理由:五大高校做了个机器人三视角世界模型评测榜,谁更稳看榜单就清楚了,之后还会持续更新。原文稍后读已读值得跟进有用关注 世界模型
03:32elvis@omarsar0精选Dyna Robotics发布世界动作模型Dyna-2,在100万小时人类第一视角视频上预训练。该模型能联合预测未来视频和未来动作,在行动前推理结果。研究首次发现,从1000到100万小时的人类数据上,世界动作模型呈现四个数量级的缩放定律。该缩放定律还能迁移到从未见过的机器人数据上,且视频数据与世界建模对跨具身缩放迁移至关重要。AI模型Dyna-2Dyna Robotics世界模型推荐理由:Dyna Robotics放出了个叫Dyna-2的世界动作模型,用100万小时人类视频训的,能预测未来再行动,还发现了数据量越大越强的缩放规律,值得看看。原文稍后读已读值得跟进有用关注 Dyna-2
11:25官方一手arXiv: DeepSeek@Devin Pereira, Willem Zuidema精选论文研究Transformer在河内塔规划任务中的表现,发现小型自训练模型能涌现出线性可解码的几何世界模型(谢尔宾斯基三角),该模型与解题存在因果关联。对Qwen3.6-27B和DeepSeek-R1-Distill-Qwen-32B两个前沿推理模型的分析显示,它们能在提示末尾近乎完美地编码该世界模型,但圆环数超过3个时仍会在多数任务上失败。探针实验表明失败源于规划过程中世界模型表征的衰减,而非缺失。在推理时注入提示阶段的表征可部分恢复性能。论文Qwen3.6-27BDeepSeek-R1-Distill-Qwen-32B世界模型推荐理由:这篇论文说推理模型其实能建出世界模型,但解题中途就弄丢了。它用小模型和可解释性方法把问题定位得很清楚,还给出了补救办法。原文稍后读已读值得跟进有用关注 Qwen3.6-27B
10:53官方账号arXiv cs.LG@Xinyi Li, Zaishuo Xia, Chenjie Hao, Yubei Chen论文提出直接预测世界模型DPWM,将任意长度的动作序列压缩为单一嵌入,单次前向预测终点观测。DPWM避免了递归卷展,使长时程端到端训练在自回归训练不稳定的尺度上可行。在连续控制和像素级基准上,DPWM相比递归世界模型大幅提升长时程终点预测,且预测时程越长优势越大。实验还显示,用同样的长时程目标重训递归基线也获得类似提升,说明训练目标而非骨干结构是主要驱动力。论文DPWM世界模型长时程预测推荐理由:这篇论文把世界模型的训练目标改成直接预测终点,DPWM在长时程预测上比递归模型准很多,而且越长优势越明显。想搞长时程决策的可以看看。原文稍后读已读值得跟进有用关注 DPWM
10:49官方账号arXiv cs.LG@Xindi Wu, Sven Elflein, James Lucas, Olga Russakovsky, Laura Leal-Taixé, Despoina Paschalidou, Jonathan Lorraine, Aljoša Ošep交互式视频世界模型依赖键值缓存作为视觉记忆,但生成超过训练长度后,时间旋转位置编码偏移超出训练范围,模型无法通过注意力可靠寻址已存储内容。论文提出WorldTrace,一种无需训练的长期视觉持久化记忆框架,通过为每个摘要槽分配分布内的虚拟位置保持可寻址性。WorldTrace-Field压缩历史以提升时序一致性,WorldTrace-Landmark在场景转换处存储逐字轨迹用于情节回忆。在LoopBench基准上,WorldTrace-Field将时序一致性提升15.5%,WorldTrace-Landmark将情节回忆提升19.5%。论文WorldTraceLoopBench世界模型推荐理由:看这个,论文解决了视频生成模型长视频记忆丢失的问题,不重新训练就能把一致性拉高15个点,做视频生成的人应该关心。原文稍后读已读值得跟进有用关注 WorldTrace
06:50官方账号Yann LeCun@ylecunLeCun在推文中指出,长期研究常被追求短期效益的公司管理层视为浪费时间。他认为,若相信AGI靠LLM scaling就能实现,则研究世界模型等新概念会被看作徒劳。LeCun与Demis认为AGI还需要更多概念性突破,因此他选择更贴近研究、远离产品管理的角色。他始终支持高质量LLM研究,但强调LLM只是有用技术,不是人类级AI的最终答案。行业LeCun世界模型AGI推荐理由:LeCun出来聊长期研究和LLM了,说AGI还得靠新概念,他看好世界模型,跟主流scaling路线唱反调。原文稍后读已读值得跟进有用关注 LeCun
23:28Y Combinator@ycombinatorYC Paper Club 本期聚焦机器人学,回顾了过去十年反复出现的“明年机器人就解决”的承诺。多位研究者展示了最新论文,如 MEM(多尺度具身记忆)用于视觉语言动作模型,以及 SimToolReal 实现零样本灵巧工具操作。演讲还讨论了遥操作如何催生下一代机器人公司,以及 VLA 之后的世界动作模型。论文机器人VLA世界模型推荐理由:这期请了一堆机器人研究者,讲 VLA 和世界模型新论文,还有遥操作创业观点,挺干货。原文稍后读已读值得跟进有用关注 机器人
10:36官方一手Pandaily@contact@pandaily.com (Pandaily)西湖大学研究员于开成创立的 Awomo 获得1亿元种子轮及天使轮融资,其创始人首次公开阐述概念空间世界模型。该模型与数据驱动的大规模扩展法则不同,强调隐式概念空间推理。于开成曾参与撰写现有规模扩展法则,如今转向新的技术路线。目前该项目仍处于早期,尚未公布完整基准测试结果。AI模型Awomo于开成西湖大学推荐理由:于开成拿了1亿融资,做了个不走老路的世界模型,跟scaling law对着干,值得看看原文稍后读已读值得跟进有用关注 Awomo
09:46官方账号arXiv cs.AI@Kapil Wanaskar, Gaytri Jena, Aman Chadha, Vinija Jain, Vasu Sharma, Amitava DasFactorJEPA提出将世界结构作为预测原语,把未来编码分解为布局、实体和交互三个子空间,并设置可见性门控来保留局部可见的智能体。研究新增DENSEWORLD-115k数据集,包含22个城市的1000小时行车、步行和航拍视频。相比现有JEPA方法,FactorJEPA在未来帧L1、因果L1和掩码比率斜率上均有提升。方法在2B和1B参数的V-JEPA 2.1骨干上排名一致,斯皮尔曼系数为0.895至0.978。AI模型FactorJEPADENSEWORLD-115kV-JEPA 2.1推荐理由:研究拥挤混乱街景的世界模型,发布了新模型和115k数据集,比传统JEPA更擅长处理遮挡和异构交通。原文稍后读已读值得跟进有用关注 FactorJEPA
11:49官方账号arXiv cs.AI@Zexuan Yan, Yuzhou Wu, Yue Ma, Zonghang He, Kaibo Yin, Xiaobing Tu, Yinggui Wang, Jinkui Ren, Xiantao Zhang, Shijian Wang, Jinghong Liu, Linfeng ZhangEgoGenesis是一个基于预训练视频生成先验的自我中心世界动作模拟器,用于合成可控的操作视频。它通过在线锚定投影记忆(OAPM)保留第一帧3D场景锚点,并用Action-3D RoPE编码末端执行器运动。将400条真实轨迹与400条EgoGenesis生成轨迹合并后,单臂任务真实机器人成功率从77%提升至84%。双臂任务成功率从53%提升至70%,说明合成数据能显著改善下游世界动作模型的泛化。论文EgoGenesis视频生成具身智能推荐理由:EgoGenesis是个能生成机器人操作视频的工具,用400条合成数据就把单臂成功率从77%提到84%,双臂从53%提到70%,挺厉害。原文稍后读已读值得跟进有用关注 EgoGenesis
22:05官方账号Decoder@Maximilian SchreinerGoogle DeepMind 研究员 Tom Zahavy 在题为“LLMs can't jump”的立场论文中认为,语言模型缺乏创造全新事物的认知机制,因此无法引发科学革命。文章指出,语言模型只能在其训练数据分布内插值,而真正的科学突破需要跳出现有知识框架。作为替代方案,Zahavy 提出“世界模型”可能具备这种能力,因为它们能模拟因果结构和进行反事实推理。该论文并未给出具体基准或数字,而是从哲学和认知科学角度提出理论观点。论文Google DeepMindTom ZahavyLLMs can't jump推荐理由:DeepMind 的 Tom Zahavy 说了个大实话:LLM 搞不了真正的新发现,得靠世界模型。不是泛泛空谈,有论文为证。原文稍后读已读值得跟进有用关注 Google DeepMind
17:42量子位@henryWorld Labs(李飞飞创立)近期将“世界模型”应用在机器人训练中,让机器人获得空间智能。该模型使机器人能够理解三维场景并规划动作路径。早期测试显示机器人可在未见过环境中自主导航和操作物体。World Labs的目标是构建能够像人类一样感知和行动的通用机器人基础模型。AI模型World Labs李飞飞世界模型推荐理由:李飞飞的公司World Labs把世界模型用到机器人上了,机器人能看懂空间、自己规划动作,跟传统方法很不一样。原文稍后读已读值得跟进有用关注 World Labs
15:55官方一手pandaily@contact@pandaily.com (Pandaily)在WAIC 2026上,Muka Robotics、Shengshu Technology、EvoPhys.ai 和 Chengwei Capital 的专家讨论了中国的世界模型初创公司。他们认为,这些公司目前已没有直接的美国对标企业,打破了以往中国科技公司对标美国的模式。小组指出,中国在世界模型领域已经领先,无需跟随美国的发展路径。行业Muka RoboticsShengshu TechnologyEvoPhys.ai推荐理由:中国搞世界模型的公司已经跑到前面了,美国找不着对标了。WAIC上几方团队聊了聊怎么做出来的。原文稍后读已读值得跟进有用关注 Muka Robotics
01:57官方账号NVIDIA AI@NVIDIAAI81°在SIGGRAPH2026上,NVIDIA Cosmos Lab副总裁刘明宇宣布了Cosmos-Dreams,一种神经闭环模拟器。他展示了该模拟器的完整演示,并阐述了世界模型作为物理AI数据引擎的理念。Cosmos-Dreams旨在将数据从被动收集转变为主动计算生成。AI产品NVIDIACosmos-DreamsCosmos Lab2 个信源在谈事件专题推荐理由:NVIDIA在SIGGRAPH上发布了Cosmos-Dreams,一个能主动计算生成训练数据的模拟器。物理AI开发不再只靠收集数据了,看看演示视频吧。原文稍后读已读值得跟进有用关注 NVIDIA
19:20官方一手pandaily@contact@pandaily.com (Pandaily)比亚迪AI团队首次公开HyWorldVLA混合世界模型,采用像素-潜在混合世界建模与VLA架构,在NAVSIM v1基准上取得90.59 PDMS,达到SOTA。该模型由比亚迪与哈尔滨工业大学机器人研究人员合作开发。这一成绩标志着比亚迪正式进入自动驾驶基础模型赛道。AI模型HyWorldVLA比亚迪NAVSIM推荐理由:比亚迪悄悄拿出的HyWorldVLA,在NAVSIM上直接以90.59分拿下SOTA,这是他们首次秀自动驾驶基础模型肌肉。原文稍后读已读值得跟进有用关注 HyWorldVLA
16:34AI Will@FinanceYF5World Labs 在其世界模型分类中将模拟器称为关键枢纽,认为它是 Agent 行动、学习和评估的核心。他们提出的 R2S2R 引擎旨在将机器人开发从缓慢、昂贵且受硬件限制的迭代,转向更可规模化、成本更低的训练与评估。该引擎通过模拟环境加速机器人开发流程,降低硬件依赖。AI模型World LabsR2S2R引擎模拟器1 个信源在谈事件专题推荐理由:World Labs 这篇博客把模拟器定位成世界模型的核心,他们的 R2S2R 引擎能让机器人训练成本降很多,值得搞机器人开发的看看。原文稍后读已读值得跟进有用关注 World Labs
11:36官方账号arXiv cs.LG@Gaspard Lambrechts, Adrien Bolland, Daniel Ebi, Damien Ernst论文提出Reinformed Dreamer算法,通过潜在引导改进不对称表示学习,解决了Informed Dreamer在特权信息表示上的局限。在多个强化学习基准测试中,相比Dreamer基线,Reinformed Dreamer表现出更一致的性能提升。该方法利用训练期间的额外监督信息学习更好的观察和特权信息表示。论文Reinformed Dreamer强化学习世界模型推荐理由:如果你做强化学习,特别关注世界模型,这篇论文提出Reinformed Dreamer,用潜在引导训练不对称表示,比Informed Dreamer更稳定地超越Dreamer。原文稍后读已读值得跟进有用关注 Reinformed Dreamer
00:44官方账号Fei-Fei Li@drfeifei精选World Labs创始人Fei-Fei Li在推文中介绍了团队的世界模型分类法,将模拟器定位为智能体行动、学习和评估的关键枢纽。新发布的R2S2R引擎使机器人开发可从缓慢、昂贵、受硬件限制的迭代转向更可扩展、成本更低的训练与评估。该引擎采用真实到模拟到真实(Real-to-Sim-to-Real)循环,有望降低机器人研发门槛。AI模型R2S2RWorld LabsFei-Fei Li2 个信源在谈事件专题推荐理由:Fei-Fei Li团队搞了个R2S2R引擎,让机器人训练不用老在真机上折腾,省时省钱,做机器人开发的一定要看看。原文稍后读已读值得跟进有用关注 R2S2R
22:14IT之家(博客/媒体)Unity中国CEO张俊波在团结引擎2.0发布会后表示,AI不会颠覆游戏引擎,反而能降低门槛扩大引擎公司的渗透。他认为世界模型能快速生成虚拟空间,但不等同于可长期运营的游戏,还需要玩法规则、数值系统等系统工程。张俊波不认同“一句话生成游戏”的说法。Unity中国当日发布团结引擎2.0,推出可独立执行游戏开发任务的AI Agent团结Codely,并新增对PS5、Xbox Series X|S、Nintendo Switch 2等主机平台的支持。AI产品Unity中国团结引擎2.0张俊波推荐理由:Unity中国CEO张俊波谈AI不会颠覆游戏引擎,并发布团结引擎2.0,新增AI Agent和主机平台支持。原文稍后读已读值得跟进有用关注 Unity中国
15:35量子位@henry精选72°研究人员利用50万小时视频数据训练出首个隐式触觉世界动作模型。该模型能够根据视觉输入生成对应触觉信号。在机器人操作任务中,它实现了比纯视觉模型更精准的动作预测。这项研究将触觉感知融入了世界模型框架。AI模型触觉世界模型50万小时视频世界模型推荐理由:团队用50万小时视频让模型学会预测触觉,这在之前没人做到过。它能帮机器人提前感知物体触感,操作更稳。原文稍后读已读值得跟进有用关注 触觉世界模型
10:34官方账号arXiv cs.AI@Liangyu Li, Qingwen Liu, Mingqing Liu论文揭示基于采样和潜在世界模型的控制器存在“提议过度生成”问题:当候选动作序列池从72增加到288,可行性从0.375降至0.062(位置目标)、0.344降至0.031(位置加偏航目标),即使大池中始终包含可行序列。作者提出相邻集动作重建(ASAR)方法,通过测量低代价序列的密度并从相邻集重建完整动作。在Carry and Release评估的75个查询中,Kernel ASAR在72、144、288个提议下分别将事件完成成功率提升28.0、24.0、18.7个百分点(潜在成本下)及18.7、20.0、17.3个百分点(轨迹可达性成本下)。论文ASARCube世界模型推荐理由:这篇论文发现了世界模型选动作的隐性陷阱:候选越多反而越容易选错。ASAR用相邻集合重建的方法,在75个机器人任务上提升了最多28%的成功率,值得搞机器人控制的看看。原文稍后读已读值得跟进有用关注 ASAR
17:16官方一手marktechpost@Michal SutterInduction Labs 推出 Imagination Models 架构,其候选模型 Photon-1 为稀疏 106B-A5B MoE,仅在未标注动作的原始视频上完成单次预训练。Photon-1 能够模拟桌面操作、玩跳棋,并建模台球物理。该架构挑战了传统需动作标签的预训练范式。AI模型Photon-1Induction Labs世界模型推荐理由:Induction Labs 搞了个新套路:不用动作标签,只看视频就能学会模拟桌面、跳棋和台球物理。106B 参数的 MoE 模型,一次预训练就够了。原文稍后读已读值得跟进有用关注 Photon-1
03:08官方一手marktechpost@Asif RazzaqReactor 团队开源了 Open Dreamer,这是一个基于 JAX 和 Flax NNX 的 Dreamer 4 世界模型管道的完整复现。该项目包含两个代码仓库:next-state/open-dreamer 提供训练管道,包括因果视频分词器、动作条件潜在动力学模型、轨迹生成和 FVD 评分;reactor-team/open-dreamer 提供推理代码。Open Dreamer 的发布使 Dreamer 4 的完整训练流程得以公开复现。AI模型Open DreamerDreamer 4JAX推荐理由:Reactor 团队把 Dreamer 4 的完整训练配方和代码都开源了,JAX/Flax 实现,想复现世界模型做视频预测的赶紧看。原文稍后读已读值得跟进有用关注 Open Dreamer