State of AI 一年一度的行业盘点,今年聚焦 AI 自我改进、世界模型和 Physical AI,还有对未来 12 个月的预测,想看行业全景可以直接翻这份报告。
#世界模型
Odyssey-3 Pro 在物理理解基准 Physics-IQ 上拿到 66.1 分冲到榜首,还能让你在生成的环境里随便走动触发事件看它怎么应对。
Yann LeCun 路线的 JEPA 思想做了个开源实现,把预测拆成互不干扰的要素分别推算,附论文和 GitHub 框架,想搞世界模型研究的可以看看。
Odyssey-3 能生成会对你操作实时反应的互动世界,Flash 版免费可玩,还顺手在 Physics-IQ 拿了 66.1 的高分,去看看 demo。
Nvidia 的 Long-WAM 把机器人模型的上下文拉到 19.2 秒,RoboCasa GR-1 成功率直接从 63.3% 涨到 78.7%,做机器人方向的可以看看。
这篇论文把机器人模型的历史上下文拉到 19.2 秒,动态杯子堆叠做到 95% 成功,Pi0.5 一个都做不成,方法细节写得很清楚。
机器人世界模型也有缩放定律了,8B 参数的 RoboJEPA 能用计算量预测真机表现,还能零样本规划长时程任务,代码全开源,搞具身的建议看看。
一家叫 Mirror Particle 的初创公司,不做聊天机器人,专门造了个预测人类行为的世界模型,想取代 LLM 角色扮演做市场调研,看它怎么在 Disrupt 上讲这个故事。
Yann LeCun 圈子的人发了 H-JEPA,把世界模型按抽象层级拆开做规划,Visual AntMaze 成功率从 18% 干到 73%,算力还更省。
JEPA 世界模型在画面几乎不动时规划会崩,这篇论文用一个逆动力学辅助损失把成功率从 0.003 拉到 0.35,还给了个不需要环境访问的探测方法,做世界模型的人应该看看。
Sakana AI 在东京办研讨会,Schmidhuber 亲自来讲世界模型,免费但座位有限,感兴趣得赶紧报名。
Citadel Securities 的 COO 分享怎么用 Slack、PPT 和会议记录给公司建一个'自我模型',还讲了踩过的坑,做企业内部 AI 的可以听听。
一篇把 14B 视频世界模型压到 1.3B、四步就能跑的蒸馏论文,专治 DMD 蒸馏后机器人动作变僵的问题,做具身智能的可以看看。
多智能体协作一直难在联合动作的相互影响上,这篇提出了首个给多智能体流策略做测试时规划的世界模型,30 个设置平均提升 22% 还只慢 12 毫秒,做 MARL 的可以看看。
Odyssey 新出的 Agora-2 能让 20 个人和 AI 在同一个实时生成的世界里玩,像 AI 版游戏引擎,多人视角还能互不冲突,做智能体研究的可以看看。
Odyssey 的 Agora-2 能让最多20个人和 AI 进同一个 AI 实时生成的世界,靠看《暗黑破坏神 II》录像学会规则,思路挺特别。