比亚迪悄悄拿出的HyWorldVLA,在NAVSIM上直接以90.59分拿下SOTA,这是他们首次秀自动驾驶基础模型肌肉。
#世界模型
World Labs 这篇博客把模拟器定位成世界模型的核心,他们的 R2S2R 引擎能让机器人训练成本降很多,值得搞机器人开发的看看。
如果你做强化学习,特别关注世界模型,这篇论文提出Reinformed Dreamer,用潜在引导训练不对称表示,比Informed Dreamer更稳定地超越Dreamer。
Unity中国CEO张俊波谈AI不会颠覆游戏引擎,并发布团结引擎2.0,新增AI Agent和主机平台支持。
这篇论文发现了世界模型选动作的隐性陷阱:候选越多反而越容易选错。ASAR用相邻集合重建的方法,在75个机器人任务上提升了最多28%的成功率,值得搞机器人控制的看看。
Induction Labs 搞了个新套路:不用动作标签,只看视频就能学会模拟桌面、跳棋和台球物理。106B 参数的 MoE 模型,一次预训练就够了。
Reactor 团队把 Dreamer 4 的完整训练配方和代码都开源了,JAX/Flax 实现,想复现世界模型做视频预测的赶紧看。
Koopman Dreamer 给 Dreamer 加了个谱约束核,长程想象稳多了。在 DeepMind 控制套件和无人机导航上,比原版 Dreamer 控得更好更稳。
高德开源的 AI 工坊,输文字或图片就能生成可实时交互的 3D 世界,还能连续跑 1 小时不崩,比同类 1 分钟长得多,且内置任意门随便穿梭。
高德发了ABot-World Studio,用一张5090就能生成小时级的实时3D场景和交互视频,做游戏或数字孪生都可以试试,门槛低了很多。
这篇论文用实验告诉你,深的世界模型在滚动预测时不一定管用——在DeepMind Control的9个任务里,有2个反而是早退浅层更好,而且原因竟然出在训练方式上。搞模型规划的值得看看。
蚂蚁发了14B的世界模型LingBot-World-Infinity,能生成60分钟视频模拟20个场景,用MoBA注意力解决长时间漂移。不过目前只开放了检查点,没有完整代码。
想低成本搞个能交互的虚拟世界?蚂蚁灵波开源了LingBot-World 2.0,小时级就能生成,还支持多人一起玩,比之前那些模型快多了。
LingBot-World 2.0 能生成一小时长、720p/60fps 的交互世界,Agent 驱动事件变化,像游戏一样可玩。
NVIDIA发了个Colab友好教程,教你搭简化版Cosmos 3世界模型,用Omnimodal MoT架构实现跨模态预测,比跑全量模型省资源。