Google 把 AI 从聊天工具升级为操作系统级智能体,做开发、用搜索、搞创意的团队都能直接受益——Gemini 3.5 Flash 已可用,建议开发者立刻试试。
#世界模型
Genie 街景版让 AI 训练和虚拟内容创作有了真实世界基础,做机器人导航或游戏场景生成的团队可以直接用这个原型来测试想法。
Odyssey 把世界模型从单人演示拉进了多人实时互动,做游戏、模拟或AI协作的团队可以直接体验这个活世界,建议点开试试。
做 AI 模拟、游戏开发或虚拟现实的人会眼前一亮——Starchild-1 让世界模型从“只看”进化到“又看又听”,实时多模态融合直接拉高了物理模拟的真实感,值得关注它的后续开放计划。
做多智能体模拟或游戏引擎的开发者,Agora-1 展示了世界模型从单机到联机的关键跃迁——共享现实一致性是下一个必须攻克的难题,值得关注其技术细节。
LeCun 的预测直指当前大语言模型的局限——只会聊天不懂物理世界,做机器人、自动驾驶、医疗决策的团队值得关注这个从“理解语言”到“理解因果”的范式转变。
这篇综述系统定义了 WAMs,解决了具身智能从“想”到“做”的落地难题,做机器人、具身 Agent 或世界模型的开发者值得收藏,直接看时间线图就能把握未来方向。
关注AI进化方向的读者值得一看——它用“宠物vs幼儿”的比喻点出了AI从被动到主动的范式转变,做AI研究或产品设计的人会从中获得启发。
Nvidia 把世界模型的门槛打下来了——2.6B 参数、单 GPU 可跑、开源,做具身 AI 和机器人仿真的团队可以直接拿来用,省去从头训练的麻烦。
LeCun 对 LLM 的批判性观点和世界模型路线图,对 AI 研究者、博士生和关注下一代 AI 架构的人极具启发,值得花一小时听完。
视频生成模型常被当作世界模型,但几何一致性是硬伤——PDI-Bench用定量方法暴露了现有模型在3D结构上的系统性失败,做视频生成或世界模型研究的团队值得用它来诊断自己的模型。
小米把 VLA 和世界模型统一到一套框架,解决了自动驾驶多模型协同的痛点,做自动驾驶或具身智能的开发者可以直接用开源代码试试,性能还刷新了基准。
自动驾驶研究者终于有了一个统一 VLA 与世界模型的开源方案——OneVL 在精度和速度上均优于现有方法,做端到端驾驶或世界模型开发的团队可以直接拿来用。