主要来源rohanpaul_ai
查看原文事件专题 · 多源确认
Nvidia 发布 Cosmos 3:统一语言、图像、视频、音频和动作的物理 AI 世界模型
Nvidia 推出 Cosmos 3,一个能够理解、模拟和行动于多种物理 AI 任务的统一模型。它将动作视为世界的一等语言,把语言、图像、视频、音频和动作整合到一个共享系统中。该模型通过动作标记设计,让机器人能连接所见与可能发生的事,并决定下一步行动。论文显示,Cosmos 3 可基于视频推断动作,或与未来场景一同生成动作,从而解决机器人抓取、滑动等物理交互问题。
当前结论
Nvidia 让机器人学会动作语言
4 个信源73° AI 热度最后更新 2026/6/13 14:23:37
证据链
相关来源 1NVIDIA AI
查看原文相关来源 2vLLM
查看原文相关来源 3LMSYS Org (SGLang)
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。