20:03Geek@geekbbDatawhale 推出了一套开源的世界模型课程,包含五讲和五个配套项目,覆盖从 VAE 到 Dreamer 再到评估仪表盘的完整学习路径。课程强调动手实践,帮助学习者系统理解世界模型的原理、架构和实现。对于想深入世界模型领域的研究者、学生或开发者来说,这是一份难得的免费学习资源。AI模型世界模型开源/仓库课程推荐理由:想系统入门世界模型的开发者终于有了一条清晰的动手路径——五讲五项目从 VAE 到 Dreamer 全覆盖,比啃论文高效得多,建议直接跟着项目跑一遍。原文稍后读已读值得跟进有用关注 世界模型
18:42IT之家(博客/媒体)阿里集团副总裁兼搜推智能产品事业部总裁张凯夫已离职创业,方向是构建面向市场的世界模型。他认为预测集体人类行为,尤其是市场行为,是AI尚未征服的终极挑战之一。张凯夫在阿里任职近十年,深度参与淘宝商家生态与流量运营,曾推动AI在淘宝搜索、推荐和广告ROI上的显著提升。他正在招募相关人才加入。行业世界模型市场预测创业推荐理由:张凯夫从阿里电商AI操盘手转向市场行为预测,做AI+金融/商业分析的团队可以关注这个新方向,看看世界模型如何落地市场预测。原文稍后读已读值得跟进有用关注 世界模型
17:41IT之家(博客/媒体)Momenta 宣布获得无锡市智能网联汽车道路测试与示范应用许可,并于今年1月起在当地启动测试。公司计划在2026年内于全球多个新城市及区域落地高阶自动驾驶,重点推进技术场景验证与民生出行服务。Momenta 已在国内上海、苏州及海外慕尼黑、阿布扎比等地运营 Robotaxi,并正拓展欧洲、新加坡及日本市场。其发布的 R7 强化学习世界模型已应用于 L4 级自动驾驶,提升车辆在复杂场景中的通行能力。Momenta 与 Uber、Grab、梅赛德斯-奔驰等合作,量产智驾方案搭载量超80万台,覆盖十余个国家和地区。行业自动驾驶Momenta路测许可推荐理由:Momenta 的全球扩张和 R7 世界模型落地,让关注自动驾驶落地的从业者看到 L4 级技术从测试到商用的加速路径,做出行服务或智驾方案的团队值得关注其多城部署节奏。原文稍后读已读值得跟进有用关注 自动驾驶
16:41官方一手marktechpost@Asif Razzaq83°NVIDIA 发布了 Cosmos 3,这是一款开源的“全模态世界模型”,采用双塔混合 Transformer 架构,将自回归 VLM 推理器与扩散生成器结合。该模型能够统一物理推理、世界生成和动作生成,为物理 AI 提供基础能力。Cosmos 3 旨在让机器人、自动驾驶等系统更好地理解物理世界并生成合理动作。其开源特性有望加速物理 AI 领域的研究与应用开发。AI模型NVIDIACosmos 3物理 AI10 个信源在谈事件专题推荐理由:NVIDIA 把物理推理和世界生成塞进一个开源模型,做机器人或自动驾驶的团队可以直接拿来用,省去从头训练物理世界模型的成本。原文稍后读已读值得跟进有用关注 NVIDIA
14:48官方一手Pandaily@contact@pandaily.com (Pandaily)精选中国开源世界模型 Boundless 在全球排行榜上超越 Google、NVIDIA 等巨头的产品,成为第一名。世界模型是能理解和模拟物理现实的 AI 系统,对机器人、自动驾驶等领域至关重要。Boundless 的开源特性降低了研究门槛,让更多团队能参与开发。这一突破显示中国在 AI 基础模型领域的竞争力正在增强。AI模型世界模型开源/仓库物理模拟10 个信源在谈事件专题推荐理由:世界模型是 AI 的下一个前沿,做机器人或自动驾驶的团队可以直接用 Boundless 开源代码加速研发,值得关注。原文稍后读已读值得跟进有用关注 世界模型
00:31小互@imxiaohuAI在医疗领域的应用正从“看片子找病灶”升级为“世界模型”,能提前模拟不同治疗方案在患者身上的长期效果,并直接推荐最优方案。该技术已在肝癌化疗栓塞和放疗中验证,将临床决策成功率提升13%。其核心价值在于,真实世界不允许多次试错,而世界模型提供了低成本、高保真的决策模拟。这一范式有望扩展到农业、城市规划、低空经济等高风险决策领域。AI产品世界模型医疗AI决策模拟推荐理由:医疗AI终于从“识别病灶”进化到“预测疗效”,做临床决策的医生和医疗AI开发者值得关注——世界模型正在把试错成本降到零,建议点开看看它如何颠覆传统治疗流程。原文稍后读已读值得跟进有用关注 世界模型
17:46rohanpaul_ai@rohanpaul_ai76°LongCat 发布了 WBench,一个用于测试视频世界模型的基准,将测试重点从视觉质量转向控制、多轮记忆、指令遵循和物理合理性。WBench 包含 289 个案例、1058 次交互、20 个模型、5 个维度和 22 个自动指标,覆盖导航、主体动作、事件编辑、视角切换等。测试发现,没有模型在所有维度上占优,视觉质量与控制能力几乎无关。WBench 的设计将世界设置与用户动作分离,帮助研究者定位失败原因。这标志着视频世界模型评估从“视频好不好看”转向“模型能否维持可控世界”。论文视频生成世界模型基准测试推荐理由:做视频生成或世界模型的研究者终于有了正经的评估工具——WBench 把视觉质量和控制能力分开测,看完你会明白为什么很多漂亮视频其实不能当世界模型用。原文稍后读已读值得跟进有用关注 视频生成
12:10Latent.Space@latentspacepod精选Ethan He 在 Latent Space 播客中分享了对视频生成、世界模型、LLM、智能体和持续学习的看法。他认为视频模型的大部分智能来自语言而非视频数据,idea-to-code 的速度已经很快,瓶颈在于计算资源。他强调迭代速度在模型开发中几乎压倒一切,下一个飞跃将是视频智能体而非更好的视频模型。他还预测扩散模型将成为 AGI 的前端,LLM 作为后端,生成式 UI 将取代 HTML/CSS,物理具身可能成为强大 AI 的工具。AI模型视频生成世界模型智能体推荐理由:Ethan He 对 AI 前沿的预判直击要害,做视频生成、智能体或世界模型的开发者看完会有启发——尤其是关于迭代速度和智能体方向的洞察,值得点开细品。原文稍后读已读值得跟进有用关注 视频生成
12:05官方账号arXiv cs.LG@Ning Lu, Baijiong Lin, Shengcai Liu, Jiahao Wu, Haoze Lv, Yanbin Wei, Lingting Zhu, Shengju Qian, Xin Wang, Ying-Cong Chen, Qi Wang, Ke Tang论文提出 PaW 框架,在强化学习训练语言智能体时,利用策略 rollout 中的动作-观测对作为世界模型监督信号,无需额外模拟器或推理计算。通过动作熵筛选数据、噪声容忍损失和自适应损失平衡三个组件,PaW 在多个智能体任务基准上显著优于纯 RL 基线。该方法解决了 RL 缺乏环境反馈监督的问题,让智能体不仅知道“做什么能得高分”,还理解“动作对环境的影响”。实验表明标准 RL rollout 即可提供有效的世界模型训练信号,降低了世界模型的应用门槛。论文强化学习世界模型语言智能体推荐理由:做语言智能体强化学习的团队,可以用 PaW 在现有 RL 流程中零成本加入世界模型监督,提升智能体对环境的理解能力,值得在项目中尝试。原文稍后读已读值得跟进有用关注 强化学习
11:16官方账号arXiv cs.LG@Eduardo Sebastián, Adrian Pfisterer, Vito Mengers, Oliver Brock, Amanda Prorok这篇论文提出了一种新的机器人学习框架,通过将策略分解为“世界因子”和“任务因子”来实现结构泛化。世界因子描述机器人和环境的固有属性,独立于任务意图;任务因子则定义任务逻辑。作者利用贝叶斯模型证据形式化了这种不对称性,并实例化为AICON图与学习策略的组合,梯度作为两个因子的接口。实验表明,该方法在异构机器人、环境和任务中优于端到端基线,能零样本泛化到分布外配置,并直接迁移到真实硬件。论文机器人学习泛化世界模型推荐理由:机器人学习领域长期面临泛化难题,这篇论文从结构分解入手给出了新解法。做机器人策略研究或部署的团队值得关注,零样本迁移到真实硬件意味着可以直接减少重复训练成本。原文稍后读已读值得跟进有用关注 机器人学习
01:11Latent.Space@latentspacepod78°前xAI世界模型负责人兼Nvidia Cosmos研究员Ethan He解释了AI视频可能遵循与编码智能体相同的路径。他认为文本到视频仅处于自动补全阶段,世界模型将变得实时和交互式,语言模型可能成为视频的控制层。未来AI视频可能更像一个拥有摄像头、编辑器、时间线和工具带的智能体,而非简单的提示框。Grok Imagine从零到一的开发过程展示了这一趋势。AI产品视频智能体世界模型Grok Imagine10 个信源在谈事件专题推荐理由:视频生成领域正在从“生成一段视频”进化到“智能体操控视频”,做AI视频工具或内容创作的团队值得关注这个范式转变。原文稍后读已读值得跟进有用关注 视频智能体
21:50官方账号Decoder@Maximilian Schreiner88°Nvidia 在 GTC Taipei 上推出了一系列面向机器人、自动驾驶和视频系统的模型。核心产品包括新的世界模型 Cosmos 3、大幅升级的驾驶模型 Alpamayo 2 Super,以及一个开源的人形机器人参考平台。这些发布标志着 Nvidia 在物理 AI 领域的重大投入,旨在为机器人提供更强大的感知、规划和交互能力。Cosmos 3 能够生成更逼真的虚拟环境,Alpamayo 2 Super 提升了自动驾驶的决策精度,而开源平台则降低了人形机器人研发的门槛。AI产品Nvidia物理 AI世界模型10 个信源在谈事件专题推荐理由:Nvidia 一口气推出世界模型、驾驶模型和开源人形机器人平台,做机器人、自动驾驶和物理 AI 的开发者可以直接关注这些新工具,看看能否加速自己的项目。原文稍后读已读值得跟进有用关注 Nvidia
14:08官方账号Runway ML@runwayml精选76°Runway 宣布作为创始成员加入 Cosmos Coalition,这是一个由 NVIDIA 和多家顶级 AI 实验室发起的全球性倡议,旨在共同构建并开源面向物理 AI 的前沿世界模型。该联盟将通过一个通用的开放生态系统,加速世界模型的研究与开发,推动物理 AI 的进步。此举有望降低物理 AI 的门槛,促进跨机构协作,为机器人、自动驾驶等领域提供基础模型。行业物理 AI世界模型开源/仓库10 个信源在谈事件专题推荐理由:物理 AI 开发者终于有了开放生态——Runway 和 NVIDIA 牵头开源世界模型,做机器人或自动驾驶的团队可以直接参与共建,值得关注。原文稍后读已读值得跟进有用关注 物理 AI
14:05berryxia@berryxia78°Decart 发布了一个非视频生成的持久化、多人协作世界模型,核心创新在于将「世界状态」与「视觉渲染」彻底解耦。这意味着世界不再是逐帧生成的画面,而是一个持续运行、可被用户实时修改、并能从任意视角稳定观测的结构化环境。该模型支持多人同时在线交互,是目前最接近「可交互持久世界」的尝试。这一突破为游戏、虚拟世界和协作式 AI 应用提供了全新范式。AI产品世界模型多人协作持久化推荐理由:做虚拟世界、游戏或协作式 AI 的团队终于有了一个真正持久化的交互环境——世界状态独立于渲染,多人可同时修改并观测。建议直接体验,这可能是下一代交互平台的原型。原文稍后读已读值得跟进有用关注 世界模型
23:18IT之家(博客/媒体)精选72°智元机器人自研的世界模型 Genie Envisioner-Sim 2.0(GE 2.0)在具身领域热门榜单 WorldArena Track1 中登顶,该赛道评测世界模型的感知与动作响应能力。GE 2.0 仅用 20 亿参数,就超越了英伟达、微软等团队的超大参数模型,验证了轻量化模型在人形机器人应用中的适配性。该模型首次全面覆盖长时序生成、多视角生成、本体状态生成、近实时推理及奖励判别等核心环节,在长时序推理中能稳定生成 40-50 秒高质量视频,且与真实世界保持强相关性。GE 2.0 还具备奖励模型机制,可自动筛选高质量数据回流给策略模型,助力多项任务性能提升。AI模型世界模型具身智能智元推荐理由:智元用 2B 参数模型在具身智能世界模型赛道击败英伟达等巨头,做机器人或具身智能的开发者值得关注——轻量化方案可能改写行业路线。原文稍后读已读值得跟进有用关注 世界模型
16:45Stanford AI Lab@StanfordAILab斯坦福人工智能实验室(SAIL)发布博客文章,介绍其最新研究VAGEN。VAGEN是一个强化学习框架,旨在训练视觉语言模型(VLM)智能体通过明确的视觉状态推理来构建内部世界模型。该框架使智能体能够更好地理解环境动态,从而在复杂任务中做出更合理的决策。这一进展对于提升AI在机器人、自动驾驶等需要环境理解的领域中的表现具有重要意义。论文强化学习VLM智能体世界模型推荐理由:VAGEN解决了VLM智能体在复杂环境中缺乏内部世界模型的问题,做机器人或自动驾驶研究的团队值得关注,它可能让AI的决策更接近人类推理。原文稍后读已读值得跟进有用关注 强化学习
00:08AK@_akhaliq精选minWM是一个全栈开源框架,专门用于构建实时交互式视频世界模型。该框架提供了从模型设计到部署的完整工具链。开发者可以利用minWM创建能够实时响应输入的环境模拟。AI模型minWM世界模型视频生成推荐理由:开源实时视频世界模型框架原文稍后读已读值得跟进有用关注 minWM
16:39官方一手pandaily@contact@pandaily.com (Pandaily)精选X-Square Robot 推出了 WALL-WM,这是全球首个事件级预测的具身 AI 世界模型。与传统逐帧预测不同,WALL-WM 转向语义事件理解,让机器人能够理解任务目标而非记忆像素序列。该模型预计于 2026 年 5 月正式发布。这一突破意味着机器人可以更高效地规划动作,减少对大量训练数据的依赖,推动具身智能从感知走向认知。AI模型具身智能世界模型事件预测推荐理由:做机器人或具身智能的团队终于有了能理解任务目标的模型——WALL-WM 从像素预测升级到事件理解,直接降低训练成本,做自主导航或操作任务的开发者值得关注。原文稍后读已读值得跟进有用关注 具身智能
09:56rohanpaul_ai@rohanpaul_ai精选Yann LeCun 团队的新论文揭示了自监督模型 LeJEPA 何时能真正学到隐藏的世界变量。研究发现,只有当这些隐藏变量呈平衡的高斯分布时,LeJEPA 才能可靠地恢复它们。论文从数学上证明,当真实隐藏变量是独立高斯变量且配对视图来自稳定噪声过程时,LeJEPA 的最优解必然能恢复这些变量(至多相差一个旋转或翻转)。这为理解自监督 AI 模型何时是在学习世界结构、而非仅生成恰好有用的特征提供了理论依据。论文自监督学习世界模型LeJEPA推荐理由:这篇论文给自监督学习社区一个清晰的数学答案:什么条件下模型真的在学世界模型。做表征学习或世界模型研究的开发者,看完会对 LeJEPA 的能力边界有更硬核的理解。原文稍后读已读值得跟进有用关注 自监督学习
11:56官方账号arXiv cs.LG@Audrey Chan, Aaron Labbé, Jacob Lavoie, Jordan Bannister, Arsène Fansi Tchango, Guillaume Lajoie, Laurent Charlin该论文提出AMRS情感音乐推荐系统,部署于LUCID健康平台,服务临床用户(如神经认知障碍老年人)和普通用户。系统使用因果Transformer构建世界模型,基于历史日志数据预测用户参与度、评分及情感状态(效价与唤醒度)。通过行为克隆初始化推荐策略,再使用直接偏好优化(DPO)离线微调,避免在线情感实验的伦理问题。实验表明,世界模型在冷启动场景下能有效预测行为与情感信号,DPO在保持推荐多样性的同时提升了情感指标。该工作为无法进行在线实验的情感推荐场景提供了可部署的验证方案。论文推荐系统情感计算离线优化推荐理由:做健康/情感类推荐系统的团队终于有了一个可落地的离线优化方案——用世界模型模拟用户情感反馈,避免在线实验的伦理风险,做医疗或老年人应用的开发者可以直接参考其方法论。原文稍后读已读值得跟进有用关注 推荐系统
11:36AK@_akhaliq精选72°Gamma-World 是一种生成式多智能体世界建模方法,超越了传统双玩家(如双人博弈)的限制,能够模拟多个智能体在复杂环境中的交互。该模型通过生成式框架学习智能体间的动态关系,适用于游戏、机器人协作等场景。研究展示了其在多智能体环境下的强大建模能力,为更复杂的群体智能研究提供了新工具。论文多智能体世界模型生成式模型推荐理由:多智能体系统开发者终于有了能处理超过两个智能体的世界模型——Gamma-World 解决了传统双玩家建模的瓶颈,做游戏 AI 或机器人协作的团队值得关注。原文稍后读已读值得跟进有用关注 多智能体
11:33IT之家(博客/媒体)精选蔚来宣布ES9行政旗舰SUV将首发世界模型全新版本,该版本采用国内首个直接操作方向盘与踏板的智能辅助驾驶系统,省去轨迹输出步骤,提升控车精准度。同时,它引入行业首个完整“世界模型+监督微调+闭环强化学习”三层训练框架,并成为首个车企自研可识别天空路牌的智能辅助驾驶系统。2026年1月,基于该架构的版本将全量推送至Banyan、Cedar、Cedar S系统的数十万辆车,6月先行更新。更新后城区领航辅助使用里程和时长环比分别提升92%和116%。AI产品蔚来世界模型智能辅助驾驶推荐理由:蔚来这次把端到端控制直接做到方向盘和踏板上,省掉轨迹翻译环节,开智能驾驶的体验会更丝滑。做自动驾驶或关注车企技术路线的开发者值得点开,看看三层训练框架怎么让模型既拟人又合规。原文稍后读已读值得跟进有用关注 蔚来
22:56官方账号NVIDIA AI@NVIDIAAINVIDIA AI 官方账号发布了一段由 Julia Turc 制作的关于“世界模型”的讲解视频。视频澄清了世界模型与视频生成的区别,探讨了其超越“AI 垃圾”的潜力,并幽默回应了 Yann LeCun 的争议。该视频旨在帮助观众理解这一当前 AI 领域最热门但最模糊的概念之一。AI模型世界模型NVIDIA视频生成2 个信源在谈事件专题推荐理由:世界模型是当前 AI 最模糊的概念之一,这个视频帮你理清它与视频生成的区别,想搞懂 AI 前沿方向的建议点开。原文稍后读已读值得跟进有用关注 世界模型
11:34IT之家(博客/媒体)76°小米汽车发布了全新的世界模型框架 Xiaomi Auto World Model,首次将三维重建与视频生成深度耦合,打破了行业长期将两者独立的技术路线。该框架通过重建提供几何锚点、生成填补未观测场景,实现了高稳定性、高一致性和高真实性,在 Waymo、nuScenes 等主流基准测试中全面取得 SOTA。目前该模型已在小米汽车的合成数据生成、仿真测试和智能座舱辅助驾驶学堂三大场景落地,交付了超过 10 万 clips 高质量合成数据。这一技术路径有望推动辅助驾驶从“场景感知”向“认知推演”的高阶形态跃迁。AI产品世界模型自动驾驶三维重建推荐理由:小米汽车把世界模型的两条路线拧成一股绳,解决了重建缺想象、生成易漂移的行业难题。做自动驾驶感知或仿真的团队,建议看看他们的论文和技术主页,或许能启发新的技术路径。原文稍后读已读值得跟进有用关注 世界模型
23:40rohanpaul_ai@rohanpaul_aiX Square Robot 开始将下一代家用机器人部署到真实家庭中,这是从舞台演示到日常生活的关键一步。该机器人运行名为 WALL-B 的世界模型,整合视觉、语言、触觉、动作和物理预测,以应对家庭环境的复杂性和不确定性。厨房等家庭场景并非工厂的受控环境,而是充满习惯、杂乱、宠物、儿童和不断变化物品的动态空间。这体现了 Moravec 悖论:对人类来说轻松的任务(如整理杂物、避开宠物、判断物品归属)对机器人来说极其困难。该测试旨在验证机器人在真实家庭中的适应性和实用性。AI产品家用机器人世界模型X Square Robot推荐理由:家用机器人终于走出实验室进入真实家庭,做机器人研发或智能家居的团队值得关注 WALL-B 世界模型如何应对日常混乱——这比任何舞台演示都更有说服力。原文稍后读已读值得跟进有用关注 家用机器人
11:31官方一手arXiv: Google DeepMind@Zhixiang Guo, Siyuan Liang, Shi Fu, Cheng Guo, Andras Balogh, Mark Jelasity, Dacheng Tao精选世界模型作为决策智能体日益普及,但其对抗鲁棒性因缺乏自动化评估方法而研究不足。现有手动调参的攻击要么高估鲁棒性,要么因穷举搜索成本过高而不可行。WMAttack 将鲁棒性评估建模为有限预算下的攻击配置搜索,包括攻击类型、扰动预算、优化步数等。其核心创新是自校正攻击搜索(SCAS)和表示引导攻击检索(RGAR),分别通过反馈优化攻击分布和利用历史配置加速新环境搜索。在 Atari 和 DeepMind Control 任务上,WMAttack 发现了比基线更强的攻击,归一化奖励下降显著提升。论文世界模型对抗攻击鲁棒性评估推荐理由:世界模型智能体的安全性评估一直缺乏自动化工具,做对抗攻击或鲁棒性研究的团队可以直接用这个框架替代手动调参,省时且结果更可靠。原文稍后读已读值得跟进有用关注 世界模型
10:49Gary Marcus@GaryMarcus精选Gary Marcus 在推文中指出,世界模型(world model)并非新概念,已在象棋程序、导航系统、维基百科等系统中存在多年,它们是对对象、地点、事件、机制等可推理内容的显式表示。然而,当前的大语言模型(LLM)缺乏这种显式世界模型。Marcus 强调,大多数世界模型是手工构建的,真正的挑战在于如何从数据中自动获取它们。这引发了关于AI系统如何更好地理解和推理世界的讨论。AI模型世界模型LLM推理推荐理由:Marcus 点出了LLM的核心短板——缺乏显式世界模型,做AI推理和知识表示的开发者值得关注,看完会重新思考LLM的局限性。原文稍后读已读值得跟进有用关注 世界模型
21:48Gary Marcus@GaryMarcusGary Marcus 在 X 上发文,感叹整个 AI 领域正朝着他在 2019-2020 年倡导的神经符号与世界模型方向发展,而批评者却声称他“总是错的”。他指出,六年前他的文章《AI 的下一个十年》就以世界(认知)模型为核心,如今这一方向终于迎来时机。Marcus 的言论反映了 AI 研究范式的转变,从纯深度学习向更结构化、可解释的模型演进。行业神经符号世界模型GaryMarcus推荐理由:Marcus 的观察点明了 AI 研究范式的关键转向,关注认知架构和符号推理的开发者值得一读,看看自己是否站在了趋势上。原文稍后读已读值得跟进有用关注 神经符号
20:54Gary Marcus@GaryMarcus精选Gary Marcus 引用六年前的文章《AI 的下一个十年》,指出世界模型(World Models)的核心地位终于得到认可。DeepMind 的 Demis Hassabis 认为当前 AI 的局限在于语言只能描述世界,无法包含世界,而世界模型是他“最持久的热情”。语言模型从文本中吸收了远超预期的现实结构,但文本只是经验的压缩残渣,无法编码重量、抓握、平衡、摩擦等物理细节。世界模型旨在学习物理现实的隐藏语法——物体如何持续、力如何展开、空间如何随行动变化——这对于真正的智能至关重要,因为智能不仅是回答得好,更是知道下一步行动会带来什么后果。AI模型世界模型Gary MarcusDemis Hassabis推荐理由:Marcus 和 Hassabis 点出了当前 LLM 的根本局限——文本无法替代真实体验,做 AI 研究或关注 AGI 方向的开发者值得深入理解世界模型为何是下一关键突破。原文稍后读已读值得跟进有用关注 世界模型
09:26rohanpaul_ai@rohanpaul_ai72°DeepMind 创始人 Demis Hassabis 指出当前 AI 的局限:语言可以描述世界,但无法包含世界。语言模型从文本中意外学到了大量现实结构,但文本只是经验的压缩残渣,而非经验本身。世界由需要亲身经历、触摸、预测、违反和修复的约束构成,而非仅由可命名的事实组成。Hassabis 认为世界模型旨在学习物理现实的隐藏语法——物体如何持续、力如何展开、空间如何变化、行动如何产生反馈。他强调,智能不仅是回答得好,更是知道如果你移动、伸手、推、闻、滑倒或失败,接下来会发生什么。AI模型世界模型语言模型Demis Hassabis推荐理由:Hassabis 点出了当前大语言模型的核心天花板——文本无法替代真实体验,做 AI 研究或关注 AGI 路径的人值得细读,看完会对世界模型的价值有更深理解。原文稍后读已读值得跟进有用关注 世界模型
23:47rohanpaul_ai@rohanpaul_ai83°Project Genie 是 Google AI 的一项新功能,允许 Ultra 用户将美国任何真实地点的 Google Maps 街景图像转化为可交互的 AI 生成场景。这意味着用户可以通过提示词操控和探索虚拟化的真实世界环境,而不仅仅是查看静态图片。该技术展示了世界模型从模拟到现实应用的跨越,为游戏、虚拟旅游和城市规划等领域带来新可能。目前该功能仅限 Google AI Ultra 用户使用,但预示着未来更广泛的沉浸式体验。AI产品世界模型Google AIProject Genie推荐理由:世界模型终于从实验室走向真实场景——Project Genie 让任何人用提示词就能把街景变成可交互的虚拟世界,做游戏、VR 或城市模拟的团队值得一试。原文稍后读已读值得跟进有用关注 世界模型
08:00小互@imxiaohu一条推文将 Gemini Omni 形容为“视频版的香蕉”,暗示其具备强大的视频编辑与理解能力。作者认为它远不止视频编辑,而是世界模型的雏形,代表了通用 AGI 的初始形态。该推文引发了对 Gemini Omni 潜力的讨论,认为它可能推动 AI 从语言模型向多模态世界理解迈进。AI产品Gemini Omni世界模型AGI推荐理由:如果你关注多模态 AI 和 AGI 进展,这条推文点出了 Gemini Omni 可能超越视频编辑、成为世界模型雏形的关键判断,值得一看。原文稍后读已读值得跟进有用关注 Gemini Omni
08:13berryxia@berryxia83°Google I/O 2026 主题演讲由 Sundar Pichai 主讲,聚焦「Agentic Gemini 时代」,强调 AI 从聊天机器人进化为能自主思考、执行任务、跨设备运行的「世界模型」。主要发布包括 Gemini 3.5 Flash(速度提升 4 倍,默认模型)、Gemini Omni 多模态世界模型(支持任意输入输出,理解物理世界)、Gemini Spark 全天候自主 Agent,以及 Android XR 智能眼镜预览。Google 将 AI 深度整合到 Search、Workspace、Gmail 等产品中,并推出开发者工具 Antigravity 2.0。整体策略务实,注重落地而非参数竞赛。行业Google I/OGemini智能体推荐理由:Google 把 AI 从聊天工具升级为操作系统级智能体,做开发、用搜索、搞创意的团队都能直接受益——Gemini 3.5 Flash 已可用,建议开发者立刻试试。原文稍后读已读值得跟进有用关注 Google I/O
06:27Justine Moore@venturetwins精选Genie是Google DeepMind开发的世界模型。演示中用户选择光球代表场景和角色,模型即时加载世界。用户可通过摇杆像玩游戏一样导航。该交互让用户实时控制世界模型中的环境与角色。AI模型GenieGoogle DeepMind世界模型推荐理由:你也能像打游戏一样操控世界模型原文稍后读已读值得跟进有用关注 Genie
03:31官方账号NVIDIA AI@NVIDIAAI76°NVIDIA 研究团队开源了 SANA-WM,一个 2.6B 参数的世界模型,能在单张 GPU 上根据一张图片、文本描述和相机轨迹生成 60 秒可控视频。该模型原生支持精确的相机控制,为视频生成和世界模拟提供了新的可能性。SANA-WM 的开源发布降低了高质量可控视频生成的门槛,对内容创作、游戏和仿真领域有重要意义。AI模型世界模型视频生成相机控制2 个信源在谈事件专题推荐理由:NVIDIA 把世界模型的门槛拉到单卡可跑,做视频生成或 3D 仿真的开发者可以直接拿来用,60 秒可控视频不再是云端专属。原文稍后读已读值得跟进有用关注 世界模型
02:54IT之家(博客/媒体)谷歌在 2026 I/O 大会上宣布,将通用世界模型 Project Genie 与街景服务结合,基于真实街景图像生成可互动、可探索的 3D 虚拟世界。用户可指定地点、风格(如“石器时代”)和角色,系统据此创建沉浸式环境。该能力目前仅支持美国地点,仍为实验性原型,主要用于 AI 智能体和机器人训练。谷歌计划未来扩展至更多地区,但未给出时间表。AI产品谷歌Genie世界模型推荐理由:Genie 街景版让 AI 训练和虚拟内容创作有了真实世界基础,做机器人导航或游戏场景生成的团队可以直接用这个原型来测试想法。原文稍后读已读值得跟进有用关注 谷歌
09:53berryxia@berryxia83°Odyssey 实验室推出了 Agora-1,这是全球第一个真正实时的多agent世界模型。该模型支持人类和AI同时进入同一个模拟世界,进行实时互动和互相影响。团队以经典游戏 GoldenEye 的死亡竞赛模式作为可玩的研究预览,用户现在就可以体验与AI一起开黑、互射、抢旗,模型会实时生成画面和声音,整个世界持续更新。这标志着从单人生成视频到多人共享活世界的转变。Odyssey 认为,多agent世界模型将彻底改变游戏、模拟、教育、机器人和AI协作的方式。AI产品世界模型多agent实时互动推荐理由:Odyssey 把世界模型从单人演示拉进了多人实时互动,做游戏、模拟或AI协作的团队可以直接体验这个活世界,建议点开试试。原文稍后读已读值得跟进有用关注 世界模型
09:15berryxia@berryxia72°Odyssey AI 实验室发布了 Starchild-1,这是全球首个实时多模态世界模型。与以往只能生成画面的世界模型不同,Starchild-1 能同时生成真实世界的声音,实现视觉与听觉的同步融合。视频演示中,画面动态与声音实时匹配,营造出完整的场景模拟。这一突破不仅提升了视频生成的真实感,更被视为向通用世界模型迈出的关键一步,旨在让 AI 真正理解和模拟物理世界。AI模型世界模型多模态实时生成推荐理由:做 AI 模拟、游戏开发或虚拟现实的人会眼前一亮——Starchild-1 让世界模型从“只看”进化到“又看又听”,实时多模态融合直接拉高了物理模拟的真实感,值得关注它的后续开放计划。原文稍后读已读值得跟进有用关注 世界模型
04:03rohanpaul_ai@rohanpaul_ai83°Odyssey 团队推出 Agora-1,一个多智能体世界模型,解决了世界模型在多人交互场景下的核心瓶颈:保持共享现实的一致性。传统世界模型只能处理单玩家预测,而 Agora-1 支持最多 4 个人类或 AI 智能体同时在模拟世界中实时行动,模型需要追踪碰撞、时序、意图和后果。这意味着世界模型从单玩家预测器转变为共享实时环境,其真实性不再只是视觉保真度,而是当多个智能体从不同方向推动世界时,它能否保持连贯。这是对世界模型能否像游戏引擎一样服务多玩家的首次严肃测试。AI模型世界模型多智能体共享现实推荐理由:做多智能体模拟或游戏引擎的开发者,Agora-1 展示了世界模型从单机到联机的关键跃迁——共享现实一致性是下一个必须攻克的难题,值得关注其技术细节。原文稍后读已读值得跟进有用关注 世界模型
08:13berryxia@berryxiaMeta AI 首席科学家、图灵奖得主 Yann LeCun 最新预测,未来 12 到 18 个月内将出现通用方法来训练分层世界模型。这些模型直接从视频和真实世界数据中学习,能够帮助机器人规划动作、辅助医疗系统决策,并解决更多物理世界中的实际问题。LeCun 认为,最终目标是将其扩展为通用世界模型,这标志着 AI 从“会聊天”走向“会做事”的关键一步。行业Yann LeCun世界模型物理世界推荐理由:LeCun 的预测直指当前大语言模型的局限——只会聊天不懂物理世界,做机器人、自动驾驶、医疗决策的团队值得关注这个从“理解语言”到“理解因果”的范式转变。原文稍后读已读值得跟进有用关注 Yann LeCun