08:13berryxia@berryxiaMeta AI 首席科学家、图灵奖得主 Yann LeCun 最新预测,未来 12 到 18 个月内将出现通用方法来训练分层世界模型。这些模型直接从视频和真实世界数据中学习,能够帮助机器人规划动作、辅助医疗系统决策,并解决更多物理世界中的实际问题。LeCun 认为,最终目标是将其扩展为通用世界模型,这标志着 AI 从“会聊天”走向“会做事”的关键一步。行业Yann LeCun世界模型物理世界推荐理由:LeCun 的预测直指当前大语言模型的局限——只会聊天不懂物理世界,做机器人、自动驾驶、医疗决策的团队值得关注这个从“理解语言”到“理解因果”的范式转变。原文稍后读已读值得跟进有用关注 Yann LeCun
13:22Gary Marcus@GaryMarcus精选Gary Marcus 等学者在皇家学会《哲学汇刊 A》组织了一期关于“世界模型”的特刊,集结了 Michael Levin、David Ha、Melanie Mitchell、Joshua Tenenbaum 等顶尖研究者。特刊聚焦于当前 LLM 的局限,探讨如何通过构建世界模型实现更接近自然智能的 AI,包括因果推理、系统 2 认知和意识等核心问题。文章指出,世界模型可能是让 AI 具备可靠推理和泛化能力的关键,甚至关系到 AI 安全的未来。这一特刊标志着学界开始认真面对“超越 LLM”的硬问题。论文世界模型AGI自然智能推荐理由:世界模型是 AI 从“鹦鹉”走向“真正理解”的关键一步,做 AI 研究或关注 AGI 路径的人,这篇特刊的阵容和问题清单值得细读。原文稍后读已读值得跟进有用关注 世界模型
01:29berryxia@berryxiaHuggingPapers 推送了一篇重磅综述《World Action Models: The Next Frontier in Embodied AI》,首次系统定义了 WAMs 概念。WAMs 是能同时预测未来世界状态并生成真实可执行动作的具身基础模型,区别于仅处理语言的传统模型。论文梳理了架构设计、数据生态和评估协议,并附有 2024-2026 年发展时间线。这标志着具身智能从“思考”迈向“行动”的关键一步。论文具身智能World Action Models综述推荐理由:这篇综述系统定义了 WAMs,解决了具身智能从“想”到“做”的落地难题,做机器人、具身 Agent 或世界模型的开发者值得收藏,直接看时间线图就能把握未来方向。原文稍后读已读值得跟进有用关注 具身智能
23:43Gary Marcus@GaryMarcusGary Marcus转发并重申其多年观点:Yann LeCun指出,当前大语言模型(LLM)缺乏世界模型,无法在行动前预测后果,因此无法构建可靠的智能体系统。LeCun认为,LLM只是“行动,然后后果是别人的问题”,这并非真正的智能。这一观点引发了对当前AI系统局限性的讨论,尤其对智能体开发方向具有重要警示意义。AI模型Yann LeCun世界模型智能体推荐理由:LeCun的批评直指当前LLM智能体的核心缺陷——缺乏因果推理能力,做智能体开发的团队值得认真思考这一根本性挑战。原文稍后读已读值得跟进有用关注 Yann LeCun
21:55向阳乔木@vista8有观点认为,AI正从被动接受训练的“宠物模式”转向主动探索世界的“幼儿模式”。宠物模式依赖明确指令和边界,而幼儿模式则允许AI自己试错、学习世界运转规律。这种转变意味着AI将具备世界模型和自主改进学习能力,可能成为未来发展的关键方向。该观点引发了对AI自主性和学习方式的讨论。行业AI进化自主改进学习世界模型推荐理由:关注AI进化方向的读者值得一看——它用“宠物vs幼儿”的比喻点出了AI从被动到主动的范式转变,做AI研究或产品设计的人会从中获得启发。原文稍后读已读值得跟进有用关注 AI进化
16:16Paul Couvert@itsPaulAiNvidia 发布了名为 Cosmos 的 2.6B 参数开源世界模型,能够将单张图片、文本提示和轨迹转化为可控的虚拟世界。该模型可在单张 GPU(如 RTX 5090 或 H100)上运行,大幅降低了世界模型的使用门槛。代码和论文已分别发布在 GitHub 和 arXiv 上。该模型适用于具身 AI、机器人研究和仿真等场景,让更多研究者和开发者能够探索世界模型的应用。AI模型世界模型开源/仓库Nvidia推荐理由:Nvidia 把世界模型的门槛打下来了——2.6B 参数、单 GPU 可跑、开源,做具身 AI 和机器人仿真的团队可以直接拿来用,省去从头训练的麻烦。原文稍后读已读值得跟进有用关注 世界模型
14:02官方账号Yann LeCun@ylecun73°Yann LeCun 在 Unsupervised Learning 播客中与 Jacob Effron 进行了深度对话,分享了他对 LLM 局限性的尖锐观点,以及为何与 Hinton、Bengio 在 LLM 问题上产生重大分歧。他透露了离开 Meta 的原因,并介绍了新公司 AMI 押注世界模型的战略。LeCun 还预测了 2027 年的 AI 发展,并建议博士生不要再专注于 LLM 研究。这场访谈涵盖安全讨论、FAIR 的得失以及突破性研究如何真正发生。行业LLM 局限世界模型Yann LeCun推荐理由:LeCun 对 LLM 的批判性观点和世界模型路线图,对 AI 研究者、博士生和关注下一代 AI 架构的人极具启发,值得花一小时听完。原文稍后读已读值得跟进有用关注 LLM 局限
10:54官方账号arXiv cs.AI@Jiaxin Wu, Yihao Pi, Yinling Zhang, Yuheng Li, Xueyan Zou精选生成式视频模型常被当作隐式世界模型,但现有评估方法依赖人工判断或学习评分器,难以诊断几何错误。研究者提出PDI-Bench框架,通过分割、点跟踪和单目重建,将生成视频中的物体提升到3D世界坐标,计算尺度-深度对齐、3D运动一致性和3D结构刚性三个维度的残差。配套的PDI-Dataset覆盖多种几何约束场景,测试发现当前最先进的视频生成器存在一致的几何特定失败模式,这些模式不被常见感知指标捕获。该框架为迈向物理可信的视频生成提供了诊断信号。论文视频生成世界模型几何一致性推荐理由:视频生成模型常被当作世界模型,但几何一致性是硬伤——PDI-Bench用定量方法暴露了现有模型在3D结构上的系统性失败,做视频生成或世界模型研究的团队值得用它来诊断自己的模型。原文稍后读已读值得跟进有用关注 视频生成
11:23IT之家(博客/媒体)小米发布并开源了 Xiaomi OneVL,一个一步式潜空间语言视觉推理框架。雷军称,该模型在业内率先通过潜空间推理将 VLA(视觉语言动作模型)和世界模型统一到同一框架中。在推理和规划等主流基准上,Xiaomi OneVL 全面刷新了潜在推理方法的性能上限。该模型在精度上超越显式 CoT,速度上对齐“仅答案”预测的潜空间 CoT 方案。小米已将模型权重和训练、推理代码全面开源,邀请全球开发者探索自动驾驶大模型的可能性。AI模型自动驾驶Xiaomi OneVLVLA推荐理由:小米把 VLA 和世界模型统一到一套框架,解决了自动驾驶多模型协同的痛点,做自动驾驶或具身智能的开发者可以直接用开源代码试试,性能还刷新了基准。原文稍后读已读值得跟进有用关注 自动驾驶
01:10AK@_akhaliq本文探讨企业系统是否需要学习世界模型来推断动态行为,强调上下文在理解系统变化中的关键作用。作者认为,传统企业系统依赖规则和静态模型,但面对复杂动态环境时,学习世界模型能提升适应性和预测能力。文章通过案例说明,结合上下文信息的世界模型可以更准确地捕捉系统行为模式,从而优化决策和自动化流程。这一观点对AI在企业应用中的落地具有重要参考价值。论文世界模型企业系统上下文推断推荐理由:企业系统正从规则驱动转向智能决策,学习世界模型是提升系统动态适应性的关键。做企业级AI应用或系统架构的开发者,值得关注这一前沿思路。原文稍后读已读值得跟进有用关注 世界模型
17:17IT之家(博客/媒体)精选70°小米技术发布并开源了 Xiaomi OneVL 一步式潜空间语言视觉推理框架,首次将 VLA(视觉语言动作)与世界模型统一到同一框架中。该模型在多个自动驾驶基准上刷新了潜在推理方法的性能上限,同时提供语言和视觉双维度的可解释性。相比传统方法,OneVL 在精度上超越显式 CoT,在速度上对齐“仅答案”预测。小米已将模型权重、训练和推理代码全面开源。AI模型自动驾驶VLA世界模型推荐理由:自动驾驶研究者终于有了一个统一 VLA 与世界模型的开源方案——OneVL 在精度和速度上均优于现有方法,做端到端驾驶或世界模型开发的团队可以直接拿来用。原文稍后读已读值得跟进有用关注 自动驾驶