17:16官方一手marktechpost@Michal SutterInduction Labs 推出 Imagination Models 架构,其候选模型 Photon-1 为稀疏 106B-A5B MoE,仅在未标注动作的原始视频上完成单次预训练。Photon-1 能够模拟桌面操作、玩跳棋,并建模台球物理。该架构挑战了传统需动作标签的预训练范式。AI模型Photon-1Induction Labs世界模型推荐理由:Induction Labs 搞了个新套路:不用动作标签,只看视频就能学会模拟桌面、跳棋和台球物理。106B 参数的 MoE 模型,一次预训练就够了。原文稍后读已读值得跟进有用关注 Photon-1
03:08官方一手marktechpost@Asif RazzaqReactor 团队开源了 Open Dreamer,这是一个基于 JAX 和 Flax NNX 的 Dreamer 4 世界模型管道的完整复现。该项目包含两个代码仓库:next-state/open-dreamer 提供训练管道,包括因果视频分词器、动作条件潜在动力学模型、轨迹生成和 FVD 评分;reactor-team/open-dreamer 提供推理代码。Open Dreamer 的发布使 Dreamer 4 的完整训练流程得以公开复现。AI模型Open DreamerDreamer 4JAX推荐理由:Reactor 团队把 Dreamer 4 的完整训练配方和代码都开源了,JAX/Flax 实现,想复现世界模型做视频预测的赶紧看。原文稍后读已读值得跟进有用关注 Open Dreamer
23:48量子位@思邈该模型在由李飞飞团队构建的视觉语言基准中拿下第一。它完全适配华为昇腾算力平台,无需依赖英伟达硬件。代码和全部权重已开放,社区可直接下载使用。从一张静态图就能生成连贯视频,展现物理规律。AI模型世界模型昇腾李飞飞2 个信源在谈事件专题推荐理由:这个国产模型在权威榜单上拿了第一,还完全开源,用昇腾就能跑,值得看看。原文稍后读已读值得跟进有用关注 世界模型
14:20官方账号vLLM@vllm_project82°NVIDIA 发布 Cosmos 3 Edge,一个4B参数的设备端世界模型,基于自研Nemotron骨干从零训练。模型采用双Transformer塔架构:自回归塔处理视觉/文本推理,扩散塔负责预测、生成和动作输出。在640×360分辨率下,单次推理可输出32个动作,于Jetson Thor上实现15Hz实时控制。vLLM和vLLM Omni已提供即日支持,可用于机器人、自动驾驶和视觉代理。AI模型NVIDIA Cosmos 3 EdgevLLM世界模型5 个信源在谈事件专题推荐理由:NVIDIA发了能在设备上实时跑的世界模型,4B参数,15Hz控制机器人,vLLM直接就能用。原文稍后读已读值得跟进有用关注 NVIDIA Cosmos 3 Edge
09:57官方一手arXiv: Google DeepMind@Jiaqi Li, Xinglong Zhang, Haibin Xie, Yixing Lan, Wei Pan, Xin Xu精选Koopman Dreamer是一种基于Dreamer架构的世界模型,其确定性潜动力学核心采用二维旋转-缩放块,谱半径有界以表示阻尼与周期模式。模型通过线性与低秩双线性动作项捕捉全局和状态依赖控制效应,结合后验条件EMA教师目标与一致性、多步展开等目标训练。论文推导了多步展开误差界,分离谱骨干和双线性交互的放大效应与随机状态失配的影响。在DeepMind Control Suite的6个 proprioceptive 控制任务和UAV-LiDAR自主导航中,Koopman Dreamer将长程潜滚动误差降低30%以上,闭环控制性能提升15%-25%。论文Koopman DreamerDreamer世界模型推荐理由:Koopman Dreamer 给 Dreamer 加了个谱约束核,长程想象稳多了。在 DeepMind 控制套件和无人机导航上,比原版 Dreamer 控得更好更稳。原文稍后读已读值得跟进有用关注 Koopman Dreamer
12:03量子位@量子位的朋友们酷哇科技在WAIC 2026上发布了行业首个双层智能体世界模型,该模型将物理世界模型与人类社会世界模型统一。不同于传统单一物理世界模型,它整合了人类行为和社会规则。该模型旨在让机器人更理解复杂环境,提升交互能力。AI模型酷哇科技双层智能体世界模型智能体推荐理由:酷哇科技搞了个新东西,把物理世界和人类社会的模型合二为一,机器人更聪明了。原文稍后读已读值得跟进有用关注 酷哇科技
18:44量子位@量子位的朋友们国家具身智能应用中试基地与魔芯科技联合发布首个合作世界模型MoWorld 3D。该模型专注于3D场景生成与具身智能交互,支持从文本或图像直接生成三维环境。MoWorld 3D在空间理解与物理模拟方面表现突出,可为机器人训练提供低成本仿真数据。这一发布标志着国内具身智能领域在3D世界模型上取得关键进展。AI模型魔芯科技MoWorld 3D世界模型推荐理由:国家基地联手魔芯搞了个MoWorld 3D,能直接文本生成3D场景,给机器人训练省大钱了。搞具身智能的别错过。原文稍后读已读值得跟进有用关注 魔芯科技
18:33量子位@量子位的朋友们启鸣达人在WAIC 2026上发布了《世界模型驱动的教育AGI白皮书》。白皮书从理论探索到体系构建,系统阐述了世界模型在教育AGI中的应用框架。该白皮书为教育AI领域提供了系统性参考。论文启鸣达人世界模型教育AGI推荐理由:启鸣达人发了份教育AGI白皮书,讲了世界模型怎么驱动教育,搞AI教育的可以看看。原文稍后读已读值得跟进有用关注 启鸣达人
18:48官方账号Decoder@Jonathan Kemper77°Google Deepmind 提出 GenCeption 方法,利用视频生成器完成深度估计和语义分割等经典视觉任务。该方法在仅使用合成视频训练的情况下,匹配甚至超越当前最先进系统的性能。研究团队认为视频生成器内部已经隐式包含了一种通用世界模型,这挑战了传统计算机视觉的范式。GenCeption 在 KITTI 深度估计基准上取得了与基于真实数据训练的模型相当的结果,证明了其有效性。论文GenCeptionGoogle Deepmind视频生成推荐理由:Deepmind 把视频生成器当成通用感知模型,用合成视频训练就达到了顶级深度估计水平,挺震撼的,值得一看。原文稍后读已读值得跟进有用关注 GenCeption
16:18IT之家(博客/媒体)73°阿里云百炼于7月19日上线世界模型产品HappyOyster 1.0。该模型从海量视频中学习物理规律,用户输入一句话或一张图即可生成可交互数字世界。提供世界探索和实时导演两种模式,分别支持1分钟连续交互和3分钟以上分支叙事。已开放Android/iOS/Web三端SDK,在阿里云百炼开启灰测。可用于游戏原型、互动短剧、虚拟陪伴等场景。AI产品阿里云百炼HappyOyster世界模型推荐理由:阿里云百炼出了个世界模型,一句话就能生成可以亲自进去玩的数字世界,还能随时改剧情,适合做游戏原型或互动剧。原文稍后读已读值得跟进有用关注 阿里云百炼
11:42IT之家(博客/媒体)小鹏图灵第二代VLA模型发布,实现同一套模型同时适配中国和欧洲路况。该模型通过世界模型与VLA结合提升在真实世界中的理解力与行动力。即使在训练数据不足的海外市场,也能自主生成训练数据加速泛化。小鹏目标在2027年逐步向海外用户交付。AI模型小鹏图灵VLA小鹏汽车1 个信源在谈事件专题推荐理由:小鹏的智驾模型做到了全球通吃,同一套代码跑通中欧路况,还有明确的2027年海外交付计划,挺酷的。原文稍后读已读值得跟进有用关注 小鹏图灵
00:42Y Combinator@ycombinatorYC的Decoded播客讨论了AI与人类学习效率的差距:顶尖AI需要数万样本学习技能,而人类几次尝试就能掌握。节目深入介绍了世界模型(world models)的概念——让AI拥有环境的内部模拟,提到了AlphaGo在围棋中面临的行动空间问题、蒙特卡洛树搜索(MCTS)的原理,以及JEPA(联合嵌入预测架构)在自动驾驶和机器人领域中的应用。该播客还探讨了模型无关强化学习(Model-Free RL)与基于模型的强化学习(Model-Based RL)的差异,指出机器人学习是其中最困难的场景。论文世界模型强化学习自动驾驶推荐理由:这期播客聊了为什么AI学东西这么慢,重点介绍了‘世界模型’这个可能的解法,涉及AlphaGo、自动驾驶、机器人等具体案例,非常有料。原文稍后读已读值得跟进有用关注 世界模型
09:51官方账号arXiv cs.AI@Yukuan Lu, Zaishuo Xia, Weyl Lu, Yubei Chen研究分析了DreamerV3、DIAMOND、TWISTER、Simulus和STORM五种世界模型在Atari Pong中的表现。冻结模型后,单独策略生成的视频轨迹出现球消失、运动错误等问题。像素空间零样本MBRL中,DreamerV3平均回报从-5.5降至-20.9,接近最低分-21。提出Concept-Guided Spatial Regularization(CGSReg)辅助重建损失,在DreamerV3、DIAMOND和TWISTER上改进了闭环轨迹和零样本MBRL。论文DreamerV3DIAMONDTWISTER推荐理由:这篇论文发现DreamerV3等模型在Pong里会弄丢球,他们用CGSReg方法修了一部分问题,做强化学习的可以看看。原文稍后读已读值得跟进有用关注 DreamerV3
09:30官方账号arXiv cs.LG@Susie Lu, Haonan Chen, Weirui Ye, Yilun DuDriftWorld 是一种动作条件的世界模型,通过训练中学习动作条件漂移,在单个前向传播中生成未来帧,速度达 30+ fps。相比扩散模型基线,平均推理速度提升 17 倍。在 Bridge-V2、RT-1、Language Table、Push-T、Robomimic 等机器人操控基准上,DriftWorld 以更少推理时间实现 SOTA 决策性能。它还可作为离线模拟器,用于排序真实机器人策略,滚动得分与真实结果相关性高达 0.99。AI模型DriftWorld世界模型机器人推荐理由:DriftWorld 能让机器人快速想象动作结果,比扩散模型快 17 倍,还能离线评估策略,性能强又省时。原文稍后读已读值得跟进有用关注 DriftWorld
12:11量子位@衡宇原力灵机发布了世界模型DW0.5,专用于训练VLA(视觉语言动作模型)。通过将强化学习搬进虚拟世界进行训练,DW0.5使VLA后训练对真机数据的需求降低60%。这一方法利用虚拟环境模拟减少真实机器人数据采集成本,提升策略泛化能力。AI模型原力灵机DW0.5VLA推荐理由:原力灵机用DW0.5世界模型训练VLA,真机数据需求降60%。把RL搬到虚拟世界,机器人后训练成本大降。原文稍后读已读值得跟进有用关注 原力灵机
00:43elvis@omarsar0精选大多数世界模型在几秒后出现纹理涂抹、几何扭曲等失败模式。LingBot-World 2.0来自@robbyant_brain,在720p分辨率下以60fps保持互动长达一小时。该模型解决了长期视频生成中的一致性难题。其架构创新使得长时间高保真世界模拟成为可能。AI模型LingBot-World 2.0世界模型视频生成推荐理由:别的世界模型几秒就崩,LingBot-World 2.0能稳跑一小时720p 60fps,超实用。来看看它怎么做到的。原文稍后读已读值得跟进有用关注 LingBot-World 2.0
15:50IT之家(博客/媒体)精选高德推出的 ABot-WorldStudio 将交互式视频生成与 3DGS 场景生成统一在同一产品中,用户输入文字或图片即可生成可实时交互的 AI 世界。该工坊在单张 RTX 5090 上即可本地部署,连续推理已稳定超过 1 小时,而同类模型生成上限大多仅为 1 分钟。工坊内置了“时空任意门”机制,允许用户在不同 3D 世界间跃迁,探索范围不受场景限制。底层模型 ABot-World0 和 ABot-3DWorld0 已全面开源,支持室内、街景与城市航拍全尺度空间生成。AI产品高德ABot-WorldStudio世界模型推荐理由:高德开源的 AI 工坊,输文字或图片就能生成可实时交互的 3D 世界,还能连续跑 1 小时不崩,比同类 1 分钟长得多,且内置任意门随便穿梭。原文稍后读已读值得跟进有用关注 高德
12:42量子位@量子位的朋友们高德推出通用世界模型工坊ABot-World Studio,可基于单张5090显卡生成小时级实时交互式视频与3D场景。该工坊支持用户通过输入文本或图像直接创建可交互的3D世界,并实现实时渲染。其生成效率较传统方案提升显著,降低了大规模3D内容创作的门槛。模型已在高德地图内部多个场景进行测试,展示出良好的实用性。AI模型高德ABot-World Studio世界模型推荐理由:高德发了ABot-World Studio,用一张5090就能生成小时级的实时3D场景和交互视频,做游戏或数字孪生都可以试试,门槛低了很多。原文稍后读已读值得跟进有用关注 高德
11:55官方账号arXiv cs.AI@Yuanzhi Liang, Xufeng Zhan, Haibin Huang, Chi Zhang, Xuelong Li这篇论文回顾了世界动作模型(WAMs)的演变,指出当前研究存在三个耦合差距:模型角色和表示、目标和标准化、系统组合。基于此,提出以embodied brain为核心的协同进化路线图,这是一个长期模型目标,能整合多模态上下文、比较候选干预、发出状态转换或能力请求。论文还介绍了物理束缚(physical harness)、共享合同和闭环后训练等组件,构建了一个模块化的物理智能堆栈。论文World Action ModelsEmbodied Brains世界模型推荐理由:这篇论文梳理了从世界动作模型到具身大脑的路线图,对搞具身智能的研究者很有参考价值。原文稍后读已读值得跟进有用关注 World Action Models
09:21官方一手arXiv: Google DeepMind@Achyuthan Sivasankar这篇论文在9个DeepMind Control任务上引入shallow penalty ρ来测量深度在自回归展开中的效果,发现6/9的任务中深度帮助(ρ最高达4.7倍),2/9的任务中浅层胜出(ρ低至0.85倍)。通过消融实验,反转现象(cheetah任务)被证实由训练目标造成:仅监督早期退出第一步时ρ从0.87升至1.18,而内在折中任务不受影响。ρ的部分可预测性通过观察/动作维度和单步模型误差与ρ的Spearman相关系数约0.75(n=9)展示。在CEM规划器中,ρ的符号可预测规划是否受益于深度,反转任务上浅层规划优于深层。论文DeepMind ControlCEM planner世界模型推荐理由:这篇论文用实验告诉你,深的世界模型在滚动预测时不一定管用——在DeepMind Control的9个任务里,有2个反而是早退浅层更好,而且原因竟然出在训练方式上。搞模型规划的值得看看。原文稍后读已读值得跟进有用关注 DeepMind Control
15:55IT之家(博客/媒体)据36氪消息,字节跳动正探索进入自动驾驶领域,项目由Seed旗下周畅的世界模型团队负责。业务方向包括无人物流,隶属于火山引擎汽车行业线。字节已与头部自动驾驶团队进行过业务探讨,并开始向辅助驾驶或自动驾驶人才发出邀约。字节官方回应称,其在物理AI领域有早期研究,但没有做智能驾驶业务的计划。行业字节跳动Seed世界模型推荐理由:字节跳动也在看自动驾驶了,虽然官方说没打算做智能驾驶,但Seed世界模型团队已经在探索,可能有无人物流方向。原文稍后读已读值得跟进有用关注 字节跳动
18:31量子位@一水一位1998年出生的哈工大教授创办公司,目标是构建人形灵巧操作世界模型。技术路线包括触觉数据采集、跨模态对齐以及触觉在实际操控中的应用。该模型旨在让机器人通过触觉实现精细化物体操作,区别于纯视觉方案。AI模型触觉人形机器人世界模型推荐理由:哈工大年轻教授从触觉切入人形机器人,想做世界模型,和主流视觉路线不同,思路挺有意思。原文稍后读已读值得跟进有用关注 触觉
16:30官方一手pandaily@contact@pandaily.com (Pandaily)2026年6月,具身AI领域迎来爆发,平均每48小时就有一个新模型诞生,共13个具身AI模型和世界模型发布。BAAI发布了其世界模型,阿里巴巴推出了Qwen-Robot。这些模型标志着竞争焦点从机器人硬件基准转向软件智能,如Sim-to-Real、操作泛化等能力。这13个模型涵盖从抓取到导航的多种任务,基准如LIBERO、RLBench表现均有提升。AI模型BAAI World ModelQwen-RobotAlibaba推荐理由:具身AI每两天就冒出一个新模型,这次BAAI和阿里都出手了,想看看软件智能怎么拼过硬件?这篇总结到位。原文稍后读已读值得跟进有用关注 BAAI World Model
17:35官方账号Decoder@Jonathan Kemper北京人工智能研究院发布Orca世界模型,它预测抽象世界状态而非token或像素。该模型在125,000小时视频上训练,未使用任何动作标签。在五个机器人任务上,Orca的表现与专用π0.5模型相当。这项研究可能有助于缓解机器人领域长期面临的数据短缺问题。AI模型Orcaπ0.5世界模型推荐理由:中国团队搞了个Orca世界模型,不用学动作标签就能看懂视频里的世界,在五个机器人任务上跟专业π0.5打平,厉害。原文稍后读已读值得跟进有用关注 Orca
12:43官方一手marktechpost@Asif Razzaq精选蚂蚁集团Robbyant团队发布LingBot-World-Infinity(LingBot-World 2.0),一个14B参数因果视频生成模型,用作交互式世界模拟器。核心创新包括混合双向自回归(MoBA)注意力机制和分布匹配蒸馏,解决长程漂移导致的纹理模糊和几何变形。报告展示单个60分钟不间断会话涵盖20个场景。但发布内容仅包含一个检查点、480P参考脚本,无部署代码和定量基准,且采用非商业许可CC BY-NC-SA 4.0。AI模型LingBot-World-InfinityRobbyant蚂蚁集团推荐理由:蚂蚁发了14B的世界模型LingBot-World-Infinity,能生成60分钟视频模拟20个场景,用MoBA注意力解决长时间漂移。不过目前只开放了检查点,没有完整代码。原文稍后读已读值得跟进有用关注 LingBot-World-Infinity
10:09AI Will@FinanceYF5@robbyant_brain 开源了LingBot-World 2.0 (Infinity)世界模型。该模型支持小时级实时生成,长时间运行后画质不衰减。输出为720p/60fps视频,解决了大多数世界模型运行几分钟后画面崩坏的问题。AI模型LingBot-World 2.0世界模型实时生成3 个信源在谈事件专题推荐理由:这个开源世界模型能稳跑几小时不崩画质,比那些几分钟就坏的强多了,机器人预判世界的好工具。原文稍后读已读值得跟进有用关注 LingBot-World 2.0
10:07AI Will@FinanceYF5Robbyant Brain再次开源发布三个模型:空间感知模型LingBot-Vision和LingBot-Depth 2.0,具身操作模型LingBot-VLA 2.0,以及世界模拟器LingBot-World 2.0。这些模型覆盖从视觉感知到物理预测的全链路。1月曾有一次类似开源发布,此次延续了开源策略。该系列旨在构建完整的具身智能技术栈。AI模型LingBot-VisionLingBot-Depth 2.0LingBot-VLA 2.04 个信源在谈事件专题推荐理由:Robbyant Brain又开源了三个模型,从看世界到模拟世界一步到位,做具身智能的可以关注LingBot系列。原文稍后读已读值得跟进有用关注 LingBot-Vision
14:55IT之家(博客/媒体)精选蚂蚁灵波开源了全新实时交互世界模型LingBot-World 2.0(14B参数),支持720p/60fps高清画面,可实现小时级不间断生成且画质不衰减。该模型支持战斗、跳跃、滑翔等丰富动作,以及文本驱动的事件注入,内置Pilot Agent和Director Agent机制,还支持多人同时探索。开源版本采用非商用开源协议,已联合Reactor和灵光APP提供在线体验。该模型可应用于游戏开发、交互式创作、自动驾驶仿真和具身智能训练。AI模型LingBot-World 2.0蚂蚁灵波世界模型3 个信源在谈事件专题推荐理由:蚂蚁灵波开源的世界模型能让你实时操控高清场景,战斗跳伞滑翔,多人一起玩,连续跑一小时不崩,比传统模型强很多。原文稍后读已读值得跟进有用关注 LingBot-World 2.0
12:57量子位@量子位的朋友们71°蚂蚁灵波团队开源了LingBot-World 2.0,这是首个支持小时级生成的世界模型,将以往数天的生成时间缩短到数小时内。该模型支持AI原生多人交互,用户可实时参与并影响场景演化。LingBot-World 2.0在多个物理模拟基准上达到SOTA,例如在Habitat测试中导航成功率提升12%。这意味着开发者可以用更低的成本构建逼真的虚拟环境,加速具身智能研究。AI模型LingBot-World 2.0蚂蚁灵波世界模型3 个信源在谈事件专题推荐理由:想低成本搞个能交互的虚拟世界?蚂蚁灵波开源了LingBot-World 2.0,小时级就能生成,还支持多人一起玩,比之前那些模型快多了。原文稍后读已读值得跟进有用关注 LingBot-World 2.0
03:40AK@_akhaliqLingBot-World 2.0(Infinity)模型已在 Hugging Face 发布,支持长达一小时的交互式世界生成,且零质量漂移。模型内置丰富动作与事件系统,包括攻击、施法、射击、召唤风暴等。通过 Director Agent 智能体驱动世界实时演化,输出 720p/60fps 画面,用户可像游戏一样自由探索。AI模型LingBot-WorldHugging Face世界模型推荐理由:LingBot-World 2.0 能生成一小时长、720p/60fps 的交互世界,Agent 驱动事件变化,像游戏一样可玩。原文稍后读已读值得跟进有用关注 LingBot-World
22:35量子位@思邈魔芯MoWorld发布了世界模型产品,推理速度达到50FPS。相比传统方案,其成本降低70%。该产品已获得华为和联想的投资。这标志着世界模型进入产业应用阶段。AI产品魔芯MoWorld华为联想推荐理由:50FPS跑世界模型还能降本70%,华为联想都投了,这是产业落地的信号。原文稍后读已读值得跟进有用关注 魔芯MoWorld
18:35IT之家(博客/媒体)7月8日Momenta在港交所挂牌上市,代码6880.HK。凯迪拉克同日宣布,将行业首发量产Momenta R7强化学习世界模型。该模型分为预训练、仿真、强化学习三层,通过海量真实驾驶数据压缩物理规律。目前搭载Momenta系统的量产车辆突破100万台,交付超100款车型,累计定点超210款。AI模型MomentaR7凯迪拉克推荐理由:凯迪拉克要首发量产Momenta的R7世界模型了,这个模型能通过强化学习理解物理规律,让自动驾驶更靠谱。原文稍后读已读值得跟进有用关注 Momenta
15:19官方一手marktechpost@Sana Hassan精选本教程使用NVIDIA的cosmos-framework,在Colab上构建紧凑的Omnimodal Mixture-of-Transformers模型。该模型共享跨模态注意力,路由文本、视觉、动作各模态到专属专家。通过合成物理世界数据和自回归rollout,模型预测未来潜状态。教程展示了如何用小型版模拟Cosmos 3世界模型的核心能力。技巧NVIDIACosmos 3Omnimodal Mixture-of-Transformers3 个信源在谈事件专题推荐理由:NVIDIA发了个Colab友好教程,教你搭简化版Cosmos 3世界模型,用Omnimodal MoT架构实现跨模态预测,比跑全量模型省资源。原文稍后读已读值得跟进有用关注 NVIDIA
10:16官方账号arXiv cs.AI@Xinyuan Chen, Haoyu Guo, Shi Guo, Bingqi Jiang, Chunhua Shen, Xing Shen, Tianfan Xue, Yufei Xue, Mulin Yu, Weinan Zhang, Bin Zhao, Bowen Zhou, Ming Zhou一篇视角文章提出了世界模型的科学定义和分阶段路线图,涵盖从基于模型的强化学习、视频生成到具身机器人和物理AI等子领域。文章指出当前对世界模型缺乏共识,并讨论了关键技术方面,包括预测内容与构建方法。它为不同研究方向的世界模型开发提供了系统性框架。论文世界模型强化学习视频生成推荐理由:这篇给了世界模型的具体定义和路线图,适合想了解它在强化学习、视频生成、机器人等领域不同玩法的人。原文稍后读已读值得跟进有用关注 世界模型
23:15官方账号NVIDIA AI@NVIDIAAI精选NVIDIA研究团队在ICML2026发表论文“Fast Autoregressive Video Diffusion & World Models with Temporal Cache Compression & Sparse Attention”。该方法通过时空缓存压缩和稀疏注意力解决自回归视频扩散中的注意力瓶颈。实验显示可实现5倍至10倍的推理速度提升,并在长序列生成中保持恒定内存占用。该工作同时适用于视频扩散模型和世界模型。论文NVIDIAICML2026视频扩散4 个信源在谈事件专题推荐理由:NVIDIA发的新论文,用时空缓存压缩和稀疏注意力,让视频扩散生成速度飙5-10倍,内存还不涨,搞视频生成和世界模型的朋友可以看看。原文稍后读已读值得跟进有用关注 NVIDIA
02:29The Rundown AI@therundownaiKyutai Labs与Gen Intuition联合Epic Games发布MIRA模型,参数规模5B,在单张Nvidia B200上以20帧/秒实时生成完整2v2火箭联盟比赛画面,无物理引擎或渲染引擎。模型仅从视频和控制器输入自监督学习,已开源代码、技术报告及1000小时数据集。局限在于模型记忆仅约4秒,回放时会遗忘比赛目标并幻觉生成替代画面。AI模型MIRARocket LeagueKyutai Labs9 个信源在谈事件专题推荐理由:Kyutai Labs开源了MIRA,一个在神经网络里直接跑《火箭联盟》的模型,5B参数、20fps,不用游戏引擎纯靠学习生成,比传统游戏模拟器有意思多了。原文稍后读已读值得跟进有用关注 MIRA
19:52量子位@贾浩楠蔚来面向70万车主推送世界模型OTA升级,实现100%覆盖。所有车辆均成功更新至最新版本,无人留在旧版本。全量推送策略相比分批次升级显著提升了用户体验。AI产品蔚来世界模型OTA升级推荐理由:蔚来直接把世界模型OTA推给了70万车主,全量更新没落下任何人,升级体验很丝滑。原文稍后读已读值得跟进有用关注 蔚来
15:57量子位@henryLeCun团队提出新方法使世界模型具备持续学习能力,克服了灾难性遗忘问题。该方法在多个连续任务上保持模型性能,无需重新训练。研究展示了世界模型在动态环境中的适应潜力。AI模型LeCun世界模型持续学习推荐理由:LeCun团队搞了个新研究,让世界模型能一直学新东西不忘记旧的,跟之前的世界模型不一样。原文稍后读已读值得跟进有用关注 LeCun
00:42量子位@田, 晏林上海交大与中科院团队提出Cell-JEPA模型,基于LeCun的JEPA架构,在单细胞RNA-seq数据集上预测基因表达动态。在10个基准数据集上对比传统VAE模型,平均预测误差降低23%。模型能推断基因调控网络,复现已知生物通路。相关工作已发布于bioRxiv预印本。AI模型Cell-JEPAJEPA世界模型推荐理由:中国团队把JEPA用在了细胞里,预测基因动态比之前准了23%,还能还原生物通路,有点意思。原文稍后读已读值得跟进有用关注 Cell-JEPA
11:25官方账号arXiv cs.AI@Yuquan Xue, Le Xu, Zeyi Liu, Zhenyu Wu, Zhengyi Gu, Xinyang Song, Bofang Jia, Ziwei WangWorldSample 提出一种物理基础的数据增强框架,通过世界模型生成高保真合成轨迹,解决真实机器人强化学习交互成本高的问题。在接触性和精密机器人操作任务中,WorldSample 将策略成功率提升 28%,训练步数减少 59%。世界模型视觉保真度提升 19.4dB PSNR 和 0.47 SSIM,验证了真实-合成循环的有效性。论文WorldSample强化学习世界模型推荐理由:机器人强化学习的新思路,WorldSample 用世界模型生成合成数据,成功率提28%还省了59%训练时间,值得一看。原文稍后读已读值得跟进有用关注 WorldSample