AI模型精选72°

智元自研世界模型 GE 2.0 登顶 WorldArena,2B 参数力压英伟达

2B 参数“四两拨千斤”,智元自研世界模型 GE 2.0 登顶 WorldArena 榜单

精选理由

智元用 2B 参数模型在具身智能世界模型赛道击败英伟达等巨头,做机器人或具身智能的开发者值得关注——轻量化方案可能改写行业路线。

AI 摘要

智元机器人自研的世界模型 Genie Envisioner-Sim 2.0(GE 2.0)在具身领域热门榜单 WorldArena Track1 中登顶,该赛道评测世界模型的感知与动作响应能力。GE 2.0 仅用 20 亿参数,就超越了英伟达、微软等团队的超大参数模型,验证了轻量化模型在人形机器人应用中的适配性。该模型首次全面覆盖长时序生成、多视角生成、本体状态生成、近实时推理及奖励判别等核心环节,在长时序推理中能稳定生成 40-50 秒高质量视频,且与真实世界保持强相关性。GE 2.0 还具备奖励模型机制,可自动筛选高质量数据回流给策略模型,助力多项任务性能提升。

原文 · IT之家

2B 参数“四两拨千斤”,智元自研世界模型 GE 2.0 登顶 WorldArena 榜单

IT之家 5 月 30 日消息,“智元 AGIBOT”官方公众号 29 日发文宣布:具身领域热门榜单 WorldArena Track1( 世界模型感知与动作响应赛道 )最新评测结果揭晓,智元自研的世界模型 Genie Envisioner-Sim 2.0(IT之家注:以下简称 GE 2.0)登顶榜单。 所谓“世界模型”,简单来说就是 能理解物理世界规律 的 AI 大模型。机器人若具备“世界模型”能力,就能知道杯子掉地上会碎、水往低处流、积木搭太高会倒等常识。 在该赛道评测中,智元团队使用了原生的世界模型 GE 2.0,并未针对赛题进行特殊设计优化,仅基于榜单数据进行了基础微调(Finetune)。 根据介绍,GE 2.0 在功能上首次全面覆盖了 长时序生成、多视角生成、本体状态生成、近实时推理以及奖励判别 等核心环节,构建了世界模拟器完整的技术能力闭环。 在长时序推理任务中,GE 2.0 表现出极强的稳定性,画面质量随推理时长的衰减显著弱于行业基线方案。即使在连续推演 40-50 秒的长视频片段时,其生成质量依然超越了基线模型前 10 秒内的表现。 团队验证了大量闭环评测结果,证明 GE 2.0 在多项任务上均 与真实世界保持着强相关 性。 这种相关性不止步于宏观统计意义上的“成功率一致”,团队还进行了逐案(Case-by-case)的 rollout 结果对比分析,并通过混淆矩阵(Confusion Matrix)提供了严谨的量化佐证,进一步证明了 GE 2.0 作为策略评测器的可靠性。 在奖励模型(Reward Model)的加持下,GE 2.0 能够对闭环评测的 rollout 过程进行自动化筛选, 将世界模型中产出的有效高质量数据精准回流给策略模型(Policy Model)。 实验证明,这一机制在多项任务上均助力策略模型实现了显著的性能涨点。 此外,据上观新闻报道,智元 GE 2.0 此次与英伟达最新模型 DreamDojo、清华联合斯坦福的 Ctrl-World 团队等国内外 AI 顶尖团队直接竞争,并最终夺冠。GE 2.0 仅用 20 亿(2B)参数的模型 ,结果比英伟达、微软等 超大参数的旗舰模型 效果更优秀,也验证了在人形机器人应用方面,轻量化模型的适配性不逊于超大参数模型。