10:44官方账号arXiv cs.AI@Alexy Skoutnev, Kirill Acharya, Gaston Longhitano, Madeleine Udell, Kevin Ellis, Iddo Drori精选Twin 系统让前沿编程智能体在测试时编写可执行世界模型,用来完成 ARC-AGI-3 等持续学习任务,全程只靠模拟与交互推断游戏规则和目标。它在 183 个关卡中通过 179 个,成功率 97.8%,其中 158 个关卡的效率高于人类玩家(88.3%)。系统在 156 个已通关关卡中于任何奖励前就推断出目标(87.2%),其余关卡则靠搜索自动发现目标。直接用基础模型玩得分仅 7.8%,加现成 harness 升至 61.1%,而 Twin 世界模型把同一基础模型提升到 93.3%,打通 25 个游戏中的 23 个。论文TwinARC-AGI-3世界模型推荐理由:Twin 让智能体边玩边写世界模型,ARC-AGI-3 得分从 7.8% 提到 93.3%,效率还超过人类。看看它怎么猜规则。原文稍后读已读值得跟进有用关注 Twin