#ARC-AGI-3
Prime Agent 是一个强大的开源 harness,它通过递归语言模型和持续 harness 提高了长期评估和编码代理工作流程的效率,其性能在多个任务上超过了其他 harness,值得一试。
OpenAI 的 GPT-5.6 Sol 在 ARC-AGI-3 上分数翻倍还多,token 还省了六倍,看看他们怎么做到的。
Twin 让智能体边玩边写世界模型,ARC-AGI-3 得分从 7.8% 提到 93.3%,效率还超过人类。看看它怎么猜规则。
Gary Marcus 说 ARC-AGI-3 上跑得最好的都用了神经符号世界模型,想看这方向为什么牛,可以读这条。
Jeremy Berman 用 Claude Code 加 Opus 5 把 ARC-AGI-3 刷到 96.2%,没做什么 ARC 定制,思路很通用。
这个框架把 Opus 5 的评分从 30% 刷到 95.5%,但作者觉得换汤不换药,实战未必比 Claude Code 强。
Prime Agent 这个递归框架挺有意思,直接把 Opus 5 的 ARC 成绩从 30% 拉到了 95%,还能替代 Claude Code 和 Codex,值得看看。
OpenAI给GPT-5.6 Sol换了套测试框架,ARC-AGI-3得分从7.8%涨到38.3%,输出还省了六分之五,这招挺妙。
OpenAI推出GPT-5.6 Sol,在自定测试里赢了Anthropic的Opus 5,但换官方环境就掉到7.8%,差距挺大。
OpenAI 分享了两个超实用的 API 开关,GPT-5.6 Sol 在 ARC-AGI-3 上分数直接翻了三倍,token 还省了十二倍,搞推理优化的一定要看看。
OpenAI 的 GPT-5.6 Sol 改了俩设置就在 ARC-AGI-3 上屠榜,教你多窗口推理+规范化压缩这套新打法。
OpenAI 发现 GPT-5.6 Sol 在 ARC-AGI-3 上表现差是因为 API 设置没开对。改两个参数分数涨三倍,token 省六倍,学起来很实用。
Anthropic 新出的 Opus 5 跑分逼近旗舰 Fable 5,价格只要一半,ARC-AGI-3 上直接三倍杀第二名,闭眼入。
他们搞了个叫 Schema 的 harness,让 AI 学物理学家那样思考,直接刷爆 ARC-AGI-3 基准,挺有意思的。
Impossible Research的[schema]让LLM像物理学家推理,ARC-AGI-3刷到99% RHAE,太强了