这个框架把 Opus 5 的评分从 30% 刷到 95.5%,但作者觉得换汤不换药,实战未必比 Claude Code 强。
Prime Agent 是一个能自主改进的递归 Agent 框架。替换外部 Harness 后,Opus 5 的 ARC-AGI-3 评分从 30.2% 升至 95.5%,超过人类专家基线 95.4%。但作者认为,这种面向评分的优化价值有限,在现实场景中不会比 Claude Code 和 Codex 更好。
1. 自主改进的 Harness 不是自进化模型,价值有限 2. 面向评分的优化价值有限,到现实场景不会比 Claude Code 和 Codex 这样的更好
1. 自主改进的 Harness 不是自进化模型,价值有限 2. 面向评分的优化价值有限,到现实场景不会比 Claude Code 和 Codex 这样的更好 小互 @xiaohu Prime Agent 一个能自主改进的递归 Agent 框架: 仅仅把外面的框架(Harness )换成 Prime Agent Opus 5 的 ARC-AGI-3 评分从 30.2% 冲到 95.5%甚至超越了人类专家基线(95.4%) 可以直接当 Claude Code、Codex 的替代品 它证明了一件事:AI 有时候跑不好的原因,很多时候不是模型不够聪明,而是外面跑它的框架束缚了它... 传统的 Agent 框架(比如固定的工具调用接口、硬编码的子 Agent 或静态提示词)是为上一代模型设计的。当大模型能力越来越强时,这些固定设计反而成了“绊脚石”,限制了模型的发挥。 best.xiaohu.ai/article/prime-… 🔗 View Quoted Tweet 💬 5 🔄 0 ❤️ 8 👀 3033 📊 4 ⚡