#Opus 5
Anthropic的Opus 5模型虽然性能强大,但因其成本较高而难以吸引用户,相比之下,OpenAI的GPT 5.6凭借较低的成本获得了更多用户。
Jeremy Berman 用 Claude Code 加 Opus 5 把 ARC-AGI-3 刷到 96.2%,没做什么 ARC 定制,思路很通用。
这个框架把 Opus 5 的评分从 30% 刷到 95.5%,但作者觉得换汤不换药,实战未必比 Claude Code 强。
看Opus 5和GPT-5.6-Sol在同一基准上的表现,一个越强越费token,一个越强越省,挺有意思的对比。
Prime Agent 这个递归框架挺有意思,直接把 Opus 5 的 ARC 成绩从 30% 拉到了 95%,还能替代 Claude Code 和 Codex,值得看看。
这个流程很适合复杂任务:Fable 5 出方案、Codex 干活、Fable 5 把关,还讲了 /compact 省钱和省上下文的细节,挺实用。
想找能照着截图做网页的模型?直接看 Code Arena 这份榜单,Opus 5 (Max) 第一,GPT-5.6 和 Grok 的分数也都列出来了。
Boris Cherny说每半年删掉Claude Code的配置和Skills,让Opus 5裸跑,你会发现旧规则反而碍事。
OpenAI推出GPT-5.6 Sol,在自定测试里赢了Anthropic的Opus 5,但换官方环境就掉到7.8%,差距挺大。
Anthropic 的 Claude Code 之父 Boris Cherny 在 YC Startup School 上揭秘 Opus 5 的新特性,还分享了删除 80% 系统提示的实战经验。想了解下一代模型和 Agent 构建思路?这视频干货十足。
这条推文直指 Opus 5 和 Fable 5 的基准与体验反差,还爆出 Anthropic 新的蒸馏训练路径,以及 RLHF 被弱化导致的体验变化,值得看看。
OpenRouter 的新 Discover 页面让你一眼看清哪个模型最强——Opus 5 综合第一,GPT 5.6 Sol 编程厉害,还有更多路由器帮你挑。
Anthropic的Opus 5在Auto Mode下把浏览器智能体的提示注入防御做到了100%,129个测试全过,这可能彻底解决智能体安全难题。