Anthropic 发了 Opus 5,智能接近 Fable 5 但价格砍半,编码和推理效率超强,日常用很划算。
Anthropic 发布 Claude Opus 5,声称其智能接近 Fable 5,价格仅为 Fable 5 的一半,且与 Opus 4.8 保持同价(input $5/M tokens,output $25/M tokens)。在基准测试中,Opus 5 在 Frontier-Bench v0.1 上达到新 SOTA,比 Opus 4.8 性能提升超过一倍;在 ARC-AGI-3 上得分是第二名模型的 3 倍。在计算机使用任务 OSWorld 2.0 中,Opus 5 以仅三分之一成本超越 Fable 5 的最佳成绩。新的快速模式提供 2.5 倍速度但价格翻倍;API 自动 fallback 功能可将被安全分类器拦截的请求降级到其他模型。
Claude Opus 5 发布:接近 Fable 5 的智能程度,价格只有一半,与 Opus 4.8 保持同价 Anthropic 自己也强调:它的目标是 “designed to be used...
Claude Opus 5 发布:接近 Fable 5 的智能程度,价格只有一半,与 Opus 4.8 保持同价 Anthropic 自己也强调:它的目标是 “designed to be used every day”,成为 Claude Max 的默认模型、Claude Pro 的最强模型。 Anthropic 把 Opus 5 放在“高端但可高频调用”的区间,而不是像 Fable 5 那样作为更昂贵、更实验性的顶级模型。它要和 Opus 4.8 保持同价(input $5/M tokens,output $25/M tokens),即性能大幅提升、价格不动。 性能:很强,但要看细分维度 · 软件工程 / 编码:Frontier-Bench v0.1 新 SOTA,比 Opus 4.8 提升超过一倍,成本比 Opus 4.8 低; · 通用知识工作:GDPval-AA、Frontier-Bench 等 SOTA · 新颖问题解决:ARC-AGI-3 得分是“第二名”的 3 倍 · 计算机使用:OSWorld 2.0 在同等成本下超过所有模型,仅三分之一成本就超过 Fable 5 · 网络安全(发现漏洞):接近 Mythos 5 · 网络安全(利用漏洞 / 写 exploit):仍明显落后于 Mythos 5 效率与定价策略 Anthropic 反复强调 “cost per task” 而非 “cost per token”。这其实是把竞争拉回到“完成同一件事要花多少钱”的维度。 几个关键数据: · CursorBench 3.2:最大 effort 下接近 Fable 5 峰值,成本仅一半。 · OSWorld 2.0:超过 Fable 5 最佳成绩,成本仅三分之一多一点。 · 某金融建模场景:平均准确率提高 9 个百分点,turns/tool calls 减少三分之一,时间减少 60%。 · 某交易场景:推理 token 大约只有 Opus 4.8 的七分之一,延迟不到一半。 这暗示 Opus 5 在推理效率上有明显优化,而不是靠堆更多算力。对于企业用户,这直接关系到成本。 还有两点商业更新: · Fast mode:2.5 倍速度,2 倍价格。 · API 自动 fallback:安全分类器拦截的 Opus 5 / Fable 5 请求可以自动降级到其它模型,避免直接失败。 行为与“能动性”:更主动、更会自我纠错 1. 自主找路:没有现成工具时,会自己造工具(例如自己写 CV pipeline 从像素提取几何信息)。 2. 根因分析:不是修表面症状,而是找到底层 bug(开源包管理器案例)。 3. 自我验证:像前端开发者一样在桌面/移动端打开页面检查、修复隐藏元素。 4. 敢于质疑:用户提出的设计有问题时,会解释并给出折中方案。 5. 长程一致性:在金融、基因组、法律等长流程任务中,偏差更小。 Claude @claudeai Introducing Claude Opus 5. It's a thoughtful and proactive model that comes close to the frontier intelligence of Fable 5 at half the price. Your browser does not support the video tag. 🔗 View on Twitter 🔗 View Quoted Tweet 💬 1 🔄 0 ❤️ 2 👀 546 📊 1 ⚡