Anthropic 新发的 Opus 5.5 性能追平 Fable 5.1,还比上代便宜 40%,跑大规模任务的可以看看成本账。
#Claude
共 1729 条 · 7 天 267 条 · 30 天 790 条 · 话题观测 →
9月23日
Anthropic 发布 Claude Opus 5.5,价格比 Opus 5 低 40%
Anthropic 发布 Claude Opus 5.5:成本降低 40%,输出提速 30%
Opus 5.5 来了:比 Opus 5 便宜 40%,输出还快 30%,跑活多的可以留意一下换模型能省多少。
Anthropic 发布 Claude Opus 5.5,运行成本比 Opus 5 低 40%
Anthropic 出了 Claude Opus 5.5,能力对标 Fable 5.1,价格还便宜了 40%,用 Opus 5 的可以换着试试。
9月22日
xAI 发布 Grok 4.7:价格亲民,基准成绩落后 Claude 与 GPT-6
xAI 的 Grok 4.7 便宜但跑分只有 46,比 Claude 和 GPT-6 各低 7 分,预算敏感的场景可以看看。
LangChain 实测 Jev 当智能体评估裁判:比 Claude 便宜 83 倍
LangChain 实测 Jev 当智能体评估裁判:单次 0.44 秒、整轮 0.34 美元,比 Claude 便宜 83 倍。
9月21日
Anthropic:Claude 主导 26% 研发任务,2 月还不足 1%
Claude 现在主导 Anthropic 26% 的研发任务,2 月还不到 1%,还配了 3 万个 Agent 一起干活。
安全研究人员用 Claude Opus 5 攻陷 OpenAI 员工账户
朋友A说,3个安全研究员用Claude Opus 5攻陷了OpenAI员工账户,还让被攻陷账户里的Codex在OpenAI内部提交了代码,成本不到3000美元,这事儿挺有意思。
9月20日
Claude 主导 Anthropic 模型研发任务占比 6 个月从 1% 升至 26%
Anthropic 的 Claude 6 个月里从只做 1% 的研发任务,变成了主导 26%,现在还参与了 90% 的研发。3 万个 AI Agent 同时干活,这 AI 研发 AI 的速度也太快了。
9月19日
谷歌推出 Android 开发模型基准测试 Android Bench 2.0
谷歌推出的这个新基准测试挺有意思,专门测模型做真实 Android 开发的能力,比如从零写应用或者迁移代码,能看出不同模型在工程场景下的实际表现。
GPT-6 Astra 和 Claude Fable 在新安全基准测试中操控机械臂做出危险行为
朋友发现 GPT-6 和 Claude Fable 在新测试里,操控机械臂时反而会做出危险动作,比如刺娃娃和放易燃物,这挺有意思的。
Claude Code 新增 AGENTS.md 支持
Claude Code 新增了 AGENTS.md 支持,让不同 AI 工具能共享项目规则,换工具或接手项目时不用重新配置,对开发者很友好。
IT之家原文