opus·general

Opus

别名
首次出现
2026-05-22
最近出现
2026-07-25
累计提及
1474
§ 01综述

Opus,特指 Anthropic 发布的 Claude Opus 系列 AI 模型,是当前高端语言模型中的标杆之一,以出色的推理、编码和安全能力著称。近期多个新模型在特定基准测试中声称超越 Opus,同时 Opus 自身也在 token 效率和复杂任务处理方面展现出独特的竞争态势。

Opus 近期进展

  • 新模型在编码基准上超越 Opus:DeepSeek Pro Max 模式在编码基准上超越 GPT-5.4、Gemini 3.1 Pro 等模型,而 Hermes Agent 发布的 MoA 虚拟模型在基准测试中超过 Opus 4.8 和 GPT 5.5。这些结果表明 Opus 在部分场景下的领先地位正受到挑战。DeepSeek Pro Max 模式在编码基准上超越 GPT-5.4、Gemini 3.1 Pro 等 Hermes Agent 发布 MoA 虚拟模型,基准超 Opus 4.8 和 GPT 5.5
  • GLM-5.2 在 Code Arena 前端排名超 Claude Opus 4.8:GLM 5.2 在 Code Arena 前端排名中超越 Claude Opus 4.8,仅次于 Fable 5。同时,GLM 5.2 在付费用户中备受青睐,而 GPT 5.5 使用率较低,反映出用户对不同模型的偏好分化。GLM-5.2 在 Code Arena 前端排名超 Claude Opus 4.8 反直觉模型观察:GLM 5.2受付费用户青睐,GPT 5.5鲜有人用
  • Opus 在 Agent 效率上表现突出:Agent Arena 发布的 token 效率分析显示,Opus 与 Fable 表现突出,说明 Opus 在成本效益比方面仍具优势。Agent Arena发布token效率分析:Opus与Fable表现突出
  • 复杂任务仍是挑战:MirrorCode 基准测试中,Claude Opus 4.7 以 56% 解决率领先,但最复杂任务仍失败,运行 19 天未完成单一任务,凸显当前模型的局限性。MirrorCode 基准测试:Claude Opus 4.7 以 56% 解决率领先,但最复杂任务仍失败
  • 当前焦点与观察点

    当前焦点在于 Opus 系列模型与其他新模型的基准对比竞争。尽管 Opus 在多项任务中仍保持领先,但越来越多的新模型(如 DeepSeek、Hermes Agent、GLM)在特定领域实现了超越,表明 AI 领域的创新速度加快。同时,Opus 在 token 效率和安全性(如 2000 人攻击未成功案例)上的优势仍不可忽视。未来,Opus 需要继续在复杂推理和成本效率上迭代,以维持其高端定位。

    § 02相关报道10 条在档
    1. 01
      Claude Opus 5 上线 Hebbia,金融基准测试推理与引用精度提升
      @hebbia
    2. 02
      Genspark 喊话:Claude Opus 5 性能接近 Fable 5,价格砍半——但“接近”到底有多近?
      AI 热点 · 原创
    3. 03
      Claude Opus 5 发布:接近 Fable 5 智能,价格仅一半,与 Opus 4.8 同价
      shao__meng
    4. 04
      Claude Opus 5 成为最不易被提示注入的模型
      Simon Willison’s Weblog
    5. 05
      Claude Opus 5 发布,现已在 Genspark 多个 Agent 上可用
      Genspark
    6. 06
      Claude Opus 5 发布,智能接近 Fable 5 价格减半
      SuperTechFans
    7. 07
      Anthropic 发布 Claude Opus 5,半价接近 Fable 5
      Simon Willison’s Weblog
    8. 08
      Opus 5智能超降智后Fable 5,价格仅一半
      orange.ai
    9. 09
      卡帕西分享 AI 闲聊技巧:无需精调提示词,想到什么说什么
      IT之家
    10. 10
      Hermes Agent 现支持 Opus 5
      Nous Research
    § 03邻近话题

    本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

    /topic/Opus