frontiercode·general

FrontierCode

别名
首次出现
2026-06-09
最近出现
2026-07-27
累计提及
44
§ 01综述

FrontierCode 是一个专注于衡量 AI 模型在真实世界软件工程任务上表现的新型基准测试,旨在评估模型编写、调试和维护代码的能力。该基准由 Cognition 等机构推动,近期成为业界关注的焦点,多个先进模型在此榜单上展开竞争。

FrontierCode 近期进展

2025 年 4 月,Cognition 发布 SWE-1.7 模型,该模型基于 Kimi K2.7 强化学习优化,在 FrontierCode 上取得了改进。 Cognition 发布 SWE-1.7 模型

同一时期,Claude Sonnet 5 在 FrontierCode 基准上得分 53.8%,超越了此前 Opus 4.8 的成绩,并已集成至 Devin Desktop 和 Devin CLI 中供开发者使用。 Sonnet 5 在 FrontierCode 基准得分 53.8% 超越 Opus 4.8

另一则报道指出,FrontierCode 基准发布时,Opus 4.8 仅取得 13.8% 的得分,且半数 SWEBench 结果无法合并,引发了关于基准难度和一致性的讨论。 FrontierCode 基准发布:Opus 4.8 仅 13.8%

当前焦点与观察点

当前 FrontierCode 的核心焦点在于其能否成为继 SWE-bench 之后的下一代编程能力标尺。不同模型在基准上的表现差异悬殊(从 13.8% 到 53.8%),表明测试可能对特定训练方法敏感。此外,部分模型宣称“随努力扩展”失效(如 Opus 4.8 和 GPT 5.5 在 FC Diamond 上),这引发了对模型 scaling 瓶颈的担忧。基准本身的可复现性和任务设计合理性也成为争议点,有言论称“半数 SWEBench 结果不可合并”,暗示现有评估流程可能存在缺陷。整体而言,FrontierCode 正处于快速演化期,其权威性有待更多验证。

§ 02相关报道10 条在档
  1. 01
    Kimi K3 现已登陆 Devin Desktop 和 CLI
    Windsurf
  2. 02
    Kimi K3 登陆 Devin Desktop 和 CLI,FrontierCode 1.1 成绩接近前沿
    Cognition
  3. 03
    Kimi K3 在 FrontierCode 1.1 Extended 上得分 58.2%,通过率 63.6%
    Cognition
  4. 04
    Opus 5 在 FrontierCode 1.1 上得分63.6%,接近Fable 5但成本减半
    Cognition
  5. 05
    Claude Opus 5 现已登陆 Devin,FrontierCode 1.1 上以半价接近 Fable 性能
    Cognition
  6. 06
    Inkling 和 Grok 4.5 登陆 Devin Desktop 和 CLI
    Windsurf
  7. 07
    FrontierCode代码编写排行榜正式上线
    Cognition
  8. 08
    Cognition 发布 SWE-1.7 模型,基于 Kimi K2.7 强化学习优化
    Cognition
  9. 09
    Claude Sonnet 5 上线 Devin Desktop 和 Devin CLI
    Windsurf
  10. 10
    Claude Sonnet 5 登陆 Devin Desktop 和 CLI
    Cognition
§ 03邻近话题

本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

/topic/FrontierCode