FrontierCode 把 AI 编程评估从“能跑就行”升级到“能合并”,做代码质量评估或 AI 编程工具的团队可以直接参考这套标准,看看自己的模型在真实维护者眼中能拿几分。
Cognition 发布 FrontierCode 评估基准,旨在衡量 AI 模型生成代码的“可合并性”,而非仅通过单元测试。该基准包含 150 个来自 36 个旗舰开源仓库的任务,由 20 多位维护者参与,每个任务耗时 40 小时以上。评估沿六个维度(行为正确性、回归安全、机械整洁、测试质量、Scope 纪律、代码质量)打分,并设置 blocker 和 non-blocker 标准。结果中 Claude Opus 4.8 在 Diamond 子集得分 13.4%,GPT-5.5 为 6.3%,Kimi K2.6 仅 3.8%,显示前沿模型仍有巨大提升空间。
Cognition 推出「FrontierCode」:把 Coding 评估标准,从可用,提升到高质量、可合并! 评估结果 Top2:Claude Opus 4.8、GPT-5.5 https://t...
Cognition 推出「FrontierCode」:把 Coding 评估标准,从可用,提升到高质量、可合并! 评估结果 Top2:Claude Opus 4.8、GPT-5.5 cognition.ai/blog/frontier-… FrontierCode 评估内容 规模与结构: · 150 个任务,来自 36 个 flagship 开源仓库 · 20+ 维护者参与,每任务投入 40+ 小时 · 三层嵌套难度:Extended(150)→ Main(100 最难)→ Diamond(50 最难) 两个核心指标: · Pass rate:通过全部 blocker 标准(维护者眼中的 hard stop) · Score:rubric 加权得分;任一 blocker 失败则 score = 0 评测体系:不止 unit test FrontierCode 沿六个维度评估 mergeability: · 行为正确性 — 是否解决问题 · 回归安全 — 是否破坏现有功能 · 机械整洁 — build / lint / style 是否通过 · 测试质量 — agent 写的测试是否真测到行为 · Scope 纪律 — 是否只改该改的 · 代码质量 — 风格、设计模式、可读性、仓库惯例 三种较新的 grading 方法: · Reverse-classical:把 agent 写的测试跑在未修复的base commit 上,必须 fail —— 证明测试有意义 · Scope:文件边界、diff 大小、语义局部性(如是否只改某个函数内) · Adaptive classical grading(mutagent):用 LLM 微调测试或应用代码,对齐 agent 的实现细节,在保持确定性的同时允许多种合法解法 Criteria 分 blocker(不通过就不能 merge)和 non-blocker(影响 score,但不一票否决)。 评估结果:前沿模型仍远未饱和 · Diamond 子集:Claude Opus 4.8:13.4% score;GPT-5.5:6.3%;Gemini 3.1 Pro:4.7% · Main 子集:Opus 4.8:34.3% · Extended 子集:Opus 4.8:51.8% 几个值得注意的点: · Diamond 几乎未被“刷满” —— 最强模型也只有 13.4%,说明高难度子集仍有大量 headroom · 闭源 vs 开源差距大:最佳开源 Kimi K2.6 在 Diamond 仅 3.8% · 成本 vs 能力:GPT-5.5 分数低于 Opus,但 token 用量约为其 1/4,性价比更优 Cognition @cognition Introducing FrontierCode: a coding eval that raises the bar for difficulty & quality. Each task took 40+ hrs of work by leading open-source maintainers. Models write sloppy code that works but isn’t maintainable. Our eval is first to measure: would you actually merge this code? 🔗 View Quoted Tweet 💬 0 🔄 0 ❤️ 0 👀 258 ⚡