08:09Scott Wu@ScottWu46Cognition 更新了 FrontierCode 1.1 基准,为 GPT-5.6 Terra 和 GPT-5.6 Luna 提供新折扣。更新后 GPT-5.6 系列在价格/性能效率上位于帕累托曲线前沿。所有 Devin 用户将自动享受到成本下降,无需手动调整。AI模型GPT-5.6FrontierCodeDevin推荐理由:GPT-5.6 系列降价了,在 FrontierCode 上性价比拉满,用 Devin 的自动省钱。原文稍后读已读值得跟进有用关注 GPT-5.6
04:48Cognition@cognition_labsCognition更新了编码基准FrontierCode 1.1,以反映GPT-5.6 Terra和GPT-5.6 Luna的新成本折扣。基于更新后的价格,GPT-5.6系列在价格/性能效率上处于帕累托曲线前沿。这意味着该系列模型在同等性能下更具成本优势。AI模型GPT-5.6 TerraGPT-5.6 LunaFrontierCode推荐理由:GPT-5.6系列降价了,在FrontierCode基准上性价比更突出了,做编码任务可以关注下。原文稍后读已读值得跟进有用关注 GPT-5.6 Terra
04:42官方账号Greg Brockman@gdb精选OpenAI下调了GPT-5.6 Terra和GPT-5.6 Luna的定价。更新后的FrontierCode 1.1基准显示,GPT-5.6系列在价格/性能效率上处于帕累托最优曲线。新折扣使其成为当前性价比最佳的选择。AI产品GPT-5.6OpenAIFrontierCode10 个信源在谈事件专题推荐理由:OpenAI给GPT-5.6 Terra和Luna降价了,现在在FrontierCode 1.1上性价比特别高,适合编程评测场景。原文稍后读已读值得跟进有用关注 GPT-5.6
01:10Cognition@cognition_labs精选Cognition 发布 FrontierCode 1.1 Extended 基准,用于评估真实工程任务的合并性与质量。Kimi K3 在该基准上取得 58.2% 的得分和 63.6% 的通过率。在 Devin 环境下,Kimi K3 在复现漏洞和环境管理方面表现突出。该结果来自 devin.ai/blog/kimi-k3。AI模型Kimi K3DevinFrontierCode10 个信源在谈事件专题推荐理由:Kimi K3 在真实工程任务基准上拿了 58.2%,而且在 Devin 里特别擅长修 bug 和管理环境,值得做开发的看看。原文稍后读已读值得跟进有用关注 Kimi K3
01:55Cognition@cognition_labsClaude Opus 5 已在 Devin 平台上线。在 FrontierCode 1.1 基准测试中,Opus 5 的 performance 接近 Fable 级别,但成本仅为一半。开发者现在可在 Devin 中使用这一更经济高效的模型。AI模型Claude Opus 5DevinFrontierCode推荐理由:Devin 上新了 Opus 5,性能跟 Fable 差不多但便宜一半,编程省钱又省力。原文稍后读已读值得跟进有用关注 Claude Opus 5
07:15Windsurf@windsurf_aiDevin Desktop 和 CLI 新增了对 Inkling 和 Grok 4.5 模型的支持。FrontierCode 排行榜已上线,专门追踪模型生成的可合并代码质量。所有分数,包括 Grok 4.5 和 Inkling,以及完整方法论和示例任务均已公开。AI产品InklingGrok 4.5Devin Desktop7 个信源在谈事件专题推荐理由:Devin 桌面版和命令行现在能用 Inkling 和 Grok 4.5 了,还有个 FrontierCode 排行榜看谁的代码更靠谱,挺实用的。原文稍后读已读值得跟进有用关注 Inkling
06:20Cognition@cognition_labsCognition发布FrontierCode排行榜,专门评估模型生成可合并代码的能力。榜单包含Grok 4.5、Inkling等模型的得分。官方提供了完整的评分方法和示例任务。AI模型FrontierCodeGrok 4.5Inkling10 个信源在谈事件专题推荐理由:想知道哪个AI写代码最靠谱?FrontierCode榜单直接告诉你哪些模型写的代码能直接合并。原文稍后读已读值得跟进有用关注 FrontierCode
07:16Cognition@cognition_labsCognition 发布了 FrontierCode (Extended) 基准,用于评估真实世界编程任务的可合并性和质量。Claude Sonnet 5 在该基准上得分 53.8%,通过率为 57.6%。该成绩高于 Opus 4.8 的表现,但 Cognition 表示随着后续基准调整,相对排名可能发生变化。AI模型ClaudeSonnet 5FrontierCode推荐理由:Cognition 用 FrontierCode 实测了 Sonnet 5 的工程能力,它比 Opus 4.8 更强,值得关注。原文稍后读已读值得跟进有用关注 Claude
13:31swyx (AI Engineer)@swyxMythos 正式上线,其 FrontierCode 被认定为下一代编程基准。在 FC Diamond 测试中,Opus 4.8 和 GPT 5.5 在随努力扩展方面表现不佳。Mythos/Fable 的后训练方法首次将测试时计算应用于解决超长任务,相当于数十小时人类工作、每任务数百美元。该功能现已在 Cognition 和 Devin 中可用,仅需 1.4x ACUs。AI产品编程基准MythosFrontierCode8 个信源在谈事件专题推荐理由:Mythos 的 FrontierCode 基准揭示了当前顶级模型在长任务上的扩展瓶颈,做 AI 编程评估或开发长流程自动化的团队值得关注,可以直接在 Devin 中体验。原文稍后读已读值得跟进有用关注 编程基准
13:31swyx (AI Engineer)@swyx73°METR 发布 FrontierCode 基准测试,发现超过一半的 SWEBench 结果是无法合并的劣质代码。FrontierCode 包含 1000+ 小时维护者验证的软件工程任务,并设有 3000+ 条评分标准,涵盖代码质量和反作弊机制。最难的 FC Diamond 级别中,Opus 4.8 得分仅为 13.8%。该基准将 AI 编程划分为三个时代:2021 年自动补全(HumanEval)、2023 年通过测试(SWEBench)、2026 年可维护代码(FrontierCode)。数据显示,2025 年底模型能力出现跃升,最易任务的通过率在 4 个月内从 41% 提升至 74%,标志着 AI 编程从 2 次重试 95% 成功率到 6 次重试的质变。AI产品基准测试代码质量SWEBench推荐理由:FrontierCode 戳破了现有基准的泡沫,真正衡量代码可维护性而非通过测试——做 AI 编程工具或智能体开发的团队,建议看看这个新标尺,它可能改变你评估模型的方式。原文稍后读已读值得跟进有用关注 基准测试
10:03Scott Wu@ScottWu4676°在 FrontierCode 基准发布仅一天后,Cognition 的 Claude Fable 5 模型即成为新的最高分获得者,尤其在最具挑战性的任务上表现突出。在 FrontierCode Diamond 子集上,Fable 5 得分从 13.4% 跃升至 29.3%,远超 Opus 的 4.8%。该基准专注于真实世界的工程任务,评估代码的可合并性和质量。Fable 5 现已可在 Devin 中使用,为开发者提供更强的编程辅助能力。AI模型Claude Fable 5FrontierCode基准测试10 个信源在谈事件专题推荐理由:Claude Fable 5 在真实工程任务基准上碾压 Opus,做复杂代码合并的开发者可以直接在 Devin 中体验,效率提升立竿见影。原文稍后读已读值得跟进有用关注 Claude Fable 5
06:02rohanpaul_ai@rohanpaul_ai本期新闻通讯涵盖多个AI领域重要动态:Claude此前被认为“过于危险”的模型终于公开,但存在使用限制;Cognition推出FrontierCode基准测试,评估AI代码是否达到人类维护者可合并的质量;Claude Fable 5在高级AI研究方面存在隐性限制;Anthropic研究显示AI智能体在编程中表现优异,但在生物学任务中可能从起点就失败;Claude Code团队分享实用技巧以充分发挥其潜力。行业ClaudeFrontierCodeAI基准10 个信源在谈事件专题推荐理由:开发者可关注FrontierCode基准,评估AI代码的真实可维护性;Claude Code用户可借鉴团队技巧提升效率;AI研究者需了解Claude Fable 5的隐性限制。原文稍后读已读值得跟进有用关注 Claude
10:03shao__meng@shao__meng精选76°Cognition 发布 FrontierCode 评估基准,旨在衡量 AI 模型生成代码的“可合并性”,而非仅通过单元测试。该基准包含 150 个来自 36 个旗舰开源仓库的任务,由 20 多位维护者参与,每个任务耗时 40 小时以上。评估沿六个维度(行为正确性、回归安全、机械整洁、测试质量、Scope 纪律、代码质量)打分,并设置 blocker 和 non-blocker 标准。结果中 Claude Opus 4.8 在 Diamond 子集得分 13.4%,GPT-5.5 为 6.3%,Kimi K2.6 仅 3.8%,显示前沿模型仍有巨大提升空间。AI模型CognitionFrontierCode代码评估3 个信源在谈事件专题推荐理由:FrontierCode 把 AI 编程评估从“能跑就行”升级到“能合并”,做代码质量评估或 AI 编程工具的团队可以直接参考这套标准,看看自己的模型在真实维护者眼中能拿几分。原文稍后读已读值得跟进有用关注 Cognition
08:46Gary Marcus@GaryMarcus83°Gary Marcus 发推指出 METR 的编码基准已饱和,但 Cognition 随即推出更难的 FrontierCode 评测,最高分仅 13.4%。该评测由顶级开源维护者花费 40+ 小时设计,首次衡量代码是否可合并维护,而非仅功能正确。这揭示了当前模型在编写可维护代码方面的严重不足,为 AI 编程能力评估设立了新标准。AI模型编码基准FrontierCodeClaude Opus 4.83 个信源在谈事件专题推荐理由:做 AI 编程评估或关注模型实际能力的开发者,这个新基准直接戳中了当前模型的软肋——代码能跑但不可维护,值得看看你的模型能拿几分。原文稍后读已读值得跟进有用关注 编码基准