7月31日
04:42
04:42官方账号Greg Brockman@gdb
精选
OpenAI下调了GPT-5.6 Terra和GPT-5.6 Luna的定价。更新后的FrontierCode 1.1基准显示,GPT-5.6系列在价格/性能效率上处于帕累托最优曲线。新折扣使其成为当前性价比最佳的选择。
事件专题

推荐理由:OpenAI给GPT-5.6 Terra和Luna降价了,现在在FrontierCode 1.1上性价比特别高,适合编程评测场景。
7月28日
01:10
01:10Cognition@cognition_labs
精选
Cognition 发布 FrontierCode 1.1 Extended 基准,用于评估真实工程任务的合并性与质量。Kimi K3 在该基准上取得 58.2% 的得分和 63.6% 的通过率。在 Devin 环境下,Kimi K3 在复现漏洞和环境管理方面表现突出。该结果来自 devin.ai/blog/kimi-k3。
事件专题

推荐理由:Kimi K3 在真实工程任务基准上拿了 58.2%,而且在 Devin 里特别擅长修 bug 和管理环境,值得做开发的看看。
7月25日
01:55
7月18日
07:15
07:15Windsurf@windsurf_ai
Devin Desktop 和 CLI 新增了对 Inkling 和 Grok 4.5 模型的支持。FrontierCode 排行榜已上线,专门追踪模型生成的可合并代码质量。所有分数,包括 Grok 4.5 和 Inkling,以及完整方法论和示例任务均已公开。
事件专题

推荐理由:Devin 桌面版和命令行现在能用 Inkling 和 Grok 4.5 了,还有个 FrontierCode 排行榜看谁的代码更靠谱,挺实用的。
06:20
6月12日
13:31
13:31swyx (AI Engineer)@swyx
Mythos 正式上线,其 FrontierCode 被认定为下一代编程基准。在 FC Diamond 测试中,Opus 4.8 和 GPT 5.5 在随努力扩展方面表现不佳。Mythos/Fable 的后训练方法首次将测试时计算应用于解决超长任务,相当于数十小时人类工作、每任务数百美元。该功能现已在 Cognition 和 Devin 中可用,仅需 1.4x ACUs。
事件专题

推荐理由:Mythos 的 FrontierCode 基准揭示了当前顶级模型在长任务上的扩展瓶颈,做 AI 编程评估或开发长流程自动化的团队值得关注,可以直接在 Devin 中体验。
6月10日
6月9日
08:46
08:46Gary Marcus@GaryMarcus
83°
Gary Marcus 发推指出 METR 的编码基准已饱和,但 Cognition 随即推出更难的 FrontierCode 评测,最高分仅 13.4%。该评测由顶级开源维护者花费 40+ 小时设计,首次衡量代码是否可合并维护,而非仅功能正确。这揭示了当前模型在编写可维护代码方面的严重不足,为 AI 编程能力评估设立了新标准。
事件专题

推荐理由:做 AI 编程评估或关注模型实际能力的开发者,这个新基准直接戳中了当前模型的软肋——代码能跑但不可维护,值得看看你的模型能拿几分。