#FrontierCode

共 23 条 · 7 天 0 条 · 30 天 9 条
信息流里打上「FrontierCode」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月23日
9月22日
9月11日
7月31日
7月28日
7月25日
7月18日
7月1日
6月12日
产品Agent 与开发者多源确认13:31
Mythos 上线:FrontierCode 成为新编程基准,Opus 4.8 和 GPT 5.5 在 FC Diamond 上不随努力扩展

Mythos 的 FrontierCode 基准揭示了当前顶级模型在长任务上的扩展瓶颈,做 AI 编程评估或开发长流程自动化的团队值得关注,可以直接在 Devin 中体验。

事件专题
swyx (AI Engineer)@swyx9 个信源在谈原文
6月10日
6月9日
模型Agent 与开发者多源确认精选76°10:03
Cognition 推出 FrontierCode:将 Coding 评估标准从可用提升到可合并,Claude Opus 4.8 领先

FrontierCode 把 AI 编程评估从“能跑就行”升级到“能合并”,做代码质量评估或 AI 编程工具的团队可以直接参考这套标准,看看自己的模型在真实维护者眼中能拿几分。

事件专题
shao__meng@shao__meng4 个信源在谈原文
模型中美对照多源确认83°08:46
METR 编码基准饱和?Cognition 发布 FrontierCode 新评测,Claude Opus 4.8 仅 13.4%

做 AI 编程评估或关注模型实际能力的开发者,这个新基准直接戳中了当前模型的软肋——代码能跑但不可维护,值得看看你的模型能拿几分。

事件专题
Gary Marcus@GaryMarcus4 个信源在谈原文