Claude Opus 5.5 在 FrontierCode 编程基准上,思考档位调到 med 和 max 成绩差不多,还比 high 高,省钱党可以看下再选档位。
#FrontierCode
Devin 接入了 GPT-6 Sol 和 Luna,Luna 每个任务不到 0.1 美元,比 GPT-5.6 便宜一大截,分数还更高。
Cognition 把 Claude Opus 5.5 接入了 Devin,在 FrontierCode 1.1 上超过 Fable 5 拿了第一,成本还更低,写代码的可以去试试。
Devin 现在能用 Claude Opus 5.5 了,在 FrontierCode 1.1 上反超 Fable 5 拿第一,价格还便宜不少,写码的朋友可以试试。
Cognition 自家的 FrontierCode 榜更新了,Claude Opus 5.5 拿 65.3% 超过 Fable 5,成本还更低,写代码的可以看看。
Cognition 公司发布了 SWE-2,这个模型在 Kimi-K3 上微调后,在 FrontierCode 基准上表现更好,成本也更低。
Cognition 推出了 SWE-2,这个模型在代码生成上很厉害,和 Fable 5.1 差不多,但便宜很多。
OpenAI给GPT-5.6 Terra和Luna降价了,现在在FrontierCode 1.1上性价比特别高,适合编程评测场景。
Kimi K3 在真实工程任务基准上拿了 58.2%,而且在 Devin 里特别擅长修 bug 和管理环境,值得做开发的看看。
Devin 上新了 Opus 5,性能跟 Fable 差不多但便宜一半,编程省钱又省力。
Devin 桌面版和命令行现在能用 Inkling 和 Grok 4.5 了,还有个 FrontierCode 排行榜看谁的代码更靠谱,挺实用的。
Cognition 用 FrontierCode 实测了 Sonnet 5 的工程能力,它比 Opus 4.8 更强,值得关注。
Mythos 的 FrontierCode 基准揭示了当前顶级模型在长任务上的扩展瓶颈,做 AI 编程评估或开发长流程自动化的团队值得关注,可以直接在 Devin 中体验。
FrontierCode 戳破了现有基准的泡沫,真正衡量代码可维护性而非通过测试——做 AI 编程工具或智能体开发的团队,建议看看这个新标尺,它可能改变你评估模型的方式。
Claude Fable 5 在真实工程任务基准上碾压 Opus,做复杂代码合并的开发者可以直接在 Devin 中体验,效率提升立竿见影。
开发者可关注FrontierCode基准,评估AI代码的真实可维护性;Claude Code用户可借鉴团队技巧提升效率;AI研究者需了解Claude Fable 5的隐性限制。
FrontierCode 把 AI 编程评估从“能跑就行”升级到“能合并”,做代码质量评估或 AI 编程工具的团队可以直接参考这套标准,看看自己的模型在真实维护者眼中能拿几分。
做 AI 编程评估或关注模型实际能力的开发者,这个新基准直接戳中了当前模型的软肋——代码能跑但不可维护,值得看看你的模型能拿几分。