产品Agent 与开发者73°13:31FrontierCode 基准发布:Opus 4.8 仅 13.8%,半数 SWEBench 结果不可合并FrontierCode 戳破了现有基准的泡沫,真正衡量代码可维护性而非通过测试——做 AI 编程工具或智能体开发的团队,建议看看这个新标尺,它可能改变你评估模型的方式。#基准测试#代码质量#SWEBench#FrontierCodeswyx (AI Engineer)@swyx原文稍后读已读值得跟进有用关注 基准测试