06:47elvis@omarsar0ProximalHQ 发布 FrontierSWE v2 超长编码基准测试,更新了任务套件和方法论。测试显示前沿模型间存在巨大性能差距,Claude Fable 5.1 领先优势明显,超过 25 个百分点。该基准专注于超长视野编码任务,是评估前沿模型能力的重要工具。论文FrontierSWEFable 5.1Claude推荐理由:ProximalHQ 推出了超长编码基准 v2,Claude Fable 5.1 在测试中大幅领先其他模型。原文稍后读已读值得跟进有用关注 FrontierSWE
05:03Suhail@SuhailProximal公司发布了FrontierSWE v2,这是一个更新的超长视野编程基准。新版本v2扩展了任务套件并改进了方法论。基准测试显示前沿模型之间存在较大性能差距,Claude Fable 5.1以显著优势领先。AI模型FrontierSWEProximalHQClaude Fable 5.17 个信源在谈事件专题推荐理由:Proximal发布了新版编程基准FrontierSWE v2,Claude Fable 5.1在测试中表现最佳。原文稍后读已读值得跟进有用关注 FrontierSWE