论文Agent 与开发者11:02代码优化基准测试能否可靠衡量编程智能体?这篇论文告诉你那些牛逼的编程智能体排行榜可能不靠谱——参考补丁在不同机器上结果都不一样,排名还受评分规则摆布。做相关研究的人必读。#GSO#SWE-Perf#SWE-fficiency#代码优化基准aarXiv cs.AI@Zhi Chen 等 5 人原文稍后读已读值得跟进有用关注 GSO