8月4日
11:31
11:31官方账号arXiv cs.AI@Yuqiao Tan, Jinxiang Meng, Fangyu Lei, Minzheng Wang, Shizhu He, Jun Zhao, Kang Liu
SWE-Touch是一个新基准,通过注入与任务冲突的代码改动来测试编码代理在共享工作区中的适应能力。在SWE-bench Verified上,Counter-Edit使九个编码模型的平均解决率下降7.7个百分点。在SWE-Bench Pro和DeepSWE等更长周期任务上,退化依然存在。轨迹分析显示,代理可能保留冲突代码,或在没有重新检查仓库和运行定向测试的情况下直接替换。
推荐理由:编码代理平时跑分很强,但用户中途改代码就露馅。SWE-Touch实测9个模型,成功率平均掉7.7个百分点,原因挺有意思。