10:21官方账号arXiv cs.AI@Yuhao Zhan, Bingxiang He, Zecong Tang, Chaojun XiaoPACE-Bench 是一个基于模拟器的基准测试,包含144个源到目标的物理适应对,覆盖6个物理域。每个任务要求代理在环境突变后,通过代码演进将源码改造成目标代码。在10种自进化方法的对比中,Reflexion + Qwen3-14B 在完整基准上仅成功35.9%,而 GPT-5.5 在 Statics 子集上达到66.7%的成功率。结果显示,基于模拟器的反馈修正比未经验证的自修订更可靠,但整体性能尚未饱和。论文PACE-BenchGPT-5.5Qwen3-14B推荐理由:想看看AI在规则变了之后能不能自己改代码?PACE-Bench 专门测这个,目前最强的 GPT-5.5 也只解决了 Statics 子集的三分之二,离满分还远得很。原文稍后读已读值得跟进有用关注 PACE-Bench