论文11:28推理努力而非工具访问保障代码生成Agent首次可靠性这篇研究发现,给编程Agent加测试工具不如直接提升推理能力——首次成功率能从28%冲到89%,成本只多一点点,别被花哨功能忽悠了。#智能体#代码生成#推理努力#测试工具aarXiv cs.AI@Achint Mehta原文稍后读已读值得跟进有用关注 智能体