论文10:56
PoPE方法评估冻结小模型自修复:错误内容未显著提升修复率这篇论文用严格安慰剂对照方法戳穿了代码模型自修复的假设,在0.5-1.5B模型上实测发现错误内容并没带来明显改善,想了解模型能力边界可以看看。
这篇论文用严格安慰剂对照方法戳穿了代码模型自修复的假设,在0.5-1.5B模型上实测发现错误内容并没带来明显改善,想了解模型能力边界可以看看。
这篇论文通过精心设计的安慰剂对照实验,拆解了自我修复反馈中真正起作用的成分——不是重新看到失败代码,而是比对可执行反例。方法严谨,结果清晰。
做 AI 智能体开发的团队会心一笑——智能体开始自己修自己的 bug 了,这既是效率提升的案例,也是 AI 自主性边界的有趣实验,值得点开看看。