论文Agent 与开发者10:02ParanoiaEval 基准发布:评测编程智能体的过度防御行为编程智能体有时会做没必要的防御性改动,这个基准用 200 个任务对量化了这问题,测了 8 个模型,做智能体评测的可以看看。#ParanoiaEval#编程助手#智能体#评测基准aarXiv cs.AI@Hanjun Luo 等 7 人原文稍后读已读值得跟进有用关注 ParanoiaEval