AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

QuoteBench

共 1 条相关 AI 资讯
8月14日
12:10
12:10官方账号arXiv cs.AI@Shangao Li, Yao Zhang, Volker Tresp, Yuanyuan Yang
QuoteBench 用 56 个单次任务、14 个事故来源族,验证 LLM 编程智能体在生成命令与执行传输之间的边界。同一回复经新增解析器后,成功率下降 55.4 到 73.2 个百分点;六种配置在披露边界后恢复 30.4 到 60.7 个百分点,另两种恢复为零或负值。GPT-5.6-sol 的匹配分数仅 -3.6 点,但实际隐藏了 -64.3 点损坏和 +60.7 点补偿。部署配置会重排模型顺序,26 对可比模型中有一对明确反转,另有四对处于单任务边缘。论文建议评估命令型智能体时报告模型配置、生成合同、执行路径、操作点和最终状态验证器,而非只给匹配分数。
论文QuoteBenchGPT-5.6-sol编程助手

推荐理由:这篇论文用 QuoteBench 拆穿了只看匹配分数的假象,原来 GPT-5.6-sol 的分数是负 64 和正 60 抵消出来的,部署配置一变排名就翻,评估编程智能体前该看看。
原文
精选全部日报登录