论文Agent 与开发者12:17HarnessOpt-Bench:评估大模型在提示词与工具编排优化上的能力想比较哪些大模型最会自己改提示词和工具编排?这个新基准用4个任务111次运行测了5个模型,结果挺反直觉。#HarnessOpt-Bench#智能体#提示词工程#基准测试aarXiv cs.AI@Varun Ursekar 等 7 人原文稍后读已读值得跟进有用关注 HarnessOpt-Bench