12:17官方账号arXiv cs.AI@Varun Ursekar, Apaar Shanker, Yash Maurya, Shehab Yasser, Vijay S. Kalmath, Veronica Chatrath, Yuan Xue论文提出 HarnessOpt-Bench,专门评测 LLM 在自动优化 agent harness(提示词、工具、控制流、记忆与编排代码)时的端到端表现。优化器需要在固定评估预算下修改种子 harness,并在搜索过程不可访问的测试分区上按归一化增益打分。实验覆盖 5 个前沿 LLM、4 个下游任务,共 111 次评分运行。结果显示,优化器模型之间的能力差异大于其所用的编码 harness 差异,原生 harness 并不总是更优,增益在不同任务和种子设定下波动明显。论文HarnessOpt-Bench智能体提示词工程推荐理由:想比较哪些大模型最会自己改提示词和工具编排?这个新基准用4个任务111次运行测了5个模型,结果挺反直觉。原文稍后读已读值得跟进有用关注 HarnessOpt-Bench