AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

HarnessOpt-Bench

共 1 条相关 AI 资讯
8月7日
12:17
12:17官方账号arXiv cs.AI@Varun Ursekar, Apaar Shanker, Yash Maurya, Shehab Yasser, Vijay S. Kalmath, Veronica Chatrath, Yuan Xue
论文提出 HarnessOpt-Bench,专门评测 LLM 在自动优化 agent harness(提示词、工具、控制流、记忆与编排代码)时的端到端表现。优化器需要在固定评估预算下修改种子 harness,并在搜索过程不可访问的测试分区上按归一化增益打分。实验覆盖 5 个前沿 LLM、4 个下游任务,共 111 次评分运行。结果显示,优化器模型之间的能力差异大于其所用的编码 harness 差异,原生 harness 并不总是更优,增益在不同任务和种子设定下波动明显。
论文HarnessOpt-Bench智能体提示词工程

推荐理由:想比较哪些大模型最会自己改提示词和工具编排?这个新基准用4个任务111次运行测了5个模型,结果挺反直觉。
原文
精选全部日报登录