12:17官方账号arXiv cs.AI@Varun Ursekar, Apaar Shanker, Yash Maurya, Shehab Yasser, Vijay S. Kalmath, Veronica Chatrath, Yuan Xue论文提出 HarnessOpt-Bench,专门评测 LLM 在自动优化 agent harness(提示词、工具、控制流、记忆与编排代码)时的端到端表现。优化器需要在固定评估预算下修改种子 harness,并在搜索过程不可访问的测试分区上按归一化增益打分。实验覆盖 5 个前沿 LLM、4 个下游任务,共 111 次评分运行。结果显示,优化器模型之间的能力差异大于其所用的编码 harness 差异,原生 harness 并不总是更优,增益在不同任务和种子设定下波动明显。论文HarnessOpt-Bench智能体提示词工程推荐理由:想比较哪些大模型最会自己改提示词和工具编排?这个新基准用4个任务111次运行测了5个模型,结果挺反直觉。原文稍后读已读值得跟进有用关注 HarnessOpt-Bench
10:14官方账号arXiv cs.AI@King Yeung Tsang, Zihao Zhao, Vishal Venkataramani, Haizhou Shi, Zixuan Ke, Semih Yavuz, Shafiq Joty, Hao Wang多智能体系统(MAS)依赖大语言模型(LLM)进行有效编排,但训练编排器面临监督信号稀缺和计算成本高的问题。本文提出OrchRM,一种自监督框架,通过多智能体执行过程中的中间产物构建胜负对,训练Bradley-Terry奖励模型,无需人工标注。相比依赖昂贵子智能体回滚的现有方法,OrchRM直接在编排层面操作,将训练效率提升10倍(以token使用量计),并将测试时扩展的准确率提升8%。该方法在数学推理、网页问答和多跳推理等多个领域均有效,代码已开源。论文多智能体系统奖励建模编排优化推荐理由:做多智能体系统编排的团队终于有了一个低成本、高回报的训练方案——OrchRM 省去了人工标注和子智能体回滚,直接提升 8% 准确率,建议做 MAS 的开发者试试这个开源框架。原文稍后读已读值得跟进有用关注 多智能体系统