事件专题 ·单一信源

Growing Harness:把重复控制逻辑从模型上下文挪进代码

arXiv 论文提出 Growing Harness,一种由失败反馈驱动的训练范式,从无策略脚手架出发自动学习 agent harness 本身。它通过函数级执行轨迹定位失败、联合修复一批失败,并用 success-first 留出集回滚损害原有能力的改动。在 BrowseComp-Plus 和 WebArena-Verified 上配合 4B 到 120B 三种模型,六组基准-模型配置中五组取得最高平均成功率。相比 Tool-Calling agent,LLM 调用减少 76.0-91.8%,推理成本降低 74.4-98.6%;4B 模型下 WebArena-Verified 成功率保持 44.7-45.3%,而 Tool-Calling 降至 6.7%。

当前结论

这篇论文教你让 harness 自己从失败里长出控制代码,省掉七到九成 LLM 调用,4B 小模型也能跑 WebArena,做 agent 工程的值得细看。

2 个信源58° AI 热度最后更新 2026/9/22 17:40:45

证据链

2 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。