主要来源rohanpaul_ai
查看原文事件专题 ·单一信源
JHU 与 CMU 论文:4B 小模型可自动改写 Agent harness 代码并泛化到新任务
Johns Hopkins 与 Carnegie Mellon University 的论文提出让小模型根据失败报告自动改写 agent 的 harness 代码。harness 是决定模型看到什么内容、调用哪些工具的代码,编辑模型读取 harness 和失败信息后生成代码修改,并以新 harness 的得分作为奖励。在 21 个未见过的推理任务类型上,4B 编辑模型的平均修改得分从 0.32 升到 0.62,超过其 35B 教师。另一个在 HotpotQA 上训练的编辑模型还能在 2 个其他 QA 基准上持续改进 harness,实验显示多轮重复修改优于单次修改。
当前结论
JHU 和 CMU 让 4B 小模型自己改 agent 的 harness 代码,效果反超 35B 教师模型,做 agent 开发可以试试这思路。
2 个信源52° AI 热度最后更新 2026/10/5 23:31:09
证据链
2 个信源相关来源 1elvis
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。