JHU 与 CMU 论文:4B 小模型可自动改写 Agent harness 代码并泛化到新任务
JHU 和 CMU 让 4B 小模型自己改 agent 的 harness 代码,效果反超 35B 教师模型,做 agent 开发可以试试这思路。
JHU 和 CMU 让 4B 小模型自己改 agent 的 harness 代码,效果反超 35B 教师模型,做 agent 开发可以试试这思路。
卡内基梅隆这篇论文挺有意思:不调模型权重,靠 RL 训一个 4B 小模型去改智能体外壳代码,结果干翻了 35B 教师,做 agent 的可以看看。