CMU 提出通过编辑 harness 代码优化智能体,4B 提案模型胜过 35B 教师
卡内基梅隆这篇论文挺有意思:不调模型权重,靠 RL 训一个 4B 小模型去改智能体外壳代码,结果干翻了 35B 教师,做 agent 的可以看看。
卡内基梅隆这篇论文挺有意思:不调模型权重,靠 RL 训一个 4B 小模型去改智能体外壳代码,结果干翻了 35B 教师,做 agent 的可以看看。
这篇讲了个挺新的思路:不微调模型,而是让一个 proposer 用强化学习学会改智能体的 harness,测试时边跑边改。做 Agent 框架的可以看看。