Meta 研究发现预训练模型加轻量脚手架在智能体任务上可超越 RL 后训练版本
Meta 这篇论文挺反直觉的:给基座模型配个轻量脚手架,多采样几次,居然比 RL 后训练版本更能解智能体任务,做训练的人可以看看。
Meta 这篇论文挺反直觉的:给基座模型配个轻量脚手架,多采样几次,居然比 RL 后训练版本更能解智能体任务,做训练的人可以看看。
这篇论文说,RL后训练时顺便就能得到一个免费的好信号,不用再费劲训练奖励模型,在好几个测试里都比专门训练的效果还好。做智能体训练的一定得看看。
做 RL 后训练的团队注意了——验证器成本可能成为瓶颈,而 LLM-as-judge 的性价比直接决定迭代速度,建议点开看看怎么优化。