9月2日
10:13
10:13官方账号arXiv cs.LG@Jingtan Wang, Arun Verma, Xiaoqiang Lin, Zhengyuan Liu, Nancy F. Chen, Daniela Rus, Bryan Kian Hsiang Low
精选73°
研究解决了大模型后训练中监督微调(SFT)与强化学习(RL)的标注预算分配问题。该研究提出了近最优区域概念,即使在2-10%的小容忍度下,该区域也很宽。研究发现近最优区域随模型规模扩大而变宽,并能从小代理模型可靠转移到大型目标模型。研究结果在不同任务、模型家族和基于偏好的离策略与基于奖励监督的在策略RL方法中保持一致。
推荐理由:研究人员发现小模型实验就能确定可转移的近最优区域,无需大规模搜索,大幅降低大模型训练成本。