8月21日
00:05
00:05elvis@omarsar0
精选
该论文分析了大量公开的智能体后训练轨迹。研究发现,智能体在第一步就锁定了训练策略,后续仅进行局部调整。论文尝试了三种改进方法:经验驱动的脚手架提升了GSM8K和HumanEval的分数,但策略仍保持冻结。人类指导能改变初始选择,但训练开始后智能体又回到局部循环。额外推理计算对简单任务有效,对最难任务几乎无效。
事件专题

推荐理由:这篇论文测试了智能体能否训练其他智能体,发现它们在第一步就锁定了策略,后续改进效果有限。作者尝试了三种方法,但智能体仍缺乏在执行中重新考虑策略的能力。
8月20日
10:12
10:12官方账号arXiv cs.LG@Joy Jia Yin Lim, Xin Huang, Hao Peng, Yaxi Lu, Xin Cong, Zhong Zhang, Maosong Sun, Yankai Lin
针对大型语言模型(LLM)后训练,研究发现其训练策略常锁定初始选择;分析公开数据后发现,训练预算多用于局部调整而非策略修订;干预实验显示,增加经验或指导仅提升执行效果,未改变策略;不同任务上的计算投入效果存在明显差异。
事件专题

推荐理由:OpenAI做了关于大模型后训练的研究,能分析训练策略问题,和以前方法比效果不一样。
7月17日
10:08
10:08官方账号arXiv cs.AI@Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl
论文提出掩码感知策略梯度方法,解决强化学习应用于掩码扩散语言模型(MDLM)时对数似然估计难的问题。方法将MDLM生成建模为两阶段动作MDP,策略梯度分解为token项和掩码项。联合优化两项后,模型在GSM8K上达87.1%准确率,在MBPP上达53.4%得分,均达到当前最优。
推荐理由:这篇论文给扩散语言模型加了个策略梯度法子,数学推理和编程测试成绩都刷了新高,搞RL训练模型的可以看看。