论文13:19DRPO:用平滑散度正则化改进LLM强化学习稳定性做LLM RL后训练的团队终于有了更优雅的信任区域控制方案——DRPO用连续正则化替代硬裁剪,解决了长尾词汇下梯度丢弃问题,训练更稳且收敛更快,做RLHF或GRPO优化的建议直接读论文。#强化学习#LLM后训练#信任区域#散度正则化aarXiv cs.LG@Jiarui Yao 等 6 人原文稍后读已读值得跟进有用关注 强化学习