#信任区域
共 3 条 · 7 天 0 条 · 30 天 0 条
信息流里打上「信任区域」标签的资讯、产品与论文,按刊登时间排,新的在上。
7月29日
7月14日
6月9日
论文13:19
DRPO:用平滑散度正则化改进LLM强化学习稳定性做LLM RL后训练的团队终于有了更优雅的信任区域控制方案——DRPO用连续正则化替代硬裁剪,解决了长尾词汇下梯度丢弃问题,训练更稳且收敛更快,做RLHF或GRPO优化的建议直接读论文。
做LLM RL后训练的团队终于有了更优雅的信任区域控制方案——DRPO用连续正则化替代硬裁剪,解决了长尾词汇下梯度丢弃问题,训练更稳且收敛更快,做RLHF或GRPO优化的建议直接读论文。