09:49官方账号arXiv cs.LG@Ezgi Oztekin, Figen Oztoprak, S. Ilker BirbilDynamic Constraint Learning (DCL) 提出一种数据驱动框架,用于在约束函数未知且无法查询时进行约束优化。该框架在每个迭代中从附近数据学习局部代理,并在数据支持的信任区域内求解子问题。与离线全局约束学习相比,DCL使用局部代理,适应优化过程中的数据分布。在合成测试问题和一个文献案例研究中,DCL实现了与全局模型相当的解决方案质量,同时使用更简单的局部模型和更小的优化子问题。论文Dynamic Constraint Learning约束优化数据驱动推荐理由:这篇论文提出DCL方法,在约束函数未知时用局部代理高效优化,解决了实际难题,值得关注。原文稍后读已读值得跟进有用关注 Dynamic Constraint Learning
09:23官方账号arXiv cs.LG@Xiangxin Zhou, Jiarui Yao, Penghui Qi, Bowen Ping, Jiaqi Tang, Haonan Wang, Tianyu PangPPO通常使用采样标记重要性比率来稳定LLM强化学习的离策略更新,包括邻近准则和方向准则。DPPO改进了邻近准则但方向准则仍继承自PPO,其基于重要性比率的方向可能与散度变化不一致。本文提出预测性分歧掩码,通过闭式解预测策略梯度步骤对同一散度的影响,并针对生产环境中的Top-K词汇开发了两种轻量估计器。实验表明,该方法在多个模型尺度和精度设定下提升了RL训练效果。论文LLMPPODPPO推荐理由:这篇论文提出了一种更聪明的掩码方法,解决了PPO和DPPO在方向判断上的不一致,让LLM强化学习训练更稳定高效。原文稍后读已读值得跟进有用关注 LLM
13:19官方账号arXiv cs.LG@Jiarui Yao, Xiangxin Zhou, Penghui Qi, Wee Sun Lee, Liefeng Bo, Tianyu Pang该论文指出,在LLM后训练中常用的PPO和GRPO方法依赖重要性比率裁剪来约束策略更新,但在长尾词汇分布下,比率无法准确反映分布偏移。DPPO虽改用散度掩码,但硬掩码会直接丢弃越界token的梯度,导致信息损失。作者提出DRPO,用平滑的优势加权二次正则项替代硬掩码,在保持相同信任区域几何的同时,提供连续梯度权重,既能抑制发散更新,又能在边界外提供修正信号。实验表明,DRPO在不同模型规模、架构和精度设置下均提升了训练稳定性和效率。论文强化学习LLM后训练信任区域推荐理由:做LLM RL后训练的团队终于有了更优雅的信任区域控制方案——DRPO用连续正则化替代硬裁剪,解决了长尾词汇下梯度丢弃问题,训练更稳且收敛更快,做RLHF或GRPO优化的建议直接读论文。原文稍后读已读值得跟进有用关注 强化学习