AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

信任区域

共 3 条相关 AI 资讯
7月29日
09:49
09:49官方账号arXiv cs.LG@Ezgi Oztekin, Figen Oztoprak, S. Ilker Birbil
Dynamic Constraint Learning (DCL) 提出一种数据驱动框架,用于在约束函数未知且无法查询时进行约束优化。该框架在每个迭代中从附近数据学习局部代理,并在数据支持的信任区域内求解子问题。与离线全局约束学习相比,DCL使用局部代理,适应优化过程中的数据分布。在合成测试问题和一个文献案例研究中,DCL实现了与全局模型相当的解决方案质量,同时使用更简单的局部模型和更小的优化子问题。
论文Dynamic Constraint Learning约束优化数据驱动

推荐理由:这篇论文提出DCL方法,在约束函数未知时用局部代理高效优化,解决了实际难题,值得关注。
原文
7月14日
09:23
09:23官方账号arXiv cs.LG@Xiangxin Zhou, Jiarui Yao, Penghui Qi, Bowen Ping, Jiaqi Tang, Haonan Wang, Tianyu Pang
PPO通常使用采样标记重要性比率来稳定LLM强化学习的离策略更新,包括邻近准则和方向准则。DPPO改进了邻近准则但方向准则仍继承自PPO,其基于重要性比率的方向可能与散度变化不一致。本文提出预测性分歧掩码,通过闭式解预测策略梯度步骤对同一散度的影响,并针对生产环境中的Top-K词汇开发了两种轻量估计器。实验表明,该方法在多个模型尺度和精度设定下提升了RL训练效果。
论文LLMPPODPPO

推荐理由:这篇论文提出了一种更聪明的掩码方法,解决了PPO和DPPO在方向判断上的不一致,让LLM强化学习训练更稳定高效。
原文
6月9日
13:19
13:19官方账号arXiv cs.LG@Jiarui Yao, Xiangxin Zhou, Penghui Qi, Wee Sun Lee, Liefeng Bo, Tianyu Pang
该论文指出,在LLM后训练中常用的PPO和GRPO方法依赖重要性比率裁剪来约束策略更新,但在长尾词汇分布下,比率无法准确反映分布偏移。DPPO虽改用散度掩码,但硬掩码会直接丢弃越界token的梯度,导致信息损失。作者提出DRPO,用平滑的优势加权二次正则项替代硬掩码,在保持相同信任区域几何的同时,提供连续梯度权重,既能抑制发散更新,又能在边界外提供修正信号。实验表明,DRPO在不同模型规模、架构和精度设置下均提升了训练稳定性和效率。
论文强化学习LLM后训练信任区域

推荐理由:做LLM RL后训练的团队终于有了更优雅的信任区域控制方案——DRPO用连续正则化替代硬裁剪,解决了长尾词汇下梯度丢弃问题,训练更稳且收敛更快,做RLHF或GRPO优化的建议直接读论文。
原文
精选全部日报登录