论文多源确认11:55OR:一种可微分的信任域策略优化方法这篇论文用OR替换PPO和GRPO的裁剪目标,在Llama-3.2上奖励得分有提升,适合想了解强化学习微调新思路的同学#OR#PPO#GRPO#强化学习3 个信源在谈事件专题aarXiv cs.LG@Chinmay Rane 等 3 人4 个信源在谈原文稍后读已读值得跟进有用关注 OR