论文精选12:11DelTA:用判别性Token信用分配提升RLVR推理能力做RLHF或推理模型训练的团队,终于有了一个能精准分配token级信用的方法——DelTA解决了高频格式token淹没关键信号的问题,数学和代码任务上效果显著,值得在自家模型上试试。#强化学习#Token信用分配#推理模型#RLVRaarXiv cs.LG@Kaiyi Zhang 等 3 人原文稍后读已读值得跟进有用关注 强化学习