17:49官方账号arXiv cs.LG@Di Yang Shi, W. Bradley Knox该论文提出一套形式化流程,让非专家也能构建符合人类偏好排序的奖励函数。流程分三步:先从自然语言任务中提炼基本目标并导出可测量的结果变量,再通过最小成本部分覆盖在因果DAG上选择奖励项,最后用偏好查询拟合权重。权重拟合被转化为凸可行性问题,借助分离预言机迭代收窄可行区域,只需 O(n log κ) 次偏好查询。这是首个保持确定性无冲突可行权重区域的奖励设计方法。论文奖励函数偏好对齐RLHF推荐理由:这篇论文把奖励函数设计拆成三步,还有个只要 O(n log κ) 次偏好查询的算法,做 RLHF 或奖励建模的值得一读。原文稍后读已读值得跟进有用关注 奖励函数
12:03官方账号arXiv cs.LG@Yuanshen Guan, Zipeng Feng, Zhiwei Xiong, Peiqin Sun论文提出 Latent Reward Registers,在冻结的 Diffusion Transformer(DiT)输入序列中加入可学习的 register token,直接从中间噪声潜在表示估计最终偏好奖励。相比稀疏终端奖励,该方法在整个去噪过程提供稠密、可微的奖励信号。训练策略 RG-OPD 在在线策略轨迹上蒸馏奖励梯度,GPU 时间最多减少 33 倍,超过在线强化学习基线。推理策略 RGS 无需参数更新即可引导采样,在无训练方法中达到新 SOTA。在高噪声水平 u=0.8 时,寄存器在潜在奖励模型中成对准确率最高。论文Latent Reward RegistersDiffusion TransformerRG-OPD推荐理由:这篇论文给扩散模型加了个奖励寄存器,不用改生成器就能获得稠密奖励,训练比在线 RL 快 33 倍,做生成对齐的可以看看。原文稍后读已读值得跟进有用关注 Latent Reward Registers
09:31官方账号arXiv cs.AI@Wentao Liu, Siyu Song, Xi Chen, Youjia Li, Xiaokun Wang, Min Ji, Ji WangAnthroDial是一个闭环框架,将拟人对话的生成、评估和偏好对齐联合建模。其运行时结合角色条件调度、长时记忆和虚拟时间;评测包含L0有效性门控、5个每轮维度和5个对话级维度。后训练管线用16,436个调度决策示例做SFT,并采用GRPO与认知诊断ZPD感知奖励,通过Kalman滤波对每个行为维度进行能力估计并加权。在55个角色、50个场景、50个角色-场景绑定、每模型100个角色条件案例的基准上,评估了16个系统,Qwen3.6-27B-SFT+RL达到39.00%严格ACC和98.5总分。9B无思考设置下,SFT和RL将严格ACC从0.00%提升到13.00%和18.37%。论文AnthroDialQwenGRPO推荐理由:这篇论文把拟人对话的生成、评测和奖励对齐做成闭环,Qwen3.6-27B微调后严格准确率39%,比基线高一大截。原文稍后读已读值得跟进有用关注 AnthroDial
10:14官方账号arXiv cs.LG@Eric Zhu, Abhinav Shrivastava, Soumik Mukhopadhyay本文提出两种互补策略提升扩散模型RLHF的反馈效率。第一种是逐时间步加权方案,重新调整策略优化中去噪步骤的权重,并与PPO的最优收敛性质建立理论联系。第二种是基于优势的回放机制,优先复用信息丰富的轨迹,减少对新奖励查询的依赖。在相同超参数下,该方法将样本效率提升高达6倍,并保持对未见提示的泛化能力。论文RLHF扩散模型样本效率推荐理由:这篇论文教你怎么用更少的反馈数据训练扩散模型,关键是把去噪步和样本按重要性加权,实验涨了6倍效率。原文稍后读已读值得跟进有用关注 RLHF
10:14官方账号arXiv cs.LG@Kevin Kingslin, Anish Natekar, Ashutosh Ranjan, Vivek Srivastava, Savita Bhat, Shirish KarandeDemocratic ICAI 通过结构化角色辩论收集多种竞争性理由,用于从人类偏好中提取自然语言原则。在创意偏好基准 MuCE-Pref 和 LiTBench 上,该方法在多种创意任务类别中提高了偏好预测准确性。与 deliberative prompting 和基于原则的基线相比,Democratic ICAI 产生了更忠实的偏好结构。LLM 标注者更偏好其生成的宪法。论文Democratic ICAIICAIMuCE-Pref推荐理由:这篇论文用辩论方式来搞AI对齐,比单次解释更细致,在创意任务上预测偏好更准,搞对齐研究的值得看看。原文稍后读已读值得跟进有用关注 Democratic ICAI
12:14官方账号arXiv cs.LG@Yonghyun Kim, Junwon Lee, Haiwen Xia, Yinghao Ma, Junghyun Koo, Koichi Saito, Yuki Mitsufuji, Chris DonahueTuneJury 是一个面向文本到音乐生成的开放实例级成对奖励模型,基于人类偏好标签(包括竞技场投票、指标对齐偏好、众包成对比较和专家美学评分)训练。它通过简单分数阈值支持数据过滤,在保留测试对和分布外基准上表现良好,并胜过先前的基线。该模型还引入锚定校准方法,以更高的数据效率恢复一致性,并在三种下游应用(推理时最优N采样、DITTO风格潜在优化和专家迭代后训练)中持续提升奖励轴收益。TuneJury 已在 GitHub 发布。论文TuneJury音乐生成多模态推荐理由:如果你在搞音乐生成,想用人类偏好来对齐模型,这个开源的奖励模型 TuneJury 可以让你直接拿来用,还附带了三种应用示例,比重新训一个省事多了。原文稍后读已读值得跟进有用关注 TuneJury
16:00官方账号arXiv cs.AI@Zhefan Xu, Ghassen Jerfel, Marina Haliem, Qi Zhao, Jeonhyung Kang, Khaled S. Refaat精选本文提出 VL-DPO 框架,利用视觉语言模型(VLM)作为零样本推理器,自动从预训练模型的轨迹输出中生成偏好对,再通过直接偏好优化(DPO)微调运动预测模型,使其与人类驾驶偏好对齐。在 Waymo Open End-to-End Driving Dataset 上实验表明,VLM 的轨迹选择可作为人类偏好的高质量代理,最终模型在评分反馈(RFS)上提升 11.94%,平均位移误差(ADE)降低 10.01%。该方法解决了标准模仿学习难以捕捉人类驾驶偏好细微差异的问题,为自动驾驶行为决策提供了新的对齐思路。论文自动驾驶偏好对齐视觉语言模型推荐理由:自动驾驶团队终于有了一个自动对齐人类偏好的实用方法——用 VLM 生成偏好对再微调,比手工标注高效太多,做运动预测或决策规划的开发者值得一试。原文稍后读已读值得跟进有用关注 自动驾驶
11:34官方账号arXiv cs.AI@Guining Cao, Jiaxin Peng, Chu Zeng, Yu Zhao, Shuangyong Song, Yongxiang精选现有强化学习方法在可验证任务中表现优异,但在开放生成任务中面临奖励模型训练成本高、输出多样性差的问题。研究者提出PPR-GDE方法,无需标量奖励,通过成对偏好奖励保留主观评价的比较结构,并引入群体级多样性奖励显式鼓励语义分散。该方法在角色扮演任务上实现了比强基线更好的对齐质量和表达多样性。实验表明,成对偏好对主观偏好对齐至关重要,而多样性指标对实现更广的语义覆盖不可或缺。论文强化学习开放生成偏好对齐推荐理由:做开放域文本生成(如角色扮演、创意写作)的团队,终于有了一个兼顾对齐质量和输出多样性的RL方法,不用再担心模型输出千篇一律,值得点开看实现细节。原文稍后读已读值得跟进有用关注 强化学习