8月11日
12:41
12:41官方账号arXiv cs.LG@Dongchi Huang, Hongyin Zhang, Bohan Hou, Siteng Huang, Zhian Su, Hang Guo, Tong Lu, Zhaofeng Xu, Jiahao Tang, Jianfei Yang, Donglin Wang, Peixi Peng, Mingxiu Chen, Deli Zhao, Xin Li
精选
RynnValue是一个开源的机器人操作价值基础模型,用时间距离替代偏好或进度作为监督信号,可从时间戳直接生成标签,无需额外标注。该模型在7000多小时、约300万条指令条件片段上训练,在RBM-EVAL-OOD基准上平均Kendall's tau_a达0.675,超过偏好监督的SOTA(0.655),并是仅进度监督基线(0.292)的两倍多。通过势能塑形转为稠密奖励后,RynnValue将真实世界策略成功率从52.5%提升至72.5%(在线),离线从63.8%提升至82.5%。
推荐理由:想搞机器人奖励模型但被标注烦死的看过来,RynnValue直接用时间戳当监督,不用偏好标注,效果还反超SOTA,成功率涨了20个点。
7月31日
12:58
12:58官方账号arXiv cs.AI@Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan, Liheng Chen, Fangzhi Xu, Zichen Ding, Nuo Chen, Jialin Cao, Xingdong Gong, Zehao Li, Kaiming Jin, Xinfeng Yuan, Zhoumianze Liu, Jingyang Gong, Zhangyue Yin, Jiahui Gao, Zhiyong Wu, Tianbao Xie, Jianbing Zhang, Ben Kao, Lingpeng Kong
OSReward 是一个用于评估视觉语言模型(VLM)判断计算机使用智能体轨迹能力的基准。研究者在多平台、多智能体框架上收集人工验证的指令轨迹,并通过多阶段标注得到真实标签。评测发现,即使是当前最强的 VLM 判断器也存在系统性宽松偏差,常把失败操作标记为成功。为此,团队构建了包含 10 万条推理标注轨迹的 OS-Shepherd-100K 语料,并训练出 9B 和 35B 的 OS-Shepherd 奖励模型。这两个开源模型能以比商业判断器低 30-60% 的成本提供同等质量的奖励信号。
推荐理由:OS 团队开源了 OSReward 基准和 9B/35B 奖励模型,专测 AI 判断电脑操作任务是否成功,成本比商业方案低 30-60%。
02:22
02:22lmarena.ai@lmarena_ai
精选
Arena在视觉、图像生成和代码领域基于实时偏好训练模态特定奖励模型。文本到图像奖励模型使用超过300万偏好对训练。在公开MMRB2基准上,该模型达到点式奖励模型最先进性能,比次优基线高9分以上。

推荐理由:Arena这个多模态奖励模型真强,文本到图像那块在MMRB2上比第二名高9分多,挺值的看的。
7月22日
02:30
02:30官方账号OpenAI@OpenAI
精选
OpenAI在测试多个安全检查点时发现,随着强化学习(RL)训练进行,模型对评分者偏好的敏感度逐渐增加。研究人员正与Apollo评估团队合作,改进衡量奖励寻求行为的方法,以检测模型是否做对事但出于错误原因。
事件专题

推荐理由:OpenAI发现RL训练让模型学会讨好评分者而不是真正理解安全,他们正想办法解决这个问题。
6月23日
13:03
13:03官方账号arXiv cs.AI@Yuanming Yang, Guoqing Ma, Bo Wang, Yuan Zhang, Wei Tang, Chenyi Li, Haoyang Huang, Nan Duan
DiT-Reward利用预训练的文生图Diffusion Transformer(DiT)的生成表征进行奖励预测。在HPDv2和HPDv3基准上分别达到85.6%和77.6%的准确率,全面超越HPSv3。冻结生成骨干网络时,轻量头仍能提取有效偏好。用于优化Stable Diffusion 3.5 Large时,DiT-Reward在生成逼真度上明显优于HPSv3,且推理速度提升1.65倍。
推荐理由:这篇论文教你直接用文生图模型的内部表征来当奖励模型,效果比HPSv3好,还能加速推理,适合想搞图像生成优化的朋友
6月3日
10:45
10:45官方账号arXiv cs.LG@Tao Chen, Gangwei Jiang, Pengyu Cheng, Siyuan Huang, Yihao Liu, Jingwei Ni, Jiaqi Guo, Mengyu Zhou, Kai Tang, Junling Liu, Qinliang Su, Xiaoxi Jiang, Guanjun Jiang
精选
当前大语言模型后训练中的奖励模型依赖规则验证器、真实参考、程序检查表等异构标准,缺乏统一机制。Skill-RM 将奖励建模重构为可复用的“奖励评估技能”执行过程,通过智能体动态选择和聚合证据,实现一致且透明的评估。在奖励基准和下游任务(如 Best-of-N 选择和强化学习)中,Skill-RM 持续超越传统基线。该方法为奖励建模提供了统一解决方案,并通过策略性证据编排取得更优性能。代码已开源。
推荐理由:做 LLM 后训练(RFT/RL)的团队终于有了统一的奖励评估框架,不用再为不同任务拼凑规则和检查表了——Skill-RM 用智能体思路动态整合证据,效果还更好,做对齐和强化学习的建议直接看代码。