#奖励模型
共 25 条 · 7 天 0 条 · 30 天 4 条
信息流里打上「奖励模型」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月30日
9月29日
9月25日
9月1日
8月13日
8月11日
8月5日
8月1日
7月31日
论文12:58
OSReward:为跨平台计算机使用智能体建立标准化评估OS 团队开源了 OSReward 基准和 9B/35B 奖励模型,专测 AI 判断电脑操作任务是否成功,成本比商业方案低 30-60%。
模型02:26
AutoEval 如何产生 Arena Score:基于奖励模型的评分流程想知道 Arena 排行榜上的自动评分怎么算的吗?这篇解释了 AutoEval 如何用数百万人类投票训练奖励模型来给新模型打分,快且透明。
AutoEval文本奖励模型:预测人类偏好比前沿LLM裁判准确8-10%
Chai团队搞了个AutoEval奖励模型,预测人类偏好比GPT-4之类还准8-10%,新模型刷榜前先看它评分,省得等人类投票。
模型02:16
Arena.ai 推出 AutoEval:基于数百万真实用户偏好的奖励模型评测方法Arena.ai 出了 AutoEval,用真实用户偏好训练奖励模型,几个小时就能评测新模型,比人工快几十倍,结果还跟人工差不多。
7月22日
6月30日
论文11:10
Shell-LCC: 数据流形隐式作为奖励模型用于文本到视频生成这篇论文发现数据流形本身就是好奖励,提出Shell-LCC,不花啥钱就能让AI生成的视频更清晰、少模糊,比加奖励模型省事多了。
6月25日
模型10:45
后训练中被忽视的免费午餐:进度优势用于LLM智能体这篇论文说,RL后训练时顺便就能得到一个免费的好信号,不用再费劲训练奖励模型,在好几个测试里都比专门训练的效果还好。做智能体训练的一定得看看。
6月23日
6月16日
论文12:14
TuneJury:用于改善音乐生成偏好对齐的开放度量如果你在搞音乐生成,想用人类偏好来对齐模型,这个开源的奖励模型 TuneJury 可以让你直接拿来用,还附带了三种应用示例,比重新训一个省事多了。
6月8日
论文09:40
Eval-Skill:探索引导的评估技能合成,提升奖励模型判断力做奖励模型或 LLM 评估的团队终于有了一个轻量级替代方案——不用每次生成评分标准,而是合成可复用的评估技能,效果还比传统方法好很多,值得在 RewardBench 上跑一下自己的模型。
6月3日
Skill-RM:用智能体技能统一异构评估标准,提升奖励模型性能
做 LLM 后训练(RFT/RL)的团队终于有了统一的奖励评估框架,不用再为不同任务拼凑规则和检查表了——Skill-RM 用智能体思路动态整合证据,效果还更好,做对齐和强化学习的建议直接看代码。
5月12日
论文19:11
FormalRewardBench:形式化定理证明奖励模型基准该基准填补了形式化定理证明中奖励模型评估工具的空白,揭示专用定理证明模型在评估任务上的不足,为改进RL训练信号提供了明确方向。