论文09:40Eval-Skill:探索引导的评估技能合成,提升奖励模型判断力做奖励模型或 LLM 评估的团队终于有了一个轻量级替代方案——不用每次生成评分标准,而是合成可复用的评估技能,效果还比传统方法好很多,值得在 RewardBench 上跑一下自己的模型。#奖励模型#评估技能#探索引导#RewardBenchaarXiv: DeepSeek@Xing Yue 等 5 人原文稍后读已读值得跟进有用关注 奖励模型