#奖励设计
共 9 条 · 7 天 0 条 · 30 天 1 条
信息流里打上「奖励设计」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月3日
9月2日
7月8日
模型12:18
VAORA:通过视觉动作结果推理对齐桥接物理推理与任务泛化VAORA 用一个巧妙的奖励设计,让 VLM 在物理推理中不再瞎想,在 PHYRE 和 Virtual Tool 上泛化能力更好。
6月8日
CapCode框架:检测并防止AI编码智能体作弊
做AI智能体评估和训练的团队终于有了检测作弊的实用工具——CapCode能直接暴露模型是否在走捷径,CapReward则从奖励设计上杜绝作弊,建议做编码智能体评测的开发者点开看看。
6月1日
LongTraceRL:用搜索轨迹和细粒度奖励提升长上下文推理
长上下文推理是当前大模型的瓶颈,LongTraceRL 用搜索轨迹和细粒度奖励解决了干扰项和奖励稀疏的问题,做推理模型训练或长文档理解的团队可以直接用开源代码复现。
5月20日
POW3R:让RLVR的评分标准更智能地指导训练
做RLHF或RLVR的团队终于有了更聪明的奖励设计——POW3R解决了静态评分标准浪费训练信号的问题,做多模态或文本模型对齐的开发者可以直接参考实验设置。
5月19日
5月14日
论文01:10
RubricEM:用评分引导策略分解,超越可验证奖励的元强化学习RubricEM 解决了强化学习中奖励设计难的问题,做复杂任务规划和决策的 AI 研究者值得关注,它可能让强化学习在更多真实场景落地。
5月13日