论文精选10:47QUBRIC:联合设计查询与评分标准,突破RLVR限制QUBRIC解决了RL在非可验证任务中的核心瓶颈——查询与评分标准不匹配,做RL训练或AI对齐的团队可以直接参考其方法,提升模型在开放推理任务上的表现。#强化学习#评分标准#查询设计#GRPOaarXiv cs.AI@Rongzhi Zhang 等 11 人原文稍后读已读值得跟进有用关注 强化学习