模型10:57重新思考奖励监督:Rubric-Conditioned Self-Distillation想提升推理模型训练效果?这篇用评分标准做细粒度自蒸馏,比GRPO和OPSD都强,实验扎实。#Rubric-Conditioned Self-Distillation#推理模型#自我蒸馏#评分标准aarXiv cs.AI@Siyi Gu 等 5 人原文稍后读已读值得跟进有用关注 Rubric-Conditioned Self-Distillation