模型11:27CriPO:基于自蒸馏增强评分RL,解决优化信号丢失问题这篇论文分析了评分RL中信号丢失的普遍问题(57%样本受影响),并提出CriPO自蒸馏方法,在医学和科学基准上效果更好且训练更快。#CriPO#Rubric-based RL#自蒸馏#强化学习aarXiv cs.AI@Mingxuan Xia 等 10 人原文稍后读已读值得跟进有用关注 CriPO