论文Agent 与开发者10:39UECR-GRPO:用熵校准统一策略内蒸馏与GRPO的信用分配教小模型做数学题的新训练方法,把教师模型的逐token提示和答案对错验证揉进一个GRPO更新里,Qwen3-1.7B和4B都涨了不到1个点,做RL训练的可以看看细节。#GRPO#Qwen3#策略内蒸馏#数学推理aarXiv cs.LG@Jie Zhang 等 5 人原文稍后读已读值得跟进有用关注 GRPO