12:28官方账号arXiv cs.LG@Yijiang Li, Bingyang Wang, Yijun Liang, Yunjie Tian, Di Fu, Nuno VasconcelosU-OPSD 提出只用模型自身生成做 on-policy 自蒸馏,不依赖真实标签、环境反馈或更大模型。它通过多次采样后多数投票构造伪答案,并把教师分布建立在最短伪答案上,蒸馏到模型最长错误补全的前缀。在 AIME24、AIME25、HMMT25、MATH500、AMC23 上,U-OPSD 让 Qwen3 4B/8B 非思考模式相对基座提升 8.5%/10.7%,平均超过 OPSD 3.2%/2.3%。思考模式下,U-OPSD 在 4B 超 OPSD 0.9%,8B 持平,并分别超 GRPO 0.7%/1.1%。论文U-OPSDQwen3OPSD推荐理由:不需要标注和外部反馈,U-OPSD靠投票让Qwen3数学成绩再涨一截,追平甚至超过OPSD和GRPO。原文稍后读已读值得跟进有用关注 U-OPSD