论文11:41弱到强泛化通过Direct On-Policy Distillation用弱模型训练强模型,Qwen3-1.7B在AIME 2024从48.3%飙到62.4%,只花4小时8卡A100。比直接RL还省,值得试试。#Direct-OPD#Qwen3#AIME 2024#推理模型aarXiv cs.AI@Shiyuan Feng 等 10 人原文稍后读已读值得跟进有用关注 Direct-OPD