09:28官方账号arXiv cs.LG@Qian Tan, Huaifei Liang, Xuanyu Zhu, Lei Jiang, Yuqiang Li在线蒸馏(OPD)沿学生生成轨迹提供密集教师监督,但长响应会拖慢批量完成。现有加速方法用固定预算或绝对师生一致阈值控制回滚长度,难以反映学习进度。Adaptive FastOPD 仅在当前边界区域学习趋于平稳且视野利用充分时扩展回滚视野,由四个师生信号相对值判断进度。在两个师生对上,Adaptive FastOPD 比 OPD 15K 减少训练时间 49.1%–71.2%,同时取得最高平均性能,且对超参数设置鲁棒。论文Adaptive FastOPDOPD在线蒸馏推荐理由:发了个叫Adaptive FastOPD的蒸馏加速方法,比OPD 15K快一半多,性能还更高。做训练加速的可以看看。原文稍后读已读值得跟进有用关注 Adaptive FastOPD
11:55官方账号arXiv cs.LG@Tianyi Men, Zhuoran Jin, Kang Liu, Jun Zhao论文提出统一多轮环境,系统研究规划能力在预训练与后训练三阶段的获取、塑造与整合。预训练中,显式世界模型通过CoT状态转换建模提升长程泛化,少量长程数据即可实现组合泛化,但次优轨迹因误差累积严重损害性能。后训练中,OPD在低质长程设置下的有效区域比GRPO更广,不同知识的教师蒸馏可能损害学生先验世界模型。多教师在线策略蒸馏(MOPD)通过收敛到共享规划模式整合能力,兼容模式支持跨环境泛化,冲突模式导致干扰。论文MOPDGRPOOPD推荐理由:这篇用一个可控环境拆解了AI长程规划的训练机制,发现次优数据会拖累性能,多教师蒸馏能整合不同能力,值得做训练方法的人细读。原文稍后读已读值得跟进有用关注 MOPD
22:38官方账号LMSYS Org (SGLang)@lmsysorg精选Miles 框架新增 On-Policy Distillation(OPD)作为一等训练原语。在 Qwen3.5-35B-A3B 上,纯 OPD 使推理 token 数从 18.6k 降至 5.5k–6.7k,缩短约 3 倍,同时 held-out DAPO 准确率从 0.8457 升至 0.8945。反向 KL 散度从 0.045 降至 0.010,学生模型收敛至教师。采用稀疏逐位置评分代替密集 O(R²K) 评分,提升效率。支持纯蒸馏或与 GRPO/PPO 奖励结合,计划扩展多教师和 RL 场景。AI模型MilesOPDQwen3.5-35B1 个信源在谈事件专题推荐理由:Miles 发布了 OPD 方法,让 Qwen3.5 模型推理更快更准,无需任务奖励,比传统蒸馏更高效,适合模型压缩场景。原文稍后读已读值得跟进有用关注 Miles
10:47官方账号arXiv cs.LG@Yan Xie, Sijie Zhu, Tiansheng Wen, Bo Chen, Yifei Wang标准在策略蒸馏(OPD)对所有token均匀加权,但研究发现学生rollout越长,后续token与教师分布偏差越大。仅使用前30%的token即可达到全token性能,而仅用后30%几乎学不到东西。基于约束优化视角,提出重要性加权在策略蒸馏(IW-OPD),根据累积偏差动态调整token权重。IW-OPD收敛更快,在AIME-2025基准上性能提升多达6.9分。论文OPDIW-OPDAIME-2025推荐理由:这篇论文揭示了OPD中后面token质量差的问题,提出IW-OPD加权方案,在AIME-2025上提分6.9,做蒸馏研究的值得一看。原文稍后读已读值得跟进有用关注 OPD
11:26官方账号arXiv cs.LG@Guo Yu, Wenlin Liu, Yulan Hu, Hao-Xuan Ma, Jun-Peng Jiang, Han-Jia Ye该论文分析了在线策略蒸馏(OPD)在语言和多模态模型中的参数更新特性,发现OPD更新具有稀疏性,主要集中在FFN层,且仅训练这些子网络即可接近完整OPD的性能。更新在几何上是满秩但谱集中的,主要落在源权重接近零的坐标上。研究还发现,密集教师监督下SGD优化器不如AdamW,因为AdamW的自适应缩放对保持异构梯度尺度更有效。这些结果表明,OPD并非简单的密集参数重写,而是保留了策略后训练的几何特征。论文模型蒸馏稀疏更新优化器对比推荐理由:这篇论文揭示了OPD更新的稀疏性和几何特性,对做模型蒸馏和微调的团队有直接参考价值——你可以只训练关键子网络来节省计算,同时理解为什么AdamW比SGD更优。建议点开看看实验细节。原文稍后读已读值得跟进有用关注 模型蒸馏