主要来源LMSYS Org (SGLang)
查看原文事件专题 · 单一信源
Miles 引入 OPD:使 Qwen3.5-35B 推理缩短 3 倍且精度提升
Miles 框架新增 On-Policy Distillation(OPD)作为一等训练原语。在 Qwen3.5-35B-A3B 上,纯 OPD 使推理 token 数从 18.6k 降至 5.5k–6.7k,缩短约 3 倍,同时 held-out DAPO 准确率从 0.8457 升至 0.8945。反向 KL 散度从 0.045 降至 0.010,学生模型收敛至教师。采用稀疏逐位置评分代替密集 O(R²K) 评分,提升效率。支持纯蒸馏或与 GRPO/PPO 奖励结合,计划扩展多教师和 RL 场景。
当前结论
Miles 发布了 OPD 方法,让 Qwen3.5 模型推理更快更准,无需任务奖励,比传统蒸馏更高效,适合模型压缩场景。
2 个信源52° AI 热度最后更新 2026/7/23 14:38:46
证据链
相关来源 1arXiv: DeepSeek
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。