15:28官方账号arXiv cs.AI@Cedric Caruzzo, Donggeun Yoo, Tae Soo Kim该论文研究同权重MoE自蒸馏中,教师和学生模型共享权重但路由不同专家的问题。通过精确的块级分解,将路由项与内容项分离,在7个开源检查点和2个领域上测试。结果显示路由项对块输出的影响仅1.6倍,残差流暴露为3.2倍。PubMedQA预注册实验表明,路由项移动输出的效果不到自然上下文效应的一半,且可被匹配范数噪声复现。结论是路由移动本身不能证明行为影响,需先测量暴露度。论文MoE自蒸馏路由推荐理由:这篇论文把MoE路由分歧讲透了,用分解和实验证明路由项影响很小,做自蒸馏的值得看看。原文稍后读已读值得跟进有用关注 MoE
17:34官方账号arXiv cs.AI@Shiyu Xuan, Zechao Li该论文提出Test-Time Self-Evolving框架,让GUI智能体在部署后无需人工标注即可自我改进。框架构建探索、评估、反思、内化的闭环,通过MLLM反射器评估预测结果并生成推理反思。反射引导的On-Policy自蒸馏将高层推理转化为密集token级监督,对比校准防止错误前缀污染监督信号。在六个基准上平均准确率提升7.4%,是首个将on-policy自蒸馏用于GUI视觉定位测试时适配的工作。论文GUI视觉定位Test-Time Self-Evolving自蒸馏推荐理由:GUI智能体部署后不会自我进化的问题有解了,这个框架用反射引导自蒸馏,六个基准平均涨7.4个点,做智能体适配的可以看看。原文稍后读已读值得跟进有用关注 GUI视觉定位
12:28官方账号arXiv cs.LG@Yijiang Li, Bingyang Wang, Yijun Liang, Yunjie Tian, Di Fu, Nuno VasconcelosU-OPSD 提出只用模型自身生成做 on-policy 自蒸馏,不依赖真实标签、环境反馈或更大模型。它通过多次采样后多数投票构造伪答案,并把教师分布建立在最短伪答案上,蒸馏到模型最长错误补全的前缀。在 AIME24、AIME25、HMMT25、MATH500、AMC23 上,U-OPSD 让 Qwen3 4B/8B 非思考模式相对基座提升 8.5%/10.7%,平均超过 OPSD 3.2%/2.3%。思考模式下,U-OPSD 在 4B 超 OPSD 0.9%,8B 持平,并分别超 GRPO 0.7%/1.1%。论文U-OPSDQwen3OPSD推荐理由:不需要标注和外部反馈,U-OPSD靠投票让Qwen3数学成绩再涨一截,追平甚至超过OPSD和GRPO。原文稍后读已读值得跟进有用关注 U-OPSD
12:19官方账号arXiv cs.AI@ Aniri, Jinhe Bi, Peng Liao, Zengjie Jin, Volker Tresp, Fei Shen, Yunpu Ma, Tat-Seng Chua现有在线自蒸馏方法忽视多模态大模型推理中的模态失衡问题,文本信息占优时多模态输入无法充分整合。OPD-V利用放大图像的正面教师与遮罩图像的负面教师,将模态平衡本身作为特权信息。通过正负教师的模态平衡对数边际定义信任区域,筛选在线策略token用于自蒸馏。在6个基准、4个MLLM骨干和5种后训练方法上,OPD-V一致提升推理性能并降低训练成本。论文OPD-V多模态大模型自蒸馏推荐理由:OPD-V把模态平衡当特权信息,用正负教师挑token做自蒸馏,在6个基准、4种骨干上更省训练费还更准。原文稍后读已读值得跟进有用关注 OPD-V
09:29官方账号arXiv cs.AI@Sarthak Harne, Chinmay Karkar, Yash Pandya, Ahmed Awadallah, Akshay Nambi论文复现了SDPO在简单设置下的收益,但相同流程应用到困难任务(问答、数学、代码、多轮agentic工具使用)后失效。训练中每个token的损失持续下降,验证准确率却无法提升甚至退化。作者提出PI偏置分数,量化教师因见过单一参考解而对特定轨迹的偏向。学生匹配这种目标后,损失主要落在停用词、标点等低信息token上,并惩罚探索性token。结论是自蒸馏单独作为目标时,优化信号与任务成功并不挂钩。论文SDPOOPSD自蒸馏推荐理由:这篇论文把SDPO从简单题搬到难题上,发现loss降了但准确率不涨,还提出PI偏置分数解释原因,值得做蒸馏的人看。原文稍后读已读值得跟进有用关注 SDPO
12:31官方账号arXiv cs.AI@Changle Qu, Sunhao Dai, Hengyi Cai, Yuqi Zhou, Xinran Chen, Simon, Jun XuTurnSight 是一个面向工具集成推理(TIR)的回合级事后自蒸馏框架。TurnSight 不从轨迹级或令牌级反馈学习,而是基于执行条件的事后状态生成监督信号。TurnSight 构造多个不同前瞻视野的事后视图,并通过跨视野方向一致性筛选可靠信号。论文在三个基准上验证了效果,代码已开源在 GitHub。论文TurnSight工具集成推理自蒸馏推荐理由:TurnSight 把工具推理的强化学习拆到回合级,用事后视角筛信号,三个基准上都有效,代码开源了。原文稍后读已读值得跟进有用关注 TurnSight
11:32官方账号arXiv cs.AI@Zixun Guo, Simon Dixon人类能识别时移或转调的音乐,但标准音乐Transformer对这类输入会产生不相关表示。研究发现模型规模增大或训练时间更久时,等变性反而下降。为此提出EMT,通过自蒸馏联合优化下一token预测与辅助等变正则化损失。等变损失作为正则化器,同时提升预测能力和表示质量。在客观与主观评估中,EMT均超过数据增强、特征工程和SOTA基线。论文Equivariant Music Transformer音乐生成自蒸馏推荐理由:音乐Transformer换个调就认不出旋律,EMT用自蒸馏让它真正学到结构,生成效果还比SOTA好。原文稍后读已读值得跟进有用关注 Equivariant Music Transformer
12:31官方账号arXiv cs.LG@Jiawei Xu, Minghui Liu, Juzheng Zhang, Tom Goldstein, Furong Huang论文提出β-OPSD,将普通在线自蒸馏(OPSD)推广为β=1特例的策略优化家族。β作为正则化参数,控制学生模型相对参考策略与特权教师之间的权衡。最优策略被推导为参考策略与教师的几何插值,实现时混合二者的token级logits。在数学推理基准上,β-OPSD比vanilla OPSD更稳定、推理性能更好。论文β-OPSD自蒸馏策略优化推荐理由:这篇论文把OPSD的隐式β变成可控参数,用蒸馏近似强化学习,数学推理上比原版更稳更强。原文稍后读已读值得跟进有用关注 β-OPSD
11:32官方账号arXiv cs.AI@Yijun Liang, Yunjie Tian, Yijiang Li, Yuqi Jia, Furong Huang, Tianyi Zhou, Di FuVCSD提出一种新的自蒸馏方法,通过对比原始图像和内容擦除控制的token级log概率差异来生成蒸馏信号。在ViRL39K数据集上,基于Qwen3-VL的实验显示,2B模型七基准聚合从62.27%提升至67.04%,4B从71.30%提升至73.16%,8B从72.51%提升至76.26%。VCSD无需外部教师、特权答案或视觉证据信号,且不增加推理开销。论文VCSDQwen3-VLQwen3.51 个信源在谈事件专题推荐理由:这篇论文提出了VCSD,不需要外部老师就能让多模态模型自己教自己,在Qwen3-VL上几个规模都涨了4-5个点,而且不增加推理成本。原文稍后读已读值得跟进有用关注 VCSD
11:27官方账号arXiv cs.AI@Mingxuan Xia, Yuhang Yang, Chao Ye, Shuai Zhu, Shenzhi Yang, Guangcheng Zhu, Yuhang Zhang, Cheng Peng, Haobo Wang, Siqing Wang论文提出Criterion-Distilled Policy Optimization (CriPO),针对评分强化学习中的两个问题:未探索准则(UC)和抑制准则(SC)。分析显示SC在训练中发生率超过57%,平均每样本1.8个SC。CriPO通过在线自蒸馏分别处理UC(构建准则注入自教师)和SC(反事实自教师翻转token级优势),在医学和科学基准上一致优于基线,训练步数减少约2倍。AI模型CriPORubric-based RL自蒸馏推荐理由:这篇论文分析了评分RL中信号丢失的普遍问题(57%样本受影响),并提出CriPO自蒸馏方法,在医学和科学基准上效果更好且训练更快。原文稍后读已读值得跟进有用关注 CriPO
09:15官方账号arXiv cs.LG@Keqin Peng, Chen Li, Yuanxin Ouyang, Yancheng Yuan, Liang Ding本文发现On-Policy Self-Distillation (OPSD)在复杂推理任务中会导致“Thinking Collapse”,即模型中间推理行为(以epistemic-token密度衡量)显著下降。通过熵梯度分析和token级目标分解,确定该崩溃源于高熵决策点的激进教师梯度。提出自适应双视角OPSD (AD-OPSD),通过冻结基础模型参考先验锚定高风险token。在多个数学基准(如GSM8K、MATH)上,AD-OPSD相比标准OPSD平均准确率提升最高达+4.1%。论文OPSDAD-OPSDThinking Collapse推荐理由:这篇论文把OPSD训练时模型思维崩溃的原因和解决方法都讲清楚了,AD-OPSD在数学题上能提4个点,做推理优化的值得看看。原文稍后读已读值得跟进有用关注 OPSD
23:52AK@_akhaliqOPSD-V是一种用于后训练阶段的自蒸馏技术,专门优化自回归视频生成器的少步生成能力。该方法通过在线策略蒸馏,让模型在仅几步推理内达到与多步推理相近的视频质量。论文展示了OPSD-V在多个视频生成基准上提升了生成效率同时保持视觉保真度。论文OPSD-V自蒸馏视频生成推荐理由:想用更少的生成步骤做出高质量视频?这篇讲OPSD-V方法,用自蒸馏让视频生成器几步就够。原文稍后读已读值得跟进有用关注 OPSD-V
11:30官方账号arXiv cs.AI@Zhuowei Chen, Xiang Lorraine Li论文提出Neuron-OPSD框架,解决无标注自蒸馏中SFT/GRPO变体导致域外性能下降、奖励型on-policy RL校准误差扩张的问题。该框架利用模型内部神经元激活值指导训练数据选择和教师上下文构建,通过on-policy蒸馏训练。在多个专业领域基准上,Neuron-OPSD提升域内任务性能,同时保持跨域泛化并减轻校准崩溃。该方法不依赖任何真实标签或外部反馈。论文Neuron-OPSD自蒸馏无标注学习推荐理由:Neuron-OPSD用神经元信号挑训练数据,让大模型自己教自己,不用人工标注,效果还更稳。原文稍后读已读值得跟进有用关注 Neuron-OPSD
10:34官方账号arXiv cs.LG@Sihan Wang, Xiyao Liu, Lianqing Liu, Zhi HanViGOS是一种针对多模态大语言模型(MLLM)的后训练框架,采用解耦感知与推理的自蒸馏方法(OPSD)。学生模型先生成视觉描述,再基于此进行推理,避免直接利用文本目标产生捷径。实验在通用视觉-语言、专家推理、视觉数学、空间定位和视觉-语言先验五类基准上验证,ViGOS在易出现捷径的场景中显著提升了图像依赖行为。论文ViGOSMLLMOPSD推荐理由:这篇论文提出了ViGOS,专门解决多模态模型自蒸馏时只看文本不看图的毛病,在多个视觉语言基准上有效果。原文稍后读已读值得跟进有用关注 ViGOS
11:03官方账号arXiv cs.LG@Semih Kara, Oğuzhan Ersoy精选该研究探讨了自蒸馏中上下文设计的关键作用,通过训练求解器接收冻结批评者的反馈,比较了三种条件:二元奖励、参考解决方案和步骤对齐批评。步骤对齐批评在Avg@12指标上比GRPO高出16.11分,比参考解决方案条件高出5.27分。分析表明,步骤对齐反馈仅针对推理失败的token,保留正确行为,而参考解决方案迫使模型在每个token上改变行为,导致效率降低。研究揭示了反馈与求解器推理的结构对齐是自蒸馏有效性的关键驱动因素。论文自蒸馏反馈对齐推理模型推荐理由:做自蒸馏或强化学习的研究者会发现,步骤对齐反馈比传统奖励信号更高效,直接提升模型推理质量,值得在实验中尝试这种上下文设计。原文稍后读已读值得跟进有用关注 自蒸馏
11:27官方账号arXiv cs.AI@Jiazhen Huang, Xiao Chen, Xiao Luo, Yong Dai, Senkang Hu, Yuzhi Zhao精选本文提出 Skill-Conditioned Gated Self-Distillation (SGSD) 方法,用于改进大语言模型的推理能力。传统自蒸馏方法依赖可信的先验信息(如参考答案),而 SGSD 从经验技能库中检索技能-错误对,构建多教师池,通过验证器判断教师极性,并设计门控目标函数来蒸馏有效信息。在多个数学推理基准上,SGSD 在 Qwen3-1.7B 上平均比 GRPO 提升 6.2%,比 OPSD 提升 1.7%,且对先验信息的假设更弱。代码已开源。论文推理模型自蒸馏数学推理推荐理由:做 LLM 推理优化的研究者可以关注——SGSD 用技能库替代参考答案作为先验,降低了蒸馏对标注数据的依赖,数学推理场景效果显著,值得在自蒸馏框架中尝试。原文稍后读已读值得跟进有用关注 推理模型
12:05AI Will@FinanceYF5精选ZEDA是一种针对混合专家模型(MoE)的后训练方法,通过自蒸馏技术让模型学会在推理时跳过半数专家,从而大幅降低计算成本。与传统的剪枝不同,ZEDA赋予模型“算力预算意识”,使其能根据每个token的重要性动态决定是否投入计算资源。该方法在保持性能的同时显著提升效率,为大规模MoE模型的部署提供了新思路。论文已发布在arXiv上。论文MoE/混合专家模型压缩/加速自蒸馏推荐理由:做MoE模型部署或推理优化的团队,ZEDA直接解决了算力浪费问题——跳过一半专家还能保持效果,值得一试。原文稍后读已读值得跟进有用关注 MoE/混合专家
02:52rohanpaul_ai@rohanpaul_ai精选72°研究发现,大型混合专家(MoE)模型在处理许多简单token时,浪费了约一半的专家计算资源。新提出的ZEDA(零专家自蒸馏适应)框架,通过为路由器添加“零专家”选项,让模型在token不需要复杂处理时直接跳过专家计算。该方法无需重新训练,而是将原MoE模型作为冻结教师,通过自蒸馏学习何时安全跳过计算。在Qwen3-30B-A3B和GLM-4.7-Flash上测试,去除了约50%的专家计算,精度损失极小,实际推理速度提升约20%。这表明计算消耗并不简单跟随任务难度,而是与不确定性相关,为部署MoE模型提供了更经济的方案。论文MoE模型优化推理加速推荐理由:部署MoE模型的团队终于可以省下一半专家计算——ZEDA让Qwen3和GLM等模型自动跳过简单token,推理速度提升20%且几乎不掉精度,做模型推理优化的开发者可以直接参考论文方法。原文稍后读已读值得跟进有用关注 MoE
10:46官方一手arXiv: DeepSeek@Xiaogeng Liu, Xinyan Wang, Yingzi Ma, Yechao Zhang, Chaowei Xiao精选论文研究了在推理任务中,教师模型token的可靠性并非均匀分布,而是与序列中的位置强相关。作者提出分支可行性诊断方法,发现位置得分是预测教师token可靠性的最强指标(AUROC达0.83),而局部不确定性得分效果很差。基于此,提出位置加权在线策略自蒸馏(PW-OPSD),在保持原有训练框架的同时,对越靠后的token赋予更高权重。在Qwen3-4B上,PW-OPSD使AIME 2024和2025的Avg@12分别提升1.0和1.1分,在DeepSeek-R1-Distill-Llama-8B和Olmo-3-7B-Think上也取得一致改进。该方法无需额外教师计算,直接利用轨迹结构提升蒸馏效果。论文推理模型自蒸馏位置加权推荐理由:做推理模型蒸馏的团队终于有了一个简单有效的改进方向——不用改架构,只需调整token权重就能提升1分以上,值得在自家模型上复现。原文稍后读已读值得跟进有用关注 推理模型
14:25官方账号arXiv cs.AI@Qianhao Yuan, Jie Lou, Xing Yu, Hongyu Lin, Le Sun, Xianpei Han, Yaojie Lu精选多模态大模型在细粒度视觉理解任务中常因无法聚焦关键证据而失败,而非缺乏局部识别能力。研究者提出Vision-OPD框架,通过区域到全局的自蒸馏方法,让模型从裁剪后的局部图像(教师)中学习,并迁移到全图(学生)策略上。该方法无需外部教师模型、标注数据或推理时工具,仅通过最小化教师与学生间token级分布差异来提升性能。在多个细粒度视觉理解基准上,Vision-OPD模型性能优于或媲美更大规模的开源、闭源及“思考+图像”智能体模型。论文多模态大模型细粒度视觉理解自蒸馏推荐理由:多模态模型开发者常头疼的“看不清细节”问题,Vision-OPD用自蒸馏给出了一个轻量解法——不用外部模型或标注,直接让模型学会“自动放大”关键区域。做细粒度视觉理解或MLLM优化的团队值得关注。原文稍后读已读值得跟进有用关注 多模态大模型
19:12官方账号arXiv cs.AI@Yuxiao Yang, Xiaoyun Wang, Weitong Zhang精选本文研究了在线策略自蒸馏(OPSD)方法,即语言模型通过在其自身生成的轨迹上蒸馏特权教师分布来提升推理能力。作者发现OPSD存在一个常见但常被忽视的问题:教师响应中的自我反思偏差和模板会导致token级监督校准错误。为此,他们提出OGLS-SD框架,利用可验证的结果奖励对比成功与失败的在线轨迹,并通过logit引导校准教师logits。该方法结合结果级正确性与密集的token级引导,在多个基准上稳定了自蒸馏过程并提升了推理性能。论文自蒸馏推理模型logit校准推荐理由:如果你在做LLM推理优化或自蒸馏训练,OGLS-SD解决了教师-学生分布不匹配的痛点,用结果奖励校准logits的思路直接可复用,值得仔细看方法细节。原文稍后读已读值得跟进有用关注 自蒸馏
21:55AK@_akhaliq该研究提出了一种名为“叛逆学生”的新方法,通过反转教师模型的信号来训练学生模型,从而在推理中探索更多可能性。该方法结合了自蒸馏和强化学习(RLVR),允许学生模型学习超越教师模型的推理策略。实验表明,该技术能有效提升模型的推理能力和探索性,在多个基准测试中取得显著改进。这项工作对于如何利用弱监督或反向信号增强AI推理具有重要启示。论文推理模型强化学习自蒸馏推荐理由:该工作通过反转教师信号进行推理探索,为自蒸馏和强化学习结合提供了新思路,可能推动弱监督下推理模型的发展,值得关注。原文稍后读已读值得跟进有用关注 推理模型
19:11官方账号arXiv cs.AI@Mohammadreza Armandpour, Fatih Ilhan, David Harrison, Ajay Jaiswal, Duc N. M Hoang, Fartash Faghri, Yizhe Zhang, Minsik Cho, Mehrdad Farajtabar该研究提出了一种无需训练的诊断框架,通过分析每token、每问题、每教师的梯度对齐度,揭示了on-policy蒸馏的有效条件。研究发现:在模型错误回答时蒸馏信号更有效,正确回答时信号噪声大;最优蒸馏配置依赖于学生模型能力和任务类型,不存在通用最优方案。该框架扩展了Google在推理模型训练中的on-policy蒸馏技术,为优化蒸馏策略提供了理论依据。论文推理模型蒸馏/训练自蒸馏推荐理由:该研究通过细粒度分析挑战了蒸馏实践中默认假设,为选择教师模型和蒸馏配置提供了理论指导,对大规模推理模型训练具有实际参考价值。原文稍后读已读值得跟进有用关注 推理模型