23:04官方账号Decoder@Maximilian SchreinerKimi K3和GLM-5.3已接近美国顶尖模型。西方实验室指责中国模型使用了知识蒸馏技术。无论是否属实,模型领先地位已无法维持。本文探讨西方AI领域剩余的领先优势。行业Kimi K3GLM-5.3知识蒸馏10 个信源在谈事件专题推荐理由:看看Kimi K3和GLM-5.3怎么追上美国模型的,西方实验室又怎么甩锅的,挺有意思的。原文稍后读已读值得跟进有用关注 Kimi K3
10:26官方账号arXiv cs.AI@Yonglong Zhang, Zongwu Xie, Yang LiuGeoDistill-Refine 是一个两阶段框架,用离线 SAM 3 生成的伪掩码训练紧凑分割网络,无需人工标注。教师端融合 6 个固定提示,通过无权重 50% 投票稳定输出;学生先学前景轮廓,再用符号距离场、骨架和面积目标细化。在 SpaceSense-Bench HJM 上,相比普通伪标签学生,Image IoU 提升 0.0456,Boundary F1 提升 0.1380。部署用的 TinyUNet 只有 0.263M 参数,RTX 4090 上单张约 1.1ms。SPEED+ Lightbox、Sunlamp 和 TANGO 上的外部测试显示边界质量或前景精度有增益。论文GeoDistill-RefineSAM 3TinyUNet推荐理由:航天图像分割常缺标注,这论文用 SAM 3 自动生成伪标签,还解决了伪标签几何错误。TinyUNet 又小又快,边界指标提升明显。原文稍后读已读值得跟进有用关注 GeoDistill-Refine
11:26官方账号arXiv cs.LG@Paritosh Parmar, Landy Lan, Hong Yang, Chen Yi, Chiat Pin Tay本论文提出一个混合基准,将生成式CCTV风格视频与真实教室姿态数据结合,用于隐私感知的教室事件识别。作者设计了轻量级运动推理框架,先构建层次化运动学表示,再通过知识蒸馏将大教师模型的能力压缩到单阶学生模型。实验显示,该模型在不到十分之一计算成本下优于更大规模基线,并展现出更强的跨领域运动推理和零样本合成到真实泛化能力。论文将公开基准、代码库和支撑工具。论文运动推理教室事件识别隐私感知推荐理由:这论文做了个教室安全识别的新基准和轻量模型,计算量只要大模型的十分之一,效果还更好,适合关心AI+教育的人看看。原文稍后读已读值得跟进有用关注 运动推理
09:53官方账号arXiv cs.LG@Jian Zhang, Bingyi Wang, Yizhi LiuCausalOPD是一种课程式在线过程蒸馏框架,让教师模型先基于因果规则生成轨迹,再由学生模型在线生成并定位首个违反约束的错误步骤。框架通过短视距强化学习修复局部错误,并按证据级、机制级、结论级的因果阶段推进训练。在临床诊断、法律判断和工业故障诊断三个领域,CausalOPD将路径正确率平均提升23.4个百分点,并将“答案对但推理错”的比例从15.7%降至4.4%。基于该方法的8B学生模型在路径正确率上超过两个商业参考模型。论文CausalOPD因果链推理知识蒸馏推荐理由:这是篇讲怎么把大模型因果推理能力蒸馏到小模型的新论文,CausalOPD专治“答案对但推理过程错”,三个领域里错误率从15.7%砍到4.4%,小模型还赢过了大牌模型。原文稍后读已读值得跟进有用关注 CausalOPD
13:18官方账号arXiv cs.AI@Feng Xiong, Leyan Xue, Hongyu Lin论文提出感知纠正蒸馏(PCD),用于多模态推理器的感知蒸馏。PCD 通过下游失败和师生分歧两个见证信号的乘积来识别可纠正的感知错误,并保持推理目标不变。在八个基准上,PCD 将 8B→2B 蒸馏的宏平均从 44.50 提升到 47.28,将 32B→8B 从 56.94 提升到 61.22。2B 消融实验中,去掉 PCD 使留出集平均下降 2.22 分,去掉分离式 rollout 下降 0.88 分。论文PCD多模态推理知识蒸馏推荐理由:这篇论文给多模态蒸馏提了个新招:用师生分歧定位该纠的感知错误,八个基准分数明显涨,做蒸馏的可以看。原文稍后读已读值得跟进有用关注 PCD
09:26官方账号arXiv cs.LG@Fengming Yu, Haiwei Pan, Kejia Zhang, Chunling Chen, Jian Guan, Baoying MaCoCaRS 提出一种基于相关校准的冗余抑制方法,用于解决异构知识蒸馏中教师和学生模型架构差异导致的表示不一致问题。该方法通过混淆证据估计和强度分配控制校准特征去相关,并采用自适应系数调节降低对超参数的敏感性。在 CIFAR-100 和 ImageNet-1K 上的实验验证了 CoCaRS 能提升蒸馏性能并减少系数设置敏感度。论文CoCaRS知识蒸馏异构知识蒸馏推荐理由:想提升异构模型蒸馏效果?CoCaRS 用三种新模块解决特征冗余和系数敏感问题,实验在 CIFAR-100 和 ImageNet-1K 上表现更好。原文稍后读已读值得跟进有用关注 CoCaRS
12:01官方账号arXiv cs.AI@Haolei Xu, Xiaowen Xu, Haiwen Hong, Zixuan Ni, Hongxing Li, Yiwen Qiu, Weiming Lu, Yongliang Shen提出Relay-OPD方法,解决同策略蒸馏(OPD)中的前缀失败问题:当学生模型进入错误推理方向后,后续生成偏离正确路径。该方法利用教师-学生在失败前缀上的延续不对称性作为无标签触发信号,让教师短暂接管生成然后交回学生训练。使用Qwen3-4B-Instruct-2507作为教师,Qwen3-0.6B/1.7B-Non-Thinking作为学生,在8个数学推理基准上,Relay-OPD在全部基准中取得最佳或次佳结果,1.7B模型平均超越标准OPD 5.73%,超越最强基线FastOPD 1.49%,且训练轨迹长度减少超过50%。论文Relay-OPDQwen3知识蒸馏推荐理由:这篇论文提出了一个很聪明的改进:当学生模型推理跑偏时,让老师模型短暂接管一段,再交回学生继续训练。在Qwen3小模型上效果明显,数学推理准确率提升,训练还更快。原文稍后读已读值得跟进有用关注 Relay-OPD
09:18官方账号arXiv cs.LG@Yi Xu, Cheng Chen, Mufan CaoOrthKD提出一种选择性信任知识蒸馏框架,针对强CNN教师(EfficientNet-B3,0.876 QWK)与弱Transformer教师(Swin-Base,0.830 QWK)的互补性,仅从强教师转移完整监督,从弱教师提取特征,并强制学生投影正交化。在132049张视网膜图像上,5.4M参数的MobileNetV3学生模型在EyePACS上达到0.885 QWK,零样本Messidor-2性能从0.507提升至0.728 QWK,同时具备强转诊AUC和校准能力。该方法在资源受限设备上实现了实用的DR筛查。论文OrthKDEfficientNet-B3Swin-Base推荐理由:论文提出OrthKD蒸馏方法,用异构教师知识教轻量模型,DR筛查准确率从0.507涨到0.728,适合边缘部署。原文稍后读已读值得跟进有用关注 OrthKD
05:51AK@_akhaliq这篇论文提出多智能体协议蒸馏方法,将专有模型在智能体搜索中的分布知识迁移到开源模型。通过多智能体协作蒸馏协议,缩小专有与开源模型在搜索任务上的性能差距。实验表明该方法能有效提升开源模型的搜索准确率。论文Multi-Agent Protocol DistillationAgentic Search知识蒸馏推荐理由:这篇论文讲的是怎么把闭源模型的搜索能力教给开源模型,用多智能体蒸馏的方法挺巧的。原文稍后读已读值得跟进有用关注 Multi-Agent Protocol Distillation
11:57官方账号arXiv cs.LG@Bingnan Li, Haozhe Wang, Haozhong Xiong, Fangtai Wu, Jinpeng Yu, Yang Shi, Jiaming Liu, Ruihua Huang本文研究在策略蒸馏(OPD)中分类器自由引导(CFG)的作用。现有OPD方法直接匹配教师和学生模型的引导速度,但在分支级别存在欠辨识问题:正负分支误差可相互补偿。作者发现,在共享负条件时匹配仍有效,但当教师负分支包含学生无法获取的特权信息时,会导致负分支不对称(NBA)失败模式。为解决NBA,提出正方向匹配(PDM),分别约束正预测和CFG条件方向。将PDM应用于稠密到稀疏视频控制,比朴素引导匹配更鲁棒有效。论文扩散模型知识蒸馏分类器自由引导推荐理由:这篇论文发现了现有扩散蒸馏方法在CFG下的一个隐蔽问题,并给出了一个简单的修正方案。做扩散模型蒸馏或视频生成的同学可以看看。原文稍后读已读值得跟进有用关注 扩散模型
10:26官方账号arXiv cs.LG@Guoqing Ma在线策略蒸馏(OPD)中教师提供的token级似然度常被局部解读,但本研究发现这种解读受到最终回答正确性的混淆。论文引入一种结果解析诊断方法,交叉评估点状师生分歧与最终答案正确性。在Qwen3-8B学生与Qwen3-32B教师的数学推理实验中,67.84%的响应token属于“同意但失败”(agreement-on-failure);Qwen2.5-7B/32B组合为67.68%。即使教师四轮均正确回答的提示,学生准确率达86.91%,但仍有14.76%的token存在同意但失败。三种训练策略(模仿、遮蔽、对比)均未能显著改善该现象,表明需要过程标签或教师延续等额外位置信息来解决定位局限。论文Qwen3Qwen2.5知识蒸馏推荐理由:论文用实验数据揭示了一个反直觉现象:学生在模仿老师时,67%的token在“同意但失败”,说明局部蒸馏有盲区。做模型蒸馏的朋友可以看看这个诊断方法。原文稍后读已读值得跟进有用关注 Qwen3
09:58官方账号arXiv cs.LG@Chen Wang, Zhaochun Li, Jionghao Bai, Yining Zhang, Hexuan Deng, Ge Lan, Yue WangDistilled RL将教师模型监督集成到强化学习目标中,提供细粒度指导并选择性传递新知识。它包含三个组件:逆重要性采样与剪切、负样本重置、序列级几何归一化。实验表明,在家族内和跨家族蒸馏场景下,Distilled RL在pass@1和pass@k上均显著优于标准RL和基于策略的蒸馏OPD。该方法能有效传递教师模型先前不可用的知识,代码已开源。AI模型Distilled RLLLM后训练推荐理由:这个新方法把强化学习和知识蒸馏结合在一起,解决了RL和OPD各自的短板,跨家族蒸馏效果尤其好。原文稍后读已读值得跟进有用关注 Distilled RL
09:19官方账号arXiv cs.AI@Kaiwen Zheng, Junchen Fu, Wenhao Deng, Hu Han, Joemon M. Jose, Xuri Ge论文针对多模态情感识别(MER)中大模型(如7B参数)推理慢、难以部署的问题,提出轻量级框架Light-MER,模型参数小于1B。通过知识蒸馏将大教师模型的知识迁移至学生模型,引入两种优化策略:基于Sliced Wasserstein距离与隐藏状态对齐的最优传输损失,以及基于GRPO的多奖励优化以平衡性能与效率。在9个基准数据集上,Light-MER取得SOTA性能,同时推理速度显著提升。代码已在GitHub开源。论文Light-MER知识蒸馏多模态推荐理由:他们挑战了多模态情感模型必须大的假设,用知识蒸馏搞出<1B的Light-MER,9个基准超了大模型还更快,做部署的可以看看。原文稍后读已读值得跟进有用关注 Light-MER
11:17官方一手arXiv: DeepSeek@Tahmid Al Hannan, Diego Garcia, Alex Njoroge, Suha Al Juboori, Tarek Sakakini该论文提出FATE(FLC AI Tutor Evaluator),一个8B参数的语言模型,专门用于评估AI导师的教学质量。FATE基于BEA 2025共享任务的四个核心评估轨道(Mistake Identification、Mistake Location、Guidance、Actionability)进行对齐。通过从前沿LLM进行知识蒸馏生成额外监督数据,FATE在评估性能上最高提升22.63个百分点。论文还使用FATE对ChatGPT、Claude、Gemini、DeepSeek等主流商业模型的教学响应进行基准测试:Gemini 2.5 Flash表现最好(82.88%),其次是ChatGPT 5.5 Instant(80.75%)、DeepSeek V4 Flash(80.13%)和Claude Sonnet 4.6(74.00%)。论文FATE知识蒸馏BEA 2025推荐理由:论文搞了个8B的小模型FATE,专门给AI老师打分,比蒸馏前涨了22个点。还顺便测了Gemini、ChatGPT等,Gemini 2.5 Flash得分最高,挺有意思。原文稍后读已读值得跟进有用关注 FATE
09:30官方账号arXiv cs.AI@Yi Zhao, Jiajun Gao, Chenyang Xu, Yuxi Zhou, Hao WangLSTrans提出了一种轻量级混合模型,专为资源受限的可穿戴设备上的自动心电图分类设计。该模型采用1D卷积骨干与交错层架构,捕捉宏观节律趋势和微观形态变化,并级联Transformer编码器建模长程时间依赖。通过低秩适配压缩关键层参数空间,结合同质与异质知识蒸馏,将高容量教师模型的诊断知识迁移至学生模型。在多个基准数据集上,LSTrans在诊断灵敏度和资源效率之间取得平衡,显著降低了峰值内存占用和下游训练延迟。代码已在GitHub开源。论文LSTransECG分类知识蒸馏推荐理由:想在心电图分类上搞轻量化部署?LSTrans用知识蒸馏和低秩适配把大模型压缩到可穿戴设备上跑,基准测试上内存和速度都优化了。原文稍后读已读值得跟进有用关注 LSTrans
09:25官方账号arXiv cs.AI@Sahil Kale该论文从时间维度研究大语言模型(LLM)的置信度估计,比较了预解答的Feeling-of-Knowing(FOK)和后解答的Judgement-of-Learning(JOL)在不同的前沿和开源LLM上的表现。实验表明,后解答置信度校准更好、判别力更强,而基于隐藏表示的线性探针能提取比模型显式表达更丰富的置信度信息。作者提出未来置信度蒸馏方法,使用后解答正确性探针作为教师,训练仅基于预解答隐藏表示的预测器。该预测器在仅用预解答信息的情况下恢复了后解答置信度的大部分校准改进,且样本效率高、在同类数据集间可迁移。论文大语言模型置信度估计知识蒸馏推荐理由:这篇论文提出了一种新方法,可以在模型回答之前就预测它的置信度,比传统方法更准更省计算成本。原文稍后读已读值得跟进有用关注 大语言模型
11:41官方账号arXiv cs.AI@Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao ZhouRLVR通过可验证奖励提升推理能力,但每次训练强模型需要大量采样,成本高昂。Direct-OPD方案在小模型上执行RL,将其策略偏移作为隐式奖励传递给强模型。对比后RL教师与前RL参考的对数比率,为学生模型提供密集监督。实验显示,Direct-OPD将Qwen3-1.7B在AIME 2024上的准确率从48.3%提升至62.4%,仅需8块A100 GPU训练4小时。该方法优于step-matched直接RL,并支持多策略偏移的级联组合。论文Direct-OPDQwen3AIME 2024推荐理由:用弱模型训练强模型,Qwen3-1.7B在AIME 2024从48.3%飙到62.4%,只花4小时8卡A100。比直接RL还省,值得试试。原文稍后读已读值得跟进有用关注 Direct-OPD
10:33官方账号arXiv cs.AI@Ekaterina Alimaskina, Denis Shveykin, Gleb Molodtsov, Igor Shalygin, Alexey Kadeishvili, Aleksandr Beznosikov语言模型越来越多地使用自生成的问答数据来微调或蒸馏。研究表明,生成阶段并非中性预处理,而是隐含策略:模型在提问时不会均匀扫描文档,覆盖很快饱和并集中在显著区域,不同提示也会聚焦相同片段。在回答阶段,模型倾向于服从文本中嵌入的指令性内容,且这种服从取决于指令的表面形式和意图。作者通过将每个问题固定到特定目标降低了选择偏差,并在回答前过滤指令性文本,将注入合规率从88%降至13%,同时保留几乎所有干净文本。论文自生成问答微调知识蒸馏推荐理由:这篇论文告诉你,用模型自己问自己生成的问答数据来训练模型,可能会引入隐蔽的偏见和指令注入风险。他们用一个简单方法就能把问题率从88%压到13%,值得做数据合成的同学看看。原文稍后读已读值得跟进有用关注 自生成问答
09:23官方一手arXiv: DeepSeek@Gaurab Baral, Aaditya Khanal, Yangyang Tao, Junxiu Zhou精选该论文研究从大型推理模型DeepSeek-R1蒸馏知识到紧凑学生模型Qwen2.5-7B。使用2011-2025年约翰·奥布莱恩数学竞赛问题构建CoT训练语料,通过LoRA在Apple Silicon上微调。基础Qwen2.5-7B准确率64.67%,教师DeepSeek-R1达91.40%。五次独立微调后学生模型平均准确率69.43%(标准差0.17%),比基础模型提升4.76个百分点,并在MATH-500上泛化至73.1%(标准差0.18%)。研究还发现回答长度从平均220词降至31.2词时,准确率从69.43%降至41.9%。论文DeepSeek-R1Qwen2.5-7B知识蒸馏推荐理由:这篇论文告诉你:把DeepSeek-R1的推理能力蒸馏到小模型Qwen2.5-7B上,MATH-500能到73%,但回答越短准确率掉得越快。原文稍后读已读值得跟进有用关注 DeepSeek-R1
11:47官方账号arXiv cs.LG@Wenhao Chi, Arkaprava Sinha, Dominick Reilly, Hieu Le, Srijan DasUNIEGO提出分层多教师蒸馏框架,使用9个教师(覆盖自我/他人视角、RGB/深度/骨架模态和4个基础模型)来训练统一编码器。为解决异构教师的不兼容架构和特征几何冲突,框架引入代理模型将不同教师知识翻译到同质化的自我中心空间。第二阶段选择性代理蒸馏(SPD)为每个样本自适应选择正确且自信的代理子集,抑制错误信号。UNIEGO在三个自我中心视频基准(动作识别、视频检索、动作分割)上达到最先进性能。AI模型UNIEGO自我中心视频知识蒸馏推荐理由:想用多视角多模态数据训练视频理解模型?UNIEGO用代理模型搞定异构教师蒸馏,在三个任务上刷新了纪录。原文稍后读已读值得跟进有用关注 UNIEGO
10:47官方一手arXiv: DeepSeek@Haolong Qian, Xianliang Yang, Yinuo ma, Lirong Che, Feng Lu, Ye Guo, Lei Song, Jiang Bian, Chun Yuan论文在Qwen2.5、LLaMA-3和DeepSeek三个系列上发现:用小模型自身生成并通过拒绝采样选取的轨迹,比用更强Oracle模型精炼的高奖励数据,能更有效提升数学推理。Oracle精炼虽修复逻辑,但引入分布偏移,增加小模型适应成本,抵消了逻辑改进的收益。作者提出风格对齐精炼(Style-Aligned Refinement),保留小模型原生轨迹风格同时融入Oracle逻辑修复,降低适应成本并恢复下游效用。该发现挑战了数学推理蒸馏中依赖奖励模型分数选择数据的常规做法。论文Qwen2.5LLaMA-3DeepSeek推荐理由:这篇论文揭穿了一个直觉错误:你以为给小白模型喂“学霸笔记”能变强,结果效果还不如它自己瞎写的解题草稿。原因是学霸的思路和它不匹配,硬学反而费劲。原文稍后读已读值得跟进有用关注 Qwen2.5
11:11官方账号arXiv cs.LG@Mohammed Arif Mainuddin, Najifa Tabassum, Omar Ibne Shahid, Riasat KhanHumP-KD框架提出一种混合不确定性感知多阶段渐进知识蒸馏方法,用于高效火灾分类。在FlameVision(8600张)和Dataset-II(31309张)两个数据集上测试,从Swin-Tiny和ViT-Base两个冻结教师模型蒸馏知识到轻量MobileViT-S学生模型。在Dataset-II上,HumP-KD达到平均F1分数0.9876±0.0063,显著高于MobileViT-S基线(0.9537±0.0351),t检验p=0.0195。学生模型仅4.94M参数、19.01Mb大小,相对于Swin-Tiny参数减少5.7倍,CPU FPS达37.72。论文HumP-KDMobileViT-SSwin-Tiny推荐理由:直接提升小模型火灾分类精度原文稍后读已读值得跟进有用关注 HumP-KD
09:51官方账号arXiv cs.AI@Shang Ma, Jisheng Dang, Wencan Zhang, Yifan Zhang, Bimei Wang, Hong Peng, Bin Hu, Qi Tian, Tat-Seng Chua精选研究者提出了一种名为 MODF-SIR 的多智能体协作框架,基于轻量级多模态大语言模型,专门用于社交智能推理。该框架通过知识蒸馏增强训练和推理阶段,能够精确定位多模态社交数据,并提取长尾事件以格式化文本呈现,避免关键信息被噪声淹没。它集成了测试时自适应(TTA)、思维链提示和自反思机制,并利用 LoRA 微调基础模型。在多个基准测试中,仅用约 30% 的训练数据就达到了最先进的结果。代码、演示和模型均已开源。论文多智能体知识蒸馏社交智能推理推荐理由:社交智能推理是 AI 理解人类互动的关键,MODF-SIR 用轻量模型和蒸馏技术解决了长尾事件被忽略的痛点,做多模态社交分析或人机交互的团队可以直接用开源代码复现。原文稍后读已读值得跟进有用关注 多智能体
22:42小互@imxiaohu苹果Siri并非由Google的Gemini模型直接驱动,而是使用苹果自研的基础模型。不过,这个自研模型是通过对Gemini模型进行知识蒸馏训练而来。Google的Gemini模型仅在苹果iCloud上提供额外支持,且是苹果定制的版本。此外,Siri不使用Google搜索提供世界知识,而是依赖苹果自己的服务。这一安排让外界感觉Google被苹果“耍了”。行业苹果SiriGemini推荐理由:这条信息揭示了苹果与Google在AI合作上的真实关系,做AI模型训练或关注大厂博弈的开发者会感兴趣——苹果用蒸馏技术借力Gemini,但最终保持自主,值得点开看看背后的技术策略。原文稍后读已读值得跟进有用关注 苹果
11:00官方账号arXiv cs.LG@Mohammadreza Sadeghi, Sareh Soleimani, Zihan Wang, Narges Armanfard本文提出无监督持续聚类(UCC)问题,并引入前向-后向知识蒸馏持续聚类方法(FBCC)。该方法通过持续教师网络和轻量级任务特定学生,在无标签且不存储旧数据的情况下,学习新聚类同时保留已有聚类结构。实验表明,FBCC在四个基准数据集上持续优于现有持续学习方法,显著减少灾难性遗忘。这是首个专门针对无监督持续聚类的研究,解决了该领域缺乏聚类特定目标的问题。论文无监督学习持续学习知识蒸馏推荐理由:做无监督学习和持续学习的团队终于有了聚类场景的专用方案——FBCC 不依赖标签和旧数据就能保持聚类结构,做数据流聚类或隐私敏感场景的开发者可以直接参考实验设置。原文稍后读已读值得跟进有用关注 无监督学习
12:20官方账号arXiv cs.AI@Lizhi Yang, Junheng Li, Nehar Poddar, Yiling Hou, Gio Huh, Robert Griffin, Georgia Gkioxari, Aaron Ames精选HANDOFF 提出了一种紧凑、直观的接口,用于人形机器人的任务规划与全身控制之间的连接。该接口通过多教师 KL 蒸馏和上下文条件门控机制,将三个互补专家(全身运动跟踪、行走、跌倒恢复)蒸馏成一个混合专家学生模型。在 Unitree G1 机器人上,HANDOFF 实现了与最先进方法相当的行走速度跟踪,并提供了最大的鲁棒操作工作空间之一。此外,通过 VLM 驱动的智能体规划器,无需任务特定数据或控制器微调,即可实现自然语言驱动的任务执行。这项工作为人形机器人在现实世界中的部署提供了更高效、更通用的控制方案。论文人形机器人全身控制知识蒸馏推荐理由:人形机器人开发者终于有了一个更直观、通用的控制接口——HANDOFF 通过蒸馏多个专家模型,让机器人能同时做好行走、操作和跌倒恢复,做机器人全身控制的团队可以直接参考其方法。原文稍后读已读值得跟进有用关注 人形机器人
07:24官方一手marktechpost@Asif RazzaqNVIDIA 提出 X-Token,一种投影引导的跨分词器知识蒸馏(KD)方法,解决了 GOLD 方法中的两个结构性缺陷。在 Llama-3.2-1B 模型上,X-Token 将 GSM8k 准确率从 2.56% 提升至 15.54%,并在多个基准测试中平均超越 GOLD 3.82 分。该方法通过投影层对齐教师和学生模型的分词器,实现了更有效的知识迁移。X-Token 为小模型蒸馏大模型知识提供了新思路,尤其适用于资源受限场景。论文知识蒸馏NVIDIALlama-3.2-1B6 个信源在谈事件专题推荐理由:X-Token 解决了知识蒸馏中分词器不匹配的痛点,做模型压缩或边缘部署的团队可以直接用这个思路提升小模型推理能力,值得关注。原文稍后读已读值得跟进有用关注 知识蒸馏
07:39IT之家(博客/媒体)78°科技媒体 The Information 爆料苹果与谷歌在 AI 方面的合作细节。苹果采用知识蒸馏技术,基于谷歌 Gemini 模型训练轻量端侧 AI 模型,使其能在 Apple 设备本地运行,以提升响应速度和保护隐私。同时,为减轻服务器压力,iOS 27 的部分 Siri 请求将转向 Google Cloud 调用 Gemini 模型处理。苹果还批准采用 NVIDIA 的机密计算技术,在云端处理时加密数据,以平衡隐私与性能。此举表明苹果在 AI 部署上坚持隐私优先,同时借助外部力量弥补自身算力不足。AI产品苹果Gemini知识蒸馏7 个信源在谈事件专题推荐理由:苹果终于把 Gemini 用在了自家 AI 上——用蒸馏技术做本地模型,同时把部分 Siri 请求外包给谷歌云。做隐私合规或苹果生态开发的团队值得关注,这可能是未来端云混合 AI 的样板。原文稍后读已读值得跟进有用关注 苹果
11:56官方一手arXiv: DeepSeek@Junhyuck Kim, Jihun Yun, Haechan Kim, Gyeongman Kim, Joonghyun Bae, Jaewoong Cho精选72°该研究提出了首个系统化框架,将混合专家模型(MoE)转换为标准全稠密架构。通过专家评分、选择、分组并拼接成稠密前馈网络,再通过知识蒸馏从MoE教师模型精炼。在Qwen3-30B-A3B上评估了7种评分、5种分组和2种幅度缩放方法,共350种配置。发现评分方法影响最大,其提出的多样性感知评分在多个模型上优于先前方法。在参数匹配控制下,MoE转稠密比稠密到稠密剪枝平均下游准确率提升6.3个百分点,训练速度快1.6倍。论文模型压缩知识蒸馏混合专家模型推荐理由:这个框架解决了MoE模型在内存受限设备上部署的痛点,做模型压缩和边缘部署的团队可以直接参考其方法,比传统剪枝效果更好且训练更快。原文稍后读已读值得跟进有用关注 模型压缩
12:16官方一手arXiv: DeepSeek@Guanghui Wang, Kaiwen Lv Kacuila, Zhiyong Yang, Zitai Wang, Jin-Wen Wu, Longtao Huang, Qianqian Xu, Qingming Huang精选72°这篇论文发现,在 LLM 知识蒸馏中,混合使用教师模型的硬标签(采样 token)和软标签(完整分布)比单独使用任何一种效果更好。作者提出 Bridge-Garden 分解理论,将生成步骤分为“桥”(需精确 token)和“花园”(可灵活选择)两类,硬标签擅长处理桥,软标签擅长处理花园,混合策略能减少训练与推理之间的暴露偏差。基于该理论开发的混合监督方法在 7 组师生模型(含 Qwen、Llama、Gemma、DeepSeek)上优于现有基线,同时将训练成本降低 9.7 倍。代码已开源。论文知识蒸馏暴露偏差混合标签推荐理由:做 LLM 蒸馏的团队终于有了理论指导——Bridge-Garden 理论解释了为什么混合标签有效,并且直接给出了可落地的方案,训练成本还降了 9.7 倍,建议做模型压缩的开发者点开看看。原文稍后读已读值得跟进有用关注 知识蒸馏
11:25官方账号arXiv cs.LG@Taiming Lu, Zhuang Liu精选72°这篇论文挑战了知识蒸馏中“强教师才能教出好学生”的传统观念。研究发现,在LLM预训练阶段,即使使用较小或训练不足的弱教师模型,通过合理混合语言建模和蒸馏损失,也能提升更大的学生模型。相反,更强的教师(更多参数或更多训练数据)可能导致蒸馏收益饱和甚至下降。此外,蒸馏在提升泛化能力(如分布外和下游任务表现)方面比在领域内拟合更有效。这些结果颠覆了蒸馏预训练必须依赖强教师的普遍认知。论文知识蒸馏LLM预训练弱到强蒸馏推荐理由:做LLM预训练或知识蒸馏的团队,这篇论文直接挑战了“教师越强越好”的默认假设,看完可能会重新设计你的蒸馏策略,值得细读。原文稍后读已读值得跟进有用关注 知识蒸馏
10:02官方账号arXiv cs.LG@Vincent C. Brockers, Roman D. Ventzke, Valentin Neuhaus, Belén Hidalgo-Ogalde, Viola Priesemann本文研究了神经网络中的“潜意识学习”现象,即学生模型通过教师模型在任务无关的输入-输出对上进行蒸馏,从而获得任务相关知识或偏差。先前研究认为这需要师生初始化高度匹配,但本文证明只需兼容的输出头即可实现。在MNIST数据集上,通过将输出分为辅助头(处理噪声)和分类头,即使在隐藏层随机初始化、增减层或改变架构(如MLP到CNN)的情况下,潜意识学习仍会发生。兼容的辅助头能传递可恢复的教师信号,使学生表征更接近教师。当分类头也兼容时,仅用噪声训练的学生模型可接近甚至匹配教师的任务性能。本文还建立了理论解释机制并推导了失效的上界,将潜意识学习从意外现象转化为可预测的机制。论文知识蒸馏神经网络潜意识学习推荐理由:这篇论文揭示了神经网络蒸馏中一个反直觉但关键的机制——潜意识学习并不依赖初始化匹配,而是由输出头兼容性驱动。做模型压缩、知识蒸馏或研究表征对齐的研究者值得细读,它可能改变你对蒸馏数据选择的认知。原文稍后读已读值得跟进有用关注 知识蒸馏
10:35官方账号arXiv cs.AI@Hyunsoo Han, Sangyeop Yeo, Jaejun Yoo精选该研究提出了一种名为 LIFT and PLACE 的知识蒸馏框架,用于训练轻量级扩散模型。LIFT 将蒸馏过程分解为粗对齐和细调优两个阶段,先让学生模型学习教师模型的整体分布,再处理细节。PLACE 则通过分组自适应系数处理空间非均匀误差,进一步提升了蒸馏效果。实验表明,该方法在图像/潜空间、U-Net/DiT 骨干网络、条件/无条件生成等场景下均有效,甚至在极端压缩(学生模型仅 1.3M 参数,为教师的 1.6%)时,传统蒸馏方法失效(FID 高达 50-200+),而新方法仍能稳定收敛并达到 FID 15.73。论文知识蒸馏扩散模型模型压缩推荐理由:做扩散模型轻量化或模型压缩的团队,终于有了一个在极端压缩下仍能稳定训练的蒸馏方案,值得直接复现实验。原文稍后读已读值得跟进有用关注 知识蒸馏
14:29官方账号arXiv cs.AI@Aditya Tanna, Nassim Bouarour, Mohamed Bouadi, Vinay Kumar Sankarapu, Pratinav Seth精选表格基础模型在健康数据集上表现优异,但高推理成本和基础设施需求限制了实际应用。研究者提出通过知识蒸馏将预测能力转移至轻量表格模型,并针对上下文表格模型在推理时依赖训练集导致的上下文泄露问题,采用分层折叠教师标注策略。在19个医疗数据集、6个教师模型、4个学生模型家族及多教师集成实验中,蒸馏学生模型保留了教师AUC的至少90%,部分甚至超越教师,同时CPU推理速度提升至少26倍,且保持校准性和公平性。多教师平均并未持续优于最佳单教师。该研究为推理受限的健康场景部署高质量预测提供了可行路径。论文表格基础模型知识蒸馏健康数据推荐理由:医疗AI团队终于有了低成本部署高精度表格模型的方案——蒸馏后模型保留90%性能且快26倍,做健康数据预测的开发者可以直接用。原文稍后读已读值得跟进有用关注 表格基础模型
07:26AK@_akhaliq75°Apple 发布了一项关于 On-Policy Distillation 的研究,探讨了这种知识蒸馏方法在哪些场景下有效、哪些场景下有害,并分析了背后的原因。该研究旨在帮助 AI 开发者更好地理解和应用蒸馏技术,以优化模型性能。关键发现包括:On-Policy Distillation 在特定任务中能显著提升学生模型的表现,但在某些情况下可能导致性能下降。研究还揭示了蒸馏过程中数据分布和模型容量等因素的影响。这项工作为 AI 训练提供了实用指导,尤其适用于资源受限的部署场景。论文知识蒸馏On-Policy Distillation模型优化推荐理由:Apple 这篇研究把 On-Policy Distillation 的坑和甜点都讲透了,做模型压缩或部署的团队可以直接参考,避免踩坑。原文稍后读已读值得跟进有用关注 知识蒸馏
19:12官方一手arXiv: DeepSeek@Zizhao Chen, Yuying Li, Siting Lin, Lianxi Wang精选75°大语言模型在复杂推理中常出现“过度思考”问题,导致推理链过长、效率低下。现有强化学习方法通过设计复杂奖励函数压缩推理链,但高质量样本在探索空间中极为稀疏,形成采样瓶颈。受认知科学启发,研究者从理论上证明,参考答案引导的后验分布比先验分布具有更高期望效用,可突破高质量样本的采样瓶颈。为此,他们提出VPG-EA框架,将高效推理形式化为变分推断问题,引入效率感知的证据下界作为理论基础。该框架采用参数共享的双流架构实例化后验分布和先验策略,通过交叉视图评估过滤伪高效路径,再通过变分蒸馏将后验的高效模式单向迁移至先验策略。在DeepSeek-R1-Distill-Qwen-1.5B和7B规模上的实验显示,VPG-EA在综合效率指标ε³上分别比最强基线提升8.73%和12.37%。论文推理模型效率优化变分推断推荐理由:这篇论文为LLM推理效率问题提供了理论严谨且可落地的解决方案,做推理优化或模型压缩的研究者可以直接参考其变分蒸馏方法,值得细读。原文稍后读已读值得跟进有用关注 推理模型
19:12官方账号arXiv cs.AI@Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang, Alborz Geramifard精选75°该论文提出了一种新的语言模型后训练原则:将稀缺的标注验证数据优先用于最强模型(教师)进行稀疏奖励强化学习(如GRPO),然后通过稠密奖励蒸馏(如OPD)将行为迁移到小模型(学生)。实验表明,在固定学生模型大小(Qwen3-1.7B)下,先对8B教师进行RL再蒸馏,效果优于直接在学生上运行GRPO。该原则强调避免在未准备好的策略上使用稀缺数据,而是通过“稀疏奖励发现→稠密迁移→学生侧稀疏奖励”的流程优化资源分配。论文后训练强化学习知识蒸馏推荐理由:这篇论文为资源受限的团队提供了明确的训练策略——用最强模型做探索、用小模型做部署,做模型压缩或后训练的开发者可以直接参考这个稀疏到稠密的分配原则来提升效率。原文稍后读已读值得跟进有用关注 后训练