精选 AI 资讯 · AI 热点

AITOP

6月11日

15:28

AITOP6月11日 15:28

1107 vs 303：谷歌悄悄开源了一个“拆打字机”的模型，把大模型速度翻了4倍

15:23

AITOP6月11日 15:23

DiffusionGemma颠覆文本生成？自回归模型的“统治”要结束了

15:07

AITOP6月11日 15:07

每秒1107个token，Google开源的扩散模型为什么能改变本地推理格局？

09:51

arXiv cs.AI@Shang Ma, Jisheng Dang, Wencan Zhang, Yifan Zhang, Bimei Wang, Hong Peng, Bin Hu, Qi Tian, Tat-Seng Chua

精选

研究者提出了一种名为 MODF-SIR 的多智能体协作框架，基于轻量级多模态大语言模型，专门用于社交智能推理。该框架通过知识蒸馏增强训练和推理阶段，能够精确定位多模态社交数据，并提取长尾事件以格式化文本呈现，避免关键信息被噪声淹没。它集成了测试时自适应（TTA）、思维链提示和自反思机制，并利用 LoRA 微调基础模型。在多个基准测试中，仅用约 30% 的训练数据就达到了最先进的结果。代码、演示和模型均已开源。

论文多智能体知识蒸馏社交智能推理多模态 LoRA

推荐理由：社交智能推理是 AI 理解人类互动的关键，MODF-SIR 用轻量模型和蒸馏技术解决了长尾事件被忽略的痛点，做多模态社交分析或人机交互的团队可以直接用开源代码复现。

原文

6月5日

12:20

arXiv cs.AI@Lizhi Yang, Junheng Li, Nehar Poddar, Yiling Hou, Gio Huh, Robert Griffin, Georgia Gkioxari, Aaron Ames

精选

HANDOFF 提出了一种紧凑、直观的接口，用于人形机器人的任务规划与全身控制之间的连接。该接口通过多教师 KL 蒸馏和上下文条件门控机制，将三个互补专家（全身运动跟踪、行走、跌倒恢复）蒸馏成一个混合专家学生模型。在 Unitree G1 机器人上，HANDOFF 实现了与最先进方法相当的行走速度跟踪，并提供了最大的鲁棒操作工作空间之一。此外，通过 VLM 驱动的智能体规划器，无需任务特定数据或控制器微调，即可实现自然语言驱动的任务执行。这项工作为人形机器人在现实世界中的部署提供了更高效、更通用的控制方案。

论文人形机器人全身控制知识蒸馏混合专家模型 Unitree G1

推荐理由：人形机器人开发者终于有了一个更直观、通用的控制接口——HANDOFF 通过蒸馏多个专家模型，让机器人能同时做好行走、操作和跌倒恢复，做机器人全身控制的团队可以直接参考其方法。

原文

6月1日

00:09

AITOP6月1日 00:09

OpenAI 发起“Codex for Open Source”：免费赠送 6 个月 Pro 订阅，开源维护者能否迎来 AI 变革？

5月29日

08:02

AITOP5月29日 08:02

Opus 4.8发布：编程助手的“静默时刻”，是解放开发者，还是新门槛？🔥Anthropic 把 AI 编程的“确认键”彻底删掉了！Claude Code 搭载全新 Opus 4.8 模型，长时间任务不跑偏、不废话、不中断，像一个资深工程师一样默默干活，从功能开发到漏洞清扫全包圆，你在旁边喝茶等结果就行。过去 AI 写代码三步一问“这样可以吗”，现在它直接交完整交付物……自主编程的最后一层窗户纸，被捅破了。做自动化开发和代码审查的团队，这个模型建议直接上手，效率差距肉眼可见……

5月28日

11:56

arXiv: DeepSeek@Junhyuck Kim, Jihun Yun, Haechan Kim, Gyeongman Kim, Joonghyun Bae, Jaewoong Cho

精选72°

该研究提出了首个系统化框架，将混合专家模型（MoE）转换为标准全稠密架构。通过专家评分、选择、分组并拼接成稠密前馈网络，再通过知识蒸馏从MoE教师模型精炼。在Qwen3-30B-A3B上评估了7种评分、5种分组和2种幅度缩放方法，共350种配置。发现评分方法影响最大，其提出的多样性感知评分在多个模型上优于先前方法。在参数匹配控制下，MoE转稠密比稠密到稠密剪枝平均下游准确率提升6.3个百分点，训练速度快1.6倍。

论文模型压缩知识蒸馏混合专家模型稠密模型 Qwen3

推荐理由：这个框架解决了MoE模型在内存受限设备上部署的痛点，做模型压缩和边缘部署的团队可以直接参考其方法，比传统剪枝效果更好且训练更快。

原文

5月27日

12:16

arXiv: DeepSeek@Guanghui Wang, Kaiwen Lv Kacuila, Zhiyong Yang, Zitai Wang, Jin-Wen Wu, Longtao Huang, Qianqian Xu, Qingming Huang

精选72°

这篇论文发现，在 LLM 知识蒸馏中，混合使用教师模型的硬标签（采样 token）和软标签（完整分布）比单独使用任何一种效果更好。作者提出 Bridge-Garden 分解理论，将生成步骤分为“桥”（需精确 token）和“花园”（可灵活选择）两类，硬标签擅长处理桥，软标签擅长处理花园，混合策略能减少训练与推理之间的暴露偏差。基于该理论开发的混合监督方法在 7 组师生模型（含 Qwen、Llama、Gemma、DeepSeek）上优于现有基线，同时将训练成本降低 9.7 倍。代码已开源。

论文知识蒸馏暴露偏差混合标签模型压缩 Qwen/Llama/Gemma/DeepSeek

推荐理由：做 LLM 蒸馏的团队终于有了理论指导——Bridge-Garden 理论解释了为什么混合标签有效，并且直接给出了可落地的方案，训练成本还降了 9.7 倍，建议做模型压缩的开发者点开看看。

原文

5月25日

11:25

arXiv cs.LG@Taiming Lu, Zhuang Liu

精选72°

这篇论文挑战了知识蒸馏中“强教师才能教出好学生”的传统观念。研究发现，在LLM预训练阶段，即使使用较小或训练不足的弱教师模型，通过合理混合语言建模和蒸馏损失，也能提升更大的学生模型。相反，更强的教师（更多参数或更多训练数据）可能导致蒸馏收益饱和甚至下降。此外，蒸馏在提升泛化能力（如分布外和下游任务表现）方面比在领域内拟合更有效。这些结果颠覆了蒸馏预训练必须依赖强教师的普遍认知。

论文知识蒸馏 LLM预训练弱到强蒸馏泛化能力损失函数设计

推荐理由：做LLM预训练或知识蒸馏的团队，这篇论文直接挑战了“教师越强越好”的默认假设，看完可能会重新设计你的蒸馏策略，值得细读。

原文

5月20日

10:35

arXiv cs.AI@Hyunsoo Han, Sangyeop Yeo, Jaejun Yoo

精选

该研究提出了一种名为 LIFT and PLACE 的知识蒸馏框架，用于训练轻量级扩散模型。LIFT 将蒸馏过程分解为粗对齐和细调优两个阶段，先让学生模型学习教师模型的整体分布，再处理细节。PLACE 则通过分组自适应系数处理空间非均匀误差，进一步提升了蒸馏效果。实验表明，该方法在图像/潜空间、U-Net/DiT 骨干网络、条件/无条件生成等场景下均有效，甚至在极端压缩（学生模型仅 1.3M 参数，为教师的 1.6%）时，传统蒸馏方法失效（FID 高达 50-200+），而新方法仍能稳定收敛并达到 FID 15.73。

论文知识蒸馏扩散模型模型压缩 LIFT PLACE

推荐理由：做扩散模型轻量化或模型压缩的团队，终于有了一个在极端压缩下仍能稳定训练的蒸馏方案，值得直接复现实验。

原文

5月19日

14:29

arXiv cs.AI@Aditya Tanna, Nassim Bouarour, Mohamed Bouadi, Vinay Kumar Sankarapu, Pratinav Seth

精选

表格基础模型在健康数据集上表现优异，但高推理成本和基础设施需求限制了实际应用。研究者提出通过知识蒸馏将预测能力转移至轻量表格模型，并针对上下文表格模型在推理时依赖训练集导致的上下文泄露问题，采用分层折叠教师标注策略。在19个医疗数据集、6个教师模型、4个学生模型家族及多教师集成实验中，蒸馏学生模型保留了教师AUC的至少90%，部分甚至超越教师，同时CPU推理速度提升至少26倍，且保持校准性和公平性。多教师平均并未持续优于最佳单教师。该研究为推理受限的健康场景部署高质量预测提供了可行路径。

论文表格基础模型知识蒸馏健康数据推理效率公平性

推荐理由：医疗AI团队终于有了低成本部署高精度表格模型的方案——蒸馏后模型保留90%性能且快26倍，做健康数据预测的开发者可以直接用。

原文

5月13日

19:12

arXiv: DeepSeek@Zizhao Chen, Yuying Li, Siting Lin, Lianxi Wang

精选75°

大语言模型在复杂推理中常出现“过度思考”问题，导致推理链过长、效率低下。现有强化学习方法通过设计复杂奖励函数压缩推理链，但高质量样本在探索空间中极为稀疏，形成采样瓶颈。受认知科学启发，研究者从理论上证明，参考答案引导的后验分布比先验分布具有更高期望效用，可突破高质量样本的采样瓶颈。为此，他们提出VPG-EA框架，将高效推理形式化为变分推断问题，引入效率感知的证据下界作为理论基础。该框架采用参数共享的双流架构实例化后验分布和先验策略，通过交叉视图评估过滤伪高效路径，再通过变分蒸馏将后验的高效模式单向迁移至先验策略。在DeepSeek-R1-Distill-Qwen-1.5B和7B规模上的实验显示，VPG-EA在综合效率指标ε³上分别比最强基线提升8.73%和12.37%。

论文推理模型效率优化变分推断过度思考知识蒸馏

推荐理由：这篇论文为LLM推理效率问题提供了理论严谨且可落地的解决方案，做推理优化或模型压缩的研究者可以直接参考其变分蒸馏方法，值得细读。

原文

19:12

arXiv cs.AI@Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang, Alborz Geramifard

精选75°

该论文提出了一种新的语言模型后训练原则：将稀缺的标注验证数据优先用于最强模型（教师）进行稀疏奖励强化学习（如GRPO），然后通过稠密奖励蒸馏（如OPD）将行为迁移到小模型（学生）。实验表明，在固定学生模型大小（Qwen3-1.7B）下，先对8B教师进行RL再蒸馏，效果优于直接在学生上运行GRPO。该原则强调避免在未准备好的策略上使用稀缺数据，而是通过“稀疏奖励发现→稠密迁移→学生侧稀疏奖励”的流程优化资源分配。

论文后训练强化学习知识蒸馏奖励设计 Qwen3

推荐理由：这篇论文为资源受限的团队提供了明确的训练策略——用最强模型做探索、用小模型做部署，做模型压缩或后训练的开发者可以直接参考这个稀疏到稠密的分配原则来提升效率。

原文