8月11日
10:19
10:19官方一手pandaily@contact@pandaily.com (Pandaily)
83°
张一鸣两周前回归字节跳动Seed AI研究团队,下令停止蒸馏外部模型。随后年中全员会宣布B-side组织调整,将豆包、飞书和火山引擎划入同一产品体系。这次调整直接改变了字节AI三款核心产品的协作结构。
事件专题

推荐理由:张一鸣回归第一刀:Seed停止蒸馏,豆包、飞书和火山引擎也被整合到一起了。
8月6日
06:48
06:48官方账号Cohere@cohere
Cohere 官方账号发布视频,配文称“学生 Transformer 已变成大师”,并引用了 Aidan Gomez 的推文。Aidan Gomez 在推文中写道“Time to bring back Google Brain”。这条互动推文在 X 平台获得 22 个点赞、2529 次浏览。
推荐理由:Cohere 拿学生 Transformer 玩梗,Aidan Gomez 接话说要复活 Google Brain,这俩人到底在暗示啥,点开视频不就知道了。
7月31日
14:14
14:14官方账号Latent Space (swyx)博客/媒体
OpenAI将GPT 5.6价格下调20%-80%。由于GPT 5.6的递归自我优化,GPT 5.4的智能成本在4个月内下降了13倍。蒸馏技术在其中起到关键作用。
事件专题

推荐理由:GPT 5.6大幅降价,最高降八成,四个月前GPT 5.4的算力成本现在只要十三分之一,做AI应用的成本压力能小不少。
7月25日
16:02
16:02官方账号Latent Space (swyx)博客/媒体
Anthropic发布了Claude Opus 5模型,性能达到Fable级别,但定价与Opus相同,即Fable价格的一半。这表明Anthropic在模型蒸馏上具备显著优势,能将高价模型能力压缩到低价模型。该模型主要面向需要高性能低成本的推理场景。
事件专题

推荐理由:Anthropic整了个Claude Opus 5,性能赶上Fable只卖Opus的价,蒸馏技术太猛了!
7月23日
19:03
7月3日
09:19
09:19官方账号arXiv cs.LG@Zhanming Shen, Jintao Tong, Shaotian Yan, Chen Shen, Hao Chen, Wentao Ye, Xiaomeng Hu, Rui Miao, Haobo Wang, Junbo Zhao, Gang Chen, Jieping Ye
研究发现在线自蒸馏(OPSD)在长思维链推理模型上效果有限且破坏推理稳定性。通过分解教师监督信号,发现参考导致的成分驱动死记硬背,而可迁移的问题条件成分被忽略。提出两步解法:首先构建仅参考教师以隔离不可迁移成分,再用点互信息(PMI)过滤掉参考捷径。在4个长思维链模型和2个数据集上,该方法相比基线和标准OPSD均取得一致改进。
推荐理由:这篇论文解决了OPSD在长推理模型上越蒸馏越笨的问题,用PMI过滤器保留思考能力,值得做推理优化的朋友看看。
6月30日
02:20
02:20官方账号Decoder@Matthias Bastian
Amazon工程师正在蒸馏Anthropic模型为更小、更便宜的版本供内部使用。从2025年起,Amazon将按处理的token数而非计算小时数向Anthropic付费,这可能大幅推高成本。为应对涨价,Amazon也在评估OpenAI等其他模型供应商。
事件专题

推荐理由:亚马逊工程师把Anthropic模型蒸馏成小版本来省钱,因为明年起要按token付费了,这招挺实用。
6月12日
11:26
11:26官方账号arXiv cs.LG@Guo Yu, Wenlin Liu, Yulan Hu, Hao-Xuan Ma, Jun-Peng Jiang, Han-Jia Ye
该论文分析了在线策略蒸馏(OPD)在语言和多模态模型中的参数更新特性,发现OPD更新具有稀疏性,主要集中在FFN层,且仅训练这些子网络即可接近完整OPD的性能。更新在几何上是满秩但谱集中的,主要落在源权重接近零的坐标上。研究还发现,密集教师监督下SGD优化器不如AdamW,因为AdamW的自适应缩放对保持异构梯度尺度更有效。这些结果表明,OPD并非简单的密集参数重写,而是保留了策略后训练的几何特征。
推荐理由:这篇论文揭示了OPD更新的稀疏性和几何特性,对做模型蒸馏和微调的团队有直接参考价值——你可以只训练关键子网络来节省计算,同时理解为什么AdamW比SGD更优。建议点开看看实验细节。