10:19官方一手pandaily@contact@pandaily.com (Pandaily)83°张一鸣两周前回归字节跳动Seed AI研究团队,下令停止蒸馏外部模型。随后年中全员会宣布B-side组织调整,将豆包、飞书和火山引擎划入同一产品体系。这次调整直接改变了字节AI三款核心产品的协作结构。行业张一鸣ByteDanceSeed4 个信源在谈事件专题推荐理由:张一鸣回归第一刀:Seed停止蒸馏,豆包、飞书和火山引擎也被整合到一起了。原文稍后读已读值得跟进有用关注 张一鸣
21:58官方账号Decoder@Maximilian Schreiner83°Meta旗下Superintelligence Labs发布开放模型Muse Glimmer,参数量30B,权重压缩后可在消费级硬件运行,内存占用低于20GB。扎克伯格在配套文章中为蒸馏其他实验室模型辩护,呼吁放宽对美国实验室的限制,直接针对OpenAI和Anthropic。据华尔街日报报道,开放权重版Muse Spark 1.2预计很快推出。AI模型Muse GlimmerMeta开源模型10 个信源在谈事件专题推荐理由:Meta回归开源,发了30B的Muse Glimmer,20GB内存能跑,扎克伯格还公开力挺蒸馏,够直白。原文稍后读已读值得跟进有用关注 Muse Glimmer
16:24小互@imxiaohu78°字节跳动创始人张一鸣在内部会议中表态,做模型要长期主义,反对用蒸馏他人模型换取短期榜单排名。公司已对开源模型实施严格蒸馏禁令,并通过API检测等技术手段加强限制。张一鸣认为,蒸馏会干扰真正意义上的长期技术突破。行业字节跳动张一鸣模型蒸馏2 个信源在谈事件专题推荐理由:字节跳动内部禁止蒸馏其他模型,张一鸣说要长期主义,看大公司怎么定方向。原文稍后读已读值得跟进有用关注 字节跳动
15:05向阳乔木@vista872°字节跳动创始人张一鸣向员工明确表示,公司不会使用AI蒸馏技术来追赶竞争对手,即使短期落后也可以接受。这一决策的主要考量是避免引发华盛顿方面的新一轮审查,从而威胁到TikTok业务。评论认为这种克制有助于保持模型输出风格的多样性,防止所有大模型趋于同质化。作者还提到,体验字节豆包视频通话的全双工模型升级时,感受到了明显不同的交互体验。行业字节跳动张一鸣TikTok4 个信源在谈事件专题推荐理由:张一鸣跟员工说不搞AI蒸馏了,哪怕短期被反超也不慌,主要是怕美国再拿TikTok开刀。这招挺清醒,能让各家模型保持点个性。原文稍后读已读值得跟进有用关注 字节跳动
06:48官方账号Cohere@cohereCohere 官方账号发布视频,配文称“学生 Transformer 已变成大师”,并引用了 Aidan Gomez 的推文。Aidan Gomez 在推文中写道“Time to bring back Google Brain”。这条互动推文在 X 平台获得 22 个点赞、2529 次浏览。行业CohereAidan GomezGoogle Brain推荐理由:Cohere 拿学生 Transformer 玩梗,Aidan Gomez 接话说要复活 Google Brain,这俩人到底在暗示啥,点开视频不就知道了。原文稍后读已读值得跟进有用关注 Cohere
14:14官方账号Latent Space (swyx)(博客/媒体)OpenAI将GPT 5.6价格下调20%-80%。由于GPT 5.6的递归自我优化,GPT 5.4的智能成本在4个月内下降了13倍。蒸馏技术在其中起到关键作用。AI模型GPT 5.6GPT 5.4模型蒸馏10 个信源在谈事件专题推荐理由:GPT 5.6大幅降价,最高降八成,四个月前GPT 5.4的算力成本现在只要十三分之一,做AI应用的成本压力能小不少。原文稍后读已读值得跟进有用关注 GPT 5.6
22:39Gary Marcus@GaryMarcus72°据披露,Anthropic内部项目Panama显示,为构建世界级模型,公司首先从LibGen等网站盗版下载超过700万本书籍。随后为避免法律风险,斥资数千万美元购买实体书并物理拆解扫描,将数百万本书转化为PDF用于训练Claude。这些扫描件被私有存储且不公开。Anthropic创始人Dario Amodei曾称合法购书是“法律/实践/业务上的麻烦”。同时,Anthropic公开反对大规模模型蒸馏。行业AnthropicClaude盗版书籍10 个信源在谈事件专题推荐理由:Anthropic一边反对蒸馏,一边自己盗版和毁书训练Claude,这瓜值得吃。原文稍后读已读值得跟进有用关注 Anthropic
16:02官方账号Latent Space (swyx)(博客/媒体)Anthropic发布了Claude Opus 5模型,性能达到Fable级别,但定价与Opus相同,即Fable价格的一半。这表明Anthropic在模型蒸馏上具备显著优势,能将高价模型能力压缩到低价模型。该模型主要面向需要高性能低成本的推理场景。AI模型Claude Opus 5AnthropicFable10 个信源在谈事件专题推荐理由:Anthropic整了个Claude Opus 5,性能赶上Fable只卖Opus的价,蒸馏技术太猛了!原文稍后读已读值得跟进有用关注 Claude Opus 5
02:43Suhail@SuhailSuhail在X上发帖讨论模型蒸馏链:从一个蒸馏模型继续蒸馏多次,结果不会出问题。他认为监管无法阻止这种行为,因为原始模型基于海量版权数据训练,不会因此被起诉。呼吁美国公司投资开源权重模型以保障国家安全。行业模型蒸馏AI监管开源模型推荐理由:Suhail聊透蒸馏链:重复蒸馏没事,监管没用,重点该投开源模型。原文稍后读已读值得跟进有用关注 模型蒸馏
22:38官方账号LMSYS Org (SGLang)@lmsysorg精选Miles 框架新增 On-Policy Distillation(OPD)作为一等训练原语。在 Qwen3.5-35B-A3B 上,纯 OPD 使推理 token 数从 18.6k 降至 5.5k–6.7k,缩短约 3 倍,同时 held-out DAPO 准确率从 0.8457 升至 0.8945。反向 KL 散度从 0.045 降至 0.010,学生模型收敛至教师。采用稀疏逐位置评分代替密集 O(R²K) 评分,提升效率。支持纯蒸馏或与 GRPO/PPO 奖励结合,计划扩展多教师和 RL 场景。AI模型MilesOPDQwen3.5-35B1 个信源在谈事件专题推荐理由:Miles 发布了 OPD 方法,让 Qwen3.5 模型推理更快更准,无需任务奖励,比传统蒸馏更高效,适合模型压缩场景。原文稍后读已读值得跟进有用关注 Miles
19:03techcrunch@Tim Fernholz一位专家向TechCrunch表示,Kimi K3的强大并非源于对Anthropic模型Fable的蒸馏。该专家认为,仅靠蒸馏无法在短时间内达到如此性能。这暗示Kimi K3可能还有其他的技术突破。AI模型Kimi K3AnthropicFable10 个信源在谈事件专题推荐理由:专家辟谣了!Kimi K3不是靠‘偷’Fable,它有真本事,想了解内幕的来读。原文稍后读已读值得跟进有用关注 Kimi K3
12:19官方一手歸藏(guizang.ai)@op741878°美国科技政策办公室主任Michael Kratsios公开表示,月之暗面(Moonshot AI)通过蒸馏Anthropic开发的Fable模型来训练其K3模型。月之暗面建立了大规模蒸馏平台,切换多种访问方式以规避检测。此外,月之暗面已采购GB300服务器并在泰国获取访问权限,用于训练AI模型。美方认为这种大规模工业蒸馏旨在窃取美国技术,不可接受。行业Moonshot AIAnthropicK3模型10 个信源在谈事件专题推荐理由:美国官员直接点名月之暗面,说他们偷偷用Anthropic的模型蒸馏自己的K3,还买GB300服务器避开监管,这事儿值得关注原文稍后读已读值得跟进有用关注 Moonshot AI
01:13Paul Couvert@itsPaulAi85°美国人工智能政策总监Michael Kratsios指控Moonshot AI(月之暗面)蒸馏了Anthropic的Fable模型,用于开发其K3模型。该公司搭建了内部平台进行大规模蒸馏,并切换多种访问方式以躲避检测。Moonshot AI还获取了GB300服务器并在泰国使用GB300训练模型。美国表示支持合法蒸馏,但认为这种大规模秘密工业蒸馏不可接受。行业Moonshot AIAnthropicFable10 个信源在谈事件专题推荐理由:美国官员点名月之暗面偷学Anthropic的Fable做K3,还搞秘密平台绕检测,这事有点大。原文稍后读已读值得跟进有用关注 Moonshot AI
22:43Geek@geekbb76°爆料称 DeepSeek V4 Pro 的官方 API 会将部分复杂编程请求转给 Anthropic 的 Claude Fable 5,可能用于收集输出以蒸馏模型。测试者通过 OpenCode 让模型生成 3D 游戏,发现部分结果与 Fable 5 高度相似,且推理方式突变。加入网络安全和生物问题后,游戏质量下降,知识范围退回 DeepSeek 原水平。测试利用了 Fable 5 的机制:Anthropic 会将部分安全、生物和蒸馏请求转给 Opus 4.8。目前证据仅证明 API 行为异常,无法确认回答者或输出是否进入训练数据,混合 prompt、未公开更新或模型路由也可能导致差异。行业DeepSeekClaudeFable 510 个信源在谈事件专题推荐理由:DeepSeek API 可能偷偷调用 Claude?测试者用 3D 游戏、安全题等挖出异常行为,但证据还不铁,吃瓜注意别上头。原文稍后读已读值得跟进有用关注 DeepSeek
14:51IT之家(博客/媒体)据Notateslaapp报道,特斯拉消费者车辆的FSD软件是Cybercab原生版本的蒸馏版。HW4量产车运行的AI模型是下一代硬件的精简版,通过模型蒸馏从大型教师模型压缩为学生模型。Cybercab搭载的FSD硬件性能超HW4,配备更多内存和双GPS。HW3内存带宽仅为HW4的15%,而HW4有望实现无人监督自动驾驶。AI模型特斯拉FSDCybercab推荐理由:特斯拉先给Cybercab开发完整FSD,再精简给HW4车,这个蒸馏策略挺有意思,看看你的车为啥跑的是阉割版。原文稍后读已读值得跟进有用关注 特斯拉
08:24IT之家(博客/媒体)71°纳德拉在 7 月 12 日的博客中指出,企业使用 AI 时实际支付了两次费用:一次是明码的 token 费用,另一次是交出专有知识。他警告模型供应商可能从客户的使用痕迹中学习,包括提示词、工具调用和纠错经验,并利用这些知识开拓同类业务。纳德拉主张企业应有权对 AI 模型进行“蒸馏”研究,以打破模型厂商单方面利用客户数据却禁止逆向分析的不平衡。行业微软纳德拉AI安全推荐理由:纳德拉爆了个大实话:你给 AI 喂数据,它可能转头就抢你生意。他提议企业也能“蒸馏”模型来反制,科技圈该重新想想数据安全了。原文稍后读已读值得跟进有用关注 微软
22:39官方账号Decoder@Matthias Bastian73°微软CEO萨提亚·纳德拉批评OpenAI和Anthropic存在“反向信息悖论”:它们以公平使用为由使用公开数据训练,却禁止他人蒸馏其模型,同时从客户交互中学习。纳德拉认为公司应控制自身学习基础设施,而微软恰好提供此类服务。行业Satya NadellaMicrosoftOpenAI10 个信源在谈事件专题推荐理由:纳德拉公开怼OpenAI和Anthropic,说他们一边拿公开数据训练,一边不让别人蒸馏自己的模型,挺双标。微软还顺便推销自家产品。原文稍后读已读值得跟进有用关注 Satya Nadella
14:46IT之家(博客/媒体)微软CEO萨提亚·纳德拉在X平台发文批评Anthropic等AI公司自相矛盾:他们一方面主张基于公开数据训练模型的合理使用权,另一方面却对模型蒸馏施加严格限制。Anthropic曾指责中国AI公司利用Claude生成数据训练模型,并称阿里巴巴发起大规模蒸馏攻击。纳德拉提醒企业用户应建立自有AI基础设施,避免过度依赖单一模型供应商。马斯克也曾批评Anthropic收集数据和训练模型的方式。行业Anthropic微软模型蒸馏10 个信源在谈事件专题推荐理由:微软CEO纳德拉痛批Anthropic双标:既要合理使用公开数据训练,又不让别人蒸馏。企业该留意数据依赖风险了。原文稍后读已读值得跟进有用关注 Anthropic
00:12官方账号Hugging Face@huggingface精选HuggingFace 举办了一场名为 Training Agents 2 的直播教程,聚焦于模型蒸馏技术。该教程详细演示了如何将大模型(教师模型)的知识压缩到更小的学生模型中,以训练自定义 AI 智能体。直播吸引了超过 2.1 万次观看和 124 个点赞,适合希望降低推理成本并保持性能的开发者。技巧HuggingFace模型蒸馏智能体推荐理由:HuggingFace 手把手教你怎么用蒸馏训练自己的 agent,省资源还能定制,适合做动手实践的教程。原文稍后读已读值得跟进有用关注 HuggingFace
16:23官方一手pandaily@contact@pandaily.com (Pandaily)阿里巴巴内部通知员工于2026年7月10日前移除所有Anthropic产品,包括Claude模型和智能体产品。该禁令源于Anthropic指控阿里巴巴进行模型蒸馏攻击。此次禁令涉及阿里巴巴集团所有员工,要求彻底删除Anthropic相关软件和数据。此举可能影响阿里巴巴内部基于Claude的开发和业务流程。行业阿里巴巴AnthropicClaude10 个信源在谈事件专题推荐理由:阿里巴巴直接封杀Anthropic全家桶,因为被指控蒸馏攻击,7月10日就生效,用Claude做事的赶紧看。原文稍后读已读值得跟进有用关注 阿里巴巴
09:19官方账号arXiv cs.LG@Zhanming Shen, Jintao Tong, Shaotian Yan, Chen Shen, Hao Chen, Wentao Ye, Xiaomeng Hu, Rui Miao, Haobo Wang, Junbo Zhao, Gang Chen, Jieping Ye研究发现在线自蒸馏(OPSD)在长思维链推理模型上效果有限且破坏推理稳定性。通过分解教师监督信号,发现参考导致的成分驱动死记硬背,而可迁移的问题条件成分被忽略。提出两步解法:首先构建仅参考教师以隔离不可迁移成分,再用点互信息(PMI)过滤掉参考捷径。在4个长思维链模型和2个数据集上,该方法相比基线和标准OPSD均取得一致改进。论文OPSDlong-CoTself-distillation推荐理由:这篇论文解决了OPSD在长推理模型上越蒸馏越笨的问题,用PMI过滤器保留思考能力,值得做推理优化的朋友看看。原文稍后读已读值得跟进有用关注 OPSD
15:45IT之家(博客/媒体)76°用户 LegitMichel777 逆向分析 Claude Code 2.1.196 版本时发现自 2.1.91 版本起内置检测中国用户的机制。该机制检查系统时区是否为 Asia/Shanghai 或 Asia/Urumqi,并匹配含 147 条域名的清单,包括百度、阿里巴巴、字节跳动、月之暗面等。检测结果通过替换日期格式和 Unicode 字符(U+2019、U+02BC、U+02B9)编码在系统提示词中,代码使用了密钥为“91”的 XOR 混淆。Anthropic 团队成员 Thariq Shihipar 回应称这是 2026 年 3 月上线的实验性措施,用于防止账户转售和模型蒸馏攻击,将在 7 月 2 日更新中删除。行业Claude CodeAnthropic中国用户10 个信源在谈事件专题推荐理由:Claude Code 被曝偷偷检测中国用户时区和域名,代码藏得够深,Anthropic 承诺明天删,值得一看。原文稍后读已读值得跟进有用关注 Claude Code
02:20官方账号Decoder@Matthias BastianAmazon工程师正在蒸馏Anthropic模型为更小、更便宜的版本供内部使用。从2025年起,Amazon将按处理的token数而非计算小时数向Anthropic付费,这可能大幅推高成本。为应对涨价,Amazon也在评估OpenAI等其他模型供应商。行业AmazonAnthropicOpenAI10 个信源在谈事件专题推荐理由:亚马逊工程师把Anthropic模型蒸馏成小版本来省钱,因为明年起要按token付费了,这招挺实用。原文稍后读已读值得跟进有用关注 Amazon
12:57IT之家(博客/媒体)Anthropic致信美国参议院,指控阿里巴巴在4月22日至6月5日期间使用约2.5万个欺诈账户进行了2880万次对话,对其Claude模型实施“迄今已知最大规模的蒸馏攻击”。蒸馏是一种利用更强模型输出训练更小模型的技术。然而,Anthropic自家旗舰模型Claude Opus 4.8于5月发布后,被用户发现回答中自称是阿里通义千问(Qwen)或DeepSeek,引发双标争议。埃隆·马斯克也批评Anthropic曾大规模盗用训练数据并支付和解金。行业Anthropic阿里巴巴模型蒸馏10 个信源在谈事件专题推荐理由:Anthropic刚发的Claude Opus 4.8被揭套壳千问和DeepSeek,转头就告阿里偷模型,马斯克都看不下去了,这瓜绝对值得吃。原文稍后读已读值得跟进有用关注 Anthropic
10:07berryxia@berryxia71°Anthropic向美国白宫提交申请,指控阿里巴巴通过创建近25,000个假账户与Claude进行了2880万次对话(2026年4月22日至6月5日),以蒸馏其模型。Anthropic已屏蔽中国访问,但阿里巴巴仍绕过限制。该事件涉及AI模型安全与跨国竞争问题。行业AnthropicClaude阿里巴巴10 个信源在谈事件专题推荐理由:Anthropic告状说阿里用两万五假账号和两千八百万次对话薅Claude羊毛,这官司有意思。原文稍后读已读值得跟进有用关注 Anthropic
11:07官方账号arXiv cs.AI@Alexander V. Kozachok, Alexander M. Nazimov, Shamil G. Magomedov该研究扩展了Text2DSL自动生成领域特定语言代码的工作,用DeepSeek-V4-Flash作为教师模型,在结构化上下文(BNF语法、API规范、词汇表)下生成数据,经AST验证(使用esprima)和运行时验证(polkitd与pkcheck)的流水线,将PolkitBench语料从4,204对扩充到10,073对,其中AST有效性达100.0%、运行时通过率99.7%。在GigaChat-10B-A1.8B上对八种消融条件(C0-C7)评估发现:无上下文时语法有效从97.6%降至58.5%而完整上下文仅从98.6%降至97.4%,完整上下文C7在所有指标上最优,词汇表对语义质量贡献最大(组合得分+0.198),API和BNF分别对结构有效性贡献+24.7和+22.3个百分点。论文Text2DSLDeepSeek-V4-FlashGigaChat-10B-A1.8B推荐理由:这篇论文用DeepSeek-V4-Flash生成了上万条验证过的Polkit规则,并通过消融实验证明结构化上下文不是锦上添花,词汇表才是提升语义质量的关键。原文稍后读已读值得跟进有用关注 Text2DSL
11:26官方账号arXiv cs.LG@Guo Yu, Wenlin Liu, Yulan Hu, Hao-Xuan Ma, Jun-Peng Jiang, Han-Jia Ye该论文分析了在线策略蒸馏(OPD)在语言和多模态模型中的参数更新特性,发现OPD更新具有稀疏性,主要集中在FFN层,且仅训练这些子网络即可接近完整OPD的性能。更新在几何上是满秩但谱集中的,主要落在源权重接近零的坐标上。研究还发现,密集教师监督下SGD优化器不如AdamW,因为AdamW的自适应缩放对保持异构梯度尺度更有效。这些结果表明,OPD并非简单的密集参数重写,而是保留了策略后训练的几何特征。论文模型蒸馏稀疏更新优化器对比推荐理由:这篇论文揭示了OPD更新的稀疏性和几何特性,对做模型蒸馏和微调的团队有直接参考价值——你可以只训练关键子网络来节省计算,同时理解为什么AdamW比SGD更优。建议点开看看实验细节。原文稍后读已读值得跟进有用关注 模型蒸馏
11:55官方一手arXiv: DeepSeek@Zhaoyang Jiang, Xuanqi Peng, Fei Teng, Zhizhong Fu, Yunsoo Kim, Jiacong Mi, Zicheng Li, Honghan Wu一项针对医疗问答链式推理(CoT)蒸馏的研究发现,蒸馏后的小模型在最终答案准确率上显著提升(MedQA-USMLE从74.7%到84.4%),但推理步骤的错误率却从30.6%上升到50.3%。研究使用Qwen3-8B作为学生模型,蒸馏自DeepSeek-V3系列教师模型,并通过Kimi-K2.6等LLM裁判和临床专家盲审验证了这一反向趋势。问题根源在于:当答案选项简短、无法约束完整推理时,学生模型能模仿专家风格的推理过程,但无法确保每一步的局部事实正确。标准答案指标和整体回避率无法揭示这一风险。该发现提醒,在医疗等高风险领域,仅用答案准确率评估蒸馏模型是不够的,推理步骤的事实性必须单独审计。论文链式推理模型蒸馏医疗QA推荐理由:做医疗AI或模型蒸馏的团队注意了:答案准不等于推理对,蒸馏后步骤错误率反而飙升,临床场景下这是致命隐患。建议点开看看审计方法,避免踩坑。原文稍后读已读值得跟进有用关注 链式推理
11:50官方账号arXiv cs.AI@Jin Shi, Brady Zhang, Yishun Lu精选VLA-AD提出一种蒸馏框架,利用视觉语言模型作为离线语义监督器,将大型VLA教师模型(如OpenVLA-7B)压缩为轻量级学生策略(158M参数),模型大小减少44倍,推理速度提升3.28倍(12.5 Hz on RTX 4090),性能仅下降0.27%。该方法不仅模仿底层动作,还引入任务阶段锚点和多帧操作方向描述等高层语义信号,仅在训练时使用,测试时学生策略独立运行。在LIBERO基准测试中,VLA-AD对π0.5-4B教师也有效,学生策略在部分任务上甚至超越教师。额外分析表明,语义引导使学生对教师动作噪声(如高频夹爪误操作)更鲁棒。论文VLA策略模型蒸馏机器人操控推荐理由:做机器人策略部署的团队终于有了实用的模型压缩方案——VLA-AD用VLM离线语义信号替代在线大模型,7B教师变158M学生,速度3倍提升且性能几乎无损,做实时闭环控制的开发者可以直接参考。原文稍后读已读值得跟进有用关注 VLA策略
23:12Gary Marcus@GaryMarcusAnthropic 发布关于中美 AI 竞赛的报告,认为美国及其盟友可通过限制中国获取先进计算能力和模型输出来锁定 12-24 个月的领先优势。报告指出中国实验室利用漏洞、走私芯片、海外数据中心和蒸馏攻击来追赶美国前沿模型。Anthropic 将计算视为 AI 权力的核心瓶颈,并称蒸馏是系统性工业间谍行为。报告还预测华为 2026 年可能仅生产英伟达总计算能力的 4%,2027 年降至 2%。Anthropic 警告中国 AI 领先可能带来自动化压制、网络攻击和军事 AI 部署等风险。行业AI 竞赛Anthropic芯片封锁1 个信源在谈事件专题推荐理由:Anthropic 这篇报告把中美 AI 竞赛的博弈逻辑摊开了——芯片封锁和模型蒸馏是核心战场,做 AI 政策、投资或技术战略的人值得细读,能帮你理解未来 2 年行业格局的关键变量。原文稍后读已读值得跟进有用关注 AI 竞赛