16:39官方账号Latent Space (swyx)(博客/媒体)本期AINews探讨了通过投机解码技术窃取推理模型思维链的方法。文章指出,投机解码不仅能加速推理,还能被用来提取模型的内部推理过程。这种技术可能对模型安全构成威胁,因为推理轨迹包含敏感信息。文章还讨论了蒸馏与推理轨迹窃取之间的界限。论文投机解码推理轨迹模型安全推荐理由:想知道怎么从推理模型里偷思维链?这篇讲透了投机解码的另类用法,安全研究者必看。原文稍后读已读值得跟进有用关注 投机解码
00:30Suhail@SuhailMeta CEO马克·扎克伯格在X平台发文,呼吁行业重新思考关于蒸馏和训练数据的政策。他表示,模型从其他模型学习的能力是开源生态系统运作的重要原则。这一表态针对当前AI行业对蒸馏技术的争议,强调无法阻止模型间的知识传递。扎克伯格的观点可能影响未来AI监管和开源政策的走向。行业扎克伯格Meta蒸馏推荐理由:扎克伯格公开挺蒸馏,说模型互相学习是开源根本,这波站队值得看看。原文稍后读已读值得跟进有用关注 扎克伯格
11:37官方账号arXiv cs.AI@Yubo Jiang, Fengying Xie, Zhiguo Jiang, Haopeng ZhangSKALD 是一种基于策略的自蒸馏框架,使用 Qwen3-Base 模型的两种上下文视图:仅问题的学生和基于抽象技能卡的教师。该方法通过退火指数倾斜目标稳定分布失配,并在验证奖励为正时激活蒸馏。在五个数学基准上,SKALD 在 0.6B、1.7B 和 4B 规模下分别比 GRPO 提升 +2.46、+4.85 和 +12.01 的 avg@8。在 1.7B 规模下,零方差蒸馏恢复 84.7% 的完整增益,且比 FLOP 匹配的 GRPO 高 +4.06。论文SKALDQwen3GRPO推荐理由:想提升数学推理模型?SKALD 把技能蒸馏进权重,比 GRPO 最高涨 12 分,还不用改推理时的输入。原文稍后读已读值得跟进有用关注 SKALD
10:15AI Will@FinanceYF5Jensen Huang 在回应开源模型公司能否蒸馏闭源模型时,表示蒸馏不是抄袭,而是智能的基本方式。他认为蒸馏与人类学习中的模仿类似,是模型获取智能的常见路径。该观点通过 X 平台发布,目前推文获得 956 次浏览、4 次引用。这一表态为开源模型与闭源模型之间的蒸馏争议提供了明确立场。行业Jensen Huang蒸馏开源模型推荐理由:黄仁勋一句话说透蒸馏争议:蒸馏不是抄袭。开源模型蒸馏闭源模型,他站开源这边。原文稍后读已读值得跟进有用关注 Jensen Huang
10:14AI Will@FinanceYF5黄仁勋在 Axios 采访中回应开源模型能否蒸馏闭源模型。他称蒸馏是智能基础,就像人类通过提问相互学习。他预测数年后互联网 99% 内容将由 AI 生成。他认为 AI 互相学习能让模型更聪明,而更聪明的 AI 更安全。行业黄仁勋蒸馏开源模型推荐理由:看黄仁勋怎么回应开源模型蒸馏闭源模型,还预测互联网99%是AI内容。原文稍后读已读值得跟进有用关注 黄仁勋
09:36官方账号arXiv cs.AI@Zhihao Zhu, Hanlin Shang, Mingwang Xu, Feipeng Cai, Zhuolin He, Yaoyi Li, Jianhua Han, Hang Xu, Siyu ZhuWAM-Diff2是一种多任务离散扩散VLA框架,通过三阶段分层蒸馏将预训练自回归模型转化为并行扩散模型。该方法解决了自回归解码的高延迟和暴露偏差问题,同时保留多任务视觉-语言推理能力。在驾驶理解、感知和规划基准上,WAM-Diff2与自回归基线性能持平。推理加速达2.8倍,结合FlashInfer和CUDA Graphs系统优化后最高可达15.1倍。AI模型WAM-Diff2VLA扩散模型推荐理由:它把慢吞吞的自回归VLA模型变成并行扩散模型,性能不掉,推理快2.8倍,还能跑自动驾驶多任务。原文稍后读已读值得跟进有用关注 WAM-Diff2
09:11SuperTechFans(博客/媒体)72°Anthropic CEO Dario Amodei在2026年7月27日发表文章,澄清公司从未主张全面禁止开放权重模型,认为不具备危险能力的开放权重模型是公共产品。文章指出两大担忧:中国可能利用更强AI模型实现军事优势,以及开放权重模型更易被滥用。Amodei支持三项措施:禁止向中国出售先进芯片和芯片制造设备、打击工业级蒸馏、所有足够强的模型需接受强制安全测试。Anthropic不主张全面禁止,而是聚焦芯片管控、蒸馏规制和安全测试。行业Anthropic开放权重模型芯片管制10 个信源在谈事件专题推荐理由:看看Anthropic对开源模型的最新态度,不是一刀切禁止,而是主张芯片管制和安全测试,与中国相关风险的分析很具体。原文稍后读已读值得跟进有用关注 Anthropic
17:48AI Will@FinanceYF582°在Axios采访中,NVIDIA CEO黄仁勋被问及开源模型公司是否应蒸馏闭源模型。他回应称蒸馏(从其他AI系统中学习)是智能的基础,如同人类相互学习。他预测未来几年互联网可能99%内容由AI生成,AI系统将不断蒸馏知识。黄仁勋认为更智能的AI也能更安全,因此蒸馏是件好事。行业Jensen HuangNVIDIA蒸馏10 个信源在谈事件专题推荐理由:黄仁勋在Axios采访中正面回应蒸馏争议——AI互相学习不是坏事,反而能让AI更智能、更安全。原文稍后读已读值得跟进有用关注 Jensen Huang
17:46AI Will@FinanceYF5英伟达CEO黄仁勋回应开源模型蒸馏闭源模型争议,认为蒸馏本质上就是学习,是智能的基础。他指出早期AI模型从互联网的人类知识中学习,未来互联网可能有99%内容由AI生成,AI之间互相学习将成为常态。他主张更聪明的AI也可能更安全。行业黄仁勋NVIDIA开源模型10 个信源在谈事件专题推荐理由:黄仁勋对开源模型蒸馏闭源模型表态,核心观点是学习即智能,未来AI互相学习很正常,还提到了AI安全性。值得一看。原文稍后读已读值得跟进有用关注 黄仁勋
01:48Suhail@SuhailSuhail 在 X 上表示蒸馏是一种研究技术,本身无好坏。他愿意提供100万美元资助优秀研究者进行蒸馏实验,使其更高效,并公开结果。他警告称,开源模型限制会引发斯特赖桑德效应,导致蒸馏研究增长10倍,从而更高效地利用数据和算力,以对抗政府监管。行业Suhail蒸馏开源模型推荐理由:Suhail 出100万美元支持蒸馏研究,还说监管可能反而让蒸馏技术加速10倍,想听听他怎么看。原文稍后读已读值得跟进有用关注 Suhail
04:16Aravind Srinivas@AravSrinivasJürgen Schmidhuber指出,他早在1991年就在欧洲发表了蒸馏技术。该技术后被美国和中国复制,用于蒸馏商业公司从互联网免费获取的内容。他公开支持开源模型蒸馏这些商业公司的成果,认为这是合理的再利用。这一观点引发了关于AI蒸馏技术起源和开源与商业公司之间关系的讨论。行业Schmidhuber蒸馏开源模型推荐理由:Schmidhuber本人说蒸馏是他1991年在欧洲发明的,现在开源模型可以用这个技术蒸馏商业公司的成果。原文稍后读已读值得跟进有用关注 Schmidhuber
00:00The Rundown AI@therundownai82°美国科技顾问Michael Kratsios指控中国Moonshot AI蒸馏Anthropic的Fable模型,用于开发其Kimi K3。Anthropic在2月报告中曾指出Moonshot、DeepSeek和MiniMax大规模提取Claude数据以改进模型。K3在近期取得接近领先水平的成绩,引发开源模型领域讨论。Kratsios强调美国支持自由公平的AI发展,但反对大规模隐蔽蒸馏窃取技术。行业Moonshot AIAnthropicKimi K310 个信源在谈事件专题推荐理由:美国科技顾问直接点名Moonshot AI偷学Anthropic的Fable造Kimi K3,K3最近成绩逼近前沿,但背后是蒸馏争议,这场中美AI摩擦值得关注。原文稍后读已读值得跟进有用关注 Moonshot AI
22:19官方账号Nathan Lambert: Interconnects@Nathan Lambert文章回顾了近期开源模型进展,重点讨论了Kimi K3和Qwen 3.8的发布。提及中国WAIC上习近平的演讲对开放AI生态的影响。分析了AI蒸馏技术对模型能力的提升和开源与闭源模型之间差距的缩小。最后展望了开源模型下一步的发展方向。行业Kimi K3Qwen 3.8WAIC10 个信源在谈事件专题推荐理由:聊了Kimi K3、Qwen 3.8这些新进展,还有WAIC上习近平的发言,分析了蒸馏和开闭源差距,看完对开源格局心里有数。原文稍后读已读值得跟进有用关注 Kimi K3
13:01向阳乔木@vista8作者开发了一个视频生成Skill,计划每天发布一个大模型知识解读视频。第一期用通俗语言解释“蒸馏”概念,帮助外行理解。该Skill可自动化生成科普内容,降低AI知识传播门槛。技巧蒸馏视频生成科普推荐理由:想搞懂啥是蒸馏?这哥们做了个视频生成工具,每天讲一个AI概念,第一期专治小白看不懂。原文稍后读已读值得跟进有用关注 蒸馏
01:21官方账号Simon Willison’s Weblog(博客/媒体)Ben Thompson提议美国立法将AI训练数据收集明确为合理使用,并禁止美国公司通过服务条款阻止模型蒸馏。他指出蒸馏仅是通过API查询模型,几乎无法禁止,因此应转向支持创新。该提案同时有助于美国开源模型与中国模型竞争。文中还提及阿里巴巴发布Qwen 3.8 Max开源权重,可能受习近平关于鼓励开源合作的讲话影响。行业Ben ThompsonQwen阿里巴巴推荐理由:Ben Thompson提出了一个实际解决蒸馏禁令与训练数据版权矛盾的方案,同时还能帮美国开源模型对抗中国对手,值得一看。原文稍后读已读值得跟进有用关注 Ben Thompson
01:44Jerry Liu@jerryjliu0Jerry Liu 认为创建自定义通用 harness 价值不大,但针对特定任务的自定义 harness 可以满足准确性/成本/延迟等生产约束,例如编码领域先验、模型混合和 UX。他建议先用 Codex 或 Claude Code 引导工作流,然后蒸馏成更具体的实现。相比通用智能体提示,任务专用方案效果更好。技巧CodexClaude Code编程助手推荐理由:Jerry Liu 说通用 harness 不如任务专用,先用 Codex/Claude Code 打底再蒸馏,实践性很强。原文稍后读已读值得跟进有用关注 Codex
09:12Suhail@SuhailSuhail发文指出中国AI已跨越蒸馏阶段,开始真正的前沿研究,蒸馏的边际收益已微乎其微。他认为以“蒸馏”为名推动禁止开放权重模型的法律是荒谬的,只会扼杀美国未来创新。他警告,实验室知道开放模型会商品化其收入,并会被优化到1/100的成本。他们担心无法再掌控用户的工作负载,从而失去开发替代产品的机会。他还批评实验室使用人类数据训练模型却未支付任何费用,一旦控制智能便能征税。行业中国AI蒸馏开放权重模型推荐理由:Suhail一针见血:别再拿蒸馏当挡箭牌禁开放模型,中国早就不玩了,背后是实验室想守住摇钱树。原文稍后读已读值得跟进有用关注 中国AI
12:08官方账号arXiv cs.LG@Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon HanOn-Policy Delta Distillation (OPD²) 引入delta信号,定义为教师模型与其未经推理指令微调的基础模型之间的差异。该方法在数学、科学和代码推理基准上一致优于传统on-policy蒸馏。实验表明,仅需短期后训练即可使推理LLM达到强性能。代码已在GitHub开源。论文OPD²蒸馏推理模型推荐理由:这篇论文用老师模型和基础模型的差值做蒸馏信号,比直接模仿老师更强,数学代码推理都更好,训练时间还短。原文稍后读已读值得跟进有用关注 OPD²
09:21官方账号arXiv cs.LG@Saptarshi Roy, Debepsita Mukherjee, Pratik Patil该论文研究了整流流(Rectified Flow)的最优自蒸馏问题,其中学生模型在真实RF速度和教师速度的混合数据上训练,理论证明可提升教师模型。对于带有岭正则化的线性RF,作者推导了精确的仿射路径恒等式,并给出了最优混合系数的闭式解,正混合修正欠正则化教师,负混合修正过正则化教师。同时提出了一次广义交叉验证(GCV)方法,避免网格搜索和重复重拟合。实验在高斯模型、高斯混合和图像数据上验证,该方法在速度风险、模态恢复和有限步生成上均优于教师和纯蒸馏。论文Rectified FlowSelf-DistillationLinear Probing推荐理由:这篇论文用严格理论证明和实验验证了整流流中自蒸馏的改进方法,想了解生成模型自训练优化的可以看看。原文稍后读已读值得跟进有用关注 Rectified Flow
02:04Jerry Liu@jerryjliu0精选Jerry Liu指出,对于任何给定任务,总可以将通用模型或代理框架蒸馏为专用模型或工作流,从而获得更高准确率和更低成本。领域越窄,优化空间越大,还可以提供比聊天界面更针对性的用户体验。随着代理自我改进能力增强,未来可以通过定义顶层目标和评估标准自动完成蒸馏,无需人工编码。技巧Jerry Liu智能体蒸馏推荐理由:Jerry Liu分享了把通用模型变成专用模型的方法,能省成本又提精度,还说了未来可以自动搞。原文稍后读已读值得跟进有用关注 Jerry Liu
01:46Suhail@Suhail一位AI研究者引用多位可信研究人员的话,认为对中国实验室“蒸馏”行为的担忧被过度夸大。推文指出,蒸馏需要logits,而批评者并未展示自己成功蒸馏的结果。作者认为,所谓“叙事违规”可能只是中国AI研究确实优秀的表现。行业蒸馏中国AI实验室AI安全推荐理由:别再信中国蒸馏了,人家可能本来就很强。这篇推文让你看清实验室的真实水平。原文稍后读已读值得跟进有用关注 蒸馏
23:08向阳乔木@vista8部分国产大模型API近期限制了temperature参数的调节范围,引发开发者讨论。有观点认为这可能是为了防止模型蒸馏,即通过固定temperature使输出更确定,增加蒸馏难度。但官方尚未明确原因。该限制影响了开发者对模型输出多样性的控制。行业国产模型APItemperature推荐理由:想调大模型temperature但发现被锁死了?看看这个讨论,可能是为了防止蒸馏,有意思。原文稍后读已读值得跟进有用关注 国产模型
09:46官方一手arXiv: DeepSeek@Vinay Kumar Chaganti该论文研究将8B推理教师模型deepseek-r1:8b蒸馏为0.6B学生模型Qwen3-0.6B(使用QLoRA,三个随机种子)。学生模型每篇处理时间0.8秒,教师模型需39秒,速度提升约48倍。在摘要质量上,学生模型恢复教师与基线之间58%的差距,比约束解码高16.8分,比少样本提示高4.9分。相同规模的非推理教师(非deepseek-r1)训练的学生表现不优于未经微调的基线,表明摘要提升源于教师的推理特性。推理教师传递写作质量,托管管线传递标签多样性;在22篇短源文章中,指令教师的学生更忠实(74 vs 55篇忠实),而推理系学生易编造内容。论文deepseek-r1Qwen3-0.6BQLoRA推荐理由:这篇论文对比了蒸馏不同教师模型的效果,发现推理型教师擅长教写作质量,托管型管线擅长教标签多样性,对选哪种蒸馏方案做端侧部署很有参考价值。原文稍后读已读值得跟进有用关注 deepseek-r1
11:11官方账号arXiv cs.AI@Yuanda Xu, Zhengze Zhou, Kayhan Behdin, Jelena Markovic-Voronov, Hejian Sang, Xiaomin Li, Wenhui Zhu, Xinchen Du, Aida Rahmattalabi, Ran He, Sen Na, Zhipeng Wang, Alborz GeramifardTREK提出一种分阶段训练方法,解决GRPO在困难提示上的探索停滞问题。该方法先用蒸馏将教师模型(如DeepSeek-V4)的已验证轨迹拉入学生模型支持域,再返回标准GRPO精炼。在数学推理中,TREK将Qwen3-8B在AIME 2025上从36.9提升至40.3,在AIME 2024上从47.9提升至51.1(avg@16)。在代理任务上,ALFWorld成功率从75.8提高到82.8,ScienceWorld从12.5提高到26.7。TREK的泛化优势在于仅需已验证输出轨迹,可兼容黑盒或白盒教师。论文TREKGRPO蒸馏推荐理由:这篇论文给出了一个实用技巧:用蒸馏扩展支持域再强化学习,在数学和代理任务上都涨点明显,而且不需要改动模型结构。原文稍后读已读值得跟进有用关注 TREK
13:46官方账号arXiv cs.AI@Xinlei Yu, Gen Li, Qingyi Si, Guibin Zhang, Yuqi Xu, Congcong Wang, Shuai Dong, Kaiwen Tuo, Xiangyu Zeng, Kaituo Feng, Qunzhong Wang, Yang Shi, Xiaobin Hu, Xiangyu Yue, Jiaqi Wang, Shuicheng Yan精选DOPD是一种advantage-aware的双重蒸馏范式,通过动态路由令牌级监督信号,在特权教师和特权学生策略之间进行分配,缓解了传统同策略蒸馏中的特权幻觉问题。实验在LLM(如GPT-2)和VLM(如CLIP)上验证,结果显示DOPD在稳定性和鲁棒性等指标上持续优于Vanilla OPD。论文DOPDLLMVLM推荐理由:这篇论文提出了一种新蒸馏方法DOPD,通过分令牌监督解决特权幻觉,在LLM和VLM上效果都更好,适合关注模型压缩的研究者。原文稍后读已读值得跟进有用关注 DOPD
10:05官方账号arXiv cs.LG@Chen Wang, Peiran Yun, Pan Xie, Ke Deng现有扩散模型和连续流生成模型的确定性采样可视为求解学习到的ODE动力学,但准确离散化通常需要多步。论文指出轨迹匹配范式存在理论局限:两个学生模型可达到相同轨迹匹配损失却诱导不同端点边际分布,影响生成质量。为克服这一局限,提出边际对齐正则化器,通过追踪学生模型ODE沿线的对数密度变化并利用冻结教师模型评分来惩罚学生与教师边际分布的差异,无需辅助网络或对抗优化。该框架统一适用于原始再流和分段再流等再流族,并证明局部边际对齐通过 telescoping 总变差界控制最终时刻分布差异。在基准骨干网络上的实验验证了该方法在少步生成中的有效性。论文Reflow扩散模型蒸馏推荐理由:这篇论文发现了再流蒸馏的隐藏问题——轨迹匹配可能不够,还提出了一个简单有效的边际对齐正则化,不用额外网络就能提升少步生成质量,值得做扩散加速的人看看。原文稍后读已读值得跟进有用关注 Reflow
23:38IT之家(博客/媒体)Meta 于 5 月出台内部规范,限制其 AI 工程部门的工程师使用 Anthropic 的 Claude Code 与 OpenAI 的 Codex。该决定旨在防止蒸馏行为,即借助竞品模型的输出来训练自家模型,这违反了 Claude 和 Codex 的用户协议。Meta 警告称,若竞品输出渗入训练数据,可能引发与合作企业的严重纠纷。行业MetaClaudeCodex10 个信源在谈事件专题推荐理由:Meta怕工程师用Claude和Codex偷偷训练自家模型,直接封了,挺直接的做法。原文稍后读已读值得跟进有用关注 Meta
10:47官方账号arXiv cs.LG@Wei Zhou, Xiongwei Zhu, Zelin Xu, Bo Dong, Lixue Gong, Yongyuan Liang, Meng Chu, Leigang Qu, Lingdong Kong, Wei Liu, Tat-Seng Chua针对文本到图像(T2I)、局部编辑和全局编辑等能力难以统一且相互冲突的问题,论文提出DanceOPD框架。该框架基于流匹配模型,采用策略生成场蒸馏,将每个样本路由至对应能力场,并查询低噪声的学生诱导状态,用速度MSE目标训练。在T2I、编辑、真实性场吸收和CFG吸收等实验上,DanceOPD改善了多能力组合效果,增强了目标能力同时保持基准生成质量。论文DanceOPD流匹配模型图像生成推荐理由:这篇论文用DanceOPD把T2I、局部编辑和全局编辑统一到一个模型里,解决了相互干扰的问题,效果显著提升。原文稍后读已读值得跟进有用关注 DanceOPD
18:15shao__meng@shao__meng73°Anthropic指控阿里巴巴通过近25000个虚假账户大规模获取其Claude模型能力进行蒸馏。这一数字超过Anthropic此前指控DeepSeek、MiniMax和Kimi的数量总和。事件凸显了AI模型API被滥用于竞争对手蒸馏的风险。行业AnthropicClaudeAlibaba10 个信源在谈事件专题推荐理由:朋友,Anthropic说阿里用了2.5万个假账号偷偷薅Claude的羊毛,比之前告DeepSeek他们加一起还多,这操作挺猛。原文稍后读已读值得跟进有用关注 Anthropic
10:45官方账号arXiv cs.LG@Ali Behrouz, Farnoosh Hashemi, Vahab Mirrokni精选受人类学习过程启发,研究者提出了一种名为“睡眠”的范式,让大语言模型能够持续学习,将短期脆弱记忆蒸馏为稳定的长期知识。该范式包含两个阶段:记忆巩固(通过知识播种将小模型记忆蒸馏到大模型)和梦境(模型通过强化学习生成合成数据自我改进)。实验证明,该方法在长时任务、持续学习、知识整合和少样本泛化上效果显著。这项工作解决了LLM无法持续更新长期参数的核心痛点,为模型终身学习提供了新思路。论文持续学习记忆巩固蒸馏推荐理由:做持续学习和模型终身优化的研究者值得关注——它用“睡眠”机制解决了LLM记忆遗忘问题,比传统微调更接近人类学习方式,看完会有启发。原文稍后读已读值得跟进有用关注 持续学习
10:23官方账号arXiv cs.AI@Bishwas Mandal, Shmuel Berman, Akshay Vegesna, Samip Dahal随着计算资源增长快于高质量文本供给,多轮训练成为新常态,但单模型在几轮后即饱和。论文提出“超时代预训练”(q0),将多轮预算转化为多样模型群体并聚合预测,达到比单模型更低的验证损失。q0包含三个核心原语:反相关学习率与权重衰减的循环调度、链式蒸馏、以及基于学习先验的模型选择与加权。在1.8B参数模型、100M FineWeb tokens上,q0仅用约56轮就匹配了256轮强集成基线,效率提升约4.6倍,在Slowrun设置下累积数据效率达12.9倍。该方法还给出了不同预算下的最优分配策略,从单轮到最大预算均可适用。论文预训练数据效率模型集成推荐理由:多轮训练效率瓶颈是当前大模型预训练的痛点,q0用群体模型替代单模型精炼,做预训练或数据效率优化的研究者可以直接复现并应用到自己的训练流程中。原文稍后读已读值得跟进有用关注 预训练
12:34orange.ai@oran_ge有投资人爆料称 Anthropic 的 Claude 模型蒸馏了中国模型 Kimi 和 Qwen,而非此前猜测的 Cursor。该说法最初在私下交流中传出,如今似乎有更多证据浮出水面。事件折射出 AI 行业模型蒸馏现象的普遍性与真假难辨的现状。作者调侃称责任全在崔茂。行业AnthropicClaude蒸馏10 个信源在谈事件专题推荐理由:模型蒸馏争议触及 AI 行业的核心竞争与伦理问题,关注大模型生态的从业者和投资人值得一读,看完会对行业潜规则有新认识。原文稍后读已读值得跟进有用关注 Anthropic
13:27IT之家(博客/媒体)72°Anthropic 今日发布旗舰大模型 Claude Opus 4.8,并宣布完成 650 亿美元融资,估值逼近万亿美元。然而,模型上线后不久,用户通过 API 测试发现,Opus 4.8 在回答身份问题时自称是阿里通义千问或 DeepSeek,引发“蒸馏”争议。Anthropic 此前曾指责中国公司进行“工业规模的蒸馏攻击”,但自身模型却出现类似问题,被指“双标”。新模型在编码、推理等方面有提升,并增加了“思考强度控制”功能。行业Claude Opus 4.8蒸馏Anthropic10 个信源在谈事件专题推荐理由:Anthropic 一边指责中国公司蒸馏,一边自己的模型却自称是千问和 DeepSeek,做 AI 模型训练或关注行业伦理的开发者值得看看这场“双标”闹剧。原文稍后读已读值得跟进有用关注 Claude Opus 4.8
12:24Yangyi@Yangyixxxx从今年年初开始,由于大模型蒸馏技术的过度使用,AI模型出现了自言自语的现象。蒸馏是指用大型模型训练小型模型的过程,但频繁的蒸馏可能导致模型学习到一些无意义的内部对话模式。这种现象可能影响模型的输出质量和可靠性,引发对AI训练方法的反思。目前该问题已引起研究者的关注,需要进一步探索蒸馏的合理边界。AI模型大模型蒸馏模型行为推荐理由:做模型蒸馏或训练AI的团队值得关注——过度蒸馏可能导致模型行为异常,影响实际部署效果,建议点开了解具体表现和潜在风险。原文稍后读已读值得跟进有用关注 大模型
10:57官方账号arXiv cs.AI@Jesse Bettencourt, Xindi Wu, Matan Atzmon, James Lucas, Jonathan Lorraine精选预训练扩散模型常作为冻结教师模型用于下游任务(如文本到 3D、单步蒸馏、数据归因),但这些任务依赖蒙特卡洛期望估计梯度,方差大且计算成本高。本文提出 CARV 框架,通过分层蒙特卡洛估计器,在扩散噪声重采样上摊销昂贵上游计算,结合时间步重要性采样和分层逆 CDF 构造,有效降低方差。在文本到 3D 蒸馏和归因实验中,CARV 实现 2-3 倍有效计算加速,且不改变目标函数;在单步蒸馏中方差降低一个数量级,但下游 FID 无改善,表明此时方差已非瓶颈。该工作为扩散模型下游应用提供了高效方差缩减方案。论文扩散模型方差缩减蒙特卡洛估计推荐理由:做扩散模型下游应用(如文本到 3D、蒸馏)的团队,如果被梯度方差和计算成本困扰,CARV 的 2-3 倍加速值得直接尝试。原文稍后读已读值得跟进有用关注 扩散模型
11:39官方账号arXiv cs.LG@Thien Le, Melanie Weber精选本文研究了在组合优化任务中,如何将大型模型的知识蒸馏到更小、更高效的模型。作者假设目标模型是图神经网络,其架构与任务的动态规划算法对齐。基于决策树蒸馏的最新理论分析,论文证明了当源模型足够丰富(通过线性表示假设形式化)时,蒸馏问题可以在动态规划转移函数的复杂度参数内高效解决。该工作为算法对齐框架下的成功蒸馏提供了严格充分条件。论文蒸馏组合优化图神经网络推荐理由:组合优化任务通常依赖大型模型,但部署成本高。本文给出了理论保证,让做图神经网络和算法对齐的开发者知道何时可以安全地蒸馏到小模型,值得关注。原文稍后读已读值得跟进有用关注 蒸馏
11:01官方账号arXiv cs.LG@Grigory Bartosh, David Ruhe, Emiel Hoogeboom, Jonathan Heek, Thomas Mensink, Tim Salimans精选Dual-Rate Diffusion 提出了一种新的扩散模型加速方法,通过交错执行一个稀疏更新的重上下文编码器和一个轻量去噪模型来降低推理成本。重编码器每几步提取一次高维特征,轻量模型则在每一步复用这些特征进行高效去噪。在 ImageNet 基准上,该方法在保持生成质量的同时将计算成本降低 2-4 倍。此外,该方法与蒸馏技术(如 Moment Matching Distillation)兼容,可进一步加速少步生成。论文扩散模型推理加速ImageNet推荐理由:扩散模型推理慢是落地痛点,Dual-Rate Diffusion 用轻量网络复用特征,做图像生成的团队可以直接拿来加速现有模型,效果不打折。原文稍后读已读值得跟进有用关注 扩散模型
00:24AK@_akhaliq精选AnyFlow 是一种新型视频扩散模型,支持任意步长的生成,通过策略流图蒸馏技术提升效率。该方法解决了传统视频扩散模型在步长选择上的限制,允许用户根据需求灵活调整生成速度和质量。关键创新在于在线策略流图蒸馏,使模型在训练和推理时都能适应不同步长。这项研究有望降低视频生成的计算成本,同时保持高质量输出。论文视频生成扩散模型蒸馏推荐理由:视频生成开发者终于有了灵活控制步长的方案——AnyFlow 让生成速度和质量可调,做视频 AI 的团队值得关注,能显著降低推理成本。原文稍后读已读值得跟进有用关注 视频生成
22:16AK@_akhaliq该研究提出了一种连续时间分布匹配方法,用于改进扩散模型的蒸馏效率。传统扩散模型需要多步采样,而该方法通过优化连续时间分布匹配损失,实现了仅需几步即可生成高质量样本。实验表明,该方法在图像生成任务上显著加速推理,同时保持生成质量,对实时应用场景具有重要意义。论文提供了理论分析和实验结果。论文扩散模型蒸馏图像生成推荐理由:该方法为扩散模型加速推理提供了新思路,可能降低生成式AI的部署成本,值得关注后续应用拓展。原文稍后读已读值得跟进有用关注 扩散模型