一篇教代码智能体"怎么从自己的纠错里学到更多"的论文,在 DeepSeek/CodeARC 上把 Pass@1 从 15.0% 拉到 20.4%,做法挺有意思。
#自蒸馏
Apple 的论文,讲怎么在多个交互环境里同时训练一个 LLM 智能体,用 rubric 评分挑数据,全对全错的样本也能靠自蒸馏利用起来。
只拿 200 道题微调,就让 LLaDA-8B-Instruct 的数学和代码成绩跑赢 SFT 和扩散 RL,方法还挺省算力,做扩散模型训练的可以看看。
Perplexity 分享了怎么让 Computer 模型从自己的错误里学习,A/B 测试里工具调用失败率降了 21.2%,做法挺值得看看的。
Perplexity 公开了他们训练 Computer 智能体的后训练细节,用 RFT 加自蒸馏纠正错误工具调用,实测失败率降了 21%,做 agent 的话值得看看他们怎么用真实用户会话。
DualOPSD在模型规模和性能上都有显著提升,是自蒸馏领域的一个新突破。与OPSD相比,DualOPSD在多个基准测试中取得了更好的成绩,值得关注。
音乐Transformer换个调就认不出旋律,EMT用自蒸馏让它真正学到结构,生成效果还比SOTA好。
这篇论文分析了评分RL中信号丢失的普遍问题(57%样本受影响),并提出CriPO自蒸馏方法,在医学和科学基准上效果更好且训练更快。
这篇论文把OPSD训练时模型思维崩溃的原因和解决方法都讲清楚了,AD-OPSD在数学题上能提4个点,做推理优化的值得看看。
做 LLM 推理优化的研究者可以关注——SGSD 用技能库替代参考答案作为先验,降低了蒸馏对标注数据的依赖,数学推理场景效果显著,值得在自蒸馏框架中尝试。
部署MoE模型的团队终于可以省下一半专家计算——ZEDA让Qwen3和GLM等模型自动跳过简单token,推理速度提升20%且几乎不掉精度,做模型推理优化的开发者可以直接参考论文方法。
多模态模型开发者常头疼的“看不清细节”问题,Vision-OPD用自蒸馏给出了一个轻量解法——不用外部模型或标注,直接让模型学会“自动放大”关键区域。做细粒度视觉理解或MLLM优化的团队值得关注。
如果你在做LLM推理优化或自蒸馏训练,OGLS-SD解决了教师-学生分布不匹配的痛点,用结果奖励校准logits的思路直接可复用,值得仔细看方法细节。
该研究通过细粒度分析挑战了蒸馏实践中默认假设,为选择教师模型和蒸馏配置提供了理论指导,对大规模推理模型训练具有实际参考价值。