#微调
一篇理论味很浓的 checkpoint 合并论文:证明信息论下界,给出达到 O(h^3) 最优误差的合并系数,还在 SmolLM3-3B 上做了实测对比。
Qwen3.5-4B 只靠写复盘解释做微调,不用奖励模型就在 SWE-bench 上跑赢 GRPO,做智能体训练的可以看看这套 ROFT 流程。
Claude Code 作者本尊发话:别折腾微调和小模型,脚手架只提 10%-20%,下一代模型一发全白干,直接等新模型就行。
Meta 这次没走 self-distillation 老路,用 DCE 加 SRCL 就把 Qwen3-8B 从 30% 拉到 66%,方法细节可以看看。
一篇讲 LoRA 技能怎么叠加不互相干扰的论文,思路是把新适配器设计成只读旧技能的输入,合并进基座权重还零推理开销,SuperGLUE 比现有方法高了 20 多分。
把技能文档变成 2756 个训练环境直接练进模型权重,微调后的 Qwen3.5-35B-A3B 在终端基准上超过了 Claude Sonnet 4.6,思路很新颖。
LangChain 一口气发了五个更新,Deep Agents 到 v0.8,还能拿智能体轨迹数据做微调,做 Agent 开发的可以看看。
Hugging Face 开源了 5000 个可验证 RL 任务,专练小模型的代码和数据科学能力,环境和训练脚本全给你,想自己跑 RL 的可以看看。
用 Fireworks 和 HUD 这套流程,你不用自己搭 RL 训练基础设施,定义一次任务就能边训边评,自己微调模型的可以看看。
把人类技能攻略变成训练环境喂给模型,微调后 35B 小模型在 SkillsBench 上跑赢了 Claude Sonnet 4.6,方法思路挺有意思。
LangChain 把 LangSmith 里的真实运行轨迹直接变成微调数据,用 Baseten 和 Fireworks AI 训开源模型,做智能体的朋友可以抄这套流程。
LangChain 出了个 smithtune CLI,直接拿 LangSmith traces 微调模型,托管在 Fireworks 上,一个命令搞定不用自己搭训练环境。
LangChain 出了个 smithtune CLI,能直接拿 LangSmith 里存的 traces 数据微调小模型,省 token 钱还降延迟,已开放公测。
Together AI 手把手教你花 17 美元、25 分钟,基于 Qwen3.5 4B 微调出一个小模型,教程免费,想从零动手训模型的可以照着跑一遍。
Gemma 团队在 Kaggle 上办了个比赛,把开源模型微调成编程智能体,跑在你自己的电脑上,奖金池 10 万美元,可以试试。
Together 开源了一个基于 Qwen3.5 4B 的分类器,训练只花了 $17,还把数据配方和微调教程一起放出来了。
LangChain 一次发了五个更新,从 LangSmith 微调到托管版 Deep Agents 0.8,做智能体开发的朋友可以看看官方博客。
TogetherAI 把 Qwen3.5 4B 微调成分类器,17 美元、25 分钟就能复现,数据和代码全开源,适合想上手微调的人照着跑一遍。
这篇论文造了个很较真的基准:不看智能体能不能把指标刷上去,只看它交付的模型到底行不行,连"训练了但没学到东西"这种静默失败都能抓住,四个前沿模型全被拉出来和人类工程师对比。
把蛋白质注释当文本生成任务来解,用 QLoRA 微调 3B 的 Ministral 3,还让 GPT 当策展人打分,思路挺新鲜。
给岗位匹配选嵌入模型的看这篇:EmbeddingGemma 微调版对决 MPNet,RRF 混合检索评测细节给得很足。
想自己微调模型可以看看 White Circle 的 Halo,吞吐量达 TRL 的 2.8 倍、更省内存,还不用转格式,已开源。