把一份文档直接编译成 LoRA 权重,284B 的 DeepSeek v4 Flash 也能用,top-1 准确率从 63.4% 拉到 84.9%
#微调
论文教你看 agent 失败原因来决定改运行时框架还是微调模型,Qwen3.5 上从 0.16 拉到 0.30,做 agent 的都该看看这套诊断方法。
一篇 MoE 训练论文:把固定 top-k 换成在 k 附近随机采样,Qwen3-30B-A3B 微调能多拿 2 分,推理成本不变。
Nvidia 出的 VERA 方法挺实在:训练模型和改技能文件交替来,逐步打分定位哪一步出错,9B 智能体从 43.3 提到 69.1。
小模型靠数据逆袭的实测案例:Whisper Medium 微调后孟加拉语错字率从 85% 掉到 7.65%,做低资源语言 ASR 的可以参考。
训练完 RL 模型想追查是哪条数据教会它某个行为?这篇直接证明现有归因方法大多被梯度大小和流畅度这类干扰项骗了,还给了套评测清单。
微调 VLM 的朋友看这个:不同能力峰值时间不同,挑 checkpoint 的标准可能让你丢掉可迁移能力,SSR 方法能改善 name-free 检索。
训练偏好模型的老问题:DPO 训到后面梯度就没劲了。这篇把 sigmoid 因子当成可调信号来动态控制,三个基准上都比 DPO 强,搞对齐训练的可以看看实现思路。
DeepSpeed 常被当成只做 ZeRO 显存优化,这场演讲会讲它的自动张量、序列、专家并行,还带基准数据,做大模型训练的可以看看。
给医学问答做了个按问题动态分配 LoRA 秩的微调方法,在 Qwen3-8B 上比 LoRA r16 高了 1 个多百分点,专科越多优势越大,做医疗方向微调的可以看看。
做模型持续训练的必看:不用贵的 on-policy 采样,靠 grafting 三步就能加新能力还不忘旧本事,比 SFT 和 OPSD 都强。
训练终端智能体的朋友看这篇:监督窗口选 12K 反而比 16K 好,还能省 30% 训练时间,作者给的选择性精调方法直接可用。
这篇论文给微调遗忘问题做了套几何理论,还造了个按单元的投影器,在 OPT-1.3b 上把 Adam-NSCL 的遗忘压到最多 4.3 倍更低,做持续学习的朋友可以看看。
上海AI实验室的SkillGym把技能文件变成沙箱任务再微调,Qwen3.5-35B-A3B在Terminal-Bench 2.1涨了19个点,连不带技能文件都更强了。
Fireworks 现在能直接微调 DeepSeek V4.1 Flash 了,想做编程智能体或工具调用的可以看看,托管训练省不少事。
Alammar 那套图解 Transformer 的讲法出了本 12 章的书,近 300 张图,还专门讲多数 LLM 书不写的嵌入和 RAG,代码开源。
做微调的朋友可以看看:LESSER 只用输出层梯度就能做数据选择,SFT 成本砍到近十分之一,效果不掉,还提供了 drop-in 接口。