#微调
AgileRL 把 Nemotron 3.5 Lightning 放到 Arena 上微调,6 小时就能超过 Claude Sonnet 5,训练完权重还归你。
Reasonable微调了NVIDIA的30B开源模型,形式化证明通过率胜过50倍大的模型,生成还更快。博客还拆解了模型怎么作弊。
Fastino跟NVIDIA合作,用自动微调Agent搞出了金融和医疗两个开源模型,FinQA涨了43个点,Apache 2.0随便用。
想微调 Cohere 的视觉模型 North Micro Vision?现在用 Axolotl 就能跑,不用自己买显卡,直接上手试试吧。
CodeRabbit用不到100美元和三小时微调了NVIDIA新模型,比原来的GPT级模型准确率高4%,推理成本还省一半,想省钱的可以看看。
NVIDIA 的 Nemotron 3.5 Lightning 微调后,在 6 项任务上超过 4 个同类 MoE 模型拿了第一。想知道怎么调出来的,可以看这篇。
想自己微调模型又没大显卡?这份教程教你在 16GB 显存上跑完 SFT、DPO、GRPO 全流程,用的还是 AllenAI 的开源框架。
Fireworks出了Training Skill,装一行让Claude Code帮你跑微调,选方法、验数据、估成本都包了。
这篇论文提出了Omega-S,一个只需权重矩阵的正则项,能让微调少忘旧知识,Llama-3-8B上保留率从62.9%提到84.1%,开销只增加4%。
这篇论文把教学策略拆成13种,用260段真实对话和3.2万条标注训练出TACTutor,在78个测试场景比基座涨了20%,盲测还赢过商业模型。
Fireworks 用不到 10 美元教会你微调 Qwen3-Embedding-8B,三个实验最高 nDCG 涨 36%,做 RAG 的值得看。
MoE-LoRA 不用固定 k 值了,CARE 根据 token 难度自动选专家,在 LLaMA 和 Qwen 上效率更高,还能顺手做 OOD 检测。
Fireworks给DeepSeek V4 Flash加了全套微调,监督、偏好、RL都能用,专为编码场景设计,快去试试。
想微调LLM选框架?这篇对比了Unsloth、Axolotl、TRL和LLaMA-Factory,讲清了各自的速度、显存和多GPU表现,帮你快速决策。
想 Fine-tune MiniMax M3 的话,Fireworks 现在直接支持 LoRA 和 DPO,还能自定义 RL 训练,省事不少。
这篇论文系统测试了用SWE-trajectory数据微调Qwen2.5-Coder时,不同轨迹筛选方法的效果,发现数据质量和数量在不同规模下影响不同,值得参考。