#SFT
共 24 条 · 7 天 4 条 · 30 天 8 条
信息流里打上「SFT」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月7日
10月6日
Off-Policy Merging 持续学习方法超越 On-Policy 自蒸馏
做模型持续训练的必看:不用贵的 on-policy 采样,靠 grafting 三步就能加新能力还不忘旧本事,比 SFT 和 OPSD 都强。
10月5日
论文19:34
LESSER:用输出层梯度做后训练数据选择,成本降低最多9.7倍做微调的朋友可以看看:LESSER 只用输出层梯度就能做数据选择,SFT 成本砍到近十分之一,效果不掉,还提供了 drop-in 接口。
10月2日
9月29日
9月25日
9月13日
9月9日
9月7日
9月2日
8月31日
8月28日
8月19日
7月22日
MiniMax M3 模型在 Fireworks 平台开放训练
想 Fine-tune MiniMax M3 的话,Fireworks 现在直接支持 LoRA 和 DPO,还能自定义 RL 训练,省事不少。
7月21日
精读 MiniMind 源码,从具体实现搞懂大模型技术体系
想用代码搞懂大模型训练全流程?这个教程把 MiniMind 的源码一行行讲透,从 Tokenizer 到 GRPO 都有,还附赠量化、RLHF 等进阶知识。
6月29日
6月25日
Fireworks 支持微调开源编码模型 GLM 5.2(SFT/DPO/RL)
想用最强开源编码模型但通用版不顺手?Fireworks 让你微调 GLM 5.2,SFT/DPO/RL 全包,训练完直接上线,不用折腾。
6月19日
训练、检索还是混合?安大略住宅租赁法引用的四臂对比
这篇论文用Qwen2.5-7B做了个四路对比,发现微调加检索混合方案在法条引用上精确匹配0.481还零幻觉,比纯微调或纯检索都强,而且用轻量bge-small就够用。
6月18日
6月16日
论文10:49
Safe Trigger: 触发大推理模型的潜在安全意识实现自适应安全这篇论文发现LRM自己就能识别风险,用SFT+DPO触发安全分析,让DeepSeek-R1的越狱成功率高降36%,还不用外部数据,挺实用的。
6月1日
论文10:36
Graph-LLaDA:扩散模型在图到文本生成中优先解码实体,SFT反而破坏策略这篇论文揭示了扩散模型在图到文本任务中的独特解码机制,做结构化文本生成或知识图谱相关工作的开发者值得关注,尤其是SFT反而有害的发现可能改变你的微调策略。
5月16日