7月22日
08:52
08:52Fireworks AI@FireworksAI_HQ
精选
MiniMax M3 模型现已可在 Fireworks 上进行训练。用户可通过托管 LoRA SFT 和 DPO 进行标准微调。Fireworks 还提供 Training API,支持自定义 SFT、DPO 和 RL 训练循环,包含检查点、滚动推理和适配器热加载功能。
推荐理由:想 Fine-tune MiniMax M3 的话,Fireworks 现在直接支持 LoRA 和 DPO,还能自定义 RL 训练,省事不少。
7月21日
18:37
18:37Geek@geekbb
精选
该教程逐行解析 MiniMind 源码,涵盖 Tokenizer、模型结构、预训练、SFT、DPO、PPO、GRPO 共 10 章内容,每章标注对应源码文件和函数名。附录17篇进阶文章补充量化、投机解码、RLHF 等 MiniMind 未涉及的主题。适合希望从代码层面理解大模型全流程的读者。

推荐理由:想用代码搞懂大模型训练全流程?这个教程把 MiniMind 的源码一行行讲透,从 Tokenizer 到 GRPO 都有,还附赠量化、RLHF 等进阶知识。
6月29日
19:47
19:47eric zakariasson@ericzakariasson
73°
Elon Musk在推文中透露,Cursor团队为v9模型的SFT和RL训练做出了重要的工程贡献。当前1.5T参数量的模型已通过补充训练加入Cursor数据。而两周前开始的2T参数量训练在数据范围和规模上大幅改进,训练配方也获得多项升级,预计7月底完成,8月发布。
事件专题

推荐理由:Elon Musk说他们和Cursor团队合作训练v9模型,2T参数量的版本数据更全,8月就能见到,值得关注。
6月25日
6月19日
09:53
09:53官方账号arXiv cs.LG@Ali Asaria, Tony Salomone, Deep Gandhi
论文使用Qwen2.5-7B-Instruct对比了零样本、仅SFT、仅RAG和SFT+RAG混合四种方法在安大略住宅租赁法条文引用上的效果。混合方法以0.481精确匹配(节+条)取得最高分,且将幻觉降至零。SFT提升了高召回候选集中条款选择的鲁棒性,而仅用bge-small嵌入就超越了更大专用检索模型。扩大训练集未带来提升,0.70目标尚未达到。
推荐理由:这篇论文用Qwen2.5-7B做了个四路对比,发现微调加检索混合方案在法条引用上精确匹配0.481还零幻觉,比纯微调或纯检索都强,而且用轻量bge-small就够用。