#后训练
AI工程师大会正在播后训练专场,9场演讲聊透奖励怎么塑造模型,有Hugging Face和MiniMax的人,想学训练别错过。
AI Engineer 大会的后训练专场正在直播,讲训练怎么决定模型行为,TypeSafe、Hugging Face、MiniMax 都有人讲。
这篇论文展示了如何在华为Ascend芯片上高效后训练万亿参数模型,并且通过运筹学专用微调,在特定任务上超越了GPT-5.4-Mini。
Harvey在招人组建自己的模型训练团队,要把法律AI做到模型层,已有数千GPU和独特后训练数据,能提升开源模型到前沿水平,适合想做大型模型训练的AI研究员。
Fireworks AI 和 LangChain 搞了个新路子:从你的 traces 里自动生成训练数据,然后持续后训练,让你真正掌控自己的 AI 和数据。
做 LLM 后训练的团队终于有了 vLLM 生态内的 RL 框架选择——vime 简单稳定,直接可用,想尝试不同 RL 框架的开发者值得关注。
做模型对齐和偏好优化的团队终于有了数据层面的诊断工具——不用再盲目调奖励权重,直接看数据教了模型什么。做安全对齐或模型人格定制的开发者建议点开,能省下大量试错时间。
做合成数据后训练管线的团队会感兴趣——这篇论文用实验证明了来源证据门控和适应性恢复策略能显著提升数据质量,比简单重采样更高效,建议做数据筛选的开发者点开看看具体方法。
法律 AI 团队终于有了可审计、可定制的开放模型选择——Nemotron 3 Super 在复杂法律任务上追平闭源模型,做法律科技或合规自动化的开发者可以直接关注这个开源方案。
Orbit 让万亿参数模型的后训练不再依赖大规模集群,做 RL 微调或大模型优化的团队可以直接在单节点上跑 DeepSeek-V4,建议试试这个开源方案。
做LLM后训练数据工程的团队终于有了从模型内部获取信号的方法——SAERL用SAE直接指导数据排序和过滤,比依赖外部信号更高效,做RL训练优化的开发者值得一试。
医疗 AI 开发者终于有了一个能模拟真实临床数据流的训练环境——BioStack 把杂乱病历和长期结果变成可迭代的后训练循环,做医疗 AI 的团队可以直接用它来提升模型可靠性。
做 LLM 微调的研究者或工程师,如果受够了黑盒框架的调试痛苦,torchtune 的模块化设计和 PyTorch 原生体验值得一试,能让你在保持性能的同时自由定制训练流程。