White Circle 推出 Halo 框架:开源模型后训练吞吐量达 TRL 的 2.8 倍
想自己微调模型可以看看 White Circle 的 Halo,吞吐量达 TRL 的 2.8 倍、更省内存,还不用转格式,已开源。
想自己微调模型可以看看 White Circle 的 Halo,吞吐量达 TRL 的 2.8 倍、更省内存,还不用转格式,已开源。
Hugging Face 新出的 TRL 库版本,能直接训练百万级 token 的模型,比之前版本更强大,适合做长文本任务。
想微调LLM选框架?这篇对比了Unsloth、Axolotl、TRL和LLaMA-Factory,讲清了各自的速度、显存和多GPU表现,帮你快速决策。
他们提出了 TRL,让强模型和弱模型组队推理,强模型学会写弱模型能看懂的推理过程。训练 Qwen3-4B 后,单打能力不降,协作能力更强。
做分布式 RL 训练的团队终于可以告别昂贵的带宽和复杂的基础设施——只需 HTTPS 和一个 Bucket,就能实现跨区域的推理集群同步,建议搞 RL 的开发者直接看原文。