PrimeIntellect发布 prime-rl 0.6.0:基于vLLM的万亿级Agentic RL训练
PrimeIntellect 用 vLLM 把 agentic RL 搞到万亿参数级了,FP8 加专家并行,28 个 H200 节点跑 131k 序列,每步不到 5 分钟,训练 GLM-5 做 SWE 任务。
PrimeIntellect 用 vLLM 把 agentic RL 搞到万亿参数级了,FP8 加专家并行,28 个 H200 节点跑 131k 序列,每步不到 5 分钟,训练 GLM-5 做 SWE 任务。
Prime Intellect 新开源的 prime-rl 0.6.0,专为训练万亿参数 MoE 模型的强化学习设计。他们在 SWE 任务上用 GLM-5 跑到 131k 序列长度,速度还很快,想了解大规模 RL 训练优化的可以看看。