主要来源marktechpost
查看原文事件专题 · 官方一手
Prime Intellect 发布 prime-rl 0.6.0,用于训练万亿参数 MoE 模型的智能体 RL
Prime Intellect 发布了 prime-rl 0.6.0,这是一个用于异步强化学习的开源框架,支持训练万亿参数规模的 Mixture-of-Experts (MoE) 模型。该框架在 SWE 编程任务上训练了 GLM-5 模型,序列长度达到 131k,单步训练时间低于 5 分钟,并实现了 256 个并行 rollout。所有这些性能建立在 28 个 NVIDIA H200 节点上,优化技术包括 FP8 推理、Wide Expert Parallelism、预填充/解码分离以及 3-D 并行(FSDP、EP、CP)。
当前结论
Prime Intellect 新开源的 prime-rl 0.6.0,专为训练万亿参数 MoE 模型的强化学习设计。他们在 SWE 任务上用 GLM-5 跑到 131k 序列长度,速度还很快,想了解大规模 RL 训练优化的可以看看。
9 个信源67° AI 热度最后更新 2026/6/23 07:20:44
证据链
相关来源 1NVIDIA AI
查看原文相关来源 2IT之家
查看原文相关来源 3techcrunch
查看原文相关来源 4lmarena.ai
查看原文相关来源 5vLLM
查看原文相关来源 6AI Will
查看原文相关来源 7berryxia
查看原文相关来源 8a16z
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。