03:07官方账号vLLM@vllm_project精选PrimeIntellect 发布了 prime-rl 0.6.0,在 vLLM 上运行万亿级 agentic RL 推理。该版本采用 FP8 量化、专家并行、prefill/decode 分离以及 KV 缓存卸载(原生+Mooncake),并使用 vllm-router。在 28 个 H200 节点上,以 131k 序列长度训练 GLM-5 执行 SWE 任务,每步耗时不到 5 分钟。@m_sirovatka 将在 vLLM Office Hours 中深入讲解。AI模型PrimeIntellectprime-rlvLLM推荐理由:PrimeIntellect 用 vLLM 把 agentic RL 搞到万亿参数级了,FP8 加专家并行,28 个 H200 节点跑 131k 序列,每步不到 5 分钟,训练 GLM-5 做 SWE 任务。原文稍后读已读值得跟进有用关注 PrimeIntellect