RL-Kernel 集成 vLLM:Qwen3-8B 训练与推理 logprob 逐位一致
用 vLLM 做 RL 训练的老大难——训练和推理数值对不上,这次在 AMD MI300X 上真做到了逐位一致,做 RL 的都该看看。
RLKernel 团队将 RL-Align/RL-Kernel 集成到 vllm-project/vime,在 8 块 AMD MI300X 上完成 200 步 Qwen3-8B 的 GRPO 训练,Megatron 训练侧与 vLLM 推理侧 logprob 零不匹配。该方法通过严格对齐两侧的归约顺序、中间精度、舍入点和数学原语实现逐位一致。这次验证是在 ROCm 平台上完成的。
Training and rollout logprobs matched bit for bit on ROCm. The @RLKernel team integrated RL-Align/RL-Kernel with vllm-project/vime. A 200-step Qwen3-8B GRPO run on 8× @AMD MI300X recorded zero logprob mismatches between Megatron training and vLLM rollout.
The strict path aligns reduction order, intermediate precision, rounding points, and math primitives across both sides.
Deep dive: https://t.co/FVJHoyoo3t