RL-Kernel 集成 vLLM:Qwen3-8B 训练与推理 logprob 逐位一致
用 vLLM 做 RL 训练的老大难——训练和推理数值对不上,这次在 AMD MI300X 上真做到了逐位一致,做 RL 的都该看看。
用 vLLM 做 RL 训练的老大难——训练和推理数值对不上,这次在 AMD MI300X 上真做到了逐位一致,做 RL 的都该看看。
MoonMath 开源了一个注意力内核,能在 AMD MI300X 上全面碾压官方 AITER v3,速度更快,所有形状都更强,值得跑推理的人试试。
Kog AI 把 GPU 推理的隐藏效率瓶颈挖出来了,做 LLM 推理优化的开发者可以直接关注他们的技术预览,看看 monokernel 和延迟张量并行能否复现到自己的模型上。
Kog@AI 把推理速度从 300 拉到 3000 tokens/s,做模型部署和推理优化的团队值得研究他们的内存流方法,直接看原文能学到如何消除 GPU 瓶颈。