Kog AI 实现 3000 tokens/s 推理速度，10-30 倍提升

精选理由

Kog AI 把 GPU 推理的隐藏效率瓶颈挖出来了，做 LLM 推理优化的开发者可以直接关注他们的技术预览，看看 monokernel 和延迟张量并行能否复现到自己的模型上。

AI 摘要

Kog AI 在 8× AMD MI300X GPU 上实现了 3000 tokens/s 的推理速度，在 8× NVIDIA H200 上达到 2100 tokens/s（FP16，无投机解码）。这一速度比常规低批次解码快 10-30 倍。其核心创新是将 LLM 解码视为内存流问题而非数学问题，通过 monokernel 技术将整个解码过程作为单个持久 GPU 程序运行，消除了内核启动、CPU 调度和中间内存往返的开销。他们还优化了同步机制和内存访问，并设计了 Laneformer 模型使用延迟张量并行技术。目前技术预览基于 2B 模型，但声称可扩展到大型 MoE 模型。

AI 翻译 · 中文

rohanpaul_aiI had to test it myself to believe this unreal inference speed. 3,000 tokens/s for 1 user on standard datacenter GPUs. They leveraged a hidden efficiency gap in how GPUs generate tokens. @Kog__AI just achieved 3,000 tok…

berryxia05-29 17:17原文
Julien Chaumond05-29 23:07原文
NVIDIA AI05-29 00:37原文
阶跃星辰 Stepfun05-29 06:33原文
Together AI05-29 20:17原文

查看原推