01:29rohanpaul_ai@rohanpaul_ai83°Kog AI 在 8× AMD MI300X GPU 上实现了 3000 tokens/s 的推理速度,在 8× NVIDIA H200 上达到 2100 tokens/s(FP16,无投机解码)。这一速度比常规低批次解码快 10-30 倍。其核心创新是将 LLM 解码视为内存流问题而非数学问题,通过 monokernel 技术将整个解码过程作为单个持久 GPU 程序运行,消除了内核启动、CPU 调度和中间内存往返的开销。他们还优化了同步机制和内存访问,并设计了 Laneformer 模型使用延迟张量并行技术。目前技术预览基于 2B 模型,但声称可扩展到大型 MoE 模型。AI模型推理优化GPUKog AIAMD MI300XNVIDIA H2005 个信源在谈推荐理由:Kog AI 把 GPU 推理的隐藏效率瓶颈挖出来了,做 LLM 推理优化的开发者可以直接关注他们的技术预览,看看 monokernel 和延迟张量并行能否复现到自己的模型上。原文
07:20rohanpaul_ai@rohanpaul_ai76°Kog@AI 在 8×AMD MI300X GPU 上实现了 3000 tokens/s 的推理速度,8×NVIDIA H200 上为 2100 tokens/s(FP16,无推测解码),远超高端 GPU 通常的 100-300 tokens/s。他们将 LLM 解码视为内存流问题,通过将整个 token 生成循环保留在单个持久 GPU 程序中,消除了内核启动、CPU 调度和中间内存写入的开销。同时,通过让每个计算单元只等待所需数据,并针对 MI300X 的芯片拓扑优化内存访问,减少了同步浪费。模型架构延迟了张量并行通信,使 all-reduce 在后台进行而不阻塞每一层,这要求运行时、GPU 代码和模型设计协同优化。这一突破展示了通过软硬件协同设计大幅提升推理效率的潜力。AI模型推理优化AMD MI300XNVIDIA H200内存流GPU 编程7 个信源在谈推荐理由:Kog@AI 把推理速度从 300 拉到 3000 tokens/s,做模型部署和推理优化的团队值得研究他们的内存流方法,直接看原文能学到如何消除 GPU 瓶颈。原文