主要来源LMSYS Org (SGLang)
查看原文事件专题 · 多源确认
SGLang在GB300部署DeepSeek-V4:5倍吞吐量提升
与NVIDIA合作,在GB300上使用SGLang服务DeepSeek-V4,实现5倍吞吐量提升(~2,200→~11,200 tok/s/GPU,交互性~50 tok/s/user)。借助MTP,在80 tok/s/user交互性下吞吐再提升2.6倍。Blackwell Ultra聚合模式下30 tok/s/user时吞吐提升2.91倍,峰值无MTP吞吐提升超6倍。采用W4A4 MegaMoE量化(MXFP4)且精度损失可忽略。单个FP8-einsum修复将MTP接受率从0.57提至0.70。
当前结论
想用SGLang在GB300上榨干DeepSeek-V4?NVIDIA合作实测,吞吐翻5倍,交互延迟不变,MTP和量化细节全公开。
9 个信源79° AI 热度最后更新 2026/6/23 17:02:01
证据链
相关来源 1vLLM
查看原文相关来源 2NVIDIA AI
查看原文相关来源 3marktechpost
查看原文相关来源 4AWS Machine Learning Blog
查看原文相关来源 5techcrunch
查看原文相关来源 6lmarena.ai
查看原文相关来源 7IT之家
查看原文相关来源 8berryxia
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。