事件专题 ·多源确认

SGLang × Qwen × NVIDIA 三方合作:用 NVFP4 KV Cache 突破长上下文与 Agentic 推理瓶颈

SGLang、Qwen与NVIDIA合作,将Blackwell架构的NVFP4格式应用于KV Cache,实现4-bit精度下保持推理性能。测试显示,Qwen3.5-397B-A17B大模型在NVFP4下几乎无精度损失,而Qwen3.8-27B在SWE-bench Verified上下降1.6个百分点。在RTX PRO 6000 Blackwell上,NVFP4的decode吞吐量提升26-78%,上下文越长收益越大,1M token时提升近80%。AgentX基准测试表明,并发超过12后,NVFP4相比FP8吞吐量持续上升,缓存命中率显著提高。

当前结论

SGLang、Qwen和NVIDIA联手推出NVFP4 KV Cache,4-bit精度下1.78倍容量提升,长上下文推理提速近80%。

3 个信源79° AI 热度最后更新 2026/9/22 09:00:20

证据链

3 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。