Qwen3.6-27B-NVFP4发布,vLLM支持Blackwell GPU推理

🚀 Qwen3.6-27B-NVFP4 is inference ready with vLLM o…

精选理由

Qwen3.6-27B-NVFP4来了!在Blackwell上内存减半,MMLU Pro 86.3分,用vLLM就能跑,开源模型本地AI更省显存。

AI 摘要

Qwen3.6-27B-NVFP4模型在vLLM上可用,针对NVIDIA Blackwell GPU优化。该检查点将GPU内存需求降低约2.5倍。模型拥有27B参数,采用混合注意力机制。在MMLU Pro上得分86.3,GPQA Diamond上得分85.5。仅支持vLLM作为运行时引擎。

原文 · vLLM

🚀 Qwen3.6-27B-NVFP4 is inference ready with vLLM o…

🚀 Qwen3.6-27B-NVFP4 is inference ready with vLLM on NVIDIA Blackwell GPUs.

This checkpoint is optimized for Blackwell and reduces GPU memory requirements by ~2.5x for local AI with open-source models.

🧠 27B params, Hybrid Attention 📊 NVFP4 evals: 86.3 on MMLU Pro, 85.5 on GPQA Diamond 🛠️ Exclusively supported on vLLM as the runtime engine

Get started from the Hugging Face checkpoint: https://t.co/TDA75Mqam6