主要来源LMSYS Org (SGLang)
查看原文事件专题 · 多源确认
英伟达发布GLM-5.2 NVFP4量化版,744B MoE推理编码模型
英伟达与智谱AI合作,发布了基于GLM-5.2的NVFP4量化检查点。该模型为744B参数混合专家架构(40B活跃参数),专注于推理和编码任务。NVFP4量化通过NVIDIA Model Optimizer实现,在降低内存占用的同时保持前沿推理性能。模型还支持稀疏注意力和IndexShare索引器,实现高效长上下文处理。目前已在Blackwell/Grace Blackwell上通过SGLang提供首日支持。
当前结论
英伟达把GLM-5.2压缩成NVFP4,内存省一大截,推理编码在Blackwell上直接跑,SGLang第一时间就能用。
6 个信源67° AI 热度最后更新 2026/6/27 13:12:58
证据链
相关来源 1vLLM
查看原文相关来源 2Geek
查看原文相关来源 3AWS Machine Learning Blog
查看原文相关来源 4IT之家
查看原文相关来源 5techcrunch
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。