17:08官方账号阿里通义 Qwen@Alibaba_Qwen精选NVFP4 + DFlash2 食谱加入 Qwen3.8-27B 烹饪书。社区已见证显著效果,为探索提供起点。更多更新即将到来。AI模型Qwen3.8-27BNVFP4DFlash23 个信源在谈事件专题推荐理由:Qwen3.8-27B 新食谱发布,NVFP4 + DFlash2 融入,探索新起点!原文稍后读已读值得跟进有用关注 Qwen3.8-27B
00:45berryxia@berryxia开发者将Kimi的MoonViT视觉编码器挂载到GLM 5.2文本模型上,形成可用的视觉版本。该项目开源了NVFP4量化权重,展示了插件式多模态组装的有效性。MoonViT编码器可独立复用,GLM 5.2快速获得看图能力,无需从头联合训练。AI模型KimiGLM 5.2MoonViT推荐理由:有人把Kimi的视觉编码器接到GLM 5.2上,开源了量化权重,让GLM 5.2能看图片了。这种插件式玩法很实用。原文稍后读已读值得跟进有用关注 Kimi
21:16官方账号LMSYS Org (SGLang)@lmsysorg73°SGLang通过优化在8块B300 GPU上实现bs=1时每用户500+ tok/s的吞吐量,单用户交互性相比基线提升18%至34%,高并发峰值吞吐提升6%至11%。新推出的TopK-V2内核在80K输入长度下加速2.33倍,在1M长度下加速10.17倍,使交互性在1M token范围内基本持平。GLM-5.2模型采用IndexShare架构于DSA层和更强的MTP头,结合SGLang的服务优化共同达成这一性能。AI模型GLM-5.2SGLangB300推荐理由:SGLang让GLM5.2在B300上单用户跑500 tok/s,交互延迟几乎不随上下文增长,对多轮Agent任务很实用。原文稍后读已读值得跟进有用关注 GLM-5.2
21:12官方账号LMSYS Org (SGLang)@lmsysorg精选英伟达与智谱AI合作,发布了基于GLM-5.2的NVFP4量化检查点。该模型为744B参数混合专家架构(40B活跃参数),专注于推理和编码任务。NVFP4量化通过NVIDIA Model Optimizer实现,在降低内存占用的同时保持前沿推理性能。模型还支持稀疏注意力和IndexShare索引器,实现高效长上下文处理。目前已在Blackwell/Grace Blackwell上通过SGLang提供首日支持。AI模型GLM-5.2NVFP4NVIDIA5 个信源在谈事件专题推荐理由:英伟达把GLM-5.2压缩成NVFP4,内存省一大截,推理编码在Blackwell上直接跑,SGLang第一时间就能用。原文稍后读已读值得跟进有用关注 GLM-5.2
13:54官方账号vLLM@vllm_project精选NVIDIA发布GLM-5.2的NVFP4检查点,在Blackwell GPU上相比FP8内存占用降低一半。该模型在推理、编码和长上下文基准测试中保持与FP8相同的准确率。用户可通过vLLM直接加载运行:vllm serve nvidia/GLM-5.2-NVFP4。AI模型GLM-5.2NVFP4vLLM4 个信源在谈事件专题推荐理由:想省显存又不想降精度?GLM-5.2的NVFP4版在vLLM上线了,比FP8省一半内存,推理编码长文本都稳。原文稍后读已读值得跟进有用关注 GLM-5.2
08:05官方账号NVIDIA AI@NVIDIAAI精选72°NVIDIA 在 Blackwell 平台上使用 NVFP4 精度训练了 Llama 3 8B 和 405B 模型。实验结果显示,相比 FP8 精度,NVFP4 实现了 1.31 到 1.73 倍的训练速度提升,且未出现任何精度损失。这一突破意味着大模型训练可以在更短的时间内完成,同时保持模型质量。对于需要大规模训练 AI 模型的团队来说,这能显著降低计算成本和等待时间。AI模型NVIDIABlackwellNVFP44 个信源在谈事件专题推荐理由:训练速度提升 1.3-1.7 倍且零精度损失,做大规模模型训练的团队可以直接在 Blackwell 上尝试 NVFP4,省时省成本。原文稍后读已读值得跟进有用关注 NVIDIA
08:06Julien Chaumond@julien_cNVIDIA 发布了 DeepSeek-V4-Pro-NVFP4 的修复版本,该模型基于 DeepSeek-V4 架构,采用 NVFP4 精度优化,旨在提升推理效率和性能。修复版解决了之前版本中的一些问题,使模型更加稳定可靠。对于使用 NVIDIA 硬件进行 AI 推理的开发者来说,这是一个值得关注的更新。AI模型DeepSeek-V4NVIDIANVFP45 个信源在谈事件专题推荐理由:NVIDIA 官方修复版解决了 DeepSeek-V4 在自家硬件上的精度和稳定性问题,用 NVIDIA GPU 做推理的团队可以直接拉取使用,省去自己调优的麻烦。原文稍后读已读值得跟进有用关注 DeepSeek-V4
05:18官方账号NVIDIA AI@NVIDIAAI72°NVIDIA Research 推出 LongLive-2.0,一个端到端的 NVFP4 训练与推理系统,专门解决长视频生成问题。该系统将 NVFP4 感知训练、蒸馏和 W4A4 推理对齐,弥补了低精度部署中训练与运行之间的差距。在保持基准质量的同时,显著提升了速度和内存效率。这标志着长视频生成从模型问题转向系统问题,为实际部署提供了更高效的方案。AI模型NVIDIA长视频生成NVFP42 个信源在谈事件专题推荐理由:长视频生成一直受限于计算和内存瓶颈,NVIDIA 这次从系统层面给出了端到端方案。做视频生成模型训练或部署的团队,可以直接参考这套 NVFP4 对齐方法,提升效率。原文稍后读已读值得跟进有用关注 NVIDIA
23:48AK@_akhaliq精选Nvidia 推出 LongLive-2.0,基于 NVFP4 并行架构,专门用于长视频生成。该基础设施旨在解决长时序视频生成的计算瓶颈,提升生成效率。与以往方案相比,LongLive-2.0 能够处理更长时间的视频序列。AI产品NvidiaLongLive-2.0NVFP44 个信源在谈事件专题推荐理由:Nvidia 开源长视频生成框架原文稍后读已读值得跟进有用关注 Nvidia
19:12官方账号arXiv cs.LG@Tanmaey Gupta, Hayden Prairie, Xiaoxia Wu, Reyna Abhyankar, Qingyang Wu, Austin Silveria, Pragaash Ponnusamy, Jue Wang, Ben Athiwaratkun, Leon Song, Tri Dao, Daniel Y. Fu, Chris De Sa精选量化是加速生成模型推理的标准技术,但传统块浮点(BFP)格式使用基于块最大幅度的固定缩放因子,可能导致量化误差次优。本文提出ScaleSearch方法,通过细粒度搜索利用微缩放格式的尾数位,最小化量化误差。ScaleSearch可集成于后训练量化(PTQ)和低精度注意力机制,实验显示NVFP4量化误差降低27%,Qwen3-8B在MATH500上PTQ提升15点。此外,ScaleSearchAttention算法在Llama 3.1 70B上实现Wikitext-2困惑度降低0.77点,几乎无性能损失。论文量化块浮点NVFP4推荐理由:做模型量化和推理加速的团队终于有了更优的缩放策略——ScaleSearch直接提升精度且兼容现有方法,建议做低精度部署的开发者试试。原文稍后读已读值得跟进有用关注 量化