事件专题 · 单一信源

Gated DeltaNet在4位量化中保持性能的机制研究

Minima研究团队对Qwen3.8-27B混合模型进行了全NVFP4 W4A4量化,在4K/32K困惑度、MMLU-Pro、GSM8K等7项基准上与BF16精度相当。该模型仅17.5 GiB,预填充速度提升14-19%,32K困惑度差距随位置增加而缩小。研究揭示了四个关键机制:NVFP4的16元素块缩放局部化残差流极值异常,门控投影对误差不敏感,delta规则递归在32K token内保持噪声平坦,以及每token量化成本随上下文增长而非累积。

当前结论

Minima团队把Qwen3.8-27B全量化到4位,性能不变还更小更快,揭秘了混合模型递归部分为什么好量化。

2 个信源73° AI 热度最后更新 2026/9/3 17:04:26

证据链

相关来源 1Hugging Face: Blog
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情