用 Qwen-Image-2.1-Turbo 的人可以下载这些 GGUF 量化,4.2 GB 那档比 llama.cpp 的 Q4_K 失真少 21%,小显存也能本地跑。
#量化
Liquid AI 把 d1-3B 和 d1-omni-600M 做成了 GGUF 量化包,最小 256 MB,笔记本就能跑,量化版还能保住 97.1% 的精度,本地部署决策模型可以试试。
Milvus 官方把 HNSW 的三种量化方案讲清楚了:SQ8/SQ6、PQ、PRQ 各自怎么压缩、省内存多少、代价是什么,做向量检索选型前很值得看。
一个开源项目把阿里 Qwen 的 125B 模型量化后塞进了 12GB 显存的消费级显卡,每秒还能跑几十个 token,本地部署玩家可以看看它怎么分配显存和内存。
MiniCPM5-2B 出了 4-bit 量化版,权重才 1.61 GB,T4 上能跑 70 tokens/s,想在自己机器上跑小模型可以试试。
量化小模型的人可以看看:一个一行搜索就能让输出头 W4 量化的 KL 误差降七成的方法,还附 10.8% 延迟实测。
Google 这篇论文拆了 serverless CPU 跑量化小模型的延迟构成,55-70% 耗在加载权重,加内存到 8 GB 就能让推理快近一倍,部署前值得看。
用 FIT-GGUF 给 MiniCPM5-2B 做了 4 个混合精度量化版,1.14 到 1.46 GiB,还能自定目标体积,比固定 Q4/Q5 灵活多了。
量化到 2-bit 后模型做数学题会发疯循环?这篇论文用 on-policy 蒸馏把 MATH-500 保留率从 35% 拉到 70%,做端侧部署的可以看看。
阿里官方转发,Atomic Chat把Qwen3.8-27B量化到1位,8.5GB就能跑,16GB MacBook Air上还能保持92.4%的一致性。
Qwen3.8-27B 现在靠 Unsloth 动态量化,17GB 内存就能跑,还有 NVFP4 量化版,适合本地尝鲜。
这篇论文把PTQTP量化器约束成九级格式,在DeepSeek-V4上做到和官方API几乎一样准,还快6.7%、文件小9%,适合搞MoE推理优化的朋友看。
MixFrag用KL散度定位模型里对量化最敏感的部分,再把位宽分配变成背包问题。在COCO上比之前最好的混合精度PTQ方法涨了9.6 AP,跑ViT的可以看看。