用 Qwen-Image-2.1-Turbo 的人可以下载这些 GGUF 量化,4.2 GB 那档比 llama.cpp 的 Q4_K 失真少 21%,小显存也能本地跑。
#GGUF
共 12 条 · 7 天 3 条 · 30 天 6 条
信息流里打上「GGUF」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月10日
Qwen-Image-2.1-Turbo GGUF 量化版发布,2.6 GB 起可本地运行
10月9日
微软升级 Windows ML:实验性原生支持 GGUF 与 ONNX 本地推理
微软把 llama.cpp 和 GGUF 模型直接接进了 Win11 的 Windows ML,以后从 Hugging Face 下个模型就能在本地跑,还配了文本生成和语音识别 API。
10月8日
Liquid AI 发布 d1 系列 GGUF 量化模型,可本地运行
Liquid AI 把 d1-3B 和 d1-omni-600M 做成了 GGUF 量化包,最小 256 MB,笔记本就能跑,量化版还能保住 97.1% 的精度,本地部署决策模型可以试试。
9月24日
FIT-GGUF 为 MiniCPM5-2B 带来可控体积的混合精度量化
用 FIT-GGUF 给 MiniCPM5-2B 做了 4 个混合精度量化版,1.14 到 1.46 GiB,还能自定目标体积,比固定 Q4/Q5 灵活多了。
9月23日
Unsloth GGUF 量化让 Qwen-Image-2.1 在 12GB 显存本地运行
低配显卡党福音:Unsloth 把 Qwen-Image-2.1 量化到 12GB 显存就能本地生图,6GB 显存走 FP8 offloading 也能跑,质量还对标 Nano Banana 2.0。
9月22日
8月29日
8月15日
MLX-Serve:用 Zig 写的 Apple Silicon 原生 LLM 推理服务器
Mac 本地跑模型试试这个 Zig 写的 MLX-Serve,免 Python 还带菜单栏,配 Qwen 3 跑 Pagoda 测试比之前都强。
7月31日
7月28日
用PrismML llama.cpp部署1位Bonsai-27B模型及本地推理工作流
想本地跑Bonsai-27B?用PrismML的llama.cpp加上1位量化,速度起飞,还能直接用OpenAI API调用。
5月14日
Qwen3.6 MTP GGUF 发布:27B 模型单 GPU 达 140 tokens/s
本地大模型性能天花板被再次抬高,玩 llama.cpp、跑本地 Agent 或日常 coding 的开发者可以直接用上,体验 30B+ 模型在消费级显卡上的流畅速度。
5月11日
行业22:16
本地AI爆发:GGUF模型数量倍增GGUF模型数量的快速增长反映了本地AI部署的实际需求和技术成熟度的提升。对于开发者和企业,这意味着更丰富的开源模型选择和更便捷的本地推理实践,推动AI应用向边缘设备转移。