事件专题 ·多源确认

社区推出 MiniCPM5-2B 的 EXL3 4-bit 量化版,权重仅 1.61 GB

社区为 MiniCPM5-2B 制作了一个 EXL3 4-bit(4.0 bpw)量化版本,量化后模型权重只有 1.61 GB。在 NVIDIA Tesla T4 上实测推理速度约 68–70 tokens/s。该版本支持通过 ExLlamaV3 和 TabbyAPI 进行本地推理,适合低资源设备的本地部署。

当前结论

MiniCPM5-2B 出了 4-bit 量化版,权重才 1.61 GB,T4 上能跑 70 tokens/s,想在自己机器上跑小模型可以试试。

6 个信源73° AI 热度最后更新 2026/9/28 13:00:03

证据链

6 个信源
相关来源 2Artificial Analysis
查看原文
相关来源 3Aravind Srinivas
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。