主要来源berryxia
查看原文事件专题 · 多源确认
Unsloth将1万亿参数Kimi K2.7 Code动态2bit量化至325GB,本地跑40+ tok/s
Unsloth团队用Dynamic 2-bit方案将1万亿参数的Kimi K2.7 Code模型压缩48%,重要层保留更高精度。量化后模型仅需325GB RAM/VRAM即可本地运行,推理速度达40+ tok/s。全精度版本需要610GB显存。该优化并非粗暴量化,而是保留了模型的推理效率,尤其适合长程任务、复杂推理和agent工作流。
当前结论
Unsloth把1万亿参数的Kimi K2.7 Code压到325GB本地能跑,速度40+ tok/s,长程推理和agent工作流全闭环,开源社区终于能自己跑了。
5 个信源78° AI 热度最后更新 2026/6/16 06:05:36
证据链
相关来源 1lmarena.ai
查看原文相关来源 2ollama
查看原文相关来源 3shao__meng
查看原文相关来源 4IT之家
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。