主要来源Lxfater
查看原文事件专题 ·单一信源
开源项目 Strata 让 12GB 显存跑千亿参数 Qwen3.8-Flash-Next
开源项目 Strata 通过量化运行 Qwen3.8-Flash-Next,作者在 RTX 5070(12GB 显存)+ 64GB 内存的配置下,Q2_0 量化版达到约 94 token/s,IQ3_S 版约 53 token/s。原理是利用 MoE 模型每次只激活部分专家的特点,常用专家放显存,其余交给内存和 CPU 处理,SSD 存查询表负责调度。另有用户用 Strata 加代码优化,在单张 5070 Ti 上实现约 2200 token/s 输入处理和 67 token/s 生成。
当前结论
12GB 显存就能跑千亿参数模型,Strata 靠 MoE 冷热分离把专家塞进内存,5070 上实测 94 token/s,家用显卡玩家可以折腾了
2 个信源58° AI 热度最后更新 2026/10/3 12:40:01
证据链
2 个信源相关来源 1Gorden Sun
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。