事件专题 ·单一信源

开源项目 Strata 让 12GB 显存跑千亿参数 Qwen3.8-Flash-Next

开源项目 Strata 通过量化运行 Qwen3.8-Flash-Next,作者在 RTX 5070(12GB 显存)+ 64GB 内存的配置下,Q2_0 量化版达到约 94 token/s,IQ3_S 版约 53 token/s。原理是利用 MoE 模型每次只激活部分专家的特点,常用专家放显存,其余交给内存和 CPU 处理,SSD 存查询表负责调度。另有用户用 Strata 加代码优化,在单张 5070 Ti 上实现约 2200 token/s 输入处理和 67 token/s 生成。

当前结论

12GB 显存就能跑千亿参数模型,Strata 靠 MoE 冷热分离把专家塞进内存,5070 上实测 94 token/s,家用显卡玩家可以折腾了

2 个信源58° AI 热度最后更新 2026/10/3 12:40:01

证据链

2 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。