开源引擎 Strata 让 12GB 显卡跑 125B Qwen3.8-Flash-Next
12GB 显卡也能跑 125B 的 Qwen3.8-Flash-Next 了,Strata 开源,RTX 5070 上 94 词元/秒,配置门槛和 GitHub 链接都在文里。
12GB 显卡也能跑 125B 的 Qwen3.8-Flash-Next 了,Strata 开源,RTX 5070 上 94 词元/秒,配置门槛和 GitHub 链接都在文里。
一个开源项目把阿里 Qwen 的 125B 模型量化后塞进了 12GB 显存的消费级显卡,每秒还能跑几十个 token,本地部署玩家可以看看它怎么分配显存和内存。
不想云端模型动不动拒答的话,这个用 480KB 控制向量改 Qwen3.8-Flash-Next 的法子挺有意思,12GB 显存就能跑。
12G显存的电脑也能跑125B的Qwen3.8-Flash-Next了,Strata把常用专家放显卡、全量放内存,项目已在Github开源。
12GB 显存就能跑千亿参数模型,Strata 靠 MoE 冷热分离把专家塞进内存,5070 上实测 94 token/s,家用显卡玩家可以折腾了
一个玩家用单张消费卡跑出比多数 API 还快的推理速度,靠的是 Qwen Flash 的模型设计和 Strata 流水线架构,文章讲清了原理,本地部署党别错过。