12GB 显卡也能跑 125B 的 Qwen3.8-Flash-Next 了,Strata 开源,RTX 5070 上 94 词元/秒,配置门槛和 GitHub 链接都在文里。
#Qwen3.8-Flash-Next
共 18 条 · 7 天 4 条 · 30 天 5 条
信息流里打上「Qwen3.8-Flash-Next」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月6日
开源引擎 Strata 让 12GB 显卡跑 125B Qwen3.8-Flash-Next
10月5日
Qwen3.8-Flash-Next 加 480KB 控制向量,本地部署减拒答版本
不想云端模型动不动拒答的话,这个用 480KB 控制向量改 Qwen3.8-Flash-Next 的法子挺有意思,12GB 显存就能跑。
10月4日
Strata:12G显存本地跑Qwen3.8-Flash-Next 125B模型
12G显存的电脑也能跑125B的Qwen3.8-Flash-Next了,Strata把常用专家放显卡、全量放内存,项目已在Github开源。
开源项目 Strata 让 12GB 显存跑千亿参数 Qwen3.8-Flash-Next
12GB 显存就能跑千亿参数模型,Strata 靠 MoE 冷热分离把专家塞进内存,5070 上实测 94 token/s,家用显卡玩家可以折腾了
9月11日
9月1日
8月29日
8月27日
NVIDIA支持Alibaba Qwen3.8-Flash-Next模型微调
Alibaba Qwen3.8-Flash-Next模型发布,NVIDIA提供微调支持,与TokenSpeed等工具兼容,值得开发者关注。
DuckLabs 入 AWS,GLM-5.3-Flash 发布
想了解最新开源数据库和AI模型进展的朋友,这条新闻不容错过!DuckLabs 加入 AWS,GLM-5.3-Flash 和 Qwen3.8-Flash-Next 都值得关注。
Qwen3.8-Flash-Next 获 Code Arena WebDev 第 8 名
Alibaba Qwen 发布的 Qwen3.8-Flash-Next 在 Code Arena WebDev 获得优异成绩,性能提升显著,成本效率高,是 Qwen4 架构的早期预览,值得一看。
8月26日
阿里Qwen团队发布Qwen3.8-Flash-Next:125B多模态MoE模型,预览Qwen4架构
阿里Qwen团队发布了Qwen3.8-Flash-Next模型,参数量巨大,架构创新,训练成本低,值得关注。
阿里巴巴发布Qwen3.8-Flash-Next,目标‘极致成本效率’
想了解阿里巴巴如何以更低成本打造强大模型?Qwen3.8-Flash-Next值得一试,它比DeepSeek-V4-Flash和Claude Opus 4.6更高效,成本更低。
8月25日