8月26日
23:30
23:30官方一手marktechpost@Asif Razzaq
78°
阿里Qwen团队发布Qwen3.8-Flash-Next模型,包含125B参数,6B激活参数。模型采用Gated DeltaNet、Qwen Sparse Attention、Gated Residual、N-gram Embedding等架构,训练成本仅为Qwen3.7-Plus的1/9。预览了Qwen4架构。
事件专题

推荐理由:阿里Qwen团队发布了Qwen3.8-Flash-Next模型,参数量巨大,架构创新,训练成本低,值得关注。
23:14
23:14官方账号阿里通义 Qwen@Alibaba_Qwen
精选
@vllm_project使Qwen3.8-Flash-Next从第一天起就在NVIDIA和AMD上运行,超稀疏多模态MoE模型,125B参数,6B活跃,262K本地,1M通过YaRN,额外51B N-gram表可卸载,Qwen Sparse Attention是新的引擎工作所在。
事件专题

推荐理由:@vllm_project让Qwen3.8-Flash-Next在NVIDIA和AMD上无缝运行,新模型带来更多可能性,值得一看!