23:30官方一手marktechpost@Asif Razzaq78°阿里Qwen团队发布Qwen3.8-Flash-Next模型,包含125B参数,6B激活参数。模型采用Gated DeltaNet、Qwen Sparse Attention、Gated Residual、N-gram Embedding等架构,训练成本仅为Qwen3.7-Plus的1/9。预览了Qwen4架构。AI模型Qwen3.8-Flash-Next多模态MoE阿里Qwen团队6 个信源在谈事件专题推荐理由:阿里Qwen团队发布了Qwen3.8-Flash-Next模型,参数量巨大,架构创新,训练成本低,值得关注。原文稍后读已读值得跟进有用关注 Qwen3.8-Flash-Next
23:14官方账号阿里通义 Qwen@Alibaba_Qwen精选@vllm_project使Qwen3.8-Flash-Next从第一天起就在NVIDIA和AMD上运行,超稀疏多模态MoE模型,125B参数,6B活跃,262K本地,1M通过YaRN,额外51B N-gram表可卸载,Qwen Sparse Attention是新的引擎工作所在。AI模型Qwen3.8-Flash-Next多模态MoENVIDIA7 个信源在谈事件专题推荐理由:@vllm_project让Qwen3.8-Flash-Next在NVIDIA和AMD上无缝运行,新模型带来更多可能性,值得一看!原文稍后读已读值得跟进有用关注 Qwen3.8-Flash-Next
23:03Paul Couvert@itsPaulAi82°Qwen3.8-Flash,Alibaba Qwen团队的多模态MoE模型,性能优于DeepSeek V4 Flash和Claude Opus 4.6 Max,价格更低。采用Qwen4架构预览,参数125B,N-gram嵌入51B,激活6B。训练和推理成本大幅降低,DeepSWE 1.1评分58.7,SWE-bench Pro 62.5,CoWorkBench 73.9,AndroidWorld 84.5,MathVision 95.7。即将通过QwenCloud API提供,价格0.16/1M输入令牌和0.47/1M输出令牌。AI模型Qwen3.8-Flash多模态MoE性能卓越5 个信源在谈事件专题推荐理由:Alibaba Qwen团队发布了Qwen3.8-Flash,性能卓越且价格亲民,是DeepSeek V4 Flash和Claude Opus 4.6 Max的性价比之选。原文稍后读已读值得跟进有用关注 Qwen3.8-Flash