DeepSeek 发布 V4.1 Flash 模型,采用不对称 MoE 架构并开源
DeepSeek 新出的 V4.1 Flash 模型,用不对称 MoE 架构,参数量 552B,但只用了 8B 活跃参数处理输入、16B 处理输出,比上一代节省了 3/4 的存储,算力效率更高,还支持多模态,价格也便宜,适合需要高效推理的场景。
SuperTechFans原文
DeepSeek 新出的 V4.1 Flash 模型,用不对称 MoE 架构,参数量 552B,但只用了 8B 活跃参数处理输入、16B 处理输出,比上一代节省了 3/4 的存储,算力效率更高,还支持多模态,价格也便宜,适合需要高效推理的场景。