模型精选78°

DeepSeek 发布 552B 参数 MoE 模型,采用新因果编码器-解码器架构

🧠 Asymmetric architecture. More intelligence, less cost. 🔹 552B-parameter MoE. 🔹 New Causal Enco...

精选理由

DeepSeek 新发布的 552B 参数模型,架构更高效,成本更低,性能还比 DeepSeek-V4-Pro 更强。

DeepSeek 发布了 552B 参数的 MoE 模型,采用新因果编码器-解码器架构,输入端仅 8B 活跃参数,输出端 16B。通过新的预训练方法和更大规模的 RL 后训练,其基准结果领先旗舰模型 DeepSeek-V4-Pro。

原文 · 深度求索 DeepSeek

🧠 Asymmetric architecture. More intelligence, less cost. 🔹 552B-parameter MoE. 🔹 New Causal Enco...

🧠 Asymmetric architecture. More intelligence, less cost. 🔹 552B-parameter MoE. 🔹 New Causal Encoder–Decoder architecture: just 8B active parameters for input, 16B for output. 🔹 New pre-training methods + larger-scale RL post-training deliver benchmark results ahead of flagship models, including DeepSeek-V4-Pro. 2/6 💬 30 🔄 113 ❤️ 1469 👀 146670 📊 187 ⚡