AI模型精选73°

Transformer vs MoE:一张图讲清路由、专家选择与负载均衡

我刚刷到 Daily Dose of Data Science 的一篇视觉解释,把 Transfor…

精选理由

想搞懂 MoE 为什么又快又强,这篇视觉解释把路由和负载均衡的坑讲透了,做模型训练或推理优化的开发者值得一看。

AI 摘要

Daily Dose of Data Science 通过视觉图解清晰对比了 Transformer 和 Mixture of Experts(MoE)的核心差异。MoE 将 Transformer 中的单个前馈网络拆分为多个小专家网络,推理时仅激活部分专家,虽参数更多但计算更快。模型通过 Router(多分类器)为每个 token 选择 top-K 专家,但训练中面临“专家过选”和“负载不均”两大问题。前者通过加噪声和屏蔽非 top-K logit 解决,后者通过设置专家容量上限并自动转交 token 来平衡。Mixtral 8x7B 和 Llama 4 是典型 MoE 模型。

原文 · berryxia

我刚刷到 Daily Dose of Data Science 的一篇视觉解释,把 Transfor…

我刚刷到 Daily Dose of Data Science 的一篇视觉解释,把 Transformer 和 Mixture of Experts(MoE)讲得特别清楚。

核心区别其实就在 decoder block:

Transformer 用的是一个大的前馈网络。 MoE 则把这个位置拆成了多个更小的“专家”网络。

推理时,MoE 只激活其中一部分专家。 参数总量虽然更多,但实际参与计算的只有一小部分,所以速度反而更快。

那模型怎么决定该激活哪些专家呢?

靠 Router。 它是一个多分类器,对每个 token 输出 softmax 分数,然后选 top-K 个专家。

但训练过程中有两个经典坑:

第一个坑是“专家过选”——一开始某个专家被选上后,它越变越强,越强越容易被选,导致其他专家几乎没机会训练。

解决办法:在 router 输出加噪声,同时把非 top-K 的 logit 直接设为 -∞,让其他专家也有训练机会。

第二个坑是“专家负载不均”——有的专家处理了太多 token,有的几乎闲着。

解决办法:给每个专家设置容量上限,超过就自动把 token 转给下一个最佳专家。

MoE 就这样用更多参数换来了更快的推理速度。 Mixtral 8x7B 和 Llama 4 都是典型的 MoE 模型。

视觉图把整个路由、专家选择、负载均衡的过程画得一目了然。

Transformer vs MoE:一张图讲清路由、专家选择与负载均衡 · AI 热点