MoE 的稀疏艺术:1.6 万亿参数的模型,为什么每个 token 只唤醒 49B
混合专家(MoE)让模型总参数量和推理计算量脱钩。本文从路由公式出发,拆解 Top-K 门控、负载均衡的辅助损失与 DeepSeek-V3 的无辅助损失方案,以及细粒度专家、共享专家、节点受限路由这些工程取舍各自的含义。
2026 年的旗舰模型有一个共同特征:总参数大得吓人(DeepSeek V4-Pro 1.6 万亿、DeepSeek-V3 6710 亿),但每次前向计算只激活其中很小一部分(49B / 37B)。让”模型容量”和”单 token 计算成本”脱钩的技术就是 MoE(Mixture of Experts,混合专家)。本文把它的路由机制、负载均衡难题和主流解法拆开讲。
一、核心思想:把 FFN 换成”专家团”
稠密(Dense)模型里,每个 token 都要流过每一层的全部参数。MoE 把 Transformer 里的 FFN 子层替换成 N 个并行的”专家”小 FFN,外加一个路由器(Router)。每个 token 只被送进其中 K 个专家:
h' = Σ_{i ∈ TopK} g_i · FFN_i(h)
g_i = 路由权重(见下),K ≪ N
以 DeepSeek-V3 为例:N = 256 个路由专家 + 1 个共享专家,K = 8。每个 token 只计算 8+1 个专家,于是总参数 671B,激活参数只有 37B——参数量提供知识容量,激活量决定推理成本,两者第一次被解耦。
二、路由权重怎么算:门控公式逐变量看
经典做法(Shazeer 2017 奠基,Switch Transformer 推广)是用一个可学习的线性层给每个专家打分,再取 Top-K 做 softmax:
s_i = w_iᵀ · h # w_i:专家 i 的路由向量;h:token 表示
g_i = softmax 只对 TopK(s) 中的 i 计算,其余 g_i = 0
这里的关键变量是 K:K=1 时(Switch Transformer)路由最稀疏、通信最少,但每个 token 只有一个”视角”;K=8(DeepSeek-V3)让 token 能组合多个专家的输出,表达能力更强,代价是通信和计算都×8。DeepSeek-V3 还做了一个细节改动:打分函数从 softmax 换成 sigmoid,避免 softmax 在专家间的强制归一化扭曲亲和度排序。
三、MoE 的头号工程难题:负载均衡
如果路由器”偏心”——少数专家被选中绝大多数 token——后果是灾难性的:
- 被挤爆的专家成为吞吐瓶颈(专家是分布在不同设备上的,一个热点拖垮整个集群)
- 冷门专家长期得不到训练,参数浪费
传统解法:辅助损失(Auxiliary Loss)。Switch Transformer 的经典公式:
L_aux = α · N · Σ_{i=1..N} f_i · P_i
f_i = 分给专家 i 的 token 比例
P_i = 路由器给专家 i 的平均概率
含义很直白:f 和 P 都在 1/N 附近时损失最小,偏离均匀就受罚。问题在于辅助损失本质上是在”为了均衡牺牲路由自由”,加大了伤模型质量,调小又压不住热点。
DeepSeek-V3 的解法:无辅助损失负载均衡。不给损失函数加项,而是给每个专家的路由打分加一个偏置项 b_i,路由选择按 s_i + b_i 排序取 Top-K,但权重 g_i 仍按原始 s_i 计算:
监控每个专家的负载:过载 → b_i 减 γ;欠载 → b_i 加 γ(逐步调整)
偏置只影响”选谁”,不影响”选中后的权重”,因此路由分布被动态拉平,而梯度信号不被均衡目标污染。V3 技术报告给出的结论是:负载全程均衡,且避免了辅助损失带来的质量损耗。
四、三个容易被忽略的工程细节
- 细粒度专家:DeepSeek-V3 把专家切得很细(256 个,每个的中间维度远小于稠密 FFN)。专家越细,K 个专家的组合空间越大(C(256,8) 种组合),同一个”专家组合”可以更精确地匹配不同类型的知识
- 共享专家:1 个所有 token 都经过的共享专家,负责承载通用知识,让路由专家可以专心学”专才”,缓解路由专家之间的知识冗余
- 节点受限路由:专家分布在多机集群上,若一个 token 的 8 个专家散落在 8 台机器,通信开销爆炸。V3 限制每个 token 最多发往 M 个节点(先在节点级筛高分节点,再在节点内选专家),把跨机通信控制在有界范围——这是 MoE 从论文走向大规模可用的关键一步
五、对使用者的意义
- “激活参数”比”总参数”更接近真实成本:比较两个 MoE 模型的推理成本,看激活参数量;比较知识容量上限,才看总参数。1.6T 总参 / 49B 激活的 V4-Pro,推理成本结构和 49B 级稠密模型同档
- API 价格的架构根源:MoE + MLA 的组合(稀疏计算 + 低缓存)正是 DeepSeek 系 API 价格能做到行业低位的结构性原因,不是单纯的补贴
- 自部署要算通信账:MoE 模型自部署的瓶颈常常不在显存而在专家并行的跨机通信,节点受限路由、专家并行度这些部署参数比单纯堆卡更重要
📋 来源与核验记录:
- DeepSeek-V3 技术报告(671B/37B、256+1 专家、Top-8、sigmoid 门控、无辅助损失偏置方案、节点受限路由):arXiv:2412.19437
- Switch Transformer(辅助损失公式):arXiv:2101.03961
- DeepSeek V4-Pro 总参/激活参数(1.6T/49B):本站 DeepSeek 收录条目,数据核验日期 2026-07-24