MoE 的分水岭——DeepSeek 配方与 2026 年的主流形态
上一章把 MoE 讲到 2023 年底:可行,但浑身是刺——专家粗大冗余、均衡要收质量税。2024 年 1 月,DeepSeek(深度求索,当时在国际上还近乎无名)发表了 DeepSeekMoE 论文,对这台引擎做了一次系统性的调校。两年后的今天回头看,这篇论文是一道分水岭:2026 年你能数出来的开源旗舰——从 DeepSeek 自家到 Kimi、Qwen、GLM——参数表几乎都是这套配方的变奏。这一章讲清配方本身,然后带你巡视它统治下的 2026 年版图。
7.1 诊断:大专家的两宗罪
DeepSeekMoE 论文的出发点不是新技术,而是对 Mixtral 式"8 个大专家选 2 个"设计的两条诊断。
**第一宗罪:知识杂糅。**8 选 2 意味着每个 token 的知识来源被限定在 8 种组合方式里($\binom{8}{2}=28$ 种专家对)。粒度这么粗,每个专家被迫成为"半个通才"——它接到的 token 五花八门,只好什么都学一点。所谓"专家",实际是 8 个互相高度重叠的中型通才模型。专家化的本意——不同参数专注不同知识——被粗粒度稀释了。
第二宗罪:知识冗余。语法、常识、基本逻辑这些"公共课"知识,是几乎每个 token 都需要的。在"所有专家平等竞争"的设计里,每个专家都得各自学一遍公共课——8 份重复的语法知识,占着 8 份参数。账本上的容量看着很大,刨去冗余后的有效容量大打折扣。
两条诊断对应两项手术,都朴素得近乎直白,合起来却改变了行业。
7.2 手术一:细粒度切分——组合数的魔法
第一项手术:把专家切小、把 top-k 放大。保持激活参数量不变,把每个大专家切成 $m$ 个小专家,同时把选取数从 $k$ 变成 $mk$。比如 16 选 2 的配置,切 4 倍变成 64 选 8——每个 token 激活的总参数一点没变,但看一眼组合数:16 选 2 是 120 种,64 选 8 约 44 亿种。
这个指数爆炸不是数字游戏,它直接改变了专家分化的条件。原来一个 token 的知识需求(比如"Python 语法 + 数值计算 + 英文注释习惯")只能笼统地塞给两个通才;现在路由器可以从 64 个细分工位里拼装出贴合的组合——知识的"检索粒度"细了一个数量级。专家小了,每个专家接到的 token 反而更纯粹(都是真正属于它的),专家化终于名副其实。消融实验证实:同等参数、同等计算下,细粒度切分带来可测的质量提升,而且专家越细收益越明显。
7.3 手术二:共享专家——把公共课单独开班
第二项手术处理冗余:从专家里划出一小部分作为共享专家(shared expert),所有 token 无条件经过它们,不参与路由竞争;其余专家(称路由专家)照常 top-k 竞争。
设计意图一目了然:公共课单独开班。语法、常识这些人人要用的知识,集中放进共享专家,学一份、全员共用;路由专家从此卸下公共课负担,可以全力分化出差异化知识。一个微妙的副作用同样重要:均衡压力小了——原来路由器不得不把"人人都需要公共知识"的流量也摊进竞争池,现在这部分流量走了专用通道,竞争池里剩下的才是真正该分流的差异化需求。
两项手术合起来,DeepSeekMoE 的验证模型给出了让当时的人揉眼睛的数字:16B 总参、2.8B 激活的 MoE,用约 40% 的计算量达到了 LLaMA2 7B(dense)的水平。配方成立。接下来是把它推向极限。
7.4 手术三:不收税的均衡术
从 DeepSeekMoE 到 V2(236B/21B,就是提出 MLA 的那个模型)再到 2024 年 12 月的 V3,配方在放大中又完成了第三项革新,解决上一章留下的"均衡税"问题。
回忆税是怎么收的:辅助均衡损失的梯度混进主目标,为了雨露均沾,一些 token 被派错专家。DeepSeek-V3 的方案叫 aux-loss-free(无辅助损失)负载均衡,思路是把"均衡"从损失函数里拿出来,变成一个不碰梯度的控制器:给每个专家的路由分数配一个偏置量 $b_i$,top-k 选择看的是"分数 + 偏置",但计算加权输出时只用原始分数。每个训练步结束后,检查各专家负载:谁超载,把它的 $b_i$ 调低一点;谁吃不饱,调高一点——像水管上的阀门,拧阀门(选择偏置)而不动水质(路由分数与梯度)。
这个设计的漂亮之处在于解耦:均衡由一个独立的反馈控制器负责,主损失从头到尾只关心"预测得准不准"。质量税不用交了,均衡照样达成。V3 还顺手把路由打分从 softmax 换成 sigmoid——各专家的分数不再互相挤压(softmax 是零和的:一个分数抬高必然压低其他),每个专家独立打分,配合偏置调节更稳定。此外还有一条工程约束值得一提:限制每个 token 的专家分布在多少个节点上(node-limited routing)——上一章讲过 MoE 的瓶颈在通信,把一个 token 的专家圈在少数几台机器内,all-to-all 的快递费就被按住了。算法设计直接迁就物理网络拓扑,这是 2024 年之后架构论文越来越鲜明的气质。
7.5 V3 时刻:这套配方值多少钱
2024 年 12 月发布的 DeepSeek-V3 把全卷讲过的零件全部拼上了车:671B 总参 / 37B 激活,256 个细粒度路由专家 + 1 个共享专家、每 token 选 8 个,MLA 注意力,aux-loss-free 均衡,加上 FP8 低精度训练等一系列 infra 优化(第五卷的内容)。而技术报告里最出圈的是一个数字:整个预训练用了约 279 万 H800 GPU 小时——按市价折算约 560 万美元。同期业界对西方旗舰模型训练成本的普遍估计是数千万到数亿美元。
一个月后,基于 V3 的推理模型 R1 发布(那是第四卷的故事),"DeepSeek 时刻"成为 2025 年初全球科技界的头条,甚至短暂震动了美股。剥开新闻的喧嚣,架构层面的因果链其实就是本卷讲过的这些:MLA 把推理账单砍掉一个数量级,细粒度 MoE 把训练账单砍掉一个数量级,两者都不牺牲质量——所谓"性价比奇迹",是一系列架构决策的复利。这也解释了为什么 2025 年之后"抄 DeepSeek 作业"成了行业公开的玩笑话:配方开源、论文详尽,不抄才是怪事。
产业一瞥
值得停下来想一层:为什么这套"极致省钱"的配方出自中国公司?出口管制下,中国实验室拿不到最先进的 GPU、集群规模受限,"用同样的钱多榨出几倍效果"是生存约束而不是美德选项;而算力充裕的美国头部实验室,最优策略是把工程精力花在"把更多算力堆上去"。约束塑造创新方向——这是第六卷产业地图的核心线索之一,此处先按下伏笔。
7.6 2026 年版图:一张参数表的语法
配方确立后,2025–26 年的开源旗舰在它之上展开了一场"稀疏度军备竞赛"。把几个代表模型的 MoE 配置排开(激活占比 = 激活参数/总参数):
| 模型(发布时间) | 总参/激活 | 专家配置 | 激活占比 |
|---|---|---|---|
| DeepSeek-V3(2024-12) | 671B / 37B | 256 路由 + 1 共享,top-8 | ~5.5% |
| Qwen3-235B(2025-04) | 235B / 22B | 128 专家,top-8,无共享 | ~9.4% |
| Kimi K2(2025-07) | 1T / 32B | 384 路由 + 1 共享,top-8 | ~3.2% |
| Qwen3-Next-80B(2025-09) | 80B / 3B | 512 路由 + 1 共享,top-10 | ~3.75% |
| GLM-5(2026-02) | ~745B / 44B | 256 路由,top-8 | ~5.9% |
| DeepSeek-V4-Pro(2026-04) | 1.6T / 49B | 未完整公开 | ~3.1% |
| Kimi K3(2026-07) | ~2.8T | 896 专家,选 16 | 约 2% 量级 |
这张表值得你反复看,它浓缩了三条趋势。第一,稀疏化单调加深:激活占比从 V3 的 5.5% 一路压到 2–4% 成为主流带——总参数在膨胀(671B → 1T → 1.6T → 2.8T),激活参数却按着不动(三四十 B 上下)。背后是一个越来越清晰的经验判断:在固定的训练算力下,"更大的账本 + 更稀疏的激活"能换到更低的 loss——稀疏度本身成了 scaling 的一个新维度。第二,专家数持续细分:256 → 384 → 512 → 896,细粒度路线一路走到底;共享专家被绝大多数玩家保留(Qwen3 的 235B 版是个著名例外,他们选择了无共享的对称设计——配方有主流,但没有教条)。第三,表里几乎全是中国模型:美国闭源旗舰(GPT-5 系、Claude、Gemini)被普遍推断同样是 MoE,但参数一概不公开——于是"MoE 配方的公开演化"这条线,实际上是由中国的开源权重模型书写的。这个格局的成因和影响,第六卷细谈。
至此,本卷开头预告的那台"2026 年典型旗舰"已经完整成形:decoder-only 骨架(第一章)、干净的残差流(第二章)、RMSNorm + SwiGLU 的稳定性配方(第三章)、RoPE 与长上下文工艺(第四章)、MLA 或稀疏/线性混合注意力(第五章)、细粒度共享专家 MoE(第六、七章)。零件全部讲完了。最后一章,我们把它们拼回一张真实的发布公告里——教你像从业者一样,读懂一次模型发布的每一行黑话。
本章要点
- DeepSeekMoE 两条诊断:大专家知识杂糅(组合数太少)、知识冗余(公共课人人重学)。
- 手术一细粒度切分:专家切小、top-k 放大,激活量不变而组合数指数爆炸(16 选 2 的 120 种 → 64 选 8 的 44 亿种),专家化名副其实。
- 手术二共享专家:公共知识单独开班、全员必经,路由专家专注差异化知识,均衡压力同步减轻。
- 手术三 aux-loss-free:均衡从损失函数移出,变成"只影响选择、不碰梯度"的偏置控制器;sigmoid 打分替代 softmax;node-limited routing 迁就网络拓扑。
- V3 时刻:整套配方(+FP8 等)把 671B 旗舰的预训练压到约 560 万美元,"性价比奇迹"是架构决策的复利;约束(算力受限)塑造了创新方向。
- 2026 版图三趋势:激活占比压向 2–4%、专家数细分至近千、公开演化由中国开源模型书写;稀疏度成为 scaling 的新维度。