主题
字号
PART II · 预训练
CHAPTER 13 ≈ 50 MIN READ

把模型摊开——并行训练、万卡集群与预训练的黄昏

前几章讲了训练什么(数据)、怎么训(动力学与配方)。这一章补上最后一块拼图:在哪训。这个问题远不是"多买几张卡"那么简单——它有一个坚硬的物理内核:模型大到没有任何一张卡装得下,甚至没有任何一台机器装得下。把一个模型"摊开"到上万张卡上、还要让它们高效协同,是大模型工程里最像"重工业"的部分。按本系列的约定,这里只讲到概念层——每种并行策略解决什么问题、代价是什么、真实配置长什么样——够你听懂讨论、看懂技术报告即可,更深的 infra 细节留给第五卷。

卷末我们还要处理一个绕不开的大问题:2024 年底以来,"预训练 scaling 撞墙了"的说法不绝于耳。作为本卷的收束,我们把这场争论的证据摆开看清楚——它同时也是通往下一卷的门。

5.1 先算清楚:为什么装不下

第一卷第八章给过推理的显存速算:16 位精度下每 1B 参数约 2 GB。训练的账单是它的八倍起步,因为训练时每个参数背后拖着一整套随行状态:

项目 精度 每参数字节
权重工作副本 BF16 2
梯度 BF16 2
主权重(高精度母版) FP32 4
Adam 优化器一阶矩 FP32 4
Adam 优化器二阶矩 FP32 4
合计 约 16

(混合精度训练的标准配置:为了速度用 16 位算,为了数值精度用 32 位"记账"——优化器那两项是 Adam 为每个参数维护的梯度历史统计,第三章见过它们的作用。)

代入真实模型,问题的尺度立刻显形:一个 8B 的"小"模型,训练状态 $16 \times 8\text{B} = 128$ GB——单张 80 GB 的 H100 根本训不了一个 8B 模型,这个数字第一次听说的人往往难以置信。至于 405B 的 Llama 3:$16 \times 405\text{B} \approx 6.5$ TB——需要八十多张卡只为了装下训练状态,一张卡连百分之一都放不下。

这还没完。除了"模型状态",还有激活值——前向传播的全部中间结果,反向传播要用它们算梯度,量级正比于 batch × 序列长度 × 隐藏维 × 层数,长上下文时能反超模型状态本身。标准缓解手段叫激活重算(activation checkpointing):只存每段边界的激活,反向时现场重新前向一遍——用约三分之一的额外计算(6ND 变 8ND)换一个数量级的激活显存。计算换显存,这笔交换在显存为王的世界里几乎总是划算的。

结论:**并行不是为了"更快"而存在的奢侈品,而是为了"能训"而存在的必需品。**接下来的四种策略,每一种都在回答同一个问题的不同侧面:把什么切开、摊给谁、付出什么通信代价。

5.2 数据并行与 ZeRO:先摊数据,再摊状态

数据并行(DP)是最直觉的一种:每张卡放一份完整模型,各吃不同的数据分片,反向传播后把各卡的梯度求平均(一次 all-reduce 集合通信),同步更新。它完美解决"算力不够"——卡越多,单位时间吃的数据越多。但它对"装不下"毫无帮助:每张卡都要放全套 16 字节/参数的状态,显存占用一点没少。

细看这个设计,浪费显而易见:一千张卡存了一千份完全相同的 Adam 状态——它们只在每步结尾的更新瞬间才被用到。2020 年微软的 ZeRO(零冗余优化器)把这层冗余逐级消掉:把优化器状态切成一千份摊到各卡(Stage 1),梯度也摊(Stage 2),最后连参数本身也摊、用到哪层临时从别的卡凑齐(Stage 3,PyTorch 里的 FSDP 就是这个思路)。一句话逻辑:DP 的显存浪费在冗余上,ZeRO 用"分片 + 按需通信"消灭冗余。代价是通信量上升——又是一次"通信换显存"。

5.3 张量并行:把一个矩阵乘切开

ZeRO 到 Stage 3 已经能把状态摊薄,但有极限:单层的计算本身还是在一张卡上做。模型宽到一定程度(回忆第一卷:旗舰的 $d$ 上万,单层矩阵是几亿参数),需要更狠的刀——张量并行(TP):把单个矩阵乘法按行或列切到多张卡上,每张卡算矩阵的一条,再拼合。FFN 的两层恰好可以一层按列切、一层按行切,配合成对的通信算子,每层只需一次 all-reduce;注意力则天然按头切。

TP 的代价是四种并行里最重的:它通信的不是每步一次的梯度,而是每一层前向、反向都要交换的激活值——通信频率高、且卡在计算的关键路径上(不传完算不下去)。这决定了它的部署铁律:TP 只能在超高带宽的互联域内做。传统上就是一台机器内的 8 张卡(NVLink 直连),所以你在技术报告里几乎总看到 TP=8 这个数字——它不是算法选择,是机箱的形状。

这里值得插入一条硬件常识,它解释了并行策略的整个"地形":机内 NVLink 的带宽(H100 每卡 900 GB/s,新一代 1.8 TB/s)比跨机的 InfiniBand/以太网快 10–20 倍。于是并行策略的排布像地质分层:通信最凶的(TP)压在最内层的 NVLink 域里,通信温和的(PP、DP)放到外层跨机器。2025 年后上线的 GB200 NVL72 机架把 NVLink 域从 8 卡扩到整机架 72 卡——高带宽域一变大,TP/EP 的设计空间随之改写,硬件形状再一次重塑算法。

5.4 流水线并行与专家并行:按层切、按专家切

流水线并行(PP):模型太深、一台机器的 8 张卡也放不下时,按把模型切成若干段,每段放一组卡——第 1–8 层在这台机器,9–16 层在下一台……数据像流水线上的工件依次流过。它的通信极便宜(只在段间传一次边界激活,跨机可忍),但引入了独特的代价:气泡(bubble)——流水线灌满和排空的阶段,前后段的卡在干等。缓解思路是把 batch 切成许多 micro-batch 让流水线尽量满载,以及各种精巧的调度算法;DeepSeek-V3 的 DualPipe(双向流水线、计算与通信完全重叠)是这条线上 2024 年的代表作。

专家并行(EP)第一卷第六章已经预告过:MoE 的专家摊到不同卡上,token 路由到哪个专家就"快递"到哪张卡(all-to-all 通信),算完寄回。MoE 旗舰的标配,代价是 all-to-all 这种最难优化的通信模式。

还有一个配角序列并行/上下文并行(CP):长上下文训练时激活值爆炸(正比序列长),把序列维切到多卡分担。它解决的是激活显存而非参数显存——长上下文续训阶段(上一章讲的 mid-training 后期)的专属工具。

5.5 两个真实配置:教科书与叛逆者

概念讲完,看两份真实的配置单——它们恰好构成一组绝妙的对照。

**教科书:Llama 3 405B(Meta,2024)。**16384 张 H100,四维并行叠加:TP=8(机内 NVLink 域)× PP=16(跨机切 16 段)× DP=128(数据并行兜底),$8 \times 16 \times 128 = 16384$,严丝合缝;长上下文阶段把 CP 开到 16、DP 缩到 8,用同一批卡换一种摊法。实测 MFU(模型算力利用率——实际有效吞吐占硬件理论峰值的比例)38–43%。这个数字值得咀嚼:世界顶级工程团队、教科书式的优化,一万六千张卡也只能把六成的理论算力用出来——通信、气泡、重算吃掉了剩下的。MFU 是评价训练系统的核心指标,dense 模型 35–45% 是行业常态,MoE 因为 all-to-all 更重、普遍只有 20–40%。

**叛逆者:DeepSeek-V3(2024)。**2048 张 H800——不到 Llama 的八分之一,而且 H800 是出口管制下 NVLink 带宽被削的特供版。他们的配置单让当时的从业者反复确认没看错:完全不用 TP。TP 依赖的正是被削掉的 NVLink 带宽,于是干脆绕开:用 FP8 低精度、激活重算、把各种状态卸载到 CPU 内存,硬生生把显存压到不需要 TP 的程度;然后 16 段 DualPipe 流水线 + 跨 8 台机器的 64 路专家并行 + ZeRO-1 数据并行。第一卷第七章那句"约束塑造创新"在这里有了最具体的注脚——并行配置单本身就是一份地缘政治文件:Meta 的配置写着"我有无限的 NVLink",DeepSeek 的配置写着"我没有,但我有别的办法"。

产业一瞥

读技术报告时,并行配置和 MFU 是"工程实力"最诚实的横向标尺——基准分数可以刷,MFU 很难装。另外注意集群规模的语义:2024 年的旗舰用 1.6 万张卡,2025–26 年前沿集群已到 20 万卡(xAI 训练 Grok 3 用了 20 万张 H100,其集群 2026 年扩到约 55 万卡、2 吉瓦)——但单次训练 run 用多少、怎么用,各家披露得越来越少。集群规模的军备竞赛,第六卷算总账。

5.6 卷末大哉问:预训练到头了吗

本卷从 scaling laws 的信仰出发,走过数据、配方、集群,最后必须诚实地面对 2024 年底以来悬在全行业头顶的问题。

2024 年 12 月,Ilya Sutskever(GPT 系列的缔造者之一)在 NeurIPS 领奖台上说出了那句被无限转引的话:"我们所知的预训练将毫无疑问地终结。"他的论据不是算法,是库存:"计算在增长,但数据没有——我们只有一个互联网。数据是 AI 的化石燃料。"上一章讲的数据墙,在他口中成了预训练时代的死刑判决书。

随后的事态似乎在为他作证。2025 年初,OpenAI 发布了迄今最大的预训练模型 GPT-4.5(代号 Orion)——反响平淡:相比前代提升温和,推理任务甚至不如用强化学习训出来的小推理模型,定价却贵一个数量级,几个月后悄然从 API 下架。更有分量的是一个反直觉的数据点:据 Epoch AI 分析,之后的 GPT-5 用的预训练算力比 GPT-4.5 更少——历史上每代模型算力涨百倍的节奏,戛然而止。

那么,钱和卡都去哪了?答案构成了本系列后半部的目录:增量算力转向了后训练——用强化学习教模型推理(o1、R1 这条线,后训练的 RL 算力一代翻十倍地涨);转向了推理时计算——让模型回答前"想得更久";预训练本身则转向效率与质量——FP8/FP4、MoE 稀疏化、更精细的数据配方,都是"同样的损失,更少的钱"。

所以对"预训练死了吗"的诚实回答是:**没死,但王座易主了。**预训练从"能力增长的唯一引擎"退位为"昂贵但必需的地基"——地基本身仍在变好(2026 年的新基模照样重训、照样 30T+ token),但行业最陡峭的能力增长曲线,已经不在这里了。它在哪里?在把续写机器变成推理者的那套后训练技术里——那正是 GPT-3 之后真正的魔法所在,也是你最初那个问题("这六年发生了什么")的下半个答案。

而要看懂那套魔法,你需要一样此前不需要的数学装备:强化学习。下一卷,我们从零开始,把它一次补齐。


本章要点