厨房里的三个月——损失、优化器与一场不能崩的马拉松
菜备好了,进厨房。这一章讲预训练这场"烹饪"本身:目标函数为什么朴素得令人失望却又深刻得出人意料;优化器和学习率这两个你在课程里学过的老朋友,在几万卡的尺度上变成了什么样;一场几个月不许失败的马拉松在工程上意味着什么;以及全程唯一的仪表盘——损失曲线和评测——该怎么读。读完这一章,"训练一个大模型"对你就不再是一个黑箱动词,而是一套你能逐环节讨论的流程。
3.1 目标函数:朴素得令人失望,深刻得出人意料
先直面一个让所有初学者错愕的事实:这个行业烧几亿美元优化的目标函数,就是你在深度学习课上见过的交叉熵——在每个位置上预测下一个 token,猜错了罚分:
$$
\mathcal{L} = -\frac{1}{T}\sum_{t=1}^{T} \log p_\theta(x_t \mid x_{ 没有精巧的多任务设计,没有奖励,没有对"智能"的任何直接刻画。就这一个数,从 GPT-1 到 2026 年的每一个基模,一以贯之。 它凭什么够用?最有解释力的视角是压缩。"预测下一个词"和"压缩文本"在数学上是一回事(预测得越准,编码文本所需的比特越少),而压缩的极限是理解。想把"巴黎是法国的……"压到极致,你得知道首都这个事实;想压缩一篇侦探小说的结局,你得理解前文的诡计;想压缩一段程序的输出,你得会执行这段程序。互联网文本是人类知识与思维过程的投影——把它压缩到极限的系统,被迫在内部建构出产生这些文本的世界的模型。损失每下降一点,都对应着某种规律从"没学会"到"学会"。这就是那句行话的含义:loss 里压着一切。顺带一提,Chinchilla 论文拟合出的损失函数里有一个常数项 1.69——那是语言本身的不可约随机性(下一个词真的可能是很多种),神也压不掉的部分;预训练争夺的是它之上的每一个小数位。 目标定了,谁来下山?过去七年答案唯一:AdamW——你学过的 Adam 加上解耦的权重衰减。它为每个参数维护两笔"账"(梯度的一阶、二阶动量),据此给每个参数自适应的步长。稳定、宽容、久经考验;代价在上一章的显存账里见过:那两笔账占了训练状态 16 字节中的 8 字节——优化器是显存里最大的单一租户。 2025 年起,王座出现了七年来第一次真实的动摇。挑战者叫 Muon,思路是换一种"步子的度量衡":AdamW 逐元素地缩放梯度,Muon 把整个权重矩阵的更新做近似正交化——直觉上,它约束的不是每个数字动多少,而是这次更新对该层整体变换的"形状"改变多少,让矩阵的各个方向被均衡地更新,而不是被少数主导方向拖着走。实测收益直接写在账单上:同样数据到达更低损失(token 效率更高),且只需一笔动量账、优化器显存减半。 让 Muon 从论文走向生产的还是那家熟悉的公司组合:月之暗面把它扩展到大规模并给它加了一个保险丝——MuonClip:监控注意力 logits(第一卷第三章讲过的那个 loss spike 火源),超过阈值就直接对 Q、K 投影权重做重缩放,从源头掐灭爆炸。结果成了 2025 年技术报告里最漂亮的一句话:Kimi K2 的 15.5T token 预训练全程零 loss spike——损失曲线光滑得像教科书插图。此后 GLM-5、DeepSeek-V4、Kimi K3 相继采用 Muon 系优化器。而 AdamW 仍是西方旗舰的默认。优化器这个课本里"选型题"级别的组件,在 2026 年重新成了竞争前沿——这个行业没有任何一层是彻底定型的。 学习率调度,课程作业里常被一笔带过的配置项,在这里是被精心编排的舞蹈,而且 2024 年前后换了一支舞。 经典编舞是 warmup + cosine:开头几千步从零线性爬升(避开初始化时刻的大梯度雷区——第一卷讲 Post-LN 时见过这个雷区的来历),随后沿余弦曲线缓缓降到峰值的百分之一。它效果好,但有个隐藏的僵硬之处:余弦曲线必须预先知道终点——整条调度是为"总共训 X 万亿 token"量身定制的,中途想多训一段?对不起,整支舞重编。 2024 年后主流转向 WSD(warmup–stable–decay):爬升之后长期恒定,只在最后一段快速衰减。恒定段的妙处是"永远没定终点"——随时可以决定再多训 5T token,也随时可以从恒定段的任何一个 checkpoint 分出一支、跑一段衰减来"结账"。这个灵活性下一章会显出真正的威力:它让预训练的尾声从一次性动作变成了可反复实验的阶段。Kimi K2 的配方就是典型:前 10T token 恒定,后 5.5T 衰减。 其余超参数在旗舰之间惊人地一致:权重衰减 0.1、梯度全局范数裁剪 1.0(第一卷深度学习课的老朋友)、batch size 从小往大爬坡(训练初期模型什么都能学,小 batch 省算力;后期需要更稳的梯度估计,batch 加大到千万 token 级)。至于"模型放大十倍,学习率该怎么变"——各家用小模型拟合自己的超参缩放律再外推,是"小模型侦察兵"方法论的又一次出场。 现在把视角从算法拉到机房。一次旗舰预训练是数万张 GPU 连续运转两三个月,这个尺度上,一类平时可以忽略的问题成了日常:硬件会坏,而且一直在坏。 Meta 公布过 Llama 3 405B 训练的完整"病历",数字足以刷新直觉:54 天的训练窗口、1.6 万张 H100,共发生 466 次中断,其中 419 次是非计划的——平均每三小时坏一次。病因排行:GPU 本体故障 30%,HBM 显存故障 17%(算上其他 GPU 部件,卡本身的问题占近六成),再往下是网线、交换机、偶尔的宿主机。做个朴素的算术就明白这不是 Meta 倒霉:单张卡哪怕年故障率只有百分之几,一万六千张卡同时跑,"每天坏几张"就是数学必然。故障不是异常,是常态;容错不是补丁,是系统的默认形态。 工程应对是一套成熟的组合拳:高频异步 checkpoint(把模型状态持续快照到内存和存储,坏了就回滚,损失以分钟计)、自动故障检测与节点热替换(Llama 3 的 466 次中断只有 3 次需要人工介入,有效训练时间保持在 90% 以上)。对付 loss spike 也有标准剧本,出自 PaLM 时代的经典观察:spike 发生后,回滚到几百步之前、跳过那几百个 batch 再继续,spike 就不再复现——说明爆炸不是"某条坏数据"的错,而是"优化器状态与特定数据顺序"的坏组合,错开就好。而 2026 年的风向是从抢救转向预防:与其练熟救火(回滚、跳批、临时降学习率),不如从机制上让火点不着——MuonClip、QK-Norm 这些第一卷和本章讲过的"保险丝",让新一代技术报告的炫耀点从"我们扛住了 spike"变成了"我们全程零 spike"。 产业一瞥 "每三小时坏一次"这个数字还解释了一条产业链:大集群运维(故障预测、静默数据损坏检测、checkpoint 基础设施)本身成了核心竞争力和招聘热点。读技术报告时,"故障与恢复"章节的详实程度是判断一家实验室工程成熟度的可靠信号——这部分吹不了牛。 马拉松跑着,怎么知道方向对不对?预训练的仪表盘有三层。 第一层:损失曲线本身。在留出的验证集上持续测交叉熵(或困惑度——loss 的指数,直观含义是"模型在多少个候选词之间犹豫")。团队还会盯分领域的损失切片:代码 loss、数学 loss、多语言 loss 分别怎么走——总 loss 平滑下降而代码 loss 停滞,就说明配比或数据出了问题。 **第二层:对照预言。**第一章讲过"小模型侦察、外推预测"——正式 run 的损失曲线要与开跑前 scaling law 的预测值持续对表。GPT-4 团队用万分之一算力的小模型预测了最终损失并精确命中;实际曲线偏离预言,是配置出错的最早警报。 **第三层:能力抽检。**loss 相同的两个模型能力未必相同,所以定期拉 checkpoint 做 few-shot 基准评测:知识(MMLU 及其更难的后继 MMLU-Pro)、研究生级科学(GPQA)、数学、代码。这层仪表有一个著名陷阱——数据污染:几十 T 的语料里很可能混进了基准测试的原题,模型"背过答案",分数虚高。所以严肃的团队做去污染处理,而基准本身也在不断轮换——旧基准饱和加污染,新基准顶上,这是评测领域永恒的猫鼠游戏。 仪表盘的话题通向本卷立过 flag 的一场辩论,它关乎"loss 下降"和"变聪明"之间那道缝隙。 2022 年,"涌现能力"论文给出了一组令人着迷的曲线:很多能力(多步算术、思维链推理)在小模型上完全为零,模型放大到某个规模时突然出现——像相变,不可预测。这个叙事传播极广(也顺手成了"大模型可能突然涌现危险能力"的论据)。2023 年,斯坦福团队发表了针锋相对的《涌现是海市蜃楼吗?》:所谓突变,很大程度是度量方式的伪影——"完全做对才得分"这类非连续指标天然把平滑的进步显示成跳变(一道五步算术,每步对的概率从 70% 爬到 99% 是平滑的,"五步全对"的概率却像开关)。换成连续的尺子,多数"涌现"曲线变回了平滑的坡。 2026 年回望,这场争论以"各让一步"收场:大部分涌现确实是尺子问题加阈值效应;但少数能力换了尺子依然表现出顽固的非线性跃升,无法完全解释掉。留给你的教学要点有两条。其一,"你测到什么取决于你用什么尺子"——这在评测泛滥的今天是价值连城的防身术。其二,它精确划定了 scaling laws 的边界:幂律保证的是 loss 的平滑可预测,从不保证任意下游能力的平滑可预测——loss 与能力之间的换算,至今仍是半经验的艺术。这道缝隙,正是"预训练之外还需要什么"这个问题的萌芽——本卷结尾会回到它。 厨房的日常讲完了。但还有一个尾声被我反复按下不表:训练的最后一段——学习率衰减的那几个星期——藏着近两年才被行业郑重命名的一整套工艺。下一章,mid-training:预训练的后半场,以及它如何模糊了"预训练"和"后训练"的边界。3.2 优化器:AdamW 的王座与 Muon 的叛乱
3.3 学习率的编舞与超参的缩放律
3.4 马拉松:每三小时坏一次的机器
3.5 仪表盘:几亿美元烧完之前,怎么知道没做砸
3.6 涌现之争:你的尺子决定你看到什么
本章要点