后半场——mid-training、退火与长上下文课程
前两章把预训练讲成了一场连续的马拉松,但这幅图景漏了一个近两年才被行业看清的事实:马拉松的最后几公里,跑法完全不同。同样的集群、同样的目标函数,数据换了、学习率的走法换了、目的也换了——这段"后半场"如今有了自己的名字:mid-training(中期训练)。这个词 2024 年之前几乎不存在,2025 年起频繁出现在技术报告和招聘启事里,2026 年的你如果想听懂师兄们聊训练,它是绕不开的词汇。这一章讲清它包含什么、为什么有效、以及它如何动摇了"预训练/后训练"这个本卷开篇就建立的二分法。
先交代术语的实情:mid-training 是个边界模糊的工程词,各家用法不完全一致。公约数是:介于大规模预训练和后训练之间、以"数据课程 + 学习率再设计"为核心的所有阶段——典型包括退火、长上下文扩展,有时还包括高质量数据的专项强化。下面按这三块拆开。
4.1 退火:黄金时段理论
上一章留了个钩子:WSD 调度的衰减段"藏着一整套工艺"。现在揭开。
退火(annealing)指训练末段学习率从恒定值一路衰减到接近零的那几个星期。经验发现是:这段时间里模型对数据格外敏感——同样一批高质量数据,放在退火段喂,对最终能力的提升远大于混在主训练里喂。一个有用的直觉(借物理的退火意象):高学习率时期,参数在损失地形上大步跳跃,学到的是粗轮廓,细节随学随忘;学习率降下来,参数的走动越来越小,此时喂进去的东西会被"细密地刻"进最终落点附近。退火段是整个预训练的黄金时段——收官前的最后雕琢。
于是各家不约而同地在退火段做同一件事:换好菜。把数学、代码、教科书级文本、竞赛题解这些最贵最稀缺的数据,在这几周里大幅上采样。第二章说过高质量数据总量有限、反复吃会过拟合——退火给出了最优雅的用法:平时吃粗粮打底子,最后几周吃细粮定型。公开配方里能看到这个共识的不同变奏:Llama 3 在退火段上采样高质量数据、学习率线性归零;OLMo 2(目前唯一全开放的复现级配方)专门调制了一份以数学为主的"退火餐"数据集;DeepSeek 的阶梯式衰减、Kimi 的 WSD 衰减段,承担的都是同一职能。
退火还催生了两个漂亮的衍生技巧。**其一,退火当探针。**想知道某份新数据集值不值得买/爬/造?不必从头训练——从恒定段拉一个 checkpoint,把候选数据混进一小段退火跑下来,看基准涨不涨。Llama 3 团队就用这法子给数据集"验货"(几千万 token 的退火就能让数学基准显著变化)。上一章说 WSD 的恒定段"随时可以分叉结账",价值正在于此:退火从一次性的收官动作,变成了可反复重放的实验平台——这是 WSD 取代 cosine 的深层原因。**其二,终点平均。**训练最后阶段取多个 checkpoint 把权重直接平均(model souping / Polyak 平均),相当于把落点附近的几次"采样"合成一个更稳的中心,白捡一点泛化。OLMo 2 甚至用三种数据顺序各跑一遍退火、再平均三个终点。
4.2 数据课程:先什么后什么,本身就是配方
退火是"课程"思想最浓缩的体现,把它推广开:整场预训练的数据顺序都可以编排——这叫数据课程(data curriculum)。第二章讲了配比(各类数据占多少),课程是它的时间维度:什么阶段喂什么。
公开案例里最清晰的是 Qwen3 的三段式:先用约 30T token 的通用语料打底;再用约 5T 的"强化餐"——STEM、代码、推理数据显著上采样;最后做长上下文扩展。逻辑与人类教育异曲同工:先通识、后专项、最后练"长篇阅读"。而 2026 年的多模态基模又给课程加了新的一段——文本先行还是图文混合先行、多模态 token 何时进入,都是课程设计的新自由度。
课程为什么有效?回到第三章的压缩视角:模型的学习是"先抓高频规律、再抠低频细节"的过程,课程设计等于顺着这个节奏递材料——地基期给广度,敏感期给深度。反过来这也解释了为什么数据顺序是被随机化保护的:除了刻意的课程编排,同一阶段内部必须充分打乱——上一章 spike 剧本里"跳过几百个 batch 就没事"暗示过,特定的数据顺序本身能把训练带进坏状态。课程是宏观的编排加微观的随机,两层缺一不可。
4.3 长上下文扩展:课程的终章
第一卷第四章从架构侧讲过长上下文(RoPE 的 base、YaRN);现在补上训练侧的另一半——它在课程表里的位置和成本结构。
先看三份真实课程表。Llama 3 405B:主训练全程 8K 窗口,之后用约 800B token、分六个阶段把窗口逐级推到 128K。DeepSeek-V3:主训练 4K 跑完全部 14.8T,再用 YaRN 分两阶段扩到 32K、128K——整个扩展只花了主训练约 4% 的算力。Qwen3:30T + 5T 之后,末段扩到 32K(更长靠部署期外推)。三份表格的共同结构:短窗口跑主体、长窗口只跑零头。
为什么这样排?两个原因都见过铺垫。成本上,注意力开销随长度平方增长,全程 128K 训练是天文数字的浪费——而语言的绝大多数规律(语法、事实、局部推理)在 4K 窗口内就学得到,何必为它们付长窗口的钱。数据上,真正的长依赖样本(整本书、大代码库)本来就稀缺,只够喂几百 B。于是"长上下文"在训练里的本质是一门短期速成课:模型先在短窗口里学会语言本身,再用少量长材料学会"把已有能力铺到十万 token 上"——位置编码换大 base(第一卷的知识在此接轨),配上真实长文档,几个阶段渐进拉伸。
2026 年的新趋势把这门课和架构彻底焊在了一起:旗舰们的 1M 上下文(Kimi K3、DeepSeek-V4、GLM-5.2)不再是"训完再拉伸",而是稀疏/线性注意力(第一卷第五章的三派)从架构上把长窗口的账单压平之后、在训练课程里原生安排的。架构决定了你付不付得起长窗口的学费,课程决定了你怎么上这门课——两卷的线索在这里合流。
4.4 边界的消融:一个二分法的黄昏
最后谈谈 mid-training 这个词背后真正的行业变化——它不只是新术语,是训练流程观的改变。
本系列开篇建立过一个清晰的二分:预训练造基模(能力天花板),后训练做加工(兑现产品能力)。这个二分在 2023 年是准确的,但 mid-training 的兴起让边界两侧开始互相渗透。从预训练侧看:退火段大量上采样"题解式"数据、推理强化阶段刻意喂思维链体裁的语料——这些做法的意图已经不是"压缩互联网",而是为后训练预置能力接口(第四卷你会看到,基模里有没有埋好推理的种子,直接决定强化学习能不能把推理能力"点燃")。从组织侧看:2026 年招聘页上 "mid-training engineer" 已是独立岗位,职责恰好横跨旧边界——既要懂数据管线,又要懂下游对齐的需求。
所以对"什么是 mid-training"最诚实的回答是:它是预训练与后训练之间正在生长的缓冲带,是"两阶段"流程图向"多阶段连续课程"演化的中间产物。你现在拥有的图景应该是一条渐变的流水线:海量粗粮打地基 → 强化餐提能力 → 退火细刻 → 长上下文拉伸 → (交给后训练继续)。每一段的数据、学习率、窗口长度都是独立设计的变量——"训练一个基模"在 2026 年是一份多幕剧本,而不是一个按钮。
基模到这里就完整出炉了。下一章是本卷终章,处理两个收尾问题:这一切发生在什么样的钢铁之上——万卡集群与并行策略;以及悬在整个预训练头顶的大哉问——scaling 到头了吗。
本章要点
- mid-training:预训练与后训练之间、以数据课程+学习率再设计为核心的阶段总称;2024 年前几乎不存在的词,2026 年已是独立岗位。边界模糊是其本性,各家口径不一。
- 退火 = 黄金时段:低学习率期数据被"细密刻入",故末段大幅上采样数学/代码/教科书级细粮;"粗粮打底、细粮定型"是高质量数据的最优用法。
- 两个衍生技巧:退火当数据价值探针(WSD 恒定段可反复分叉结账——WSD 胜过 cosine 的深层原因);终点 checkpoint 平均(souping)白捡泛化。
- 数据课程 = 配比的时间维度:Qwen3 三段式(30T 通用→5T 强化→长上下文);宏观编排 + 微观随机,两层缺一不可。
- 长上下文是短期速成课:短窗口跑主体、长窗口跑零头(DeepSeek 扩展仅花 ~4% 算力);2026 年 1M 上下文 = 稀疏/线性架构把学费压平后的原生课程,与第一卷合流。
- 二分法的黄昏:退火与推理强化在为后训练预置接口,"预训练 vs 后训练"正演化为多幕连续剧本。