主题
字号
PART IV · 后训练
CHAPTER 25 ≈ 50 MIN READ

兑现与迭代——蒸馏、LoRA 与小版本的秘密

前六章讲完了后训练的两次质变:从续写到听话,从听话到推理。这最后一章讲兑现——这些昂贵的能力怎么变成人人用得起的产品、怎么持续迭代交付;顺便把本卷所有零件拼成几张真实流水线的全景图,并兑现第一卷第八章的那张欠条:"小版本更新到底更新了什么"。

7.1 蒸馏:把旗舰的本事灌进小模型

2026 年行业有一条心照不宣的分工结构:大模型当教师,小模型当产品。旗舰级巨兽(万亿参数、天价推理成本)越来越少直接大规模服务用户,它们的日常工作是当数据工厂——生成训练数据、当裁判、当教师;真正跑在手机、汽车、API 走量套餐里的,是从它们身上"蒸"出来的小模型。这道工序叫蒸馏(distillation),有三种形态,恰好构成一个投入与效果的阶梯。

**黑盒蒸馏:拿输出当教材。**最朴素——让教师模型生成大批高质量回答,拿去给学生做 SFT。你其实已经见过它两次:第一章的 Alpaca(拿 GPT 系的输出训 LLaMA)是它的野生形态;第五章 R1 的 80 万条推理样本蒸出整个 R1-Distill 家族(1.5B 到 70B)是它的教科书形态——纯 SFT、不带一步 RL,小模型的数学推理成绩就大幅超越了同尺寸直接做 RL 的结果。R1 论文由此留下一个重要结论:小模型上,蒸馏胜过直接 RL——推理能力可以先在大模型上用 RL 昂贵地"发现",再用蒸馏廉价地"传授";让小模型自己从零试错,反而学不出来。发现一次,传授无数次——这是推理能力得以普及的经济学基础。

白盒蒸馏:拿分布当教材。如果拿得到教师的权重,可以更进一步:不只学"教师说了什么",还学"教师有多确定"——让学生的输出分布对齐教师的完整概率分布(KL 损失,逐 token)。软标签的信息量远大于硬标签(教师在两个近义词间的犹豫、对错误选项的相对排序,全是知识)。Gemma、Qwen 的小模型线都用这条路。

**On-policy 蒸馏:2025 年的合流。**前两种蒸馏共享一个你已能一眼识破的缺陷(第三卷的装备):off-policy——学生在"教师的作品"上学习,但它自己生成时会走到教师从不会去的地方,那里没有任何监督。2025 年成熟的新配方把两个世界焊接起来:让学生自己采样(on-policy,暴露自己真实会犯的错),教师对学生轨迹的每个 token 给出评分/分布(蒸馏式的密集信号,而不是 RL 那种整条轨迹一个分数)。既修正"自己的错",又拿到逐 token 的浓监督——公开实验显示,小模型达到教师水平的成本比纯 RL 低一到两个数量级。你可以用本卷的语言给它定位:它是"SFT 的信号密度"与"RL 的分布正确性"的合题——第一章与第三卷的两条线,在此收拢。

7.2 LoRA:微调的性价比边界

蒸馏是厂商的兑现手段;生态的另一端是千千万万下游用户的定制需求——企业想让模型学会自家术语,开发者想调一个专用风格。全参微调一个 70B 模型的显存账你会算(第二卷:16 字节/参数,一百多 GB 起步)——绝大多数人付不起。2021 年的 LoRA(Low-Rank Adaptation,低秩适配)把这道门槛砍掉了两个数量级。

机制上它是第一卷"低秩压缩"思想(MLA 那章)的近亲:冻结原权重 $W_0$,只训练一个低秩的增量 $\Delta W = BA$——两个瘦长矩阵($d \times r$ 和 $r \times d$,秩 $r$ 取 8 到 64,远小于 $d$)的乘积。可训练参数只有全量的 0.1%–1%,优化器状态、梯度全都只对这一小撮存在,显存需求断崖式下降;训完还可以把 $BA$ 直接加回 $W_0$,推理时零额外开销。配上 4 位量化基座的 QLoRA,一张消费级显卡就能微调 65B 模型——2023 年之后遍地开花的社区微调模型,几乎全是这么来的。

它的能力边界如今也测绘得很清楚,一句话版本来自一篇论文标题:"LoRA 学得更少,忘得也更少"——低秩瓶颈限制了它注入大量新知识的容量(想教模型一整个新领域,还得全参),但同样的瓶颈保护了原有能力不被冲刷。而 2025 年的系统研究补上了精彩的一笔:在 RL 微调场景下,LoRA 几乎不吃亏——原因用第三卷的信息论直觉就能说通:RL 每条轨迹只提供"成/败"这么一点信息(对比 SFT 每个 token 都是监督),信号本来就稀疏,低秩容量绰绰有余。于是 2026 年的定制生态里,"LoRA + 小规模 RL"成了低成本对齐定制的标准姿势。

7.3 流水线全景:四张真实配方单

零件全齐了,看总装。把四条公开的后训练流水线并排放开——这是本卷全部内容的一次点名:

Llama 3:每轮"训 RM → 拒绝采样(每题采一二十个回答、RM 挑最优当 SFT 数据)→ SFT → DPO",滚动六轮,每轮补充新偏好数据;各阶段还把多个平行实验模型做参数平均(第二卷退火章的 souping,在后训练里也是正式工序)。全程没有 PPO——偏好路线走到极致的代表。

Tülu 3(学界全开源复现):SFT(约 94 万条,大量强模型合成)→ 长度归一化 DPO(管偏好)→ RLVR(管可验证能力)——第三、五章分工共识的标准演绎。

Qwen3:四阶段——长思维链冷启动 SFT → 推理 RL(GRPO)→ 思考融合(把"不思考也能答"的能力合并回思考模型,并教会它按预算控制思考长度)→ 通用 RL(二十多种任务的综合奖励)。小模型不走全流程,直接从大模型蒸馏——7.1 的分工结构写在配方单里。

DeepSeek-R1:第五章讲过的四幕剧——冷启动 SFT → 推理 RL → 拒绝采样重训 SFT → 全场景 RL(规则奖励管推理题、RM 管通用题)。

四张单子长得各不相同,但眯起眼看是同一个语法:SFT 立格式,偏好方法修行为,RL 长能力,蒸馏与合并做交付——顺序、轮数、配比就是各家的"配方"。第二卷说过"架构同质化后工艺是护城河";到了后训练,这句话加倍成立——这四张单子里的每一个数字(采几个、滚几轮、何时融合),都是烧了真金白银试出来的。

7.4 小版本的秘密:后训练是持续交付

现在兑现第一卷的欠条。当年我们靠发布间隔"考古"推断小版本更新的性质;本卷学完,你可以看懂正面证据了。

最干净的案例:DeepSeek-V3-0324(2025 年 3 月)——基座一个参数没动,只重跑了后训练(把 R1 那套推理 RL 的成果吸收进来),数学与代码能力跳了一大级。同一个基模,翻新后训练,性能接近换代——"小版本更新到底更新了什么"的答案在这里具象化了:更新的是本卷讲的这条流水线。新的 SFT 数据、新一轮偏好、新的 RL 配方、新蒸馏的能力——预训练基座像底盘,复用数月到一年;后训练像软件,以周和月的节奏持续交付。Qwen 的"2507"式日期后缀 checkpoint、各家同名模型的季度性悄然变强,全是同一模式。

这也把第一卷"基模决定天花板、后训练兑现天花板"的图景补上了动态维度:天花板立起来之后,每个月都有人在往上够——同一个基座上,后训练配方的持续演进能挖出的增量,在 2025–26 年一再超出预期。这正是"后训练时代"这个说法的操作性含义。

7.5 税单:对齐的代价清账

卷末最后一件事:诚实地算一算这一切的代价。"对齐税"这个词出自 InstructGPT 时代——当年 RLHF 确实会让一些学术基准回退(听话是用能力换的)。但到 2025–26 年,经典意义的对齐税已经缩水甚至反转:后训练本身成了数学、代码、agent 能力的主要来源,"对齐让模型变笨"不再成立。

税没有消失,而是换了形态,你在日常使用中大概率亲身缴过:多样性税——RLHF 后的模型输出风格趋同、创造性收窄(那股挥之不去的"AI 腔"是有实证文献的);谄媚税——第二章讲过的结构性倾向;过度拒绝税——把无害请求误判为危险而拒答。最后这项有个扎眼的实证发现:对多数模型,安全拒绝率和过度拒绝率高度相关(相关系数近 0.9)——它们只是在同一条权衡曲线上挪阈值,"该拒的都拒、不该拒的都不拒"两头兼得的模型极少。行业的应对方向倒是一致:用更聪明的判断取代模式匹配式的硬规则——让模型在推理中阅读安全规范再决定(而非条件反射地拒绝)、把"拒绝/服从"的二元换成"在约束内尽量有帮助"、把宪法从规则清单改写成讲清"为什么"的解释性文档。对齐的前沿正在从"驯服"走向"教养"——这句话背后的深水区(欺骗、价值观、监督的极限),留给你未来自己去探。


本卷到此收官。回望全书的主线问题——"从 GPT-3 到今天,这六年发生了什么"——答案的骨架已经完整:架构进化让模型装得下更多(第一卷),预训练把世界压进权重(第二卷),对齐流水线把知识变成可用的助手(本卷前半),可验证奖励上的强化学习把助手变成推理者(本卷后半)。剩下两卷是这幅图景的支撑面与全景图:第五卷补齐"这一切跑在什么钢铁上"的常识账,第六卷带你巡视 2026 年的产业地图——谁在做、路线怎么分岔、竞争走到了哪一步。


本章要点