主题
字号
PART IV · 后训练
CHAPTER 23 ≈ 55 MIN READ

第二次质变——从 o1 到 R1 的推理革命

上一章结尾的问题悬在半空:如果把 RL 的全部火力对准"奖励即事实"的可验证领域,会发生什么?这一章就是答案的编年史——大模型发展史上继 ChatGPT 之后的第二次质变:推理模型。你在第三卷磨好的所有兵器(GRPO、RLVR、组内基线)将在这里全部开刃。而故事的起点,比多数人以为的早了两年半。

5.1 史前史:三块拼图,2022 年就齐了

第一块:让模型把过程写出来(2022 年 1 月)。Google 的研究者发现一个朴素得令人错愕的现象:few-shot 示例里如果不只给"问题→答案"、而是给"问题→中间推理步骤→答案",大模型的数学能力会脱胎换骨——PaLM 540B 在小学应用题基准 GSM8K 上从 18% 跳到 57%。这就是思维链(Chain-of-Thought,CoT)。注意它的性质:这不是训练方法,是纯提示技巧——能力早就藏在预训练权重里,只是没人用对了取出的姿势。几个月后有人发现连示例都不用给,在答案前加一句 "Let's think step by step"(让我们一步一步想)就能触发——这句话成了整个领域的梗,也是一个重要命题的最强证据:推理行为是预训练自带的,等待被激发。原论文还留下一个著名论断:CoT 是"随规模涌现的能力",百亿以下的小模型写出的推理链流畅但逻辑崩坏——这个论断三年后会被漂亮地推翻,先记下。

**第二块:让模型多想几遍再投票(2022 年 3 月)。**同一问题采样几十条不同的推理链,对最终答案做多数表决(self-consistency)——GSM8K 再从 57% 提到 74%。看清它的本质:花更多推理算力换更高准确率。这是"测试时计算"(test-time compute)的第一个系统性结果,比 o1 早两年半。

**第三块:让模型按对错自举(2022 年 3 月)。**斯坦福的 STaR:让模型对训练题生成推理过程和答案,只保留最终答案正确的那些,拿它们微调模型,再用变强的模型重复循环。用第三卷的眼光看,这就是"带二值可验证奖励的强化"——只不过用离线 SFT 实现,RLVR 的思想前驱如假包换。6B 的小模型经它自举后追平了大三十倍的微调 GPT-3。

盘点一下 2022 年底的牌桌:写出过程(CoT)、算力换精度(投票)、按对错强化(STaR)——通往推理模型的三块拼图全部就位。中间隔着的两年,行业主流其实押错了宝:大家以为通路是"过程奖励模型给每一步打分 + 树搜索"(OpenAI 自己 2023 年的 PRM 论文带头),精巧、优雅、符合直觉。谜底揭晓时所有人都愣了一下——赢的是那条最笨的路。

5.2 o1:第三条曲线(2024 年 9 月)

2024 年 9 月 12 日,OpenAI 发布 o1。官方对训练方法惜字如金,只有一句:"通过大规模强化学习,模型学会在回答前生成长的内部思维链,并不断打磨它。"思维链对用户隐藏,只展示摘要——这个保密决定,四个月后会招来一记响亮的回声。

数字先声夺人:美国数学邀请赛 AIME 上,GPT-4o 只能做对 12%,o1 做到 74%(再配上采样投票超过 83%);Codeforces 编程竞赛的等级分从"业余爱好者"跳到"击败 89% 的人类选手"。但比数字更重要的是官方博文里的两张图:AIME 成绩分别随训练期 RL 算力测试期思考算力的对数增长而线性上升——两条对数线性曲线。你在第二卷见过这种图的分量:它宣告了一条新的 scaling 定律。预训练的曲线(第二卷)之外,现在有了第二条(RL 算力)和第三条(思考时长)——"让模型想久一点"第一次被证明是可预测、可购买的商品。

三个月后预告的 o3 把"可购买"演示到了极端:在专测抽象推理的 ARC-AGI 基准上,低算力档得 75.7%(约 20 美元一题),高算力档(算力乘 172 倍)得 87.5%、首次跨过人类基准线——代价是每题数万美元。收益真实,账单也真实:从此讨论 test-time scaling,成本轴必须画在同一张图上。

但 o1 留给世界的是一个黑箱:思维链藏着、方法保密、只知道"是 RL"。**怎么做到的?**全行业都在猜。答案在四个月后到来,来自太平洋对岸,而且是以最不给面子的方式——全部公开。

5.3 R1:谜底公开(2025 年 1 月)

2025 年 1 月 20 日,DeepSeek 发布 R1:论文、完整配方、MIT 协议的全部权重,同日放出。它的历史地位一句话可以说尽:把 o1 闭门四个月的谜底,变成了人人可复现的公开 baseline。而论文里最震撼的不是 R1 本身,是它的前置实验——R1-Zero

实验设计干净得像教科书。取 V3 基模(就是第一卷第七章那个 671B),跳过所有 SFT,直接上第三卷的全套装备:GRPO 算法,奖励纯用规则——数学答案放进指定格式判对错、代码跑测试,外加一条格式奖励(思考过程装进 <think> 标签)。没有奖励模型,没有人类偏好,没有过程监督。最讲究的一笔是提示模板刻意极简:只要求"先推理后作答",不教任何推理策略——不教反思、不教分步、不教验算。这样一来,训练中涌现的一切行为都只能来自激励,不可能来自模仿。

然后是见证时刻。AIME 从 15.6% 一路爬到 71.0%(投票后 86.7%),追平 o1。与分数一起爬升的是另一条曲线:模型的平均思考长度随训练近乎单调增长——从几百 token 涨到上万 token。没有任何人、任何奖励项要求它想得更久;是 RL 自己发现了"多想有利于做对",于是学会了想更久。o1 那条神秘的 test-time scaling 曲线,原来不是设计出来的旋钮,是激励下的自然产物。训练日志里还有一个被广为传颂的瞬间:某个中间版本在解方程时突然写下——"等等,等等。这是一个值得标记的顿悟时刻(aha moment)"——然后自发回头重审解法。不用教方法,只给激励,模型自己发展出反思与重试:这就是第三卷第一章许诺过的"RL 的天花板是任务而非人类示范"的兑现现场。

科学的诚实要求把后续的冷水也浇上。几个月后有研究者指出:基模在 RL 之前就会低频地表现出反思行为("wait""let me check" 这类模式在基模的采样里就找得到),RL 是把这些低概率的既有模式放大成了高概率的策略——放大器,而非无中生有的创造者;响应长度的增长也有一部分来自 GRPO 目标函数的统计偏差(下一章细讲)。修正后的叙事没有那么浪漫,但更深刻,而且和本卷反复出现的主题严丝合缝:预训练藏好火种,后训练点燃它——CoT 用一句提示词点燃,STaR 用自举点燃,RLVR 用大规模强化点燃,一脉相承。

R1-Zero 有真实缺陷:纯结果奖励不在乎人类是否读得懂,思考过程中英夹杂、格式狂野。于是完整版 R1 走了一条四阶段流水线(上一章末尾你已见过它的骨架):数千条精修长思维链冷启动 SFT → 大规模推理 RL(加一条语言一致性奖励)→ 用 RL 模型拒绝采样出 80 万条数据回炉重训 → 全场景二次 RL(推理题用规则、通用题用 RM)。最终 R1 的 AIME 达 79.8%,与 o1 正式版相当。

行业冲击你在第一卷已看过宏观面("DeepSeek 时刻"),现在补上本卷视角的三个点:价格——API 定价约为 o1 的三十分之一,"推理是奢侈品"的定价体系一夜瓦解;公开——o1 藏起来的思维链,R1 全文展示,用户第一次亲眼看到模型"想"的样子(这后来成了所有推理产品的标配体验);复现——配方全开,此后三个月内推理 RL 的复现与改良论文以每周数篇的速度涌出,一个闭门的黑魔法变成了开放的工程学科。

5.4 涌现的降级:蒸馏把推理装进口袋

R1 论文还顺手完成了第三件大事,它回收了本章开头那个伏笔——"CoT 是百亿以上大模型的涌现能力"。

做法朴素到家:拿那 80 万条 R1 生成的推理样本,对一系列小模型(1.5B 到 70B)做纯 SFT 蒸馏,一步 RL 都不做。结果:7B 的蒸馏模型 AIME 到 55.5%——数学推理超过 GPT-4o;32B 到 72.6%——超过 o1-mini;连 1.5B 的口袋模型都有 28.9%,高于 GPT-4o。2022 年的"涌现"命题就此被改写:推理链一旦被大模型显式地写出来,小模型学它不需要任何涌现——只需要监督。神秘的相变,降级成了普通的师徒传授。

对照实验补上了另一半结论:对同一个 32B 基模直接做大规模推理 RL,只能到 47%——远不如蒸馏的 72.6%。上一章 7.1 节引用过的那个结论("小模型上蒸馏胜过直接 RL")的原始出处就在这里,机理也和"RL 是放大器"完全同构:小基模里火种太弱,放大器空转。随后的研究把"激发"推到了更极端:斯坦福的 s1 用一千条精选推理样本、16 张 GPU 训 26 分钟,就让一个 32B 模型的数学能力逼近 o1-preview——推理的"开关"可以被千级样本打开(天花板仍由基模决定)。到 2026 年,"蒸馏一个会推理的小模型"已经从研究问题降格为数据工程问题,开源推理数据集百万条级地流通。

站远一步看这一章的完整弧线:推理能力在预训练中孕育(第二卷的伏笔),被提示词偶然发现(2022),被大规模 RL 系统性点燃(o1/R1),再被蒸馏廉价地传遍整个生态(2025)——发现一次,点燃一次,复制无数次。这就是短短一年里"推理"从前沿实验室的黑魔法变成手机端小模型标配的完整机制。

质变讲完了,但工程的故事才开头:想多久才算够(想太久也是病)?GRPO 那台机器在万亿规模上磨出了哪些新刀?RL 到底是在"创造能力"还是"锐化分布"?以及当模型学会了推理,它离"替你干完一整天的活"还有多远?下一章,推理时代的工艺与暗礁。


本章要点