PPO 与会师——通往大模型的最后一站
三块拼图备齐了,这一章先完成组装(PPO),然后做全卷真正的目的所在:把语言模型正式放进强化学习的坐标系。读完这一章,你将带着一套完整的装备回到主线——第四卷里的每一个训练算法,对你都将只是"熟悉零件的新组合"。
5.1 PPO:用 min 和 clip 造护栏
上一章末尾的悬念:能否用一阶方法廉价逼近 TRPO 的信任域?2017 年 Schulman 等人的答案叫 PPO(Proximal Policy Optimization,近端策略优化——"近端"就是"别走远")。它把 TRPO 的"硬约束"换成了目标函数里的"软钳制":
$$ L^{\text{CLIP}}(\theta) = \mathbb{E}_t\Big[\min\Big(r_t(\theta)\,\hat A_t,\ \ \text{clip}\big(r_t(\theta),\, 1-\epsilon,\, 1+\epsilon\big)\,\hat A_t\Big)\Big] $$
零件全是熟人:$r_t$ 是重要性采样比率,$\hat A_t$ 是 advantage 估计(GAE 出品)。新面孔只有 clip 和 min,我们慢放拆解——这里也是初学者最容易被教错的地方。
clip 在做什么:把比率 $r_t$ 钳在 $[1-\epsilon, 1+\epsilon]$ 内($\epsilon$ 典型取 0.2,即比率限于 0.8 到 1.2)。含义:一个动作的概率相对旧策略变化超过 ±20% 后,继续变化不再带来任何梯度收益——激励被"平顶"了,推力自然消失。这就是软护栏:不硬性禁止出界,而是让出界无利可图。
min 在做什么——这是精髓,请细读。取"原始项"与"钳制项"中较小的那个,效果是一种刻意的不对称:当 $\hat A_t > 0$(好动作,想加大概率),钳制生效,收益封顶——概率涨到 1.2 倍就到头,再涨没奖励,防止对好动作用力过猛;当 $\hat A_t < 0$(坏动作,想减小概率),若比率反而涨过了界(新策略更爱这个坏动作),min 会选择不钳制的那个更负的项——惩罚不封顶,错误可以被全力纠正。一句话:涨有上限,纠错无上限——一个"悲观下界"目标,宁可少赚、不可失控。这正是浓雾山脊上该有的步态,而实现它只需要几行代码,普通梯度下降直接可用。
PPO 的江湖地位需要一个具体的锚:2019 年,OpenAI Five 用大规模 PPO 训练的智能体在 Dota 2 中 2:0 击败了世界冠军 OG 战队;三年后,把 ChatGPT 从续写机器调教成助手的 RLHF,用的还是它。从 Dota 打到 ChatGPT,是同一个算法——简单、皮实、对超参宽容,这些工程品质让它成了深度强化学习历史上被引用最多、被部署最广的算法。
5.2 会师:语言模型跨进 MDP 的坐标系
现在做全卷铺垫已久的那次对接。第一章埋的对应关系,此刻可以一次性铺满整个坐标系:
| RL 概念 | 语言模型对应 |
|---|---|
| 状态 $s_t$ | 提示词 + 已生成的前缀 |
| 动作 $a_t$ | 从词表选出的下一个 token(约十几万个候选) |
| 策略 $\pi_\theta(a\|s)$ | 模型的下一 token 概率分布——模型本身 |
| 一条轨迹 | 一次完整的回答生成 |
| 环境转移 | 拼接:新状态 = 旧状态 + 新 token(确定性!) |
| 奖励 | 对完整回答打的一个分数(末端、稀疏) |
这张表要配着它的特殊性清单读,因为语言场景的 MDP 和游戏很不一样,而每条特殊性都塑造了算法的取舍:
**环境是退化的。**没有真正的世界动力学——转移就是字符串拼接,确定、已知、无随机。整个回合只在末尾拿一次奖励。眯起眼看,这更像一台"上下文老虎机":给定题面(上下文),拉一次杆(生成一条完整回答),看一次结果。这个"其实没那么 MDP"的观察不是贬低——它预示了一件大事:那些为复杂环境设计的重型零件(比如逐步估值的 critic),在这里可能是杀鸡的牛刀。记住这句,两节之后兑现。
**策略不是从零学的。**游戏 RL 从随机策略起步,一切从乱按开始;语言 RL 从一个预训练+微调过的强大策略出发——RL 在这里是"精修"而非"启蒙"。这也解释了探索问题的退场:不需要 ε-greedy 或好奇心奖励,采样温度加上预训练分布本身就提供了足够的多样性。
多了一根缰绳:KL-to-reference。语言 RLHF 的标配是在优化中惩罚"当前策略与一个冻结参考模型(通常是 RL 之前的那份权重)的 KL 散度"。注意这和上一章的信任域不是一回事:信任域管"这一步别离上一步太远"(锚点随训练移动),KL-to-reference 管"无论训多久都别离出发点太远"(锚点固定)。为什么需要后者?两个理由。一是语言流形:奖励只说"分高就好",纯追奖励的策略可能漂移出"像人话"的区域——缰绳把它拴在流形上。二是奖励是可攻击的:语言 RL 的奖励常来自一个学出来的奖励模型,而学出来的东西就有漏洞可钻——限制策略漂移,等于限制它钻漏洞的自由度。这根缰绳的松紧(KL 系数)是 RLHF 最重要的旋钮之一;而 2025 年后的推理训练甚至开始把它整根扔掉——为什么敢扔,第四卷分解。
5.3 四模型机器:PPO-RLHF 的全家福
把 PPO 原样搬进语言场景,得到的是 InstructGPT/ChatGPT 谱系的标准机器。盘点一下同时驻留在显存里的角色,你会认出每一个:
- Policy(演员):被优化的模型本身——要训练(参数+梯度+优化器状态全套);
- Reference(锚点):冻结的出发点副本,只为算 KL 缰绳——只推理;
- Reward Model(打分员):给完整回答打分的模型(它怎么来的是第四卷主题)——只推理;
- Value/Critic(教练):估计每个 token 位置的价值,把末端的一个分数经由 GAE 摊派到几千个 token 头上(功劳分配的执行者)——要训练,规模常与 policy 相当。
看出代价了吗?四个大模型同时在场,其中两个要全套训练开销。回想第二卷的显存账(训练 ≈ 16 字节/参数),这台机器的显存账单是纯 SFT 的好几倍;工程复杂度(四个模型的调度、两套训练状态)同样翻倍。PPO-RLHF 能训出 ChatGPT,但它重。行业的下一步棋,几乎是被这份账单逼出来的。
5.4 GRPO 的门口:把教练裁掉
2024 年 2 月,DeepSeek 在数学推理训练中提出 GRPO(Group Relative Policy Optimization,组相对策略优化)。它对四模型机器下刀的位置,用你已有的知识一句话就能说穿——用第三章的 baseline 思想,裁掉整个 critic。
具体做法:对同一道题,用当前策略采样一组 $G$ 个回答(比如 16 个),各自拿到奖励分;然后用组内平均分当 baseline,每个回答的 advantage 就是它相对组平均的标准化超额分:
$$ \hat A_i = \frac{R_i - \text{mean}(R_1, \dots, R_G)}{\text{std}(R_1, \dots, R_G)} $$
其余照旧:重要性比率、clip、KL(挪进了损失项)。逐条核对你的知识清单:为什么组均值是合法 baseline?——第三章证过,减去不依赖动作的量,无偏(这里"同一道题的平均水平"扮演了 $V(s)$ 的角色,而且是用采样直接量出来的,不用学)。为什么在语言场景裁得起 critic?——5.2 节的观察兑现了:环境退化成"一题一答一分"的老虎机结构,critic 那套逐 token 估值的重型装备,本就是为真正的多步随机环境准备的;这里用"同题多答、互为对照"就能拿到质量不俗的 advantage。代价也直白:每道题要多生成 $G$ 倍的回答(推理开销上升),且整条回答共享一个 advantage(功劳分配退回粗粒度——好回答里的废话也被一起表扬)。
这笔交换在 2025–26 年被证明极其划算:省下一个与主模型同尺寸的可训练网络,显存和工程复杂度近乎减半,而推理训练的效果不降反升。到 2026 年,旗舰模型的推理 RL 几乎清一色是 critic-free 的组相对方法及其变体——PPO 的骨架仍在(比率、clip、advantage 加权的 $\log \pi$),只是教练下岗了,由"同题竞争者"们互相当参照。有研究者调侃这些方法是"披着 PPO 外衣的 REINFORCE"——你现在完全听得懂这句玩笑的深意,而这正是本卷想交付的能力。
5.5 卷末盘点:你的装备清单
强化学习速成到此结束。这一卷刻意砍掉了传统 RL 教材的大半版图(Q-learning、DQN、模型规划、探索理论——在 LLM 后训练的世界里它们几乎不出场),换来一条走得极实的主干。清点一下你背包里的装备,以及每件在下一卷的用途:
- MDP 与策略的语言——读任何后训练论文的坐标系;"模型即策略"的视角。
- 价值、advantage、baseline——GRPO 组均值、RLOO 留一法,全是它的变奏;"减基线降方差"是你能识别一切新算法的探针。
- 重要性采样比率——2025–26 年算法创新的主战场恰好搬到了这里(序列级比率、比率截断、训推不一致修正),你已有原理钥匙。
- clip 与信任域直觉——"涨有上限、纠错无上限";以及为什么有人调高上界(对抗熵坍缩,第四卷见)。
- KL 缰绳——拴住语言流形、限制钻奖励漏洞;以及"何时敢扔缰绳"的判断框架。
- on-policy 的代价意识——为什么 RL 后训练比 SFT 贵一个量级(样本要现场生成)、为什么全行业奔向异步基础设施。
- 奖励假设的阴影面——"算法只认合同的字面条款"。下一卷你会见到成建制的反面案例库:谄媚的模型、篡改单元测试的模型、学会向监控者隐藏意图的模型。
第一章的承诺可以验收了:RLHF、PPO、GRPO——这三个词的数学,此刻对你已无秘密。剩下的问题全是怎么用:奖励从哪来(人类偏好怎么变成奖励模型)、拿它训什么(从"听话"到"深思")、会出什么幺蛾子(reward hacking 的军备竞赛)。下一卷,后训练——续写机器变成推理者的完整现场,也是你最初那个问题的最终答案。
延伸阅读
想系统补 RL:Sutton & Barto《Reinforcement Learning: An Introduction》(官方免费 PDF,领域圣经);OpenAI Spinning Up(策略梯度到 PPO 公认最清晰的推导);Lilian Weng 的博客 Policy Gradient Algorithms(一页串起全谱系)。中文:西湖大学赵世钰《强化学习的数学原理》(B 站公开课)、上海交大《动手学强化学习》。通往下一卷的桥:Nathan Lambert 的开源书《RLHF Book》(rlhfbook.com)。
本章要点
- PPO 的 clip 目标:比率出 $[1\!-\!\epsilon, 1\!+\!\epsilon]$ 即梯度断流;min 造成不对称——好动作收益封顶、坏动作惩罚不封顶(悲观下界);一阶实现信任域,从 Dota(OpenAI Five 胜 OG)用到 ChatGPT。
- 会师坐标系:模型=策略、前缀=状态、token=动作、生成=轨迹、末端一个分数;特殊性:转移确定(近似上下文老虎机)、从强策略起步(探索退场)、多一根 KL-to-reference 缰绳(拴语言流形+防钻奖励漏洞,与信任域不同:锚点固定)。
- PPO-RLHF 四模型机器:policy+critic 要训练、reference+RM 只推理;critic 负责把末端奖励摊派到每个 token;账单沉重。
- GRPO = 用组内平均分当 baseline、裁掉 critic:合法性来自第三章的 baseline 定理,可行性来自环境的老虎机结构;代价是 $G$ 倍采样与粗粒度功劳分配;2026 年旗舰推理 RL 几乎全面 critic-free——"披着 PPO 外衣的 REINFORCE"。
- 装备清单齐整:MDP 语言、advantage/baseline、重要性比率、clip、KL 缰绳、on-policy 代价、reward hacking 警觉——第四卷全部即插即用。