另一种学习——从「有标准答案」到「只有后果」
这一卷要补的课,是你的知识版图上最后一块空白:强化学习(Reinforcement Learning,RL)。先说清楚为什么绕不开它。前一卷的结尾说,预训练的王座已经让位——2024 年之后,模型能力最陡峭的增长来自后训练,而后训练的引擎正是强化学习:教会模型"听话"的 RLHF 里有它,教会模型"深度思考"的 o1/R1 路线更是把它推到了绝对核心。你想看懂"续写机器怎么变成推理者",就必须先看懂 RL。
这一卷的写法和前两卷不同。前两卷你有深度学习的底子,我们可以快走;RL 对你是全新的数学世界,所以这一卷放慢速度,一条主线走到底:问题框架(本章)→ 价值(第二章)→ 策略梯度(第三章)→ Actor-Critic 与稳定性(第四章)→ PPO 与通向大模型(第五章)。每一站只为下一站服务,不铺支线;但每一站都把"为什么需要它"讲透。终点站很明确:读完本卷,第四卷里的 RLHF、PPO、GRPO 对你将不再有任何数学障碍。
1.1 监督学习的边界:老师不在场的时候
先回到你熟悉的地方。你学过的所有训练——MLP 分类图片、LSTM 预测序列、Transformer 预测下一词——本质上都是监督学习:每个输入都配着一个标准答案,模型答错了,损失函数立刻告诉它错在哪、往哪改。这套范式强大到统治了深度学习,以至于很容易忘记它站在一个奢侈的前提上:每一步都有老师在场,且老师知道正确答案。
现在考虑几件人类真实在学的事。学骑自行车:没有任何老师能告诉你"此刻你的左手应该往回收 3.2 度"——根本不存在这样的标准答案,你歪了、摔了、爬起来再试,最后"就会了"。学下围棋:第 37 手到底该下哪?连世界冠军也只能说"我感觉这里好"——唯一确定的反馈是三百手之后的胜负。经营一家公司、和人谈判、写一篇打动人的文章——全都一样:没有逐步的标准答案,只有延迟到来的后果。
把"骑自行车"换成我们的主角:让语言模型解一道数学竞赛题。它要生成几千个 token 的推理过程,中间要做几十次"下一步往哪推"的决策。哪有标准答案?同一道题有无数条正确的推理路径,也有无数种在第 40 步看起来很有希望、实则通向死胡同的路径。你唯一确定知道的,是最后算出来的数字对不对——一个延迟的、粗糙的、只有一个比特的信号。监督学习的框架装不下这件事,这不是技术困难,是范式错位。我们需要一套为"没有答案、只有后果"而生的数学。这就是强化学习。
1.2 试错:一个古老思想的数学化
RL 的核心思想古老得可以追溯到心理学:行为的后果塑造行为。桑代克把猫关进迷箱,猫乱抓乱撞偶然碰到开关逃出来吃到鱼;多关几次,猫"乱撞"得越来越少、直奔开关越来越快。桑代克称之为效果律:带来好结果的行为被强化,带来坏结果的行为被削弱——"强化学习"这个名字就从这来。注意这里没有任何"教学"发生:没人给猫演示开关怎么用,猫是从自己行为的后果里学的。
把这个思想变成可计算的数学,需要回答三个问题,它们正是 RL 区别于监督学习的三道坎,值得你逐条记住:
第一,反馈是评价而不是指导。老师批改作文会告诉你第二段哪里逻辑断了(指导性反馈:错在哪、怎么改);观众只会鼓掌或嘘声(评价性反馈:好或不好,仅此而已)。RL 里的反馈叫奖励(reward),是评价性的——一个分数,不附带任何"该怎么改"的说明。从"只知道好坏"里推断出"该怎么改",是 RL 全部算法要解决的核心难题。
**第二,后果是延迟的。**下赢一盘棋,功劳属于三百步中的哪几步?解出一道题,关键是哪一次转折?奖励往往在一长串决策的末尾才出现,而学习需要把这份"总账"摊派到每一个具体决策头上——这个难题有个专名,功劳分配问题(credit assignment),它是第二、三章大部分数学的存在理由。
**第三,数据是自己挣的。**监督学习的数据集是固定的、别人给的;RL 里,你见到什么数据取决于你怎么行动——猫不去碰开关,就永远不知道开关有用。于是产生一个监督学习里不存在的两难:是继续做已知有效的动作(利用),还是尝试没做过的动作看看有没有更好的(探索)?只利用会困在平庸的舒适区,只探索永远学不会稳定的本事。这个"探索-利用权衡"没有免费的解,每个 RL 算法都要对它表态。
1.3 把问题说清楚:MDP
思想有了,现在做数学化。RL 给"在后果中学习"建立的标准形式叫马尔可夫决策过程(Markov Decision Process,MDP)。别被名字吓到,它只是把"智能体在世界里行动"这件事拆成了五个零件。我们边定义边用两个例子对照:一个是走迷宫的机器人(教学经典),一个是解题的语言模型(我们真正的目的地)。
状态(state,$s$):世界此刻的样子,是决策的全部依据。机器人:我在迷宫的哪个格子。语言模型:题目加上我到目前为止已经写出的所有 token——注意这个对应,它在第五章会成为主角。
动作(action,$a$):此刻可做的选择。机器人:上下左右。语言模型:从词表里选下一个 token——词表有十几万个词,所以这是一个动作空间大得惊人的 MDP。
转移(transition,$P(s'|s,a)$):做了动作后世界怎么变。机器人往北走,大概率到北边格子(也许地滑,小概率偏西)——转移可以是随机的。语言模型:写下一个 token 后,新状态就是"原文本 + 这个 token",确定无疑。
奖励(reward,$r$):每步转移后世界给出的分数。机器人:走到出口 +100,掉进坑 −100,平时每步 −1(这个 −1 是个精妙设计:它无声地催促机器人别磨蹭——奖励函数的每个数字都在塑造行为,后面我们会反复见识这件事的威力和危险)。语言模型:中间每一步都是 0,最后答案对了 +1、错了 0——极度稀疏的奖励,这正是难点所在。
折扣因子($\gamma$):一个 0 到 1 之间的数,刻画"未来的奖励值多少现钱"——它的完整故事留给第二章。
五个零件里藏着一条重要的假设,就是名字里的"马尔可夫":状态必须装下决策所需的全部信息——知道现在,就不需要知道过去是怎么走到现在的。机器人在 (3,5) 格,它怎么绕到这的不影响接下来该怎么走。这个假设是整套理论的地基(第二章的递归式全靠它成立)。对语言模型它天然满足:状态本来就是"到目前为止的全文",历史全在里面。
最后是主角:策略(policy,$\pi$)——从状态到动作的规则,"处在什么局面该做什么"。一般写成概率形式 $\pi(a|s)$:状态 $s$ 下选各个动作的概率分布。**RL 的全部目标就是找一个好策略。**而对语言模型,请把这句话读两遍:语言模型本身就是一个策略——给定前文(状态),它输出下一个 token 的概率分布(动作分布)。第一卷讲的整个架构,从 RL 的眼光看就是一个 $\pi(a|s)$ 的实现。这两个领域将在第五章正式会师,但你从现在起就可以带着这副对应关系读后面的一切。
「奖励假设」——整座大厦的地基
RL 有一条不加证明的信念,Sutton(这个领域的奠基人)称之为奖励假设:任何目标都可以表述为"最大化累积奖励的期望"。想让机器人快点走出迷宫?把目标编码成奖励(+100/−1)。想让模型答对题?答对给 1。这条假设的强大在于统一——五花八门的目标全部塞进一个数学框架;它的危险在于编码总是有损的:"你写下的奖励"和"你真正想要的"之间永远有缝隙,而 RL 算法只会不知疲倦地钻缝隙。这个缝隙有个名字叫 reward hacking,它会是第四卷反复出现的反派。现在只需记住:奖励函数是你与算法签的合同,算法只认字面条款。
1.4 轨迹与目标:这门学问到底在优化什么
零件齐了,把一次完整的经历串起来。智能体从初始状态出发,按策略选动作、收奖励、进入新状态、再选动作……直到回合结束(走出迷宫/生成了结束符)。这一串 $s_0, a_0, r_1, s_1, a_1, r_2, \dots$ 称为一条轨迹(trajectory)。机器人的轨迹是一次完整的走迷宫;语言模型的轨迹是一次完整的答案生成——几千个 token 的推理过程,就是几千步决策连成的一条轨迹。
一条轨迹的总收成叫回报(return):沿途所有奖励的(折扣)总和。于是 RL 的目标可以用一句话写尽:
$$ \text{找到策略 } \pi\text{,使得按它行动得到的轨迹的期望回报最大。} $$
注意"期望"二字:策略是随机的、环境可能是随机的,同一个策略每次走出的轨迹不同,我们优化的是平均表现。这句话就是整卷的总纲——后面四章的所有数学,全部是在为"怎么找到这个 $\pi$"服务:第二章先解决"怎么评估一个局面/策略的好坏"(价值),第三章解决"怎么根据评估直接改进策略"(策略梯度),第四、五章解决"怎么改得又快又稳"(Actor-Critic、PPO)。
出发之前,最后校准一次期待。你可能听说过 RL 的赫赫战功:1992 年 TD-Gammon 自学西洋双陆棋逼近人类顶尖水平、2013–2015 年 DQN 用同一套网络从像素学会四十九款雅达利游戏、2016 年 AlphaGo 以 4:1 击败李世石——这些故事共同的关键词是"没有人类逐步示范,从后果中自己学出超越人类的策略"。这正是 RL 对语言模型的诱惑:预训练和监督微调的天花板是人类示范(你只能模仿到人类的水平),而 RL 的天花板是任务本身——只要奖励信号真实(比如"答案对不对"这种可以机器判定的事实),模型就有可能学出人类没教过、甚至人类想不到的解法。第四卷讲 R1 的"aha 时刻"时,你会亲眼看到这一点。
但从"目标"到"能落地的算法"隔着几道认真的数学关卡。第一道关卡是:轨迹很长、奖励在最后——**怎么给"未来"定价?**下一章,价值函数。
本章要点
- 监督学习的前提是"每步有标准答案";骑车、下棋、解题这类任务只有延迟的后果——需要为"评价性反馈"而生的新范式。
- RL 三道坎:反馈只评价不指导;后果延迟(功劳分配问题);数据自己挣(探索-利用权衡)。
- MDP 五零件:状态(决策的全部依据,马尔可夫性)、动作、转移、奖励、折扣;策略 $\pi(a|s)$ 是主角。
- 关键对应(第五章会师):语言模型 = 策略;前文 = 状态;下一 token = 动作;一次生成 = 一条轨迹;解题对错 = 稀疏的末端奖励。
- 奖励假设:一切目标 = 最大化期望累积回报;奖励函数是"只认字面条款的合同"——reward hacking 的种子在此埋下。
- RL 的天花板是任务而非人类示范——这是它能把模型带到"人类没教过的解法"的原因,也是它成为推理模型引擎的原因。