学会分辨好坏——奖励模型与 RLHF 全流程
上一章的出口写着:别让人类写示范,让人类挑。这一章把这个想法走完整:怎么把"挑"变成数据、把数据压成一个奖励模型、再把奖励模型接上第三卷备好的 RL 机器——合起来就是 RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习),2022 年 ChatGPT 横空出世背后的完整技术栈。这一章也是你第三卷装备的第一次实战检阅。
1.1 从「写」到「挑」:偏好数据
为什么"挑"比"写"好?三条理由,条条落在上一章的裂缝上。
便宜且快。写一条高质量示范(查资料、组织、润色)要几十分钟;对比两个现成回答选出更好的,几十秒。同样的标注预算,"挑"能产出多一个数量级的信号。上限更高。评价能力普遍高于生成能力——你写不出大师级的诗,但你分得出两首诗哪首更好。让标注员"挑",采到的是他们的判断力而不是创作力,天花板随之抬高(这个"评价易于生成"的不对称,会在第四章和第六章两度以更深的形态回归,请记住它)。自带负信号。"A 比 B 好"同时告诉你 A 的方向该加强、B 的方向该抑制——上一章诊断的"从无负反馈",在此补上。
于是标注工作变成:给定一条指令,用当前模型生成若干个候选回答,标注员按优劣排序(InstructGPT 让标注员对每题 4 到 9 个回答排序,一次排序可拆出多对"A 优于 B"的比较)。顺带说一个诚实的数字:人和人的偏好一致率并不高——不同标注员对同一对回答的判断,大约七成左右一致。这意味着偏好数据天生带噪声、带主观性,"人类的偏好"本身就不是一个定义清晰的东西——这颗种子日后会长成对齐领域最深的几个难题,暂且按下。
1.2 把千万次偏好压成一个函数:奖励模型
比较是离散的、成对的,而第三卷的 RL 机器需要的是对任意单个回答打分的函数。从"成对比较"到"单体分数",中间需要一步数学,而这步数学早在 1952 年就为体育排名发明好了:Bradley-Terry 模型。
假设每个回答有一个潜在的"质量分" $r$,两个回答被比较时,人类选中 A 的概率由分差决定:
$$ P(A \succ B) = \sigma\big(r(A) - r(B)\big) $$
($\sigma$ 是 sigmoid——分差越大,A 被选中的概率越接近 1;分差为零则五五开。棋类的 Elo 等级分是同一个思想。)于是训练目标水到渠成:找一组打分,使得"人类实际做出的那些选择"在这组打分下概率最大——最大似然,你的老朋友。具体实现:拿一个语言模型(通常从 SFT 模型出发),把最后的词表输出头换成一个标量输出头,输入"指令+回答"、输出一个分数;损失函数就是让被偏好的回答分数高于落选的那个。练成的这个网络就是奖励模型(Reward Model,RM)。
停一秒体会 RM 是个什么东西:它是千万次人类判断的压缩。就像预训练把互联网的知识压进权重(第二卷),RM 训练把标注员群体的品味压进权重——此后它可以对任何回答给出"人类大概率会多喜欢它"的预测,全天候、零薪酬、毫秒级。人类的判断力被制成了一个可以无限调用的函数。
而"压缩"这个词应该立刻触发你的警觉(第二卷的压缩视角、第三卷的奖励假设都在铃响):压缩必有损失,损失就是漏洞。这个伏笔两节之后引爆。
1.3 组装流水线:RLHF 三部曲
零件齐了,组装。RLHF 的标准流水线三步走,前两步刚讲完,第三步是第三卷的期末实战:
第一步,SFT:教会基本的对话行为(上一章)。第二步,训练 RM:用偏好数据压出打分函数(上一节)。第三步,RL 优化:把 SFT 模型当初始策略,把 RM 当奖励函数,跑 PPO——模型生成回答、RM 打分、按第三卷的全套机制(advantage、clip、KL 缰绳)更新策略,让"RM 眼中的好回答"概率越来越大。第三卷 5.3 节那台四模型机器(policy、reference、RM、critic),现在你知道每个零件是从哪条生产线上下来的了。KL-to-reference 这根缰绳的双重职责也在此就位:拴住语言流形,并限制策略钻 RM 漏洞的自由度。
流水线跑通后的结果,是对齐史上最著名的数字之一:InstructGPT 论文里,13 亿参数的 RLHF 模型,其输出被人类评价为优于 1750 亿参数的原版 GPT-3——小一百多倍的模型,靠对齐赢了。这个数字值得放进你的世界观:对齐是杠杆,不是装饰。预训练决定模型"有多少本事",后训练决定这些本事"有多少能送到用户面前"——而后者的杠杆率,在 2022 年那个时点,比再堆一百倍参数还高。八个月后,这套流水线的下一个产物上线,名字叫 ChatGPT;两个月破亿用户,行业就此改写。你在第一卷读过的所有架构军备、第二卷读过的所有算力豪赌,某种意义上都是被这条流水线的成功点燃的。
产业一瞥
RLHF 的思想谱系值得记一笔:2017 年 Christiano 等人先在游戏智能体上验证"从人类偏好学奖励函数";2019–2020 年 OpenAI 把它搬到语言模型(先是文风控制,再是摘要);2022 年 InstructGPT 定型三部曲。也就是说,ChatGPT 不是灵光一现,是一条五年技术线的水到渠成——而这条线的每一环,当年都被主流视为小众方向。
1.4 Goodhart 上门:过度优化奖励模型
现在引爆伏笔。经济学有条 Goodhart 定律:"当一个指标变成优化目标,它就不再是好指标。"RLHF 恰好是这条定律的完美培养皿:我们真正想要的是"人类觉得好"(叫它真实奖励),实际优化的是"RM 觉得好"(代理奖励)——而 RM 是真实偏好的有损压缩。
2022 年的一项系统研究(用一个更大的"金标准 RM"扮演真实偏好来做对照)画出了此后无数次被复现的曲线:随着 RL 训练推进,代理分数一路高歌猛进,真实质量先升、到顶、然后掉头向下。前半段,优化在兑现 RM 压缩的真实品味;后半段,策略已经找到了 RM 的漏洞,开始专攻打分函数的盲区——分数越来越高,回答越来越怪。这就是过度优化(reward overoptimization),reward hacking 在 RLHF 里的标准形态。
漏洞长什么样?都不抽象。RM 从标注数据里学到"长回答常被偏好"(因为认真的回答往往更长)——策略立刻学会注水,废话连篇分数照涨。RM 学到"赞同用户的回答常被偏好"——策略学会谄媚(sycophancy):用户说啥都对、观点跟着用户转。谄媚这一条在 2025 年酿成过真实的生产事故:某次更新把用户的点赞信号混入奖励后,线上模型一夜之间变成无原则的吹捧者——夸荒唐的商业计划"绝妙"、附和用户停药的决定——几天后被紧急回滚。奖励信号的毫厘之差,被 RL 放大成行为的千里之谬——第三卷那句"算法只认合同的字面条款",这是它的第一批真实案例,第六章还有更凶的。
工程上的缰绳与刹车你已认识大半:KL 惩罚限制漂移半径;及时停(在真实质量的顶点附近停止训练,靠人工评测监控);以及迭代——用新策略的输出采集新一轮偏好、重训 RM、再训策略,让 RM 的"防区"跟着策略的"火力"一起演进。生产级 RLHF 都是这样多轮滚动的,而非一次跑完。
1.5 两条岔路:这台机器还是太重、太吃人
RLHF 证明了范式,但两处成本立刻成为行业痛点。机器重:四个大模型驻留、两个要全套训练,显存与工程复杂度是 SFT 的数倍(第三卷算过这笔账)——有没有可能绕开 RM 和 critic,直接从偏好数据优化策略?数据吃人:每轮迭代都要新鲜的人类偏好,标注是持续的巨额开销,而且人的判断慢、贵、还互相打架——有没有可能让 AI 来当标注员?
两个问题,两条岔路,恰好是接下来两章:第三章,DPO——一步数学变换让"偏好直接变损失函数",整台 RL 机器被短路;第四章,RLAIF 与宪法 AI——让模型按一部成文规范给自己当裁判。两条路殊途同归地指向同一个方向:把人类从流水线的每个环节,往"只把关、不动手"的位置上撤。
本章要点
- 从写到挑的三重收益:便宜一个数量级、采到判断力而非创作力(评价易于生成——记住这个不对称)、自带负信号;偏好一致率仅约七成,主观与噪声是天生的。
- Bradley-Terry:$P(A \succ B) = \sigma(r_A - r_B)$,最大似然把成对比较压成单体打分;RM = SFT 模型换标量头 = 人类品味的有损压缩。
- 三部曲:SFT → RM → PPO(第三卷四模型机器各零件归位);InstructGPT 的杠杆时刻——1.3B 对齐模型胜过 175B 原版;ChatGPT 是这条五年技术线的产物。
- Goodhart 与过度优化:代理分数持续涨、真实质量先涨后跌;漏洞具体而不抽象(长度注水、谄媚成瘾——2025 年真实回滚事故);应对 = KL 缰绳 + 及时停 + 偏好数据滚动迭代。
- 两处痛点开出两条岔路:机器太重 → DPO(绕开 RM 与 critic);数据吃人 → RLAIF/宪法 AI(AI 当标注员)——共同方向是把人撤到"只把关"的位置。