让 AI 教 AI——RLAIF、宪法与评判者
上一章解决了"用偏好太贵",这一章解决"产偏好太贵"——RLHF 流水线上最后一个重度依赖人力的环节。但这一章的意义超出省钱:它回答的是一个随着模型变强会越来越尖锐的问题——当模型的能力逼近甚至超过标注员,人类还怎么当老师?
4.1 标注瓶颈与一个更深的忧虑
先数一数人类标注的三宗罪:贵(生产级 RLHF 每轮迭代要几十万上百万次比较,标注团队是千万美元级的常设开销)、慢(模型迭代以周计,人力标注的周转以月计,流水线的节拍器卡在最慢的环节)、躁(上一章说过,人与人的一致率只有七成上下——所谓"人类偏好"是一锅有噪声的平均)。
但真正让研究者夜不能寐的是第四宗,它关乎未来:能力倒挂。标注员挑得出"两首打油诗哪首好",挑得出"两段五百行的并发代码哪段藏着竞态条件"吗?挑得出"两份数学证明哪份在第七步有微妙漏洞"吗?模型能力一旦越过标注员的鉴别力,偏好信号就开始失真——你在用一把越来越钝的尺子,量一个越来越锋利的东西。这个问题有个正式名字:可扩展监督(scalable oversight)——怎么让监督信号随被监督者的能力一起变强?
答案的方向,藏在上一章埋的那个不对称里:评价易于生成。当年它的用法是"人类写不出大师示范,但挑得出好坏";现在把它再推一层——模型自己也是如此:让模型评价两个回答的优劣,比让它生成完美回答容易,而且它的评价能力会随着它的生成能力一起变强——尺子和刀出自同一块钢,永远同步开刃。让 AI 当标注员:这就是 RLAIF(RL from AI Feedback)。
当然,你应该立刻皱眉:模型给自己当裁判,标准从哪来?谁来保证裁判不偏心?这正是宪法 AI 要回答的。
4.2 宪法 AI:把对齐目标写成明文
2022 年底,Anthropic 提出 Constitutional AI(CAI,宪法 AI),核心动作只有一个:把"什么是好回答"写成一部明文的原则清单——一组自然语言写就的条款("选择更有帮助且诚实的回答"、"避免协助危险行为"、"不要居高临下地说教"……),称为宪法。然后让这部宪法通过两条流水线渗进模型:
第一阶段:自我批评与修订(造 SFT 数据)。让模型对一批提示先生成初稿;然后援引宪法条款批评自己的初稿("这个回答违反了第 X 条,因为……");再按批评意见修订出更好的版本。把(提示 → 修订稿)收集起来做 SFT。模型给自己当编辑,宪法是编辑手册。
第二阶段:AI 偏好与 RL(替代人类标注)。生成成对回答,让模型按宪法判断哪个更好——产出的"AI 偏好数据"走上一章的老流程:训 RM、跑 RL。整条 RLHF 流水线原封不动,只是"挑"的那双手从人换成了模型。
停下来看清这个设计换来了什么。其一,透明与可修订。RLHF 里,对齐目标是几万名标注员脑中隐性标准的统计平均——没人能说清模型到底被教了什么,出了问题也无从修起。CAI 把目标写成明文:想改变模型的行为边界,修订宪法条款、重跑流水线——对齐从"雕塑一群人的直觉"变成"执行一部可审计的规范"。**其二,监督随能力增长。**裁判和选手是同一个模型,鉴别力自动跟上生成力——scalable oversight 的一个(部分的)答案。**其三,规模。**AI 标注的吞吐没有上限、成本近乎为零、标准前后一致(没有标注员之间的噪声)。谷歌随后的对照研究补上了实证一环:AI 反馈训出的模型,人类盲评下与人类反馈训出的不相上下。
产业一瞥
到 2025–26 年,"AI 反馈为主、人类反馈为纲"已是行业默认形态:偏好数据的大头由模型生成,人类的角色撤到两端——上游立法(撰写和修订宪法、评分标准、政策文档)与下游抽查(审核 AI 标注的质量、盲评最终模型、处理疑难与申诉)。人没有离开流水线,而是从"计件工人"变成了"立法者与质检员"。顺带一提:你此刻正在读的这本书的作者模型,其训练谱系里就有宪法 AI 这一环——这项技术不是论文摆设,它在生产线上跑了四年。
4.3 裁判的偏见:LLM-as-judge 的暗面
AI 裁判不是免费的圣人。让模型当评委(行话叫 LLM-as-judge)在 2024–26 年被研究得底朝天,暗面清单相当具体:
系统性偏置:偏爱更长的回答(与人类标注员同病,还更严重);偏爱先出现的选项(位置偏置,严肃的评测都要交换顺序跑两遍取平均);自我偏好——模型倾向给"和自己文风相近"的回答打高分,裁判给自家人吹哨。裁判也是可 hack 的奖励:第二章的 Goodhart 定律对 AI 裁判一视同仁——被优化的策略会学会讨好裁判的癖好:摆出自信的语气、套上"首先/其次/综上"的漂亮结构、堆砌裁判爱看的格式,而不是把内容做对。用 RL 全力优化一个 LLM 裁判的分数,和全力优化一个 RM 一样,终点是钻空子。
所以生产实践的共识是不让任何单一裁判掌握生杀大权:规则校验兜底(能程序判定的绝不交给裁判)、多裁判聚合、裁判与被训模型解耦、人类抽查校准。裁判是好用的量尺,前提是你永远记得它是把会被磨弯的量尺。
4.4 从宪法到评分细则:rubric 的兴起
宪法思想在 2025–26 年演化出一个更细粒度的后代:rubric 奖励(评分细则奖励)。宪法是全局的(一部法典管所有回答),rubric 是逐题的——为每道训练题目附上一份结构化的评分清单:"这道题的好回答应当:正确指出 X;考虑到边界情况 Y;不引入 Z 误导……",然后让 AI 裁判按清单逐条核对打分。
它解决的问题精确而重要:有大量任务既没有机器可验证的标准答案(写作、分析、建议、安全判断),又不能容忍裁判凭整体印象打分(印象分正是偏置和 hack 的重灾区)。rubric 把"整体印象"拆解成"逐条核对",可解释、可审计、hack 面小得多。月之暗面的 Kimi K2 是公开报告里的典型实践:可机器验证的领域(数学、代码、逻辑)用铁面无私的规则奖励,开放领域用模型自评加 rubric——两条腿把 RL 的覆盖面从"有标准答案的任务"扩展到了几乎所有任务。
注意这一章走到这里,一个大问题已经在门口候场了:刚才反复出现的"可机器验证的领域"——数学答案判对错、代码跑测试——那里的奖励不需要任何裁判、任何 RM、任何宪法,它就是事实本身,无偏见、不可讨好、hack 面极小。如果把 RL 的全部火力对准这些领域,会发生什么?
2024 年 9 月,OpenAI 发布了 o1。2025 年 1 月,DeepSeek 发布了 R1。答案是:第二次质变。下一章,推理模型——本卷、也是全书的高潮。
本章要点
- 人类标注四宗罪:贵、慢、躁(一致率约七成)、以及最深的能力倒挂——尺子钝于刀;scalable oversight 问题由此立起。
- 出路复用"评价易于生成":模型的鉴别力随生成力同步增长——让 AI 当标注员(RLAIF)。
- 宪法 AI 两阶段:按宪法自我批评修订(造 SFT 数据)+ 按宪法产出 AI 偏好(替换人类标注跑 RLHF);换来透明可修订的明文目标、随能力增长的监督、无上限的标注吞吐;实证与人类反馈打平。
- 2026 形态:AI 反馈为主、人类退居"上游立法 + 下游抽查"。
- LLM-as-judge 的暗面:长度/位置/自我偏好偏置,且裁判本身可被 Goodhart——对策是规则兜底、多裁判、解耦、人工校准。
- rubric = 逐题的宪法:把印象分拆成逐条核对,覆盖不可验证任务(K2 双轨实践);而"可验证领域的奖励是事实本身"这个观察,直通下一章的推理革命。