跳到主要内容

为什么需要 RLHF — 续写机与答话机的差距

这一章讲三件事: 一个「刚读完互联网」的模型和一个你天天在用的聊天模型,差距具体在哪; 把前者变成后者的那套技术(RLHF)分几步、每步干什么;以及这条技术线是怎么从游戏 AI 一路走到 ChatGPT 的。读完你手里会有全书的地基——后面每一章都在拆这章给出的某一步。

1. 先看现象:同一个问题,两种生物的回答

拿这句话去喂一个 2024 年最大级的开放模型(开放,指模型文件公开可下载;Llama 3.1 405B 的基座模型——大规模读文本调教出来的底子,也就是刚做完 大规模读文本、还没做任何对话改造的原始版本):

The president of the united states in 2006 was

它的续写是:

George W. Bush, the governor of Florida in 2006 was Jeb Bush, and John McCain was an Arizona senator… September 1 – U.S. President Bush signs an executive order… 2009 was a common year starting on Thursday of the Gregorian calendar…1

信息其实都在——它知道 2006 年总统是小布什。但它把网页正文、新闻标题、维基百科的 年份条目全糊在一起吐出来,因为它在做的事只有一个:接着往下写「像训练材料的东西」, 而训练材料就是这样的网页。

把同一个模型做完本书要讲的那套训练再问一遍,回答变成了:

George W. Bush was the president of the United States in 2006. He served two terms in office, from January 20, 2001, to January 20, 2009.2

同一个基座模型,前后两次回答:
训练前:信息对,但混着网页垃圾,格式失控 —— 它在「续写互联网」
训练后:一句话,直接回答,干净利落 —— 它在「回答你这个人的问题」

图说:知识没变,变的是「用这些知识的方式」。这一步改造,就是全书的主角。

这一章的主走查就是这组对照。后面每一节都会回到它:第 2 节说这个改造的技术叫什么、 分几步;第 4 节说它动的到底是什么;第 5 节说为什么这套改造的潜力比想象的大。

2. 这套改造叫 RLHF,标准做法分三步

上面那个从「续写」到「答话」的过程,行话叫后训练(post-training):大规模读文本的 阶段结束之后,对模型做的所有后续训练3。而后训练中最出名的技术,就是本书的书名 RLHF——Reinforcement Learning from Human Feedback,用人类反馈的强化学习: 把人对模型输出的评价,变成训练信号去改造模型——这门手艺服务的目标,行话叫对齐(让机器的行为对准人的意图)4

一个能被拿去做 RLHF 的模型,标准流水线分三步5:

步骤干什么我们的哪一章拆它
① 指令微调教会模型「一问一答」的基本格式第 03 章
② 训奖励模型把人的偏好压成一个能自动打分的模型第 04 章
③ 强化学习优化让模型对着这个打分机器改进自己第 05、06 章

本书围绕这三步展开,再加两条重要的支线:不训中间的奖励模型、直接在偏好数据上下手的 DPO 一族(第 08 章),和不打主观分、直接判对错的 RLVR(第 07 章)。

后训练的三件套:RLHF 只占其中一件

今天说「把模型调好用」,指的是一整套多阶段流程,书里把它归成三类优化6:

管什么一句话
指令微调(SFT)格式与形式教模型「像问答的样子」,学的是语言里反复出现的套路(行话叫特征)
偏好微调(RLHF 的主场)风格与微妙偏好让模型对准人「说不清但选得出」的判断
RLVR可验证的硬技能数学、代码这种能自动判对错的领域

RLHF 统治第二类——因为「什么样的回答好」这件事写不出公式,只能靠人喂偏好数据7。 这个「写不出公式」为什么是本质困难,第 09 章会从哲学和经济学的地基拆起。

3. 这套东西是最近才有的:三个时代

RLHF 的完整历史只有十几年,书里切成三段8

2008–2017:在游戏里试。 最早的类似做法(TAMER,2008)是人看着游戏 agent(游戏里做决策的那方)的动作 逐个打分,让 agent 学会「人喜欢什么」。2017 年的开山论文(Christiano et al.)让人在 Atari 游戏的两段操作录像里二选一,用这些选择当训练信号9——人不示范怎么做, 只当裁判,这个形状延续到了今天。

2019–2022:搬进语言模型。 2019 年 OpenAI 的那篇「Fine-Tuning Language Models from Human Preferences」把今天的主干术语全部定了型:奖励模型、KL 散度正则(第 02 章讲)、 反馈流程图——只是当时的任务还是「写一段续写但不写坏话」这种小场景10。之后几年, 这套方法被依次用到摘要、问答、上网查资料、对话上,全部长在 GPT(OpenAI 的模型家族)这条线上:查资料那一站叫 WebGPT,对话那一站叫 Sparrow11

2022 至今:ChatGPT 时代。 ChatGPT 发布公告里写得明白:用的就是 InstructGPT 的 方法,只是数据收集略有不同12。此后 Llama 2/3、Claude、Nemotron、Tulu 3 全线跟进, RLHF 从一篇论文变成了整个行业的标准工序13

判断(我们的,不是书里的): 这条历史线里最值得记的不是哪个年份,而是 「从 2019 到 2022 有整整三年的断层」——方法 2019 年就定型了,但直到 ChatGPT 才被证明「装在一个大家真的会用的产品里」。技术成形和产品破圈之间,隔的不是研究, 是工程与胆量。 如果错,会错在: 如果 2019–2022 年间已有同量级的产品化尝试(只是没公开), 那「断层」就是公开信息的假象,不是历史的真实形状。

4. RLHF 到底动了模型的什么:风格,以及风格之上的行为

书里给的最有力视角是风格(style):同一份信息,用无所谓还是体贴的口气说、 用一行话还是分点列表说,体验天差地别14。书里给了一组对照:同一个「明天要演讲 我好慌」的求助,一种回答是「你没事的,练两遍赶紧睡」;另一种先接住情绪 (「这确实让人紧张,很正常」),再给一条能立刻做的小事15。信息量差不多, 但后者是你愿意继续用的那个。

拿第 1 节的主走查收拢:指令微调教会了模型「以问答格式回应」;RLHF 再把回答打磨成 可靠、温暖、讨人喜欢的样子16——「2006 年总统是谁」这句话的干净版本, 就是这两步的共同产物。

它和逐字模仿是两种优化

为什么不用「多喂几万条好回答」硬教?书里的机制区分很清楚17:

  • 指令微调是逐 token(文字被切碎后的最小单位)的模仿:在见过相近的例子的地方,预测「下一个字该是什么」;
  • RLHF 在整条回答的层面调:告诉模型「更好的回答长什么样」和「该避开的回答 长什么样」,而不是给一条指定的标准答案。

第二种方式(给好坏信号、不给标准答案)在书里叫对比式的损失(contrastive loss), 它是第 04、08 两章全部数学的出发点。

换个没见过的领域它也照样好使(这种「学了能带到没见过的地方」的性质,行话叫泛化):同样的偏好训练比逐字模仿更能迁移到没见过的领域18

代价也明码标价

RLHF 更贵、更慢、更难做稳:要专门训一个打分机器;这机器只是人类偏好的代理 (proxy,替身——你优化它,不等于优化了真实目标),使劲优化会翻车(第 14 章); 还有著名的长度偏差(第 13 章)19。书里的结论很冷静:RLHF 是做出强模型绕不开的 工序,但没有便宜版20

5. 为什么这么折腾是值的:引出解释

第 1 节那组对照还藏着一个更深的问题:改动量这么小(相对于前面那个大规模读文本的阶段——行话叫预训练),提升为什么 这么大?书里给的解释叫引出解释(elicitation interpretation):后训练做的不是 「往模型里装能力」,而是把基座模型里已经有的潜力引出来21

书里的比方是一级方程式赛车:所有车队赛季初带着新底盘来,之后一整年都在底盘不变的 前提下调空气动力——强队的赛季内提升远大于换底盘的提升22。后训练就是那个 「底盘不变、狂调空气动力」的阶段。

有个硬数字支持这个说法:混合专家(MoE,即把模型内部分成多个「专家」小组、按需启用的结构)路线的开放模型 OLMoE,第一版到第二版基本没动预训练, 只换了后训练,主流评测平均分从 35 涨到 4823。对照一下:基座决定了最终模型潜力 的大头,后训练负责把这份潜力全部收割出来24

这个解释还顺带清理了一个流行误解。2023 年那篇很有名的 LIMA 论文主张「对齐只是学 风格,几千条样本就够」——书里承认它对了直觉、错了结论:几千条样本确实能显著改变 模型(短期适配够用),但由此推出「对齐是表层的」就错了。今天的后训练能教出 模型原本完全没有的行为(比如长链条推理),风格是浮在行为上面的那层,不是 全部25

判断(我们的,不是书里的): 「引出」这个比喻好用的地方是它给了一个预算直觉—— 基座越强,同样的后训练能引出的东西越多;基座里的能力不存在,后训练变不出来。 这解释了为什么 2024 年后大家忽然发现「推理训练只在前沿基座上跑得动」(第 07 章)。 如果错,会错在: 如果后训练实际上能给基座添加它完全没有的新能力(而不只是 提高已有行为的出现频率),那「底盘」比喻会系统性低估后训练的价值——目前 RLVR 的结果处于两者之间,边界仍在移动。

6. 边界与局限

边界说明
写不出通用配方书里明说:给特定需求开一份精确 RLHF 配方的书是写不出来的,这正是有一整条「RLHF 即服务」产业的原因26
最佳实践未定型奖励模型怎么做、正则给多少,书里多处写「没有公认做法」(第 04、14 章展开)
时代快门书 2025 年定稿,推理模型的实践部分(第 07 章)作者自己预告「可能很快过时」27
主体是英文文献历史线与菜谱全部来自英文公开论文,中文社区的工程细节不在覆盖范围

7. 可带走的

  1. 基座模型只会续写:它答非所问不是笨,是它压根不在「回答你」,在「接着写网页」;
  2. 后训练 = 把续写机改造成答话机,RLHF 是其中最出名的一件工具;
  3. 标准三步:指令微调教格式 → 奖励模型压偏好 → 强化学习对着打分机器优化;
  4. RLHF 动的是整条回答级别的行为,与逐字模仿的指令微调是两种优化;
  5. 引出解释:后训练收割基座的潜力,基座决定天花板;
  6. 代理目标必有代价:更贵、更慢、会翻车,但没有便宜版;
  7. 方法 2019 年定型,2022 年靠 ChatGPT 破圈——技术成形与产品破圈是两件事

8. 原文地图

主题原书章原文位置
RLHF 的定义与三步流水线Overviewtext/04-ch01-1-overview.txt:29(搜「incorporate human information」) · text/04-ch01-1-overview.txt:35(搜「basic pipeline」)
后训练三件套Overviewtext/04-ch01-1-overview.txt:60(搜「Instruction / Supervised Fine-tuning」) · text/04-ch01-1-overview.txt:71(搜「dominates the second area」)
续写对照与风格Overviewtext/04-ch01-1-overview.txt:113(搜「George W. Bush」) · text/04-ch01-1-overview.txt:267(搜「T lu 3 405B」) · text/04-ch01-1-overview.txt:125(搜「how style applies」)
两种优化与对比损失Overviewtext/04-ch01-1-overview.txt:304(搜「per-token update」) · text/04-ch01-1-overview.txt:310(搜「contrastive loss function」)
代价:代理、过优化、长度偏差Overviewtext/04-ch01-1-overview.txt:316(搜「proxy objective」) · text/04-ch01-1-overview.txt:322(搜「length bias」)
引出解释与 OLMoE 数字Overviewtext/04-ch01-1-overview.txt:340(搜「elicitation interpretation」) · text/04-ch01-1-overview.txt:346(搜「chassis of a car」) · text/04-ch01-1-overview.txt:352(搜「35 to 48」)
LIMA 批判Overviewtext/04-ch01-1-overview.txt:376(搜「Superficial Alignment Hypothesis」) · text/04-ch01-1-overview.txt:406(搜「wrong for the same reason」)
三个时代A Tiny History of RLHFtext/05-ch02-2-a-tiny-history-of-rlhf.txt:16(搜「three era」) · text/05-ch02-2-a-tiny-history-of-rlhf.txt:50(搜「TAMER」) · text/05-ch02-2-a-tiny-history-of-rlhf.txt:56(搜「choosing between trajectories」)
2019 定型术语与应用A Tiny History of RLHFtext/05-ch02-2-a-tiny-history-of-rlhf.txt:74(搜「canonical terms」) · text/05-ch02-2-a-tiny-history-of-rlhf.txt:74(搜「WebGPT」)
ChatGPT 公告与现状A Tiny History of RLHFtext/05-ch02-2-a-tiny-history-of-rlhf.txt:115(搜「same methods as InstructGPT」) · text/05-ch02-2-a-tiny-history-of-rlhf.txt:121(搜「Constitutional AI for Claude」)
开不了配方Overviewtext/04-ch01-1-overview.txt:89(搜「impossible」)

Footnotes

  1. 出处:「Overview」第 107 段(text/04-ch01-1-overview.txt:107,搜「The president of the united states」)与第 113 段(text/04-ch01-1-overview.txt:113,搜「George W. Bush」)。原文给的是 Llama 3.1 405B Base 的真实续写,此处节录开头与中段。

  2. 出处:「Overview」第 267 段(text/04-ch01-1-overview.txt:267,搜「T lu 3 405B」)与同段后文(text/04-ch01-1-overview.txt:284,搜「He served two terms」)。原文的问法是把后训练(书中称 Tulu 3 系列,其底座即 Llama 3.1 405B)后的模型问同一句话。

  3. 出处:「Overview」第 54 段(text/04-ch01-1-overview.txt:54,搜「post-training」)。原文:「In modern language model training, RLHF is one component of post-training.」

  4. 出处:「Overview」第 29 段(text/04-ch01-1-overview.txt:29,搜「incorporate human information」)。原文:RLHF 是「a technique used to incorporate human information into AI systems」,最初为「hard to specify problems」而生。

  5. 出处:「Overview」第 35 段(text/04-ch01-1-overview.txt:35,搜「basic pipeline」)。

  6. 出处:「Overview」第 60 段(text/04-ch01-1-overview.txt:60,搜「Instruction / Supervised Fine-tuning」)至第 66 段(text/04-ch01-1-overview.txt:66,搜「Verifiable Rewards」)。

  7. 出处:「Overview」第 71 段(text/04-ch01-1-overview.txt:71,搜「dominates the second area」)。

  8. 出处:「A Tiny History of RLHF」第 16 段(text/05-ch02-2-a-tiny-history-of-rlhf.txt:16,搜「three era」)。

  9. 出处:「A Tiny History of RLHF」第 50 段(text/05-ch02-2-a-tiny-history-of-rlhf.txt:50,搜「TAMER」)与第 56 段(text/05-ch02-2-a-tiny-history-of-rlhf.txt:56,搜「choosing between trajectories」)。

  10. 出处:「A Tiny History of RLHF」第 74 段(text/05-ch02-2-a-tiny-history-of-rlhf.txt:74,搜「canonical terms」)。原文列举的定型术语:learning reward models、KL divergence for regularization、feedback diagrams。

  11. 出处:「A Tiny History of RLHF」第 74 段(text/05-ch02-2-a-tiny-history-of-rlhf.txt:74,搜「WebGPT」)。摘要、递归摘要、InstructGPT、WebGPT、GopherCite、Sparrow 同段列举。

  12. 出处:「A Tiny History of RLHF」第 115 段(text/05-ch02-2-a-tiny-history-of-rlhf.txt:115,搜「same methods as InstructGPT」)。这是书里转引的 OpenAI ChatGPT 发布公告原文。

  13. 出处:「A Tiny History of RLHF」第 121 段(text/05-ch02-2-a-tiny-history-of-rlhf.txt:121,搜「Constitutional AI for Claude」)。

  14. 出处:「Overview」第 125 段(text/04-ch01-1-overview.txt:125,搜「how style applies」)。

  15. 出处:「Overview」第 131 段(text/04-ch01-1-overview.txt:131,搜「low-empathy」)与第 173 段(text/04-ch01-1-overview.txt:173,搜「That sounds really stressful」)。

  16. 出处:「Overview」第 292 段(text/04-ch01-1-overview.txt:292,搜「downstream of the post-training」)。

  17. 出处:「Overview」第 304 段(text/04-ch01-1-overview.txt:304,搜「per-token update」)与第 310 段(text/04-ch01-1-overview.txt:310,搜「response level rather than」)。

  18. 出处:「Overview」第 298 段(text/04-ch01-1-overview.txt:298,搜「generalizes far better」),引 Kirk et al. 2024 与 Chu et al. 2025 两篇。

  19. 出处:「Overview」第 316 段(text/04-ch01-1-overview.txt:316,搜「proxy objective」)与第 322 段(text/04-ch01-1-overview.txt:322,搜「length bias」)。

  20. 出处:「Overview」第 322 段(text/04-ch01-1-overview.txt:322,搜「cannot be dispensed with」)。

  21. 出处:「Overview」第 340 段(text/04-ch01-1-overview.txt:340,搜「elicitation interpretation」)。

  22. 出处:「Overview」第 346 段(text/04-ch01-1-overview.txt:346,搜「chassis of a car」)。

  23. 出处:「Overview」第 352 段(text/04-ch01-1-overview.txt:352,搜「35 to 48」)。OLMoE Instruct 两版只更新后训练,评测均值 35→48。

  24. 出处:「Overview」第 364 段(text/04-ch01-1-overview.txt:364,搜「determine the vast majority」)。

  25. 出处:「Overview」第 376 段(text/04-ch01-1-overview.txt:376,搜「Superficial Alignment Hypothesis」)与第 406 段(text/04-ch01-1-overview.txt:406,搜「wrong for the same reason」)。

  26. 出处:「Overview」第 89 段(text/04-ch01-1-overview.txt:89,搜「impossible」)。

  27. 出处:「Reasoning & Inference-Time Scaling」第 784 段(text/26-ch07-7-reasoning-amp-inference-time-scaling.txt:784,搜「incomplete」)。作者在该章开头自陈「By the time this chapter is published, the table of reasoning models above will be incomplete」。