跳到主要内容

后训练是什么 — 两次训练的分工,以及第二次训练改不了什么

这一章讲三件事: 造一个能用的语言模型,为什么要分两次训练; 第二次训练(后训练)具体在改什么;以及它改不了什么。 读完你会拿到全书的总地图——后面六章都在展开这张图上的某一块。 不需要任何基础,遇到的生词全部当场解释。

1. 先看现象:同一个问题,两种模型给出两种东西

先认识主角。语言模型(LLM)就是一种读一段文字、接着往下写的系统——你手机里的输入法联想、网页上的聊天机器人,背后都是它1

拿同一个问题分别喂给两种模型看:

输入:「用两句话解释 TCP 和 UDP 的区别。」(TCP 和 UDP 是互联网上传送数据的两套规矩)

基础模型——也就是只做完第一次训练的模型——可能给你三种反应:像样地回答了;或者无视你的问题,续写出五个新的问题;或者接着写一段教科书式的段落,离题万里2

后训练过的模型——今天你在任何产品里用到的模型——会规规矩矩给出两句话的答案。

差距不在「谁更聪明」。差距在于:只有后一个被专门训练过「怎么回应用户」。作者开篇第一句就是这个判断:今天生产环境里每一个有用的语言模型,都经过了后训练;它们已经不是单纯的「预测下一个词」的机器了3

2. 顶层全景:两次训练,各管一件事

第一阶段:预训练(贵,慢)
几万亿个 token 的网页、书、代码
└─ 反复练一件事:预测下一个词
└─ 产物:基础模型——会续写,不会应对

第二阶段:后训练(便宜,快,但决定用户体验的大半)
几千到几百万条人工整理的示例
└─ 按想要的行为定向调整
└─ 产物:听指令、拒危险请求、能推理的产品模型

图说:两个阶段用的数据量差了六个数量级以上;第二次训练不是「再练一遍」,
而是换了一种信号、换了一个目标。

这一章的主走查就是上面那个「TCP 和 UDP」的问题:第 3 节讲它为什么会在基础模型那里走样,第 4 节讲后训练怎么把它掰回来,第 6 节讲后训练有哪些掰不动的地方。

3. 核心原理(上):预训练把语言的规律压进权重

它在练什么

预训练吃进几万亿个 token(文字切成的小块:可能是一个词,也可能只是小半个词;模型眼里没有「字」和「词」,只有 token)4

练的目标只有一句话:遮住一段文字的最后一个词,让模型猜它是什么,猜错了就调整模型。 整个互联网的文本反复这么练。注意这个练法里没有人告诉模型什么叫「好答案」——正确答案就是原文里本来有的那个词。这种没人标对错、答案藏在数据本身的练法,行话叫无监督学习5

练完的产物:模型把语言的统计规律——哪些词爱跟在哪些词后面,各自的概率(可能性,全部加起来是一)有多大——连同广而杂的世界知识,一起压进了自己的权重里。

权重就是模型内部那几百亿个可以调的数,行话叫参数,模型「知道」的一切都存在这堆数里6

它花多少钱,买到什么

代价:几千张 GPU(GPU 是专门做大规模算术的芯片,训练全靠它)跑上几周到几个月,数据集按几十 TB 算7。作为对比,后面会讲到后训练用的数据是「几千到几百万条示例」——两边的量差着六个数量级。

买到的东西有价值但不完整:一个能像样地续写任何文字的模型。像样,不等于听话。这就是主走查里三种走样反应的来源——它在完成你这段文字,而不是回应你这个用户8

两个方向反着来的训练

作者特别点了一组对照:预训练用大杂烩的语料(拿来喂模型的海量文字),换来的是跨任务通用的底子;后训练用精选数据,换来的是定向的行为。两个方向各自成立,但如果反过来——直接在精选指令数据上从零训练——效果反而更差,因为模型没先攒下那些让它灵活的通用底子;而跳过后训练,得到的就是「有知识、但没纪律」9

4. 核心原理(下):后训练在改什么

数据变小了,目标变准了

后训练拿着基础模型,做几次更小、更有针对性的训练:数据是几千到几百万条示例,但每一条都是策展过的——人工挑选、人工整理、专门为了练出某种行为而写10

如果预训练教的是「语言长什么样」,后训练教的就是「拿这些知识去做事」:怎么回答、怎么拒答、怎么按格式输出11

三段配方,各教一样东西

后训练通常由三个阶段组合而成,每个阶段教的东西不一样12:

阶段教什么用什么信号
SFT(监督微调)格式与风格:答案怎么组织、什么格式你写好的示范(输入-输出对)
偏好学习好坏:同一个问题的两个回答,哪个更好人做的成对比较
可验证奖励 RL推理:数学、代码这类对错能自动判的任务任务本身的对错

SFT 一行里藏着一个关键词「微调」:意思是不从头训,拿着训好的模型接着调——就像不重学一门手艺,只在老师傅的手上纠几个动作。SFT 教的是模仿:给它看示范,它学着写出一模一样的东西,包括格式——怎么组织答案、怎么输出 JSON(机器能直接读的数据格式)和代码。它给不了「好答案和平庸答案」的差别信号,不能教会模型写出比示范更好的东西13

示范里还有更细的举止:多轮对话(一问一答连好多轮)怎么接、什么时候该用列表什么时候该用整段——这些也都靠示范教。

偏好学习补的就是这一块:把同一个问题的两个回答摆在一起,一个标「更好」、一个标「更差」,让模型学会把「更好」那个回答的概率往上调。

经典做法叫 RLHF(基于人类反馈的强化学习)。

它先训练一个奖励模型(替人打分的模型),再用强化学习去优化语言模型。

后出的 DPO(直接偏好优化:省掉打分模型、直接在比较数据上训练的方法)则把这条流水线缩短14。强化学习(RL)这个词,指的就是「不直接给答案,只给分数,让模型自己往高分方向调」这一类训练方法。

可验证奖励 RL 走得更远:在数学题、代码这类对错能由程序自动判定的任务上,模型生成一批候选答案,一个验证器(自动判对错的程序)逐个检查,模型学着多产出对的、少产出错的——奖励信号来自任务本身,不用人打分15。作者引用 DeepSeek-R1 作为证据:可验证奖励带来的数学、代码、多步推理提升,是前两个阶段给不了的16

不是每个模型都要三段全上

一个只做结构化抽取的模型,可能 SFT 就够;通用助手通常要加偏好学习;数学或代码模型才需要可验证奖励。选哪几段,取决于任务、基础模型、数据和你有多少算力(能调用的计算能力)17

5. 作者的判断与证据

书里给了出处的证据:

  • 13 亿打赢 1750 亿:OpenAI 的大模型家族名叫 GPT(GPT-3、InstructGPT 都是这一族),它 2022 年的 InstructGPT 实验里,13 亿参数的小模型经 RLHF 训练后被人类评委认为好过没做这件事的 1750 亿参数大模型——小模型赢的不是知识,是对知识的使用(细节在第 04 章讲)18;

  • DeepSeek-R1:纯用可验证奖励训练的 R1-Zero 版本,没人教过它分步思考,它自己长出了思维链(一边写一边一步步拆问题、自查、错了就换路的推理样子)19

是作者的论断、书里没给实验证据的:

  • 「直接在策展数据上从零训练,效果比两阶段差」——这是行业共识式的断言,本章没有引具体实验;
  • 「后训练在预训练定义的『表面』上调整行为」——这是作者对越狱现象的解释框架(下一节的第 3 条),是一个模型,不是被证明的定理。

判断(我们的,不是书里的): 这一章最有长期价值的是那个「表面」比喻—— 后训练像是在一张已经画好的画上描边:描得起颜色、描得起风格, 但改不了底稿的线条。凡「微调能不能让模型学会 X」的问题,先问 X 在不在底稿里。 如果错,会错在: 如果后续技术能在后训练阶段长出预训练完全没有的新能力 (而不只是放大已有倾向),这个比喻就把边界画早了——第 05 章的 R1-Zero 恰好是这个判断的压力测试点。

6. 边界与局限:后训练改不动的五件事

这是本章最实用的一节。作者列了五条「后训练不能干什么」,每条都直接决定你该不该用后训练、把预算花在哪20:

改不了什么书里的说明
加知识权重里没有的知识,后训练变不出来。SFT 能教医疗格式,偏好学习能教谨慎措辞,但变不出没学过的医学事实
补能力基础模型算术差,后训练只能改善练过的那些题型,给不出通用算术能力
根除深埋行为安全训练只在见过的格式上教会拒绝;对抗者换个新格式就能绕过。作者强调:这不是技术没做好,是后训练在预训练定义的表面上工作,模式越深越盖不住
替代数据质量示范写得烂,模型就学出坏习惯;又杂又不可靠的偏好数据,训出失真的打分模型;不可靠的验证器会奖励错误答案
一劳永逸解决对齐(让模型行为合乎人的意图)只在训练数据覆盖的情形里更安全;遇到没见过的情形没有保证。书里的原话:这些技术是当前最佳实践,不是已解决的问题

拿主走查的口径把第一条走一遍(问句和答串是为演示编的,机制是书里的):

问一个没读过医学文献的基础模型改出来的模型:
「小孩发烧,布洛芬和止咳糖浆能一起吃吗?」

├─ SFT 之后:输出格式标准的段落——「关于儿童用药,建议注意以下几点:……
│ 如有疑问请咨询医生。」语气谨慎、格式漂亮
└─ 但段落里的事实可能整个是错的
预训练没给过它这些知识,后训练只能改「怎么说话」,改不了「知道什么」

图说:这就是「流畅、格式好、可能错」的完整来路。

7. 可带走的

  1. 能用的语言模型都过了两次训练:预训练教语言规律,后训练教行为;
  2. 基础模型是「续写机器」:问它问题,它可能回答、可能续写五个问题、可能续写教科书——它只是在完成文字;
  3. 后训练数据比预训练小六个数量级,但策展过、目标明确,决定用户体验的大半;
  4. 三段配方各教一样:SFT 教格式(模仿),偏好学习教好坏(人的比较),可验证奖励 RL 教推理(任务对错);
  5. SFT 的天花板是示范:它不能教出比示范更好的回答;
  6. 不是每个模型都要三段全上:从 SFT 开始,评测说不够再加下一段;
  7. 后训练改不了底子:加不了知识、补不了能力、根除不了深埋行为——选基础模型时要记住它的预训练决定了天花板;
  8. 「流畅但错误」是结构性的:格式训练 + 缺失的知识 = 漂亮的错话,这不是 bug。

8. 原文地图

主题原书章原文位置
生产模型都经过后训练Chapter 1. Introduction to Post-Trainingtext/04-ch01-chapter-1-introduction-to-post-training.txt:12(搜「went through post-training」)
后训练是第二阶段、决定体验Chapter 1. Introduction to Post-Trainingtext/04-ch01-chapter-1-introduction-to-post-training.txt:14(搜「shorter and cheaper」)
预训练的数据与目标Chapter 1. Introduction to Post-Trainingtext/04-ch01-chapter-1-introduction-to-post-training.txt:24(搜「trillions of tokens」)
预训练成本与基础模型的三种走样Chapter 1. Introduction to Post-Trainingtext/04-ch01-chapter-1-introduction-to-post-training.txt:26(搜「thousands of GPUs」) · :26(搜「five more questions」)
后训练数据几千到几百万条Chapter 1. Introduction to Post-Trainingtext/04-ch01-chapter-1-introduction-to-post-training.txt:28(搜「thousands to millions of examples」)
两个方向、从零训更差、没纪律Chapter 1. Introduction to Post-Trainingtext/04-ch01-chapter-1-introduction-to-post-training.txt:30(搜「knowledge but no discipline」)
三段配方总览Chapter 1. Introduction to Post-Trainingtext/04-ch01-chapter-1-introduction-to-post-training.txt:34(搜「three stages」)
SFT 教格式与风格Chapter 1. Introduction to Post-Trainingtext/04-ch01-chapter-1-introduction-to-post-training.txt:38(搜「format and style」)
SFT 只会模仿Chapter 1. Introduction to Post-Trainingtext/04-ch01-chapter-1-introduction-to-post-training.txt:40(搜「better than its demonstrations」)
偏好学习与 RLHF/DPOChapter 1. Introduction to Post-Trainingtext/04-ch01-chapter-1-introduction-to-post-training.txt:42(搜「preferred and the other as rejected」)
可验证奖励与 DeepSeek-R1Chapter 1. Introduction to Post-Trainingtext/04-ch01-chapter-1-introduction-to-post-training.txt:44(搜「The reward signal comes from the task itself」) · :46(搜「verifiable rewards can improve performance」)
不是每个模型都要全上Chapter 1. Introduction to Post-Trainingtext/04-ch01-chapter-1-introduction-to-post-training.txt:48(搜「structured extraction model」)
加不了知识(医疗例)Chapter 1. Introduction to Post-Trainingtext/04-ch01-chapter-1-introduction-to-post-training.txt:54(搜「reliable medical assistant」)
补不了能力Chapter 1. Introduction to Post-Trainingtext/04-ch01-chapter-1-introduction-to-post-training.txt:56(搜「representational capacity」)
根除不了深埋行为Chapter 1. Introduction to Post-Trainingtext/04-ch01-chapter-1-introduction-to-post-training.txt:58(搜「novel prompt formats」)
替代不了数据质量Chapter 1. Introduction to Post-Trainingtext/04-ch01-chapter-1-introduction-to-post-training.txt:60(搜「teach the model bad habits」)
对齐没有解决Chapter 1. Introduction to Post-Trainingtext/04-ch01-chapter-1-introduction-to-post-training.txt:62(搜「not a solved problem」)
TCP/UDP 示例问句Chapter 1. Introduction to Post-Trainingtext/04-ch01-chapter-1-introduction-to-post-training.txt:136(搜「TCP and UDP in two sentences」)

Footnotes

  1. 出处:「Chapter 1. Introduction to Post-Training」第 12 段(text/04-ch01-chapter-1-introduction-to-post-training.txt:12,搜「next token prediction models」)。原文说生产中的模型「are not next token prediction models」,即它们已在下一词预测之上被进一步训练。

  2. 出处:「Chapter 1. Introduction to Post-Training」第 26 段(text/04-ch01-chapter-1-introduction-to-post-training.txt:26,搜「five more questions」)。原文列的三种反应:回答问题、续写出五个新问题、续写一段像教科书的东西。具体的 TCP/UDP 问句来自同文件第 136 段(SFT 数据示例),两类输出串是我们为演示编的。

  3. 出处:「Chapter 1. Introduction to Post-Training」第 12 段(text/04-ch01-chapter-1-introduction-to-post-training.txt:12,搜「went through post-training」)。

  4. 出处:「Chapter 1. Introduction to Post-Training」第 24 段(text/04-ch01-chapter-1-introduction-to-post-training.txt:24,搜「trillions of tokens」)。原文列举语料类型:网页、书、代码仓库、科学论文。

  5. 出处:「Chapter 1. Introduction to Post-Training」第 24 段(text/04-ch01-chapter-1-introduction-to-post-training.txt:24,搜「unsupervised objective」)。原文:模型没被告知什么是好输出,被告知的是整个语料库中「下一个词是什么」。

  6. 出处:「Chapter 1. Introduction to Post-Training」第 24 段(text/04-ch01-chapter-1-introduction-to-post-training.txt:24,搜「statistical structure」)。原文:模型吸收了语言的统计结构,以及广而杂的世界知识表示。「权重是可调的数」这层解释补充(不在书里,来自通用知识),第 03 章会亲手调到它们。

  7. 出处:「Chapter 1. Introduction to Post-Training」第 26 段(text/04-ch01-chapter-1-introduction-to-post-training.txt:26,搜「thousands of GPUs」)。原文:数千 GPU、数周到数月、数据集几十 TB。

  8. 出处:「Chapter 1. Introduction to Post-Training」第 26 段(text/04-ch01-chapter-1-introduction-to-post-training.txt:26,搜「completing text」)。原文:它在补全文本,不是回应用户的指令。

  9. 出处:「Chapter 1. Introduction to Post-Training」第 30 段(text/04-ch01-chapter-1-introduction-to-post-training.txt:30,搜「worse results」)与第 30 段(搜「knowledge but no discipline」)。

  10. 出处:「Chapter 1. Introduction to Post-Training」第 28 段(text/04-ch01-chapter-1-introduction-to-post-training.txt:28,搜「curated, structured」)。

  11. 出处:「Chapter 1. Introduction to Post-Training」第 28 段(text/04-ch01-chapter-1-introduction-to-post-training.txt:28,搜「how to use that knowledge」)。

  12. 出处:「Chapter 1. Introduction to Post-Training」第 34 段(text/04-ch01-chapter-1-introduction-to-post-training.txt:34,搜「three stages」)与第 48 段(text/04-ch01-chapter-1-introduction-to-post-training.txt:48,搜「Not every model needs all three stages」)。三阶段「各教一样东西」的分工表述综合自第 38、42、44 段。

  13. 出处:「Chapter 1. Introduction to Post-Training」第 40 段(text/04-ch01-chapter-1-introduction-to-post-training.txt:40,搜「better than its demonstrations」)。

  14. 出处:「Chapter 1. Introduction to Post-Training」第 42 段(text/04-ch01-chapter-1-introduction-to-post-training.txt:42,搜「Direct preference optimization」)。RLHF 与 DPO 的机制细节在第 04 章展开。

  15. 出处:「Chapter 1. Introduction to Post-Training」第 44 段(text/04-ch01-chapter-1-introduction-to-post-training.txt:44,搜「a verifier checks them」)。

  16. 出处:「Chapter 1. Introduction to Post-Training」第 46 段(text/04-ch01-chapter-1-introduction-to-post-training.txt:46,搜「verifiable rewards can improve performance」)。

  17. 出处:「Chapter 1. Introduction to Post-Training」第 48 段(text/04-ch01-chapter-1-introduction-to-post-training.txt:48,搜「depends on the task」)。

  18. 出处:「Chapter 1. Introduction to Post-Training」第 150 段(text/04-ch01-chapter-1-introduction-to-post-training.txt:150,搜「1.3B-parameter model」)。原文:经 RLHF 训练的 1.3B 模型被人类评委偏好,胜过原始 175B 的 GPT-3;小的模型不是知识更多,而是对知识的用法判断更好。

  19. 出处:「Chapter 1. Introduction to Post-Training」第 170 段(text/04-ch01-chapter-1-introduction-to-post-training.txt:170,搜「spontaneously developed chain-of-thought」)。原文:R1-Zero 在没有任何 SFT 的情况下用 GRPO 训练,自发涌现思维链推理;「没人给它看过这种行为的示例」。

  20. 出处:「Chapter 1. Introduction to Post-Training」第 50-64 段(text/04-ch01-chapter-1-introduction-to-post-training.txt:50,搜「What post-training cannot fix」)。五条边界的原文位置分别是第 54、56、58、60、62 段。