跳到主要内容

出师 — 预训练之后的四阶段与对齐

这一章讲三件事: 预训练之后的完整流水线——中训、SFT、对齐各自补什么; RLHF 的三步与它的两条简化路线(DPO、宪法 AI); 以及怎么知道训练成了——评测基准的能与不能。第 11 章翻车的模型,欠的就是这一章的工序。

1. 先看现象:为什么预训练的产物不能直接上架

第 11 章的模型被问「who is rick」时只会背课文——因为它这一辈子只干过一件事:续写。 原书把「从原始文本到可用助手」的全程划成四段1:

预训练(第 10 章)──▶ 中训 ──▶ SFT ──▶ 对齐
学语言与知识 补专项 教指令 立规矩(哪些回答更好)

图说:每一段都在上一段的产物上继续训,越往后数据越小、学习率越低、
便宜程度越差——但每一段都在回答一个前一段回答不了的问题。

各段的「体量感」(原书给的口径)2:预训练吃万亿 token、占掉绝大部分算力; 中训吃数十亿到千亿 token、以周计;SFT 只有几万到几百万条样本、几天到几周; 对齐又要另配一整套人马。钱主要花在第一段,「像个助手」却全靠后三段。

2. 中训:补专项,别把旧的忘了

中训(continued pretraining / 领域适配)= 用高质量专项语料继续做预训练那件事3。 原书给了两族例子4:

  • 补领域:医疗(病历+文献)、法律(判例+法条)、代码(CodeLlama 从 Llama 2 出发再喂代码);

  • 补能力:数学推理、长上下文、多语言。

  • 还有思维链(把中间步骤一步步写出来再答)。

  • 以及工具调用(按需去调外部程序)。

真正的难点不是「学会新的」,而是别把旧的学丢——这叫灾难性遗忘 (继续训练把原有能力覆盖掉)5。原书给了四招,按常用程度排:

做法
数据掺老专项语料里持续掺通用数据,老本行不断练
回放定期重放一批预训练老样本
弹性权重固化给「对老能力重要的参数」上保护,不许大改
学习率保守中训的学习率(1e-5~1e-4)比预训练低一档,改动幅度先限死6

3. SFT:从「会续写」到「会回答」

监督微调(SFT)的训练材料换成了指令-回答对:「用简单的话解释光合作用」+ 一段好答案7

两个关键决定,原书都给了明确口径:

只对回答算损失。 预训练对整段文字的每个位置都算损失;SFT 更常用的是只对「回答部分」算—— 不然模型会花力气学「怎么复述指令」,而我们要教的是「怎么回答」8

质量碾压数量。 原书的口径干脆利落:一万条高质量样本的产出好过一百万条低质样本9。 道理也直白:SFT 是模仿学习——模型逐字模仿示范答案,示范里有多少毛病,它原样吸收多少。 学习率压到 1e-5 甚至 5e-6,遍数 1-3 遍就收——怕的就是把预训练的底子训坏10

SFT 之后的模型会听指令、会多轮对话(你来我往好几趟不掉线)、会拒答一部分危险请求——但原书列的残余问题(同类问题前后不一、 拒答时紧时松、啰嗦)指向下一站11

4. RLHF:用「更喜欢哪个」立规矩

SFT 只教了「什么是好答案的样子」,没教「两个都不错的答案里人更爱哪个」。 RLHF(基于人类反馈的强化学习:靠「做对了给高分」来训练的一族方法)三步走12:

① 造卷:同一个提示,让 SFT 模型生成 4-9 个回答,人排序
→ 得到一堆「A 比 B 好」的偏好对
② 训裁判:奖励模型(一个打分器,输入提示+回答,输出一个分)
学会预测「人会更喜欢哪个」,损失 = −log σ(好答案分 − 差答案分)
③ 调模型:用强化学习(PPO)让语言模型生成更高分的回答,
同时拴一根 KL 绳子防止跑飞[^13]

KL 绳子是这一节最该带走的机制:最终奖励 = 裁判打分 − β × 与原模型的偏离度(KL 散度,衡量两套概率分布(机会在候选上怎么铺)差多远)13。 不拴绳会怎样?原书给了现象级清单——reward hacking(钻空子):模型发现裁判偏爱长回答就一味写长、 偏爱某种套话就满篇套话,分数涨了、答案更差了14。 绳子不保证不钻,但保证「钻」的成本变高。

原书如实列了这套流程的三座大山:贵(同时跑策略、裁判、参考三个模型)、 标注贵(几万到几十万次人工比较)、裁判本身有偏(标注员的口味会烙进奖励模型)15。 ChatGPT、Claude、Gemini 都在这条流水线上16

5. 两条简化路线:DPO 与宪法 AI

原书给了两个「RLHF 的减配替代」,各有各的砍法17:

路线砍掉了什么怎么补回来
DPO(2023)砍掉奖励模型和强化学习直接用偏好对更新模型:损失函数(把差距算成数的公式)里把「好答案与差答案的分差」和「与参考模型的偏离」写成一个公式,数学上可证与 RLHF 目标等价
宪法 AI(Anthropic)砍掉大部分人工标注先写一份成文宪法(「选更有帮助、更无害、更诚实的回答」……),模型按宪法自我批判、自我改写,再用改写结果训练

DPO 的代价:偏好数据的质量要求更高(没有裁判兜着,脏数据直接进模型); 宪法 AI 的代价:AI 批改 AI,批改者自己的偏见会传给被训模型18。 原书还点了混合流水线的现状:生产系统常常 SFT+RLHF+宪法 AI 叠着用,人的判断管微妙处、AI 批改管量19

6. 怎么知道成了:评测的能与不能

各阶段盯的成绩尺(行话叫指标:给成绩打分的尺子)不同20:预训练盯困惑度与验证损失(第 10 章); SFT 盯任务分(摘要 ROUGE、代码 pass@k);对齐盯「与人偏好的一致率」和安全评测。

公开基准按科目分工21:知识考 MMLU(57 个学科的选择题)、代码考 HumanEval(编程题跑测试用例)、 数学考 GSM8K、真实性考 TruthfulQA、偏见考 BBQ。

原书毫不客气地列了基准的两块天花板22:

  • 饱和与泄漏:分数顶到天花板不代表能力到顶;考题混进训练语料(第 10 章的「污染」)让高分变成背诵;
  • 考不出真实使用:基准测的是窄题,用户要的是开放式任务;基准分高 ≠ 用户满意。

所以最终的裁判还是:两两对比、按维度打分、线上 A/B23。 这一句其实回应了第 01 章埋的那条——「类人任务的对错由人的判断定义」,评测体系绕一圈又回到了人。

7. 作者的判断与证据

说法书里的证据我们的标注
质量重于数量(SFT)「1 万条胜 100 万条」的直接论据9领域共识;具体倍数是经验口径
reward hacking 真实存在现象清单(变长、套话、钻裁判空子)+ 缓解手段14机制成立;RLHF 流水线的公开经验
DPO 与 RLHF 目标等价「Under certain mathematical conditions…theoretically equivalent」17有论文出处(DPO 2023),条件性成立
基准会污染、会饱和评测一节两块天花板22领域共识

判断(我们的,不是书里的): 四阶段里最容易被低估的是中训——公开叙事只讲「预训练+SFT+RLHF 三段」, 原书把中训单列并给了完整的机制(含防遗忘四招),这是它比多数科普材料扎实的地方。 反过来,原书对 RLHF 的「三座大山」着墨不少,却没给「标注一致性」这类可操作的指标, 照着这一章你搭不出 RLHF 流水线——这一章是地图,不是施工图如果错,会错在: 如果后续实践证明中训可以被「更大数据+更长预训练」吸收掉, 四阶段就会退回三阶段——但防遗忘四招在任何继续训练场景里都独立成立。

8. 边界与局限

  • 原书各阶段的学习率、遍数全是数量级口径(如 SFT 1e-5~5e-6),不是推荐配置;
  • 宪法 AI 一节的宪法条款示例是英文原文直译,真实项目的宪法长得多、细得多;
  • 评测一节列的基准全部是 2025 年前口径,作者自己承认「需要不断造新基准」24;
  • 原书 94 章末的未来展望(持续学习、自监督对齐、理论解释)是展望不是现状,引用时注意时态。

9. 可带走的

  1. 预训练出「会说话的」,后三段出「好用的」;钱花在第一段,体验全靠后三段;
  2. 中训=继续预训练;真正的敌人是灾难性遗忘,防法是掺老数据+回放+保护重要参数+压低学习率;
  3. SFT 学的是模仿:只对回答算损失;一万条好示范胜一百万条差示范;
  4. RLHF 三步:人造偏好对 → 训打分裁判 → 用 PPO(那族方法里最常用的一款)调模型;
  5. KL 绳子:奖励=裁判分−β×偏离度;没有它,模型会为分数发明各种歪招(reward hacking);
  6. DPO 砍掉裁判直接用偏好对;宪法 AI 用成文原则让模型自产训练数据;生产系统常常混用;
  7. 基准两块天花板:饱和+泄漏;最终的裁判是人;
  8. 各阶段体量:万亿 token → 数十亿千亿 → 数万数百万条;学习率一路下调。

10. 原文地图

主题原书章原文位置
四阶段总览The Journey from Raw Text to Intelligent Assistant—The Art and Science of LLM Trainingtext/85-fm-the-journey-from-raw-text-to-intelligent-assista.txt:3(搜「multistage process」)
预训练口径Pretraining—Building the Foundationtext/86-fm-pretraining-building-the-foundation.txt:3(搜「first and most fundamental」) · text/86-fm-pretraining-building-the-foundation.txt:23(搜「Chinchilla」)
中训定义Mid-Training—Targeted Capability Developmenttext/87-fm-mid-training-targeted-capability-development.txt:3(搜「Mid-training」)
CodeLlama/Minerva 实例Mid-Training—Targeted Capability Developmenttext/87-fm-mid-training-targeted-capability-development.txt:57(搜「CodeLlama」) · text/87-fm-mid-training-targeted-capability-development.txt:59(搜「Minerva」)
防遗忘四招Mid-Training—Targeted Capability Developmenttext/87-fm-mid-training-targeted-capability-development.txt:49(搜「catastrophic forgetting」) · text/87-fm-mid-training-targeted-capability-development.txt:53(搜「Elastic weight consolidation」)
中训学习率与体量Mid-Training—Targeted Capability Developmenttext/87-fm-mid-training-targeted-capability-development.txt:47(搜「1e-5 to 1e-4」)
SFT 数据格式Supervised Fine-Tuning (SFT)—Teaching Instructionstext/88-fm-supervised-fine-tuning-sft-teaching-instructions.txt:11(搜「photosynthesis」)
只对回答算损失Supervised Fine-Tuning (SFT)—Teaching Instructionstext/88-fm-supervised-fine-tuning-sft-teaching-instructions.txt:25(搜「response-only」)
质量胜过数量Supervised Fine-Tuning (SFT)—Teaching Instructionstext/88-fm-supervised-fine-tuning-sft-teaching-instructions.txt:35(搜「Ten thousand」)
SFT 超参口径Supervised Fine-Tuning (SFT)—Teaching Instructionstext/88-fm-supervised-fine-tuning-sft-teaching-instructions.txt:29(搜「1e-5 to 5e-6」)
SFT 残余问题Supervised Fine-Tuning (SFT)—Teaching Instructionstext/88-fm-supervised-fine-tuning-sft-teaching-instructions.txt:61(搜「inconsistent preferences」)
RLHF 三阶段Reinforcement Learning from Human Feedback (RLHF)text/89-fm-reinforcement-learning-from-human-feedback-rlhf.txt:11(搜「three distinct stages」)
偏好数据采集(4-9 个回答)Reinforcement Learning from Human Feedback (RLHF)text/89-fm-reinforcement-learning-from-human-feedback-rlhf.txt:21(搜「four to nine」)
奖励模型损失Reinforcement Learning from Human Feedback (RLHF)text/89-fm-reinforcement-learning-from-human-feedback-rlhf.txt:29(搜「-log」)
PPO 与 KL 罚Reinforcement Learning from Human Feedback (RLHF)text/89-fm-reinforcement-learning-from-human-feedback-rlhf.txt:41(搜「Proximal Policy Optimization」) · text/89-fm-reinforcement-learning-from-human-feedback-rlhf.txt:45(搜「KL」)
reward hacking 清单Reinforcement Learning from Human Feedback (RLHF)text/89-fm-reinforcement-learning-from-human-feedback-rlhf.txt:51(搜「Reward Hacking」)
RLHF 三座大山Reinforcement Learning from Human Feedback (RLHF)text/89-fm-reinforcement-learning-from-human-feedback-rlhf.txt:69(搜「Computational Cost」) · text/89-fm-reinforcement-learning-from-human-feedback-rlhf.txt:73(搜「Human Labeling」)
ChatGPT/Claude/Gemini 采用Reinforcement Learning from Human Feedback (RLHF)text/89-fm-reinforcement-learning-from-human-feedback-rlhf.txt:81(搜「ChatGPT using」)
DPOAlternative Alignment Approachestext/90-fm-alternative-alignment-approaches.txt:3(搜「Direct Preference Optimization (DPO)」) · text/90-fm-alternative-alignment-approaches.txt:7(搜「theoretically equivalent」)
宪法 AI 两阶段Alternative Alignment Approachestext/90-fm-alternative-alignment-approaches.txt:25(搜「Constitutional AI (CAI)」) · text/90-fm-alternative-alignment-approaches.txt:33(搜「critique and revision」)
RLAIF 局限Alternative Alignment Approachestext/90-fm-alternative-alignment-approaches.txt:57(搜「Limitations」)
混合流水线Alternative Alignment Approachestext/90-fm-alternative-alignment-approaches.txt:69(搜「Hybrid Approaches」)
后训练技术(上下文蒸馏/红队)Post-Training Techniques and Refinementstext/91-fm-post-training-techniques-and-refinements.txt:3(搜「Context Distillation」) · text/91-fm-post-training-techniques-and-refinements.txt:19(搜「Red Teaming」)
评测指标与基准Evaluation and Benchmarkingtext/92-fm-evaluation-and-benchmarking.txt:7(搜「Perplexity」) · text/92-fm-evaluation-and-benchmarking.txt:11(搜「MMLU」) · text/92-fm-evaluation-and-benchmarking.txt:37(搜「HumanEval」)
基准的污染与饱和Evaluation and Benchmarkingtext/92-fm-evaluation-and-benchmarking.txt:61(搜「Benchmark Saturation」) · text/92-fm-evaluation-and-benchmarking.txt:65(搜「Gap Between Benchmarks」)
数据为王与红线Practical Considerations and Best Practicestext/93-fm-practical-considerations-and-best-practices.txt:3(搜「Data Is King」) · text/93-fm-practical-considerations-and-best-practices.txt:43(搜「Red Lines」)
未来展望The Future of LLM Trainingtext/94-fm-the-future-of-llm-training.txt:5(搜「Multimodal Training」) · text/94-fm-the-future-of-llm-training.txt:57(搜「Why Does It Work」)

Footnotes

  1. 出处:「The Journey from Raw Text to Intelligent Assistant」(text/85-fm-the-journey-from-raw-text-to-intelligent-assista.txt:3,搜「multistage process」)。原文:现代 LLM 开发通常四阶段——预训练、中训、监督微调、对齐训练;每段在前一段之上继续精炼。

  2. 出处:「Computational Resource Management」(text/93-fm-practical-considerations-and-best-practices.txt:11,搜「most expensive phase」)。原文:预训练最贵(数月 GPU 集群时间、占预算大头);中训数周;SFT 便宜(数天);RLHF 中到贵(数周+多模型并跑的开销)。体量口径另见第 10 章所引各节。

  3. 出处:「What Is Mid-Training?」(text/87-fm-mid-training-targeted-capability-development.txt:5,搜「continued pretraining」)。原文:中训(又称继续预训练/领域适配)是预训练与微调之间的中间阶段,用精选数据增强推理、编程、数学等专项能力。

  4. 出处:「Examples of Successful Mid-Training」(text/87-fm-mid-training-targeted-capability-development.txt:57,搜「CodeLlama」)。原文:CodeLlama 从 Llama 2 经代码中训派生;Google 的 Minerva 展示了数学推理的中训成果;长上下文模型靠长序列训练加位置插值。

  5. 出处:「Preventing Catastrophic Forgetting」(text/87-fm-mid-training-targeted-capability-development.txt:49,搜「catastrophic forgetting」)。原文:关键挑战是加新能力时保住通用能力。

  6. 出处:text/87-fm-mid-training-targeted-capability-development.txt:53(搜「Elastic weight consolidation」)与「Training Approach」(:69,搜「1e-5 to 1e-4」)。四招:数据混合、回放缓冲、弹性权重固化、保守学习率;中训学习率常在 1e-5 到 1e-4。

  7. 出处:「SFT Data: Instructions and Demonstrations」(text/88-fm-supervised-fine-tuning-sft-teaching-instructions.txt:11,搜「photosynthesis」)。原文给的示例对:「Explain photosynthesis in simple terms」+ 一段通俗解释。

  8. 出处:「Objective Function」(text/88-fm-supervised-fine-tuning-sft-teaching-instructions.txt:25,搜「response-only」)。原文:全序列训练与只对回答算损失两种;后者更常用,确保模型学的是产出好回答而非复述指令。

  9. 出处:「The Importance of Quality over Quantity」(text/88-fm-supervised-fine-tuning-sft-teaching-instructions.txt:35,搜「Ten thousand」)。原文:「Ten thousand high-quality examples typically produce better results than a million low-quality examples」;SFT 是模仿示范,示范质量直接塑造模型行为。 2

  10. 出处:「Training Hyperparameters」(text/88-fm-supervised-fine-tuning-sft-teaching-instructions.txt:29,搜「1e-5 to 5e-6」)。原文:SFT 学习率远低于预训练(典型 1e-5 到 5e-6),1-3 轮防过拟合。

  11. 出处:「The Result: An Instruction-Following Model」(text/88-fm-supervised-fine-tuning-sft-teaching-instructions.txt:61,搜「inconsistent preferences」)。原文:SFT 后仍会前后不一、拒答不稳、啰嗦重复——这些残余问题引出对齐训练。

  12. 出处:「The Three Stages of RLHF」(text/89-fm-reinforcement-learning-from-human-feedback-rlhf.txt:11,搜「three distinct stages」)与「Data Collection Process」(:35,搜「four to nine」)。原文:SFT→奖励模型→强化学习三段;每提示生成 4-9 个回答由标注员比较排序。

  13. 出处:「Key Innovation: KL Penalty」(text/89-fm-reinforcement-learning-from-human-feedback-rlhf.txt:45,搜「KL」)。原文:最终奖励=奖励模型分−β×KL(新策略,原策略);KL 散度衡量两个分布的差异,防止模型偏离太远或钻空子。

  14. 出处:「Reward Hacking」(text/89-fm-reinforcement-learning-from-human-feedback-rlhf.txt:51,搜「Reward Hacking」)。原文:模型可能堆长度、用套话、钻奖励模型与真实人类偏好不一致的边角;缓解手段包括定期更新奖励模型、多样化提示、持续人工评估、多裁判并用。 2

  15. 出处:「Computational Cost」「Human Labeling」(text/89-fm-reinforcement-learning-from-human-feedback-rlhf.txt:69,搜「Computational Cost」;:119,搜「Human Labeling」)。原文:要同时跑策略、奖励、参考三个模型;需要数万到数十万次人工比较;标注员口味会烙进奖励模型。

  16. 出处:「Results of RLHF」(text/89-fm-reinforcement-learning-from-human-feedback-rlhf.txt:81,搜「ChatGPT using」)。原文:ChatGPT(GPT-3.5/4)、Claude、Gemini 等生产系统都以某种形式的 RLHF 为关键组件。

  17. 出处:「Direct Preference Optimization (DPO)」(text/90-fm-alternative-alignment-approaches.txt:3,搜「Direct Preference Optimization (DPO)」;:11,搜「theoretically equivalent」)。原文:DPO 跳过奖励模型直接优化策略,在特定数学条件下与 RLHF 理论等价、实现更简单。 2

  18. 出处:「Constitutional AI (CAI)」(text/90-fm-alternative-alignment-approaches.txt:25,搜「Constitutional AI (CAI)」;:31,搜「critique and revision」)与「RLAIF」局限(:57,搜「Limitations」)。原文:宪法+自我批判改写+RLAIF;AI 评估者的偏见会传给被训模型。

  19. 出处:「Hybrid Approaches」(text/90-fm-alternative-alignment-approaches.txt:69,搜「Hybrid Approaches」)。原文:生产系统常把 SFT+RLHF+宪法 AI 叠用;人的判断管微妙处、AI 批改管规模。

  20. 出处:「Evaluation During Pretraining」等三节(text/92-fm-evaluation-and-benchmarking.txt:7,搜「Perplexity」;:43,搜「pass@k」;:69,搜「Preference Modeling」)。原文:预训练盯困惑度/损失;SFT 盯任务分;对齐盯偏好一致与安全。

  21. 出处:「Comprehensive Benchmarks」(text/92-fm-evaluation-and-benchmarking.txt:11,搜「MMLU」;:63,搜「HumanEval」)。原文:MMLU 考 57 学科;HumanEval 用测试用例评 Python 生成;GSM8K 考小学数学;TruthfulQA 考真实性;BBQ 考社会偏见。

  22. 出处:「The Limitations of Benchmarks」(text/92-fm-evaluation-and-benchmarking.txt:61,搜「Benchmark Saturation」;:89,搜「Gap Between Benchmarks」)。原文:基准数据混入训练导致污染与分数饱和;基准的窄题与真实开放使用之间存在鸿沟。 2

  23. 出处:「Human Evaluation」(text/92-fm-evaluation-and-benchmarking.txt:37,搜「Human Evaluation」)。原文:两两对比、绝对质量打分、多维评估、线上 A/B。

  24. 出处:「Solutions」(text/92-fm-evaluation-and-benchmarking.txt:71,搜「New, harder benchmarks」)。原文:需要定期造更难的新基准、做污染检测、加重人工评估与现实部署指标。