跳到主要内容

免强化学习的对齐,与幻觉的病理解剖

这一章讲三件事: DPO 怎么用一条推导链把 RLHF 里的强化学习整个省掉(只剩两个模型的概率比); SFT 与 RLHF 到底谁治什么病(表 8.1 的对照,它们是先后的两站不是二选一); 以及对齐的头号敌人——幻觉:它长哪六种样子、病根在哪三层、怎么查、怎么治。 主走查: 拿第 08 章那对「农村地价」的正负例,手算一遍 DPO 损失与它的自适应梯度。

1. DPO:五步把强化学习推导没

第 08 章末尾说过,PPO 是可以整个换掉的零件。换它的主流方案叫 DPO(直接偏好优化): 不用训奖励模型、不用跑强化学习,直接拿偏好数据微调模型,复杂度与普通指令微调相当1。 它省掉 RL 不是另起炉灶,而是从 RLHF 的目标函数里推导出来的。原书给了完整的推导链, 我们把五步各自在干什么讲清2:

第 ① 步 写出 RLHF 的目标:最大化「奖励 − β·KL 散度(与参考模型的距离)」
—— 就是第 08 章那套「往高分走、但别跑偏」。
第 ② 步 求它的最优解:这个目标不用迭代试,数学上有闭式解——
最优策略 ∝ 参考模型 × e^(奖励/β)。含义:最优模型就是
「在参考模型基础上,按奖励指数级加权」的那个分布。
第 ③ 步 反解奖励:把上式调个头,奖励 = β·log(最优策略/参考模型) + β·log Z(x)。
Z(x) 是配分函数(把所有候选答案的概率归一化的那个常数,只与问题有关)。
—— 奖励第一次被「两个模型的概率比」表示出来,奖励模型可以下岗了。
第 ④ 步 代入偏好公式:人标注的是「y+ 比 y− 好」,偏好概率 = σ(r₊ − r₋)。
把第 ③ 步的奖励代进去——Z(x) 在分子分母各出现一次,正好相消!
第 ⑤ 步 得到 DPO 损失:只剩
−log σ( β·log[πθ(y+)/π_old(y+)] − β·log[πθ(y−)/π_old(y−)] )
图说:整个式子里只有正在训练的模型 πθ 和它的初始快照 π_old,
没有奖励模型,没有价值模型,没有采样循环。

读一遍这个损失就懂它在干什么:让正例的概率比(相对原样)尽量变大,负例的概率比尽量变小。 和 RLHF 的对比法裁判(第 08 章式 8.2)形状几乎一样,只是「打分的人」从奖励模型 换成了模型自己与原样的比值3。训练时只需加载策略模型与参考模型两个, 可以从同一个 checkpoint 初始化——比 PPO 的四个模型省了一半4

2. 主走查:一对正负例,手算 DPO

拿第 08 章那对例子:y+ =「指出『地价便宜就适合污染产业』这个前提有误的回答」, y− =「顺着前提答是的回答」。下面的小数都是为演示编的,不是真实数值, 算法严格按上节第 ⑤ 步的式子:

设 β = 0.1。当前模型与原样对这两个回答的生成概率(演示值):

log[πθ(y+)/π_old(y+)] = log(0.30/0.25) ≈ +0.18 ← 模型比原样更偏爱正例了
log[πθ(y−)/π_old(y−)] = log(0.40/0.20) ≈ +0.69 ← 但它更爱负例!麻烦

代入损失:-log σ( 0.1×0.18 − 0.1×0.69 ) = -log σ(-0.051) ≈ 0.513

更新方向:压低 y− 的概率、抬高 y+ 的概率。
梯度大小:式子里藏着一个自动刹车——梯度系数 = σ(r̂₋ − r̂₊)。
此刻模型错爱 y−(r̂₋ > r̂₊),系数接近 1 → 大步更新,猛修;
设想训练后期模型已经偏爱 y+(比如 r̂₊ − r̂₋ = 5),系数 ≈ σ(-5) ≈ 0.007
→ 几乎不再动 —— 已经学会的东西不再被过调。
图说:错得越离谱,更新越猛;学得越到位,更新越轻。
这个系数就是 DPO 不用 PPO 那套裁剪/KL 也能稳的原因。

3. SFT vs RLHF:先后的两站,各有对方治不了的病

有了 DPO,还要不要 SFT?原书 8.4 节把两条路线摆开对照(表 8.1),结论是它们不是二选一, 而是先后两站5。先看本质区别:SFT 是行为克隆——逐 token 模仿人写的范例, 训练时每个位置都拿标准答案当输入(这叫 teacher forcing);RLHF 是结果反馈—— 不教你怎么写,只告诉你写得好不好,优化的是整段文本层面的对齐损失6

各自的病,正好被对方治:

SFT(行为克隆)RLHF(结果反馈)
长处简单高效、提升泛化、能专业化(定角色)进一步提升能力与有用性;能纠正坏行为;标注偏好比写范例简单且一致
模仿无探索;teacher forcing 造成暴露偏差(训练时从没见过自己生成的错,生成时一错就连锁);数据超出模型知识范围会加重幻觉样本效率低;训练不稳、超参敏感;必须从强 checkpoint 热启动

两个要害判断值得单独记。其一,SFT 是解锁不是注入:拿超出模型知识范围的指令数据硬训, 模型学不会「知道」,只会学会「不懂也敢答」——幻觉就是这么喂出来的; OpenAI 联合创始人 John Schulman(PPO 论文一作)还警告过: 用大模型蒸馏小模型(让小模型模仿大模型的输出)同样可能增加幻觉7。 其二,RLHF 的标注员可以评判自己写不出来的内容——打分比创作容易, 所以模型能探索到范例之外的好答法;GPT-4 正是用 RLHF 来压幻觉的8。 原书末尾还提到 OpenAI 的「超级对齐」研究计划:当模型强过标注员, 「人来指认哪个好」这套机制本身也会失效,那是下一层问题9

4. 幻觉:六种长相,三层病因

幻觉是模型一本正经地生成不实信息——第 04 章见过这个词,这里是它的病理解剖。 原书把开放域的事实性幻觉分成六类,每类都带真实例子10:

类型书里的例子
实体错误南京长江大桥建成答成 1970 年(实际 1968)
关系错误「海水里氮含量高于氯」;「比尔·盖茨比扎克伯格出生晚」
不完整四大发明只答出三个,漏了火药
过时问微软 CEO 答比尔·盖茨(训练数据停在旧年代)
过度断言「维生素 C 能治所有感冒」
不可验证编造一个听起来像真的一样的书名

病因分三层,对应流水线上下游11:

  • 数据层:预训练料里的错误被原样学会(「模仿陷阱」);数据有时间截点(过时)、 缺专业领域(医法易幻觉)、长尾知识稀疏(越少见的知识越容易答错);
  • 训练层:自回归训练里注意力随距离衰减,长程依赖抓不牢; teacher forcing 的暴露偏差;蒸馏超出小模型能力; RLHF 自己也可能贡献幻觉——模型会学会「迎合裁判的偏好」而不是「说真话」12;
  • 解码层:提示词绕弯子、用抽象概念不用具体说法,模型更容易编; 温度(控制采样随机度的旋钮,第 10 章细讲)调得越高, 低频词被选中的概率越大,幻觉越多13

5. 检测与缓解:三查四治

查幻觉,三路人马14:

  1. 以模治模:让更强的模型(如 GPT-4)当判官,把回答切成句子逐句核验; 短板是判官自己的知识边界;
  2. 查不确定性:生成时概率低的 token 更可疑;只有 API、看不到内部状态时, 用自洽(多次回答互相一致、不自相矛盾)性检查——同一问题多问几遍看答案一不一致, 或让模型根据自己的回答反推原问题、再和真问题比对;
  3. 外部工具:逐句丢给搜索引擎核验,数值交给计算器、代码交给解释器跑—— 不依赖模型自身知识,最硬。

治幻觉,四种手段15:

  • 对齐训练:让强模型当教官,把有幻觉的回答迭代改写到无幻觉为止, 「原答(有幻觉)/新答(无幻觉)」成对,训奖励模型——就是第 08 章 RLAIF 的打法;
  • 检索增强生成(RAG):先从外部资料库搜相关文档、再照着写答案 (第 13 章整节讲它);搜来的资料与模型记忆冲突时,要先过滤;
  • 高级解码:动态调 top-p(另一种截断采样范围的旋钮,第 10 章细讲)—— 句首放开保多样,句中收紧保事实,并设下限防单调;
  • 改进提示:任务描述里给领域信息、给模型指派角色(「你是程序员」)、 让它自我反思——成本低,先从这个用起。

判断(我们的,不是书里的): 把 §3 和 §4 连起来看,浮现出一条贯穿全书后训练部分的线索: 每一个训练手段都自带一种幻觉成因——SFT 带来暴露偏差与「不懂敢答」, 蒸馏带来能力超载,RLHF 带来迎合裁判。幻觉不是某个环节的事故,而是整套范式的结构性副产品, 所以它的治理也只能是全流程的(数据、训练、解码、检索一起上)。 如果错,会错在: 如果未来的训练目标(比如可验证奖励的强化学习,第 14 章) 被证明能系统性地让模型「知道什么才说什么」,结构性副产品的说法就要松动—— 目前长 CoT 模型上的幻觉率仍是公开问题,证据不支持松动。

6. 作者的判断与证据

  • 推导链完整: DPO 的五步推导与梯度分析是原书给出的数学推导(式 8.23~8.45)23, 结论与原论文一致;
  • 有出处的判断: SFT「解锁而非注入」、Schulman 的蒸馏警告、RLHF 减幻觉(GPT-4)、 RLHF 可能「迎合偏好而非真实」,原书都标了文献来源7812;
  • 作者的归纳: 幻觉六分类沿用研究文献的分类10;三层病因、三查四治是原书对文献的梳理, 个别手段(动态 top-p)是作者给的实用建议15

7. 边界与局限

  • DPO 省掉了裁判,也就放弃了裁判的一个用途:在线打分——过程监督(第 08 章)、 推理时重排(第 12、14 章)仍需要显式的奖励模型,DPO 给不了。
  • DPO 的推导从「带 KL 惩罚的 RL 目标」出发,它继承了这个目标的全部假设; 偏离假设时(比如偏好数据本身有噪声),它的行为比 RLHF 更少被研究。
  • 幻觉六分类针对事实性幻觉;逻辑错误、指令偏离这类不属事实问题的「胡说」不在表里。
  • 「迎合裁判」的幻觉成因,意味着第 08 章那套对齐流水线天然携带反噬; 原书开了这个头但没有给系统解法——这是第 16 章开放问题的素材。

8. 可带走的

  1. DPO 五步:RL 目标 → 最优策略闭式解 → 反解奖励 → 代入偏好公式 → Z(x) 相消,只剩两个模型的概率比;
  2. DPO 只要策略+参考两个模型;梯度系数 σ(r̂₋−r̂₊) 自动刹车:错得狠更得猛,学到位不再动;
  3. SFT=行为克隆(token 级模仿),RLHF=结果反馈(文本级对齐);先 SFT 后 RLHF,不是二选一;
  4. SFT 是解锁不是注入:超出知识范围的指令数据会喂出幻觉;蒸馏小模型同样有此险;
  5. RLHF 的独特价值:标注员能评判自己写不出的内容,模型得以探索范例之外;
  6. 幻觉六种:实体错、关系错、不完整、过时、过度断言、不可验证;
  7. 三层病因:数据(模仿陷阱/过时/长尾)、训练(暴露偏差/蒸馏超载/迎合裁判)、解码(绕弯提示/高温度);
  8. 三查:强模型逐句判、不确定性(自洽性/反推问题)、外部工具核验;
  9. 四治:对齐训练(教官迭代改写)、RAG(先搜再写)、动态 top-p、提示改进;
  10. 每个训练手段自带一种幻觉成因——治理幻觉是全流程工程。

9. 原文地图

主题原书章原文位置
RLHF 的三个痛点8.3text/42-ch08-03-8-3-alignment-methods-without-reinforcement-lear.txt:3(搜「multiple models simultaneously」)
DPO 核心思想8.3.1text/42-ch08-03-8-3-alignment-methods-without-reinforcement-lear.txt:13(搜「direct relationship between the policy function」)
推导五步(式 8.23-8.43)8.3.1text/42-ch08-03-8-3-alignment-methods-without-reinforcement-lear.txt:55(搜「optimal solution」) · text/42-ch08-03-8-3-alignment-methods-without-reinforcement-lear.txt:71(搜「βlogZ(x)」) · text/42-ch08-03-8-3-alignment-methods-without-reinforcement-lear.txt:95(搜「cancel out」)
梯度自适应分析8.3.1text/42-ch08-03-8-3-alignment-methods-without-reinforcement-lear.txt:109(搜「gradient coefficient」)
DPO 只需两个模型8.3.1text/42-ch08-03-8-3-alignment-methods-without-reinforcement-lear.txt:115(搜「only the policy model and reference model」)
其他监督对齐(质量提示/质量对比)8.3.2text/42-ch08-03-8-3-alignment-methods-without-reinforcement-lear.txt:127(搜「Good response」) · text/42-ch08-03-8-3-alignment-methods-without-reinforcement-lear.txt:131(搜「partial ordering of output quality」)
表 8.1 优缺点对照8.4text/43-ch08-04-8-4-further-discussion-on-sft-and-rlhf.txt:3(搜「Table 8.1」)
行为克隆与 teacher forcing8.4.1text/43-ch08-04-8-4-further-discussion-on-sft-and-rlhf.txt:45(搜「behavior cloning」)
解锁非注入与 Schulman 警告8.4.2text/43-ch08-04-8-4-further-discussion-on-sft-and-rlhf.txt:53(搜「unlock」;同段搜「John Schulman」)
RLHF 的优势与减幻觉8.4.3text/43-ch08-04-8-4-further-discussion-on-sft-and-rlhf.txt:61(搜「beyond their creative abilities」) · text/43-ch08-04-8-4-further-discussion-on-sft-and-rlhf.txt:63(搜「reduce hallucinations」)
超级对齐8.4.3text/43-ch08-04-8-4-further-discussion-on-sft-and-rlhf.txt:67(搜「superalignment」)
幻觉六分类8.5.1text/44-ch08-05-8-5-hallucination.txt:9(搜「Nanjing Yangtze River Bridge」) · text/44-ch08-05-8-5-hallucination.txt:15(搜「Satya Nadella」) · text/44-ch08-05-8-5-hallucination.txt:19(搜「cannot be verified」)
病因:数据层8.5.2text/44-ch08-05-8-5-hallucination.txt:29(搜「imitation trap」) · text/44-ch08-05-8-5-hallucination.txt:31(搜「long-tail knowledge」)
病因:训练层8.5.2text/44-ch08-05-8-5-hallucination.txt:37(搜「exposure bias」) · text/44-ch08-05-8-5-hallucination.txt:39(搜「cater to human preferences」)
病因:解码层8.5.2text/44-ch08-05-8-5-hallucination.txt:45(搜「readability, formality, and specificity」) · text/44-ch08-05-8-5-hallucination.txt:47(搜「low-frequency words」)
检测三法8.5.3text/44-ch08-05-8-5-hallucination.txt:53(搜「segmented into sentences」) · text/44-ch08-05-8-5-hallucination.txt:55(搜「consistency」) · text/44-ch08-05-8-5-hallucination.txt:57(搜「search engines」)
缓解四法8.5.4text/44-ch08-05-8-5-hallucination.txt:63(搜「instructor model」) · text/44-ch08-05-8-5-hallucination.txt:65(搜「retrieve-then-generate」) · text/44-ch08-05-8-5-hallucination.txt:67(搜「top-p」)

Footnotes

  1. 出处:「8.3 Alignment Methods Without Reinforcement Learning」第 3-9 段(text/42-ch08-03-8-3-alignment-methods-without-reinforcement-lear.txt:3,搜「multiple models simultaneously」;text/42-ch08-03-8-3-alignment-methods-without-reinforcement-lear.txt:9,搜「direct preference optimization」)。

  2. 出处:「8.3.1 Introduction to the DPO Algorithm」第 15-95 段(text/42-ch08-03-8-3-alignment-methods-without-reinforcement-lear.txt:55,搜「optimal solution」;text/42-ch08-03-8-3-alignment-methods-without-reinforcement-lear.txt:71,搜「βlogZ(x)」;text/42-ch08-03-8-3-alignment-methods-without-reinforcement-lear.txt:95,搜「cancel out」)。五步划分是我们对原书式 8.23~8.43 推导链的归纳。 2

  3. 出处:「8.3.1 Introduction to the DPO Algorithm」第 91-95 段(text/42-ch08-03-8-3-alignment-methods-without-reinforcement-lear.txt:91,搜「σβlog」)。DPO 损失与式 8.2 对比损失的同构关系是原书推导的直接结果。 2

  4. 出处:「8.3.1 Code Practice for DPO」第 113-115 段(text/42-ch08-03-8-3-alignment-methods-without-reinforcement-lear.txt:115,搜「only the policy model and reference model」)。

  5. 出处:「8.4 Further Discussion on SFT and RLHF」第 3 段(text/43-ch08-04-8-4-further-discussion-on-sft-and-rlhf.txt:3,搜「Table 8.1」)。

  6. 出处:「8.4.1 Comparison Based on Learning Methods」第 45-47 段(text/43-ch08-04-8-4-further-discussion-on-sft-and-rlhf.txt:45,搜「behavior cloning」;text/43-ch08-04-8-4-further-discussion-on-sft-and-rlhf.txt:47,搜「text-level alignment loss」)。

  7. 出处:「8.4.2 Advantages and Disadvantages of SFT」第 53 段(text/43-ch08-04-8-4-further-discussion-on-sft-and-rlhf.txt:53,搜「unlock」;同段搜「John Schulman」)。 2

  8. 出处:「8.4.3 Advantages and Disadvantages of RLHF」第 61 段(text/43-ch08-04-8-4-further-discussion-on-sft-and-rlhf.txt:61,搜「beyond their creative abilities」)与第 63 段(text/43-ch08-04-8-4-further-discussion-on-sft-and-rlhf.txt:63,搜「reduce hallucinations」)。 2

  9. 出处:「8.4.3 Advantages and Disadvantages of RLHF」第 67 段(text/43-ch08-04-8-4-further-discussion-on-sft-and-rlhf.txt:67,搜「superalignment」)。

  10. 出处:「8.5.1 Definition and Classification of Hallucination」第 9-19 段(text/44-ch08-05-8-5-hallucination.txt:9,搜「Nanjing Yangtze River Bridge」;text/44-ch08-05-8-5-hallucination.txt:15,搜「Satya Nadella」;text/44-ch08-05-8-5-hallucination.txt:19,搜「cannot be verified」)。 2

  11. 出处:「8.5.2 Causes of Hallucination」第 29-47 段(text/44-ch08-05-8-5-hallucination.txt:29,搜「imitation trap」;text/44-ch08-05-8-5-hallucination.txt:31,搜「long-tail knowledge」)。

  12. 出处:「8.5.2 Training Methods」第 39 段(text/44-ch08-05-8-5-hallucination.txt:39,搜「cater to human preferences」)。 2

  13. 出处:「8.5.2 Decoding Strategies」第 47 段(text/44-ch08-05-8-5-hallucination.txt:47,搜「low-frequency words」)。

  14. 出处:「8.5.3 Methods for Hallucination Detection」第 53-57 段(text/44-ch08-05-8-5-hallucination.txt:53,搜「segmented into sentences」;text/44-ch08-05-8-5-hallucination.txt:55,搜「consistency」;text/44-ch08-05-8-5-hallucination.txt:57,搜「search engines」)。

  15. 出处:「8.5.4 Methods for Hallucination Mitigation」第 63-69 段(text/44-ch08-05-8-5-hallucination.txt:63,搜「instructor model」;text/44-ch08-05-8-5-hallucination.txt:65,搜「retrieve-then-generate」;text/44-ch08-05-8-5-hallucination.txt:67,搜「top-p」)。 2