跳到主要内容

奖励从人来 — 对齐、可解释与量子前沿

这一章讲三件事: 人类偏好怎么被做成奖励模型(把人的口味学成一个打分函数)、再拿第 09 章的 PPO 去优化模型(RLHF);为什么 RL 的「可解释」比一般的可解释 AI 更难; 量子 RL 到底在赌什么、不赌什么。 读完你应能回答:「写不出来的目标」是怎么被驯服成训练信号的。

1. 这一章讲什么

第 09 章结尾留了个钩子:奖励函数是人写的,而写错奖励,智能体只会更忠实地错。 原书第 6 章的三个前沿从三个方向接住这个问题:

  • 奖励写不出公式 → 让人当裁判,把裁判口味学成奖励模型(RLHF);
  • 信不过学习结果 → 要解释(XAI/XRL);
  • 算力(可调动的计算能力)不够 → 换计算介质(量子 RL)。

书里对生成式 AI 与 RL 的结合有一张三方表1,它其实是本章的地图: 纯生成(没有明确目标,靠判别器信号或似然)、目标最大化 (可量化的性质当奖励)、人类反馈(无法量化的性质——有用、得体、 有创意——靠人偏好)。第三行就是 RLHF 的位置,也是这三块里 今天影响最大的一块。

2. 顶层全景:三个前沿,一个共同敌人

共同敌人:「目标」这东西,有时根本写不成函数

RLHF: 人写不出 → 让人排序,学一个奖励模型当代理
XAI/XRL: 就算学对了 → 解释不出也不能用(医疗、法律、自动驾驶)
量子 RL: 就算解释得清 → 经典算力算不动(2ⁿ 空间)

图说:三者都在给「学习」这件事补外部性——奖励的来源、信任的根据、算力的出路。

主走查:一条人类偏好,怎么变成奖励模型的训练信号——第 3 节第 1 小节。

3. 核心原理

3.1 RLHF:把裁判的口味学成函数(主走查)

书里给的两步:先以监督方式训练一个奖励模型,让它直接表示人类偏好; 再拿这个奖励模型去改进智能体的策略(优化算法书里点名 PPO)2

拿一个具体场景走通(奖励数值为演示编的):给语言模型两个候选回答—— A 照办了写诈骗信的请求,B 拒绝并解释原因。

① 采偏好:标注员比较 A 与 B,给出 B ≻ A(A 比 B 差)
—— 注意训练信号不是分数,是「序」:人靠谱的本事是比较,不是打分

② 训奖励模型 r(回答):给它看大量这样的「B ≻ A」,学出打分函数
收敛后 r(B) = +0.8 , r(A) = −1.2(演示)
—— 「不该做什么」从此有了一个可优化的数

③ 拿 PPO 优化策略:模型生成回答 A 时挨罚(r=−1.2),
生成 B 时得赏(r=+0.8);KL 惩罚(第 09 章的尺子)把策略
拴在原模型附近,防止为了讨好奖励模型而语无伦次

书里给出的履历:RLHF 由 OpenAI 为文本续写与摘要引入,后来用在 InstructGPT3; 应用面涵盖摘要、对话、文生图3。书里同样给了病:高质量、无偏的偏好数据 采集成本极高3。书里在第 6 章的表里把病列得更细:收集人的偏好昂贵、 用户可能乱来或有偏见、奖励建模难、容易越狱(钻规则的空子做出被禁止的事)跑偏4;还有一个结构性的: 奖励建模可能把多样性压扁成单一奖励函数,多数人的观点不成比例地占上风5。 ——「谁的味道算数」是对齐绕不开的政治学,不只是技术题。

3.2 XAI/XRL:要能被质问

书里的出发点:传统 AI 是黑箱,只会答「是/否」,而法律与医疗场景需要答 「为什么、何时、在哪」6。XAI 要照看三件事:透明(人能看懂 justification, 否则模型可以被悄悄调成谋私利)、信任(有逻辑与科学依据可依)、 公平(处理偏差-方差权衡)6

技术分两族7:一族透明——模型本身简单可读,比如逻辑回归(把各因素加权加总、过一道门槛给结论的老牌式子)、决策树、规则系统; 书里给了三条透明的标准——可模拟、可分解、算法透明)与事后解释 (训完的黑箱外面套一层:特征重要度、规则集、热图;再分模型无关—— 扰动输入看输出变化——与模型特定)。

RL 的可解释性单独一档(XRL),书里给的差别理由很准8:监督学习的观测 独立同分布、目标是即时误差;RL 的奖励延迟,智能体必须同时考虑短期与 长期后果——所以解释 RL 也不能只解释「这一步为什么」,得解释「这一串 为什么」。书里给 XRL 立了四根柱子:信任(利益相关方愿意把决策交给它)、 新洞见(从系统里挖出对问题的新理解——造 RL 系统不只为决策,也为懂领域)、 可修(知道系统怎么运作才能找 bug、修 bug、预判失效)、 公平与伦理(不因肤色性别歧视)8

3.3 量子 RL:在赌什么

先补最小必要知识(书里 §6.8.1 的口径):经典比特只能是 0 或 1;量子比特(量子版的比特)则不然。

它可以处在两个基态的叠加(既 0 又 1、各占一份)上——|ψ⟩ = α|0⟩ + β|1⟩, α、β 是复数,|α|²+|β|²=1;测量时按概率 |α|² 塌缩到对应基态 (书里讲的玻恩规则)9。n 个量子比特的状态有 2ⁿ 个复振幅—— 书里给的对比:量子系统处理信息按 O(2ⁿ) 缩放,经典只能 O(n)10。 操作必须是酉矩阵(保长度),测量则不可逆地扰动系统11

量子 RL 的路线书里列了四类12:量子启发的(如按振幅放大选动作, Grover 型搜索)、变分量子线路(VQC)当函数近似器(在含噪中等规模量子 硬件上跑、参数由经典计算机迭代优化,书里说它能近似任何解析的动作-价值函数)13、 把量子计算当子程序(大流程里调用的一小段)嵌进来(量子策略/值迭代),以及全套量子 RL。 拿一次测量走个数(演示):某动作被制备成 α=√0.8 的叠加态, 测量后以 0.8 的概率落进「执行」基态——奖励偏好被写进了振幅, 采样本身就是按玻恩规则进行的14

书里还给了投射模拟(智能体建一张记忆网络,按随机行走选动作; 「量子化」= 换成量子行走,潜在的量子优势在选动作加速)15 与量子玻尔兹曼机(能量模型当函数近似器)16本章的裁决:量子 RL 目前的路线全部依赖尚未成熟的硬件(书里自己标注 VQC 靠的是 「含噪中等规模量子」设备、无纠错13),读作路线图,不作能力陈述。

4. 作者的判断与证据

  • 书里给证据的: RLHF 两步与 OpenAI/InstructGPT 履历、偏好数据的成本、 XAI 的三关切与两族方法、XRL 四柱、量子比特的数学口径与 O(2ⁿ) 对比、 VQC 的 NISQ 前提,均为书中明写内容23681013
  • 书里给来源的: 生成式 AI 一节的三方表注明引自 arXiv 综述1—— ② 式的诚实标注,值得肯定。
  • 书里的定位判断: 把 RLHF 放在「生成式 AI 与 RL 的第三类应用」里讲, 而不是独立成节——我们按它今天的重要性把排序提了上来,机制未变。
  • 书里没写的: RLHF 之后的技术演进(直接偏好优化 DPO 等免 RL 路线; 依据我们书架对模型后期调优的拆解17),书成书时未收,边界节交代。

5. 边界与局限

  • RLHF 的三重病书里列了两重半。 数据贵且带偏3、多样性坍缩5、越狱4 都有;但「奖励模型会被策略钻空子(过度优化)」这一层书里没提—— 策略优化的正是奖励模型而不是人本身的真实意图,模型有误差, 误差会被放大(补充,不在书里,来自通用知识)。
  • XAI 的「解释」没有 ground truth。 事后解释(热图、特征重要度)可以 看起来有理而实际误导;书里没讨论「解释的可信度怎么验证」。
  • 量子部分的每一项优势都带前提。 O(2ⁿ) 的缩放说的是状态表示, 读出结果仍要测量、仍受采样次数限制;「量子优势」在 RL 上尚无公认演示 (补充,来自通用知识)。书里没有夸大,但也没把前提钉死。
  • 这一章的三个前沿互相不接。 书里各节独立;实际上「对齐好的模型+可解释的 决策+高效推算」是一个工程整体——书的杂货铺式写法使读者需自己连线。

6. 可带走的

  1. 写不出的目标,可以学出来:RLHF = 人排序 → 奖励模型 → PPO 优化; 人类靠谱的是比较,不是绝对打分——所以信号是序,不是数;
  2. 奖励模型是人味的代理,不是人味本身:它会带来多样性坍缩、多数派暴政、越狱;
  3. KL 拴绳是 RLHF 的安全带:优化奖励模型的同时不许离原模型太远(第 09 章的 KL);
  4. XRL 比一般 XAI 难的根子:奖励延迟 → 要解释的是「一串决策」不是「一步决策」;
  5. 解释的两族:模型本身可读(透明方法)vs 训完套壳(事后解释); 四根柱子:信任、新洞见、可修、公平;
  6. 量子 RL 的核心赌注:2ⁿ 个振幅一次演化(经典 O(n) 只能羡慕); VQC 把量子线路当函数近似器、经典机迭代调参;
  7. 但每项优势都押在不成熟的硬件上——读作路线图,别当作力;
  8. 判断某篇「前沿」文章值不值得读的土办法:它补的是奖励来源、信任根据、 还是算力出路?三样都不沾的,多半是热词

7. 原文地图

主题原书章原文位置
生成式 AI 与 RL 的三方表Recent Developments in DRL(§6.3)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:652(搜「Table 6.2」) · text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:762(搜「Franceschelli」)
三类应用与各自局限Recent Developments in DRL(§6.3)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:674(搜「Mere generation」) · text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:730(搜「Output of a model」)
奖励建模之病(多样性、越狱)Recent Developments in DRL(§6.3.3)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:805(搜「diversity」) · text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:754(搜「jailbreaks」)
RLHF 两步、OpenAI/InstructGPTRecent Developments in DRL(§6.7)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:996(搜「reward model」)
RLHF 成本之病Recent Developments in DRL(§6.7)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:1000(搜「high cost」)
XAI 出发点与三关切Recent Developments in DRL(§6.4)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:814(搜「blackbox」) · text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:821(搜「Transparency」)
透明/事后两族方法Recent Developments in DRL(§6.4)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:855(搜「Transparent methods」) · text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:874(搜「Post-hoc」)
XRL:与监督学习之别、四柱Recent Developments in DRL(§6.4.1)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:895(搜「short-term and long-term」) · text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:905(搜「Trust:」) · text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:915(搜「Making adjustments」)
量子比特、叠加、测量Recent Developments in DRL(§6.8.1)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:1018(搜「superposition」) · text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:1110(搜「eigenvalue」)
O(2ⁿ) 对比、酉算子Recent Developments in DRL(§6.8.1)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:1067(搜「O (2n)」) · text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:1076(搜「unitary」)
QRL 四类路线Recent Developments in DRL(§6.8.2)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:1125(搜「Quantum-inspired」)
VQC、NISQRecent Developments in DRL(§6.8.3)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:1149(搜「NISQ」) · text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:1153(搜「approximate any」)
投射模拟、量子玻尔兹曼机Recent Developments in DRL(§6.8.4)text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:1195(搜「random walk」) · text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:1199(搜「Boltzmann」)

Footnotes

  1. 出处:「Recent Developments in DRL」表 6.2(§6.3,text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:652,搜「Table 6.2」)。三类应用:纯生成(GAN 判别信号、似然、约束满足)、目标最大化(测试期指标、可数性质)、人的反馈(有用/得体/创意等不可量化性质、对齐问题);来源注见第 762 段。 2

  2. 出处:「Recent Developments in DRL」§6.7 第 996 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:996,搜「reward model」)。原文:先以监督方式训练奖励模型直接表示人类偏好,再用 PPO 之类的优化算法据其改进策略。 2

  3. 出处:「Recent Developments in DRL」§6.7 第 1000 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:1000,搜「InstructGPT」)。OpenAI 为文本续写/摘要引入,后用于 InstructGPT;应用面(摘要、对话、文生图);病:高质量无偏偏好数据成本极高。 2 3 4 5

  4. 出处:「Recent Developments in DRL」表 6.2 第三行局限列(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:754,搜「jailbreaks」)。采集贵、用户乱来/分歧/带偏、奖励建模难、易越狱跑偏。 2

  5. 出处:「Recent Developments in DRL」§6.3.3 第 805 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:805,搜「diversity」)。奖励建模可能把多样性压缩到单一奖励函数,多数观点不成比例地占上风;表现良好的偏好奖励模型也可能不泛化。 2

  6. 出处:「Recent Developments in DRL」§6.4 第 814–845 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:814,搜「blackbox」)。黑箱只答是/否;法律医疗要答 wh 问;透明/信任/公平三关切(第 821–845 段)。 2 3

  7. 出处:「Recent Developments in DRL」§6.4 第 855–883 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:855,搜「Transparent methods」)。透明方法清单与三条标准(可模拟、可分解、算法透明,第 859–869 段);事后方法:特征重要度/规则集/热图,模型无关 vs 模型特定(第 874–883 段)。

  8. 出处:「Recent Developments in DRL」§6.4.1 第 891–924 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:895,搜「short-term and long-term」)。XRL 的动机与 RL 特殊性;信任=愿意委托(第 905 段);新洞见(第 910 段)、可修(第 915 段)、公平伦理(第 920 段)。 2 3

  9. 出处:「Recent Developments in DRL」§6.8.1 第 1018–1031 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:1018,搜「superposition」)。量子比特叠加态 |ψ⟩=α|0⟩+β|1⟩、|α|²+|β|²=1、Bloch 球;测量给出本征值、系统塌入对应本征态(第 1110 段)。

  10. 出处:「Recent Developments in DRL」§6.8.1 第 1060–1067 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:1067,搜「O (2n)」)。n 量子比特系统 2ⁿ 个复振幅;量子按 O(2ⁿ) 缩放,经典限于 O(n)。 2

  11. 出处:「Recent Developments in DRL」§6.8.1.1 第 1072–1097 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:1076,搜「unitary」)。演化算子酉(可逆、保长);X/Y/Z 与 Hadamard;CX/CZ。

  12. 出处:「Recent Developments in DRL」§6.8.2 第 1119–1141 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:1125,搜「Quantum-inspired」)。量子启发、VQC 当近似器、量子子程序、全套 QRL 四类。

  13. 出处:「Recent Developments in DRL」§6.8.3 第 1145–1153 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:1149,搜「NISQ」)。VQC 在含噪中等规模量子硬件上跑、经典迭代优化;无纠错也能避开部分量子错误;可近似任何解析动作-价值函数。 2 3

  14. 出处:「Recent Developments in DRL」§6.8.4 第 1191 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:1191,搜「amplitude amplification」)。振幅放大:从均匀叠加出发,按奖励/价值函数有选择地放大振幅,测量按玻恩规则在「动作基」上进行。√0.8 的测量数值为演示编的。

  15. 出处:「Recent Developments in DRL」§6.8.4 第 1195 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:1195,搜「random walk」)。投射模拟:记忆网络上随机行走选动作;量子化为量子行走,潜在优势在动作选择加速。

  16. 出处:「Recent Developments in DRL」§6.8.4 第 1199 段(text/24-ch06-01-6-1-physics-based-nns-and-drl.txt:1199,搜「Boltzmann」)。量子玻尔兹曼机当函数近似器;能量模型的量子表示带来后 NISQ 时代的潜在加速。

  17. RLHF 之后的免 RL 后训练路线,补充(不在书里,依据我们的 ai-book-reference 书架)。依据: shelf=ai-book-reference/nndl-2e#32-alignment-and-reasoning.md @未提交(工作区) 事实=该拆解覆盖对齐与推理的后训练路线(含 RLHF 之外的方法)。