奖励从人来 — 对齐、可解释与量子前沿
这一章讲三件事: 人类偏好怎么被做成奖励模型(把人的口味学成一个打分函数)、再拿第 09 章的 PPO 去优化模型(RLHF);为什么 RL 的「可解释」比一般的可解释 AI 更难; 量子 RL 到底在赌什么、不赌什么。 读完你应能回答:「写不出来的目标」是怎么被驯服成训练信号的。
1. 这一章讲什么
第 09 章结尾留了个钩子:奖励函数是人写的,而写错奖励,智能体只会更忠实地错。 原书第 6 章的三个前沿从三个方向接住这个问题:
- 奖励写不出公式 → 让人当裁判,把裁判口味学成奖励模型(RLHF);
- 信不过学习结果 → 要解释(XAI/XRL);
- 算力(可调动的计算能力)不够 → 换计算介质(量子 RL)。
书里对生成式 AI 与 RL 的结合有一张三方表1,它其实是本章的地图: 纯生成(没有明确目标,靠判别器信号或似然)、目标最大化 (可量化的性质当奖励)、人类反馈(无法量化的性质——有用、得体、 有创意——靠人偏好)。第三行就是 RLHF 的位置,也是这三块里 今天影响最大的一块。
2. 顶层全景:三个前沿,一个共同敌人
共同敌人:「目标」这东西,有时根本写不成函数
RLHF: 人写不出 → 让人排序,学一个奖励模型当代理
XAI/XRL: 就算学对了 → 解释不出也不能用(医疗、法律、自动驾驶)
量子 RL: 就算解释得清 → 经典算力算不动(2ⁿ 空间)
图说:三者都在给「学习」这件事补外部性——奖励的来源、信任的根据、算力的出路。
主走查:一条人类偏好,怎么变成奖励模型的训练信号——第 3 节第 1 小节。
3. 核心原理
3.1 RLHF:把裁判的口味学成函数(主走查)
书里给的两步:先以监督方式训练一个奖励模型,让它直接表示人类偏好; 再拿这个奖励模型去改进智能体的策略(优化算法书里点名 PPO)2。
拿一个具体场景走通(奖励数值为演示编的):给语言模型两个候选 回答—— A 照办了写诈骗信的请求,B 拒绝并解释原因。
① 采偏好:标注员比较 A 与 B,给出 B ≻ A(A 比 B 差)
—— 注意训练信号不是分数,是「序」:人靠谱的本事是比较,不是打分
② 训奖励模型 r(回答):给它看大量这样的「B ≻ A」,学出打分函数
收敛后 r(B) = +0.8 , r(A) = −1.2(演示)
—— 「不该做什么」从此有了一个可优化的数
③ 拿 PPO 优化策略:模型生成回答 A 时挨罚(r=−1.2),
生成 B 时得赏(r=+0.8);KL 惩罚(第 09 章的尺子)把策略
拴在原模型附近,防止为了讨好奖励模型而语无伦次
书里给出的履历:RLHF 由 OpenAI 为文本续写与摘要引入,后来用在 InstructGPT3; 应用面涵盖摘要、对话、文生图3。书里同样给了病:高质量、无偏的偏好数据 采集成本极高3。书里在第 6 章的表里把病列得更细:收集人的偏好昂贵、 用户可能乱来或有偏见、奖励建模难、容易越狱(钻规则的空子做出被禁止的事)跑偏4;还有一个结构性的: 奖励建模可能把多样性压扁成单一奖励函数,多数人的观点不成比例地占上风5。 ——「谁的味道算数」是对齐绕不开的政治学,不只是技术题。
3.2 XAI/XRL:要能被质问
书里的出发点:传统 AI 是黑箱,只会答「是/否」,而法律与医疗场景需要答 「为什么、何时、在哪」6。XAI 要照看三件事:透明(人能看懂 justification, 否则模型可以被悄悄调成谋私利)、信任(有逻辑与科学依据可依)、 公平(处理偏差-方差权衡)6。
技术分两族7:一族透明——模型本身简单可读,比如逻辑回归(把各因素加权加总、过一道门槛给结论的老牌式子)、决策树、规则系统; 书里给了三条透明的标准——可模拟、可分解、算法透明)与事后解释 (训完的黑箱外面套一层:特征重要度、规则集、热图;再分模型无关—— 扰动输入看输出变化——与模型特定)。
RL 的可解释性单独一档(XRL),书里给的差别理由很准8:监督学习的观测 独立同分布、目标是即时误差;RL 的奖励延迟,智能体必须同时考虑短期与 长期后果——所以解释 RL 也不能只解释「这一步为什么」,得解释「这一串 为什么」。书里给 XRL 立了四根柱子:信任(利益相关方愿意把决策交给它)、 新洞见(从系统里挖出对问题的新理解——造 RL 系统不只为决策,也为懂领域)、 可修(知道系统怎么运作才能找 bug、修 bug、预判失效)、 公平与伦理(不因肤色性别歧视)8