偏好到底是什么 — RLHF 的哲学地基
这一章是全书唯一的「停下来想」章。 前八章在造机器,这一章问:这台机器 吃进来的那种叫「偏好」的东西,存在吗?测得准吗?压成一个数合理吗? 读完你不会得到答案——你会得到一张「这个领域哪些地方理论上就没保证」的地图, 这比答案值钱。
1. 这一章讲什么
RLHF 的每个环节我们都拆过了,唯独没 问过最上游的问题:「人更喜欢 A 而不是 B」 ——这个「更喜欢」是什么? 书里把这章放在数据章之前,用意明确:它回答 「为什么 RLHF 会被驱赶着走到今天的形状,又为什么它不可能彻底解决」1。
2. 顶层全景与主走查
主走查不是走程序,是走你自己的判断。书里给的原题:2025 年 2 月 26 日,作者拿同一句 「写一首关于乐观的金鱼的诗」问了 Claude 3.7 Sonnet 和 GPT-4o,得到两首诗—— 一首三节直白抒情(「The world is vast,」she'd always say…),一首三节带意象 (据说只有三秒记性、金鱼缸当整个世界)2。
你现在就是标注员。请回答:
哪首更好? → 你的答案靠什么标准?
哪首出自哪个模型? → 你的证据呢?
换个人来选,结论会一样吗?
你昨天选的,今天还会选吗?
图说:四个问题里,只有第一个有「答案」,后三个全是 RLHF
数据收集时真实发生的不确定性。对比一下「2006 年美国总统
是谁」——那道题有标准答案,而这首诗没有。
书里拿这道对比点题:用人类当奖励信号,本质是给「没有客观对错的目标」找一个 间接的、可优化的替身3。这个替身的一切缝隙,就是本章的内容。
3. 核心原理
3.1 三个学科的汇流,各带各的假设
书里的判断:现代 RLHF 是三条思想线的汇合,每条线都偷偷塞进了自己的假设4:
| 学科 | 带进来的概念 | 塞进的假设 |
|---|---|---|
| 哲学·经济·心理 | 偏好、效用 | 偏好可测、可比较、相对稳定 |
| 最优控制·强化学习 | 奖励、回报、最优 | 目标写得出函数、且定义良好 |
| 深度学习 | 表征、拟合 | 压缩进一个函数就能还原 |
3.2 「给价值标上数」这条线:三百年,没吵完
把「好坏」变成数,至少能追到 1662 年的《波尔罗亚尔逻辑》:要判断该不该做一件事, 既要看好坏本身,也要看它发生的概率——期望值的雏形。之后是边沁的功利主义 「快乐可以计算」、1931 年拉姆齐把概率与效用绑进同一个数学框架5。
但这条线从未收敛。书里引了两派反对意见:有经济学家指出人有对自己偏好的偏好 (二阶偏好),还互相在意彼此的偏好——测量在原则上就难;更有行为经济学家主张 偏好可能根本不存在——它不是人心里一件等着被测量的东西,而是研究者为了 方便而发明的方法论工具,里面混着行为规范、伦理义务、法律约束6。
3.3 「奖励」这条线:从训动物到训模型
强化学习的 reward 一词,血统来自 20 世纪的行为主义心理学——桑代克的「效果律」 和斯金纳的操作条件反射:行为带来的后果好,行为就重复7。书里引了一段要害的 分析:RL 系统里的奖励对应的是初级奖励(primary rewards)——对动物来说, 那是进化过程硬连线进神经系统的东西(食物、安全);价值函数则扮演「次级奖励」 ——对初级奖励的预测本身开始起奖励的作用8。
这就是冲突所在:RL 的整个数学预设「存在一个定义良好的、稳定的目标」—— 下棋赢棋、物理系统能耗最低。而 RLHF 把「亿万个体、随时间漂移、互相冲突、 连存在性都被质疑的偏好」灌进了这台为「单一稳定目标」设计的机器。书里的 原话:把许多个体的欲望压缩成单一函数,与 reward 概念的预设直接冲突9。
控制论那半条线也交代了:动态规划、Bellman 方程、TD 学习(从西洋双陆棋的 TD-Gammon 到 Q-learning),这些带性能 保证的方法只在「能建模成马尔可夫(下一步只看当前局面、不看更早历史)决策 过程」的封闭域里成立。深度强化学习的辉煌战绩(围棋、核聚变控制、无人机竞速) 全部属于「成功有有限定义」的域10。
3.4 VNM 定理:一张会过期的许可证
数学上有没有「把偏好变成函数」的许可证?有——冯·诺依曼-莫根施特恩(VNM) 效用定理:只要你的偏好满足几条公理(完备、传递、连续、独立性),就存在一个 效用函数,你的选择看起来像在最大化它的期望11。
书里的态度是:许可证是真的,有效期存疑。它开列的失效方式12:
- 偏好不传递(喜欢 A 胜 B、B 胜 C,却喜欢 C 胜 A)在复杂测量环境里家常便饭;
- 选项的呈现方式改变偏好(HCI 研究的老结论)——而标注界面就是一种呈现方式;
- 「选择」与「偏好」是两回事:我选择了刷手机,不代表我偏好它——从行为反推 偏好,撞的是休谟那道「是推不出应该」的老墙;
- 社会选择理论的不可能定理:没有任何聚合程序能同时满足几条都合理公平性准则 ——群体偏好压成单个函数,数学上就有代价;
- 还有一个术语的地雷:RL 里的 value(数值上的价值)和伦理里的 value(人类价值) 共用一个英文词,两套语境在 RLHF 文献里反复互相污染13。
书里还补了一个标注员视角的具体机制:人连续标注几百条后,偏好会漂移—— 而数据管线假设每条标注独立同分布14。
3.5 那怎么办:实证转向
这一章的落脚不是虚无主义。书里指出,实践中的 RLHF 早就悄悄换了目标:从 「把人类价值观校准进模型」(价值对齐的哲学初衷)换成「在具体技能上让模型 更好用」(实证对齐)。哲学初衷没有死——多元偏好、个性化、集体宪法这些研究 还在推进,但它们是研究前沿,不是生产线的现状15。
判断(我们的,不是书里的): 这一章解释了一个此前各章反复出现的现象: 为什么 RLHF 的每个环节都「没有最佳实践」。不是工程师不努力,而是上游的 目标本身在数学上欠定——欠定的目标不可能收敛出唯一的最佳解法 。第 14 章 的 Goodhart 灾难、第 15 章的评测混乱,根子都在这页纸上。 如果错,会错在: 如果存在某种聚合方案(比如按人群分层建模、偏好条件化) 实践上绕过了不可能定理的约束,那「欠定」就只是当前做法的欠定,不是问题 本身的欠定——个性化 RLHF 正是这么主张的。
4. 作者的判断与证据
这一章的性质决定了「证据」多为思想史实(1662/1789/1931/1947 的文献、不可能 定理的出处都给全了)。需要分开标注的是:作者对「RLHF 永远不会完全解决」的 断言是他的立场,依据是概念冲突的论证而非实验;书里同时如实记录了反方向—— 理论家在尝试把 VNM 塞进马尔可夫框架、把人际比较做成可行假设,这些尝试存在16。
5. 边界与局限
- 哲学争论没有裁决:「偏好存在吗」书里两派并列,不站队;
- IRL 的缺席:书里自己点出,「从行为反推奖励」的逆强化学习(IRL)与 RLHF 高度相关,却几乎不在 RLHF 文献里被讨论——这是文献的盲区不是方法的定论17;
- 本章不产生工程结论:它是理解后续各章「为什么这么乱」的透镜,读完拿不出 可操作的开关。
6. 可带走的
- 「偏好」从没有被定义清楚过;有严肃学者主张它只是方法论工具而非实体;
- RL 的 reward 概念预设单一、稳定、硬连线的目标——与人类偏好全面错配;
- VNM 定理给了「偏好→效用函数」的许可证,但公理(传递性、独立性)在真实 标注场景反复失守;
- 呈现方式改变偏好——标注界面不是中立的量杯;
- 群体偏好聚合撞不可能定理;「选择」推不出「偏好」;
- 连续标注会让偏好漂移——数据管线假设的「独立同分布」不成立;
- RLHF 实践已经从「价值对齐」滑向「实证对齐」——这个滑动的每一步都值得 被看见,而不是默认发生。
7. 原文地图
| 主题 | 原书章 | 原文位置 |
|---|---|---|
| 三学科汇流 | 10 The Nature of Preferences | text/29-ch10-10-the-nature-of-preferences.txt:139(搜「convergence of three areas」) |
| 金鱼诗主走查 | 10 The Nature of Preferences | text/29-ch10-10-the-nature-of-preferences.txt:35(搜「optimistic goldfish」) · text/29-ch10-10-the-nature-of-preferences.txt:127(搜「clear right and wrong answer」) |
| 波尔罗亚尔与拉姆齐 | 10 The Nature of Preferences | text/29-ch10-10-the-nature-of-preferences.txt:211(搜「probability that it happens」) · text/29-ch10-10-the-nature-of-preferences.txt:217(搜「Ramsey」) |
| 偏好怀疑论 | 10 The Nature of Preferences | text/29-ch10-10-the-nature-of-preferences.txt:229(搜「preferences over their own preferences」) · text/29-ch10-10-the-nature-of-preferences.txt:229(搜「don」) |
| reward 的行为主义血统 | 10 The Nature of Preferences | text/29-ch10-10-the-nature-of-preferences.txt:235(搜「operant conditioning」) · text/29-ch10-10-the-nature-of-preferences.txt:247(搜「hard-wired」) |
| 与 RL 预设的冲突 | 10 The Nature of Preferences | text/29-ch10-10-the-nature-of-preferences.txt:253(搜「reduced to a single function」) |
| 控制论谱系 | 10 The Nature of Preferences | text/29-ch10-10-the-nature-of-preferences.txt:265(搜「Bellman equation」) · text/29-ch10-10-the-nature-of-preferences.txt:283(搜「finite notion of success」) |
| VNM 及其失效 | 10 The Nature of Preferences | text/29-ch10-10-the-nature-of-preferences.txt:307(搜「VNM」) · text/29-ch10-10-the-nature-of-preferences.txt:313(搜「Hume」) · text/29-ch10-10-the-nature-of-preferences.txt:319(搜「impossibility theorems」) |
| value 双关 | 10 The Nature of Preferences | text/29-ch10-10-the-nature-of-preferences.txt:301(搜「overloading of the term」) |
| 标注漂移 | 10 The Nature of Preferences | text/29-ch10-10-the-nature-of-preferences.txt:301(搜「labeling many examples sequentially」) |
| 实证转向 | 10 The Nature of Preferences | text/29-ch10-10-the-nature-of-preferences.txt:156(搜「empirical alignment」) · text/29-ch10-10-the-nature-of-preferences.txt:156(搜「pluralistic alignment」) |
| IRL 缺席 | 10 The Nature of Preferences | text/29-ch10-10-the-nature-of-preferences.txt:289(搜「inverse reinforcement learning」) |