跳到主要内容

决策 — 效用、序贯决策与多智能体

这一章讲三件事: 「好不好」怎么变成一个数;「一连串动作」怎么 变成一张策略表;「对手与人类」在场时理性意味着什么。 读完你会拿到从 RLHF 回看时最该读的三页:效用、MDP、辅助博弈—— 第 15 章的强化学习全部站在 MDP 的肩膀上。

1. 这一章讲什么

三个决策场景,三章原书,一条逻辑线。一次决策:候选动作的结果有概率分布, 选期望效用最大的(做简单决策)。序贯决策:一步之后还有下一步, 解是一个「每个状态该做什么」的策略(做复杂决策/MDP)。 多智能体决策:别人也在优化(寻找对自己最有利的选择),「最优」要重新定义(博弈论)1

2. 顶层全景

一次决策 序贯决策 多智能体
效用公理 → MEU 定理 MDP = 状态+动作+转移+奖励 正则形式博弈
决策网络(机会/决策/效用节点) 策略 π(s)≠动作序列 支付矩阵
VPI:信息值多少钱 贝尔曼方程 → 价值/策略迭代 占优策略→纳什均衡
开关游戏(偏好不确定) 老虎机/POMDP 辅助博弈
│ │ │
└──────── 最大化期望效用,是同一条骨架的三次加码 ────────┘

3. 核心原理

3.1 效用理论:从偏好到数字

MEU 原则「选期望效用最大的动作」听起来像定义而非定理。 效用理论把它变成定理:先立 6 条关于偏好的公理 (有序性、传递性、连续性、可替换性、单调性、可分解性——对象是「彩票」 L=[p1,S1;…;pn,Sn]),然后证明:偏好满足公理的 agent 必然 可被某个效用函数 U 描述,且彩票的效用=ΣpᵢU(Sᵢ)2。 公理不是白立的:传递性破了,别人能用「1 美分换环」把你的钱换光—— A≻B≻C≻A 的偏好持有者,三次各让 1 美分的交换回到原点,再循环, 直到破产3

两个直接可用的推论:效用函数做正仿射变换 U′=aU+b 不改变行为 (所以「效用没有绝对零点」);金钱的效用通常是对数(log)形的—— 100 万美元 vs 掷硬币(正面归零、反面 250 万,EMV=125 万), 大多数人拒绝,因为第一个 100 万的边际效用远大于后一个4。 书里的量化货币:微亡(百万分之一的死亡概率)——英国人开车每 370 千米 摊上一个微亡,行为显示每微亡的规避价值约 60 美元5

决策网络(影响图)= 贝叶斯网络 + 决策节点(矩形)+ 效用节点(菱形)。 评估算法朴素到诚实的程度:给每个动作取值,跑概率推断算效用节点父变量的 后验,选期望效用最高的动作6

信息价值(VPI)回答「该不该再做一项检查」。定义:获得信息前后 最佳动作期望效用之差。石油公司买 n 块开采权之一,买前期望利润为零; 一份「3 号区有/没有油」的确定报告值 C/n——信息的价值来自它能改变决策; 规划不变,信息一文不值7。两条性质:VPI≥0(期望上,最坏可以无视它); 但不可加(VPI(Ej,Ek)≠VPI(Ej)+VPI(Ek)),只次序独立8

3.2 主走查:4×3 世界与价值迭代

MDP 的四件套:状态、动作、转移 P(s′|s,a)、奖励 R(s,a,s′)。 主走查环境是一个 4×3 网格:目标是 +1 格,陷阱是 −1 格, 每个动作 0.8 概率按预期走、各 0.1 概率向两侧滑,撞墙原地不动; 非终止转移的奖励全是 −0.04(逼 agent 赶紧出去)9

先感受随机性的分量:确定性世界里的解 [Up,Up,Right,Right,Right], 在这里只有 0.8^5=0.32768 的概率原样走到 +110

正因为单条路径不可靠,解从「序列」变成「策略」π(s)—— 每个状态配一个动作,无论滑到哪,查表就能继续11。 奖励 r 的取值甚至决定「活法」:r∈[−0.0850,−0.0273] 时走标准最优; r≤−1.6497 时生活痛苦,agent 直奔最近的出口(哪怕它是 −1); 0<r 时生活愉快,agent 永不离开,靠不终止拿无限总奖励—— r 的全部区间共有 9 种最优策略12

状态效用 U(s) 与邻居的关系就是贝尔曼方程:

U(s) = max_a Σ_s′ P(s′|s,a) [ R(s,a,s′) + γ U(s′) ]

γ 是折扣因子(γ=0.9 等价于 11.1% 的利率;也等价于每步 1−γ 的意外终止率)13。 方程非线性(max 不可导),解法是迭代——价值迭代: U_{i+1}(s) ← max_a Σ P(s′|s,a)[R+γU_i(s′)],反复到收敛。 收敛的保证是「压缩」:贝尔曼更新像「除以 2」一样把任意两个效用向量拉近, 因子恰是 γ;误差每轮至少乘 γ,所需迭代次数 N=⌈log(2Rmax/ε(1−γ))/log(1/γ)⌉14。 更妙的是策略损失有界:4×3 世界 γ=0.9 时,第 5 遍迭代的效用误差 还有 0.51,策略却已经最优——决策比数值早熟15

策略迭代是另一台引擎:评估当前策略(解一组线性方程)→ 按一步前瞻改进策略 → 不再改变则停。与价值迭代的取舍在工程里见真章16。 带老虎机(多臂赌博机)的一节把「探索-利用」形式化:Gittins 指数给每台 机器一个可索引分数,贪心选指数最高的就是最优17。状态看不见时升级为 POMDP:在信念状态上跑 MDP,代价是凸分段的价值函数与爆炸的计算18

3.3 多智能体:均衡取代最优

囚徒困境的支付矩阵:A、B 各选 testify 或 refuse; 都 refuse 各判 1 年,都 testify 各判 5 年,单方 testify 者释放、 对方判 10 年。逐行分析:testify 对 A 是占优策略(对方拒,自己释放; 对方供,5 年好过 10 年)。双双占优策略 ⟹ 都判 5 年—— 比合作时的 1 年更糟。这就是「困境」:占优策略均衡 是全场唯一的非帕累托最优结果19

纳什均衡:任何参与者单方面改策略都不会更好。它弱于占优策略均衡, 但保证存在——混合策略(按概率选动作)的纳什均衡在有限博弈中 总是存在(纳什,1994 年诺贝尔奖)20。猜硬币没有纯策略均衡 (出正面必被利用),唯一均衡是双方各 50%;谁偏离固定比例谁挨打21

计算上:零和博弈的极大化极小=线性规划(冯·诺依曼,1928); 一般博弈找均衡是棘手的(书里给了穷举 m^n 与迭代最佳响应)22

3.4 兑现伏笔:开关游戏与辅助博弈

第 1 章埋的「益机」在这里兑现成算术。开关游戏:机器人 R 给人类 H 订酒店,R 对 H 的效用判断是 Uniform(−40,+60),均值 +10。 三个选项23:

立即行动:期望 +10
自我关闭:0
请示 H:40% 概率 H 关掉(收益 0),60% 概率 H 允许
——而 H 允许这个事实本身是信息:效用已证明非负,
条件期望升到 +30。期望 = 0.4×0 + 0.6×30 = +18

+18 > +10:顺从(允许自己被关)是理性的。一般性的证明更干净: EU(d)≥EU(a),因为请示把负效用区域整体截断为零;只有当 R 完全确定 H 的偏好时,请示才不带信息、顺从才失去动机24。这就是第 1 章那句话 ——「机器追求人类的目标,但不确定这些目标是什么」——的数学形态。

辅助博弈把它推广成双人博弈:H 按 θ 行动,R 持有 P(θ) 的先验, 两人的收益函数相同,都等于 H 的收益——这是「有益 AI」的形式化25回形针博弈是它的最小示范:H 的偏好参数 θ 是回形针相对订书钉的汇率 (先验 Uniform(0,1));H 先行动,可以做 2 个回形针、2 个订书钉或各 1 个。 若 θ 高,H 会多做回形针;R 观察她的选择就更新 θ,再决定自己做 90 个回形针、90 个订书钉还是各 50 个。教学与顺从都不是预先写死的, 是博弈均衡自己长出来的行为26

4. 作者的判断与证据

  • (书内定理) 效用公理→MEU(von Neumann-Morgenstern);纳什均衡存在性; VPI≥0;贝尔曼更新是 γ-压缩22014
  • (书内数据) 0.8^5=0.32768、9 种最优策略、i=5 时策略早熟、 微亡 60 美元、+18>+10——每个数字都可现场复算101215523
  • (书内坦白) 「效用函数的存在并不意味着 agent 明确地在最大化它」—— 理性行为可以由查表产生;效用是从外部行为读出的解释27
  • (作者的立场) 人类判断的系统偏差(框架效应、确定性损失厌恶) 被如实记录,但书里的立场是「把这些当要建模的事实,而不是推翻 理性框架的理由」28

5. 边界与局限

  • 效用函数从哪来?偏好启发成本高昂,人类还会给出不一致的答案—— 这正是「未知偏好」一节存在的理由,也是 RLHF 时代重新发明的问题29
  • POMDP 精确求解只在信念空间维度很低时可行。
  • 纳什均衡在 n 人一般博弈中的计算复杂度是出了名的难(书里只给了穷举与迭代法)。
  • MDP 的奖励函数是「我们给的」;给错了,MDP 越优离目标越远—— 第 18 章(本收尾章)的 specification gaming 案例是它的注脚。

6. 可带走的

  1. 效用不是玄学:6 条偏好公理 + 一个存在定理。「像温度一样,只有原点任意」。
  2. 决策网络评估=「每个动作跑一遍贝叶斯推断」;工具直接复用。
  3. 信息的价值=它可能改变决策的空间;VPI<成本的检查一律跳过。
  4. 序贯决策的解是策略不是剧本——环境会把你甩到计划外的状态。
  5. 贝尔曼方程是「最优性可以局部验证」的宣言;压缩性质保证迭代收敛。
  6. 囚徒困境不是「人性自私」的寓言,是支付矩阵结构的推论; 想合作,先改博弈(重复、契约、沟通)。
  7. 对人类偏好不确定的机器会顺从;确定性太强的机器才会固执—— 「不确定」是安全特性,不是缺陷。

7. 原文地图

主题原书章原文位置
MEU 原则16.1text/10-fm.txt:17041(搜「最大期望效用」)
六公理与彩票16.2.1text/10-fm.txt:17080(搜「彩票」) · text/10-fm.txt:17085(搜「有序性」)
1 美分换环16.2.1text/10-fm.txt:17115(搜「非传递」)
存在性定理/仿射不变16.2.2text/10-fm.txt:17135(搜「存在性」) · text/10-fm.txt:17152(搜「正仿射变换」)
微亡16.3.1text/10-fm.txt:17208(搜「微亡」) · text/10-fm.txt:17212(搜「60 美元」)
100 万赌局16.3.2text/10-fm.txt:17228(搜「250 万美元」) · text/10-fm.txt:17245(搜「800 000」)
决策网络三节点16.5.1text/10-fm.txt:17567(搜「机会节点」)
VPI 石油例16.6.1text/10-fm.txt:17642(搜「开采权」) · text/10-fm.txt:826(搜「改变」)
VPI≥0 与不可加16.6.3text/10-fm.txt:17713(搜「非负」) · text/10-fm.txt:17724(搜「可加性」)
短视信息收集16.6.4text/10-fm.txt:17752(搜「短视」)
开关游戏 +1816.7.2text/10-fm.txt:31366(搜「日内瓦」) · text/10-fm.txt:17904(搜「+18」)
EU(d)≥EU(a)16.7.2text/10-fm.txt:17922(搜「EU(d)」)
4×3 世界与 0.8/0.117.1text/10-fm.txt:18112(搜「0.8 的概率」) · text/10-fm.txt:18135(搜「−0.04」)
0.3276817.1text/10-fm.txt:18117(搜「0.32768」)
MDP 定义17.1text/10-fm.txt:18140(搜「马尔可夫决策过程」)
策略≠序列17.1text/10-fm.txt:18147(搜「这种解被称为策略」)
9 种最优策略17.1text/10-fm.txt:18166(搜「−0.0850」) · text/10-fm.txt:18175(搜「9 种最优策略」)
折扣的利率解释17.1.1text/10-fm.txt:18218(搜「11.1%」)
贝尔曼方程17.1.2text/10-fm.txt:18297(搜「贝尔曼方程」)
价值迭代与压缩17.2.1text/10-fm.txt:18426(搜「贝尔曼更新」) · text/10-fm.txt:4031(搜「压缩」)
策略早熟 i=517.2.1text/10-fm.txt:18521(搜「0.51」)
策略迭代17.2.2text/10-fm.txt:18533(搜「策略迭代」)
Gittins 指数17.3.1text/10-fm.txt:18757(搜「基廷斯」)
POMDP17.4text/10-fm.txt:18880(搜「部分可观测 MDP」)
正则形式博弈18.2.1text/10-fm.txt:19485(搜「正则形式博弈」)
囚徒困境矩阵18.2.1text/10-fm.txt:19540(搜「testify」) · text/10-fm.txt:19550(搜「占优策略」)
纳什均衡18.2.1text/10-fm.txt:19581(搜「纳什均衡」)
猜硬币18.2.1text/10-fm.txt:19608(搜「猜硬币」)
帕累托/社会福利18.2.2text/10-fm.txt:19636(搜「帕累托最优」) · text/10-fm.txt:19654(搜「困境」)
混合均衡存在性18.2.1text/10-fm.txt:19620(搜「混合策略」)
辅助博弈18.2.5text/10-fm.txt:20060(搜「辅助博弈」) · text/10-fm.txt:20063(搜「有益人工智能」)
回形针博弈18.2.5text/10-fm.txt:20071(搜「回形针博弈」) · text/10-fm.txt:20080(搜「Uniform(θ; 0, 1)」)
投票不可能性18.4.3text/10-fm.txt:20605(搜「阿罗定」)

Footnotes

  1. 出处:「做简单决策」第 17008 段(text/10-fm.txt:17008,搜「决策论智能体」)。

  2. 出处:「做简单决策」第 17079 段(text/10-fm.txt:17079,搜「彩票」)与 第 17135 段(text/10-fm.txt:17135,搜「存在性」)。 2

  3. 出处:「做简单决策」第 17115 段(text/10-fm.txt:17115,搜「非传递」)。

  4. 出处:「做简单决策」第 17228 段(text/10-fm.txt:17228,搜「250 万美元」)。

  5. 出处:「做简单决策」第 17212 段(text/10-fm.txt:17212,搜「60 美元」)。 2

  6. 出处:「做简单决策」第 17612 段(text/10-fm.txt:17612,搜「评估决策网络」)。

  7. 出处:「做简单决策」第 826 段(text/10-fm.txt:826,搜「改变」)。

  8. 出处:「做简单决策」第 17724 段(text/10-fm.txt:17724,搜「可加性」)。

  9. 出处:「做复杂决策」第 12673 段(text/10-fm.txt:12673,搜「0.8 的概率」)。

  10. 出处:「做复杂决策」第 18117 段(text/10-fm.txt:18117,搜「0.32768」)。 2

  11. 出处:「做复杂决策」第 18147 段(text/10-fm.txt:18147,搜「这种解被称为策略」)。

  12. 出处:「做复杂决策」第 18175 段(text/10-fm.txt:18175,搜「9 种最优策略」)。 2

  13. 出处:「做复杂决策」第 18209 段(text/10-fm.txt:18209,搜「折扣因子」)。

  14. 出处:「做复杂决策」第 4031 段(text/10-fm.txt:4031,搜「压缩」)。 2

  15. 出处:「做复杂决策」第 14228 段(text/10-fm.txt:14228,搜「0.51」)。 2

  16. 出处:「做复杂决策」第 18533 段(text/10-fm.txt:18533,搜「策略迭代」)。

  17. 出处:「做复杂决策」第 18757 段(text/10-fm.txt:18757,搜「基廷斯」)。

  18. 出处:「做复杂决策」第 18880 段(text/10-fm.txt:18880,搜「部分可观测 MDP」)。

  19. 出处:「多智能体决策」第 19540 段(text/10-fm.txt:19540,搜「testify」)与 第 19654 段(text/10-fm.txt:19654,搜「困境」)。

  20. 出处:「多智能体决策」第 19620 段(text/10-fm.txt:19620,搜「混合策略」)。 2

  21. 出处:「多智能体决策」第 19608 段(text/10-fm.txt:19608,搜「猜硬币」)。

  22. 出处:「多智能体决策」第 19094 段(text/10-fm.txt:19094,搜「穷举搜索」)。

  23. 出处:「做简单决策」第 17904 段(text/10-fm.txt:17904,搜「+18」)。 Uniform(−40,+60) 在 17882 段。 2

  24. 出处:「做简单决策」第 17922 段(text/10-fm.txt:17922,搜「EU(d)」)。

  25. 出处:「多智能体决策」第 20063 段(text/10-fm.txt:20063,搜「有益人工智能」)。

  26. 出处:「多智能体决策」第 20071 段(text/10-fm.txt:20071,搜「回形针博弈」)。

  27. 出处:「做简单决策」第 1201 段(text/10-fm.txt:1201,搜「并不意味着」)。

  28. 出处:「做简单决策」第 17327 段(text/10-fm.txt:17327,搜「人类判断」)。

  29. 出处:「做简单决策」第 17844 段(text/10-fm.txt:17844,搜「个人偏好」)。