环境里有别人 — 三种均衡与一个多智能体平台
这一章讲三件事: 为什么多了一个会学的对手,「最优」这个词就用不了了; 换上来的那个词(均衡)有哪三种,以及它们在同一张表上各给出什么结果; 以及怎么把「合作」「竞争」这类形容词,变成一台机器能验算的条件。
它在全书链条里的位置:第 11 章那八个障碍的第四味药。 第 11 章第 8 节说过:智能的上限由环境决定,而对手本身就构成了会变的环境。 这一章不给算法,它给的是一套新的评判标准 —— 前面十五章所有算法都在最大化某个东西,而这一章说:有对手时,「最大」不存在。
顶层全景:一张两人收益表,六个结论
这一章从头到尾用同一张表:书里那个「胆小鬼博弈」。
两个人开车对撞,各自选「怯懦」(打方向躲开)或者「勇敢」(直冲)。
★ 这张表里的四组数全部是书里给的真数。★[^1]
对方选怯懦 对方选勇敢
我选怯懦 我 5, 他 5 我 3, 他 6
我选勇敢 我 6, 他 3 我 0, 他 0
★ 一句话读懂这张表:两个都躲,各得 5(还行);一个躲一个冲,冲的拿 6、躲的拿 3;
两个都冲 —— 撞了,各得 0(最惨)。★
这一章要在同一张表上得出六个结论:
① 纯策略的纳什均衡有两个 §3 → (我冲他躲) 与 (我躲他冲)
② 混合策略的纳什均衡 §4 → 各以 **0.75** 的机会选怯懦,期望效用各 **4.5**
③ ★ 所有纳什均衡的总效用都是 9 ★ §4 → 6+3 = 9 · 3+6 = 9 · 4.5+4.5 = 9;
而两个都怯懦的 5+5 = 10 更高,但它不是均衡(§3 逐格验算)
④ 换成按外部信号协调 §5 → 总效用 **9.3333** ★ 比 9 高 ★
⑤ 没人想偏离,逐条验算 §5 → 照做得 4,私自改只有 3
⑥ 改成一先一后 §6 → ★ 先动的那个直接拿到 6 ★
图说:这就是本章的主走查。同一张表,六个结论,全部是书里给的数。
1. 为什么「最优」这个词失效了
这一节回答:多一个会学的家伙,到底改变了什么。
先看现象
前十五章的所有算法,做的事都可以概括成一句:找一个策略,让某个东西最大。
现在加一个人进来。
★ 我该选怯懦还是勇敢?★
如果他选怯懦 → 我该选勇敢(6 比 5 高)
如果他选勇敢 → 我该选怯懦(3 比 0 高)
★ 我的最优,取决于他选什么。★
★ 而他的最优,同样取决于我选什么。★
★ 于是「最优策略」这个词,在这里指不到任何一个具体的东西。★
于是换一个词
书里说得很直接:因为每个智能体的收益和所有智能体的决策动作都相关, 所以我们希望的是「所有智能体最终都能有稳定的决策策略」—— 在那个状态下,每一个智能体都不能通过只改变自身的策略而使自己获得更高的收益1。
★ 这就是「均衡」这个词的定义,而它比「最优」弱得多:★ 「最优」说的是「没有更好的了」;「均衡」只说「你一个人改,不会更好」。
书里在开头就点明:根据每个智能体的优化问题,「均衡的概念被提出并用于规范多智能体的分布式动作」2。
三个基本元素
书里给这一章立了三个元素3:
| 元素 | 书里的说法 |
|---|---|
| 智能体 | 一群有自主决策意识的个体,各自独立地和环境交互;数目为 1 时就退回普通强化学习 |
| 策略 | 每个智能体自己制定,而它「会被其他智能体的策略影响」 |
| ★ 效用函数 ★ | 「智能体在实现各种目标时获得的总收益和总成本之差」4 |
★ 「效用」和「奖励」不是一回事,这一点要分清:★ 奖励是环境每一步给的分;效用是「把所有账算完之后,这件事对我值多少」—— 它已经把成本减掉了。这一章通篇用效用说话。
2. 见面几次,决定了你敢不敢骗人
这一节讲三种博弈框架,而它们的差别只有一个:重复不重复。
书里列了三种5:
| 框架 | 长什么样 | ★ 关键后果 ★ |
|---|---|---|
| 静态博弈 | 所有人同时决策,而且每人只决策一次 | ★ 因为只行动一次,可以骗 ★ |
| 重复博弈 | 同一个局面下反复决策多次 | ★ 骗了会被报复 ★ |
| 随机博弈 | 多个局面、多次决策 —— 书里说它可以看作一个马尔可夫过程 | 最一般的情况 |
书里对前两种的对照写得非常好:
★ 静态博弈:「由于每个智能体只行动一次,所以其可以做出一些出乎常规的
欺骗和背叛策略来使自己在博弈中获益。」★[^6]
→ 所以每个人在制定策略时,都得先防着别人骗。
★ 重复博弈:「当某个智能体在某一次动作时采取了欺骗或背叛的决策时,
在未来的动作中,该智能体可能会收到其他智能体的惩罚和报复。」★[^6]
→ 书里的结论:重复博弈「大大地避免了多智能体之间恶意的动作决策,
从而整体上提高了所有智能体总效益价值之和」。[^6]
★ 一句话:只见一次面可以骗,反复见面会被报复 —— 而后者对所有人都更好。★
★ 这一章下面全部用静态博弈(那张表只玩一次)—— 因为它是最难的那种。★
3. 第一种均衡:谁单方面改都不会更好
这一节走主走查的第一个结论。
定义
书里给的定义,拆开看只有一句话6:
★ 在其他人的策略都不变的前提下,每个人都不能通过只改自己的策略而拿到更高的效用。★ 满足这个条件的那一组策略,叫纳什均衡。