一个环境住进多个智能体 — 多智能体强化学习
这一章讲三件事: 利益对齐的三种格局(纯竞争、纯合作、混合)各自长什么样; 多智能体怎么训(各自为战还是集中学、分散用);以及没有单一最优之后, 「解」被替换成了什么(纳什均衡、帕累托最优)。 读完你应能回答:为什么把第 06–09 章的算法复制 N 份,不等于多智能体。
1. 这一章讲什么
原书第 5 章开篇的定义:多智能体强化学习(MARL)研究多个学习智能体共存于 同 一个共享环境的行为——每个智能体追求自己的奖励、为自己的利益行动; 它借重复博弈的理论,还要评估合作、互惠、公平、社会影响这类社会指标(不只看分数,还看群体行为的样子)1。
单智能体与多智能体隔着一道质变,不是数量变化:别的智能体在你的环境里, 而且也在学习。第 03 章的转移概率 P 原本是不动的物理规则;现在 P 里含着 「别人下一步怎么做」——你更新的每一秒,别人也在变。你面对的环境不再静态, 第 06 章「收敛」的承诺开始动摇。 这就是为什么 MARL 不能靠复制粘贴单智能体算法。
2. 顶层全景:利益的三种格局 + 一套新问题
智能体们的利益关系(书里的三分法 [^2])
纯竞争 纯合作 混合
你赢=我输(零和) 你好=我好 部分一致部分冲突
围棋、国际象棋 Overcooked(合作 自动驾驶:各自抢时间,
AlphaGo、深蓝 做菜游戏)、机器人 但都怕撞车;
协作 囚徒困境、StarCraft II
│ │ │
▼ ▼ ▼
对手建模 收敛到「约定」 社会困境:个体理性
(下那手最防你) (哪边端盘子) ≠集体最优(囚徒困境)
图说:格局决定问题;下面四节各管一层——训练、表示、任务拆分、解的概念。
主走查:囚徒困境的收益表——混合格局里最著名的个案,第 3 节用它算出纳什均衡。
3. 核心原理
3.1 主走查:囚徒困境,把「均衡」算成一个格子
书里点名囚徒困境是混合格局的例子,但没给数字2; 收益矩阵用通用的标准数值(数字为通用版本,不是书里的): 两嫌犯各自选「坦白」或「抵赖」,刑期记负分:
乙:坦白 乙:抵赖
甲:坦白 (−3, −3) ( 0, −5)
甲:抵赖 (−5, 0) (−1, −1)
逐格验「单方面偏离有没有好处」:
格 (坦白,坦白):甲若独自改抵赖 → −3 变 −5,更糟;乙同理。
→ 谁都不想单方面动:这就是纳什均衡(书里的定义见 [^3])。
格 (抵赖,抵赖):两人合计最好(−2 总刑期),但甲独自改坦白 → −1 变 0,有便宜可占。
→ 它帕累托更好(书里:没有别的选择能让一人更好而无人更糟 [^4]),却不稳定。
这就是社会困境的机括:对每个人理性的选择(坦白),加总成对集体的坏结果 (比合作差)。自动驾驶里「各自抢道、都不让」是同构的困境2。 书里把解的词汇表给全了:纳什均衡——任何一方在别人策略不变时单方面偏离 都讨不到好3;它不唯一、复杂情形可能算不出来,于是有放宽版 ε-纳什均衡(允许偏离,但好处必须超过 ε 才值得)3; 帕累托最优——不存在让一方更好而不让别人更糟的改法4。 记住两者的分工:纳什管稳定,帕累托管好坏;稳定的未必好(囚徒困境正是如此)。
3.2 怎么训:各自为战,还是集中学、分散用
书里给了两条路线5:
- 各自独立训练: 每个智能体把其余所有智能体当成环境的一部分, 各学各的、完全分散;
- CLDE(集中学习、分散执行): 学习时把全局状态与所有智能体的联合动作 一起输入,学出一个面向全体的策略;执行时各智能体各自行动。
岔路的原因在 3.1 已经埋好:各自独立时,「别人」是非平稳的环境 (你把他当物理规则,他却在变),收敛性没有保证;集中学习能看见全局, 但执行时又指望不上全局信息(通信有成本、有延迟)。 书里在第 6 章算法表里也点过一句:多智能体情形下,集中式因状态-动作数 随智能体数指数增长而迅速不可行6——** CLDE 是折中:学的时候用全局, 跑的时候各顾各。**
3.3 一个能落地的实例:把战场摊成 4 通道图像
书里给了一个具体到张量(好几根轴的数表——一张彩色图片就是 3 根轴的例子)的设计,值得整段走一遍7。设定:二维网格、 时间离散、两方智能体(盟友与对手)。全局状态表示成 4×W×H 的张量—— 像一张 4 通道的图片,每个通道管一类信息:
通道 1 背景:障碍物 通道 2 对手:每个非零像素 = 该格对手数
通道 3 盟友:每个非零像素 = 该格盟友数 通道 4 自己:决策者本人
走查(3×3 网格,自己在中格,东侧一个盟友、西南角一个对手):
[ · · · ] 背景通道:全 0(无障碍)
[ · 自 盟] 对手通道:左下角=1,其余 0
[对 · · ] 盟友通道:(2,3) 格=1;自己通道:中心=1
→ 四张 3×3 的小图拼起来,就是「智能 体看到的世界」。
(书里的通道划分照原文;网格内容为演示。)
这样表示的收益:可以整套借来处理图像的卷积网络——书里明说正是为了 蹭图像分类的成熟 machinery7。书里还给了两个配套招:
- 训练节奏: 一次只训一个智能体、其余全部冻结(参数原地不动、暂不学习);训若干遍后, 把学到的策略分发给全部同类盟友。学习是集中的,执行是分散的 (每个智能体自带网络控制器),而且不必把意图告诉队友8;
- 同位破对称: 两个盟友站进同一格 → 看到的状态完全相同 → 会做同样的动作。 解法是随机策略(按网络 Q 值的 softmax 抽动作):同样的局面, 两个智能体也能走出不同的步子9——第 03 章「随机策略不是没主见」在此兑现。
3.4 奖励机:把长任务拆成阶段
多智能体任务常常是非马尔可夫的:奖励取决于「任务进行到哪一步」, 而不只是当前状态。书里给的工程件叫奖励机(Reward Machine): 用一类叫Mealy 机的有限状态机把奖励结构编进去——输入是环境的 高层事件,输出是分数;机器的状态本身就是「任务进度」10。
收益是可拆分:团队级任务被分解成一串子任务,每个子任务各自学; 配套的 QRM 算法给奖励机的每个状态学一个 Q 函数(相当于每个阶段 一份估价表),书里注明表格版收敛到最优有保证,且可与深度 RL 组合11。 走廊类比(自造的):「先到 B,再到 C,才算赢」——单看每一步都没有奖励, 奖励机把「在 B」编成一个机器状态,「到 C」编成下一个,奖励按阶段发放; 每个阶段各学各的 Q,合起来就是完整任务。
3.5 两个延伸方向
神经符号(把「懂规则」接回来): 书里的出发点是人类的两层加工—— 感知(把感觉输入翻译成符号)与认知(把符号变成知识,支持抽象、类比、 长期规划)12。纯符号方法(逻辑推演三件套:演绎/归纳/溯因)对付不了 真实世界的噪声;纯联结主义(神经网络)缺泛化(换个没见过的组合就不会了)、说不清为什么这么决定, 书里点名医疗诊断、自动驾驶这类要担责任的场景因此麻烦13。 于是有六种「神经+符号」的组合套路(符号进出的 S-N-S、神经网络给符号系统 打下手的 S[N]、两者平级的 N|S 等)14——书里自己承认:这是快速演化的领域, 尚无公认做法14。
多目标 RL(奖励不止一个数): 真实决策往往要同时优化多个目标 (疗效要最大、副作用要最小)。偷懒做法是把所有目标加权重成一个标量(单个数), 书里批评它「缺可解释性、需求一变就重训」15;正路是把 Q 值存成向量、 学出一组互不支配的策略,让使用者按偏好挑(书里给了六种场景: 效用未知、决策支持、效用已知、交互式、偏好会变、执行前复审)15; 书里还点了多臂赌博机的推广——把「后悔」从单目标推广成「选了被帕累托 支配的动作的次数」16。
4. 作者的判断与证据
- 书里给证据的: 三种利益格局及其例证、纳什/帕累托/ε-纳什的定义、 4 通道张量与训练节奏、奖励机与 QRM 的收敛承诺,均为书中明写内容2371011。
- 书里的立场句: 「MARL 评估社会指标」1与「纯合作会收敛到约定」2 是书的定位陈述;囚徒困境的具体收益数字为通用版本(已在主走查处声明)。
- 书里的坦白: 神经符号「没有公认路线」14;多目标「压成一个数就不可解释、 难应对变化」15——两处都照实保留。
- 书里没做连接的: §5.5 那一节「MARL for A2C/A3C」内容与第 4 章 A3C 一节 高度重复(多线程、全局网络)17,我们并进第 08 章不再展开。
5. 边界与局限
- 均衡不是终点。 纳什均衡可能很多个、可能算不出;学习动力学 (多个学习者同时更新会不会收敛到均衡)书里完全没碰——这是 MARL 理论的 真正难点,照实标注。
- 对手建模缺席。 书里的实例里对手只是「另一类像素」;真正的对手建模 (推测对手策略并加以利用)只在零和格局的描述里暗示,没有算法。
- 奖励机依赖事件可枚举(能一一数清、列全)。 高层事件集要人来设计——奖励设计的难题 (第 03 章 §5)在这里换了个形式回来。
- 通信与信用分配两大经典难题,书里没有正面讲。 多智能体里「这份奖励 归功于谁」(信用分配)是核心痛点,书里的实例靠「冻结其他、分发策略」绕开, 没有一般解法——照实指出。
6. 可带走的
- 第二智能体 = 会变的环境:别人也在学,静态分析全部失效——这是 MARL 与「复制 N 份单智能体」的质的区别;
- 利益三格局:零和(下那手最防你)、纯合作(收敛到约定)、混合(社会困境);
- 纳什管稳定,帕累托管好坏,稳定的未必好——囚徒困境一格看穿: (坦白,坦白)是纳什,(抵赖,抵赖)帕累托更优却不稳;
- 训练的折中是 CLDE:学习看全局,执行各顾各;纯集中式被指数爆炸否决;
- 表示的巧劲:把多智能体状态摊成 4 通道图像,白拿卷积网络的全部积累;
- 两个盟友同格同状态会撞车——随机策略(softmax)是破对称的工具;
- 奖励机 = 用有限状态机编「任务进度」,把长任务拆成有各自 Q 表的阶段 (QRM),表格版收敛有保证;
- 多目标的正路:Q 存成向量,学一组互不支配的策略让用户挑, 而不是拍脑袋加权重;
- 神经符号是「感知+规则」的联姻——书里自己承认尚无公认路线,跟踪即可, 别押注某一型。
7. 原文地图
| 主题 | 原书章 | 原文位置 |
|---|---|---|
| MARL 定义、社会指标 | 5.1 Cooperation versus Competition | text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:16(搜「shared environment」) · text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:31(搜「social metrics」) |
| 三种格局与例证 | 5.1 Cooperation versus Competition | text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:46(搜「zero-sum」) · text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:51(搜「conventions」) · text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:56(搜「Mixed-sum」) |
| 训练两路线(独立 / CLDE) | 5.1 Cooperation versus Competition(§5.2) | text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:78(搜「fully decentralized」) · text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:83(搜「Decentralized Execution」) |
| 4 通道张量表示 | 5.1 Cooperation versus Competition(§5.2.5) | text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:278(搜「4 W H」) · text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:282(搜「Background Channel」) |
| 训练节奏与策略分发 | 5.1 Cooperation versus Competition(§5.2.5) | text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:304(搜「distributes its policy」) |
| 同位歧义与 softmax 破对称 | 5.1 Cooperation versus Competition(§5.2.5) | text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:309(搜「break this symmetry」) |
| 奖励机与 Mealy 机 | 5.1 Cooperation versus Competition(§5.3) | text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:318(搜「non-Markovian」) · text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:376(搜「Mealy」) |
| QRM 与收敛保证 | 5.1 Cooperation versus Competition(§5.3.4) | text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:447(搜「one for each」) · text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:565(搜「guaranteed to converge」) |
| 纳什均衡定义、不唯一、ε-纳什 | 5.1 Cooperation versus Competition(§5.3.3) | text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:438(搜「unilaterally」) |
| 帕累托最优 | 5.1 Cooperation versus Competition(§5.3.2) | text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:429(搜「Pareto-efficient」) |
| 神经符号:两层加工与三推理 | 5.1 Cooperation versus Competition(§5.4) | text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:574(搜「two-tiered」) · text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:607(搜「Deductive」) |
| 联结主义的短板 | 5.1 Cooperation versus Competition(§5.4) | text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:648(搜「very problematic」) |
| 六种组合、无公认路线 | 5.1 Cooperation versus Competition(§5.4) | text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:656(搜「six broad types」) · text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:691(搜「universally agreed」) |
| 多目标:标量化之苦与六场景 | 5.1 Cooperation versus Competition(§5.6) | text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:709(搜「scalar and additive」) · text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:713(搜「unsatisfactory approach」) |
| 多目标:Q 向量与多策略 | 5.1 Cooperation versus Competition(§5.6) | text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:778(搜「vectors rather than as scalars」) · text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:808(搜「Pareto-Q-learning」) |
| A3C 一节(与第 4 章重复) | 5.1 Cooperation versus Competition(§5.5) | text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:700(搜「own set of network parameters」) |