跳到主要内容

一个环境住进多个智能体 — 多智能体强化学习

这一章讲三件事: 利益对齐的三种格局(纯竞争、纯合作、混合)各自长什么样; 多智能体怎么训(各自为战还是集中学、分散用);以及没有单一最优之后, 「解」被替换成了什么(纳什均衡、帕累托最优)。 读完你应能回答:为什么把第 06–09 章的算法复制 N 份,不等于多智能体。

1. 这一章讲什么

原书第 5 章开篇的定义:多智能体强化学习(MARL)研究多个学习智能体共存于 同一个共享环境的行为——每个智能体追求自己的奖励、为自己的利益行动; 它借重复博弈的理论,还要评估合作、互惠、公平、社会影响这类社会指标(不只看分数,还看群体行为的样子)1

单智能体与多智能体隔着一道质变,不是数量变化:别的智能体在你的环境里, 而且也在学习。第 03 章的转移概率 P 原本是不动的物理规则;现在 P 里含着 「别人下一步怎么做」——你更新的每一秒,别人也在变。你面对的环境不再静态, 第 06 章「收敛」的承诺开始动摇。 这就是为什么 MARL 不能靠复制粘贴单智能体算法。

2. 顶层全景:利益的三种格局 + 一套新问题

智能体们的利益关系(书里的三分法 [^2])

纯竞争 纯合作 混合
你赢=我输(零和) 你好=我好 部分一致部分冲突
围棋、国际象棋 Overcooked(合作 自动驾驶:各自抢时间,
AlphaGo、深蓝 做菜游戏)、机器人 但都怕撞车;
协作 囚徒困境、StarCraft II
│ │ │
▼ ▼ ▼
对手建模 收敛到「约定」 社会困境:个体理性
(下那手最防你) (哪边端盘子) ≠集体最优(囚徒困境)

图说:格局决定问题;下面四节各管一层——训练、表示、任务拆分、解的概念。

主走查:囚徒困境的收益表——混合格局里最著名的个案,第 3 节用它算出纳什均衡。

3. 核心原理

3.1 主走查:囚徒困境,把「均衡」算成一个格子

书里点名囚徒困境是混合格局的例子,但没给数字2; 收益矩阵用通用的标准数值(数字为通用版本,不是书里的): 两嫌犯各自选「坦白」或「抵赖」,刑期记负分:

乙:坦白 乙:抵赖
甲:坦白 (−3, −3) ( 0, −5)
甲:抵赖 (−5, 0) (−1, −1)

逐格验「单方面偏离有没有好处」:
格 (坦白,坦白):甲若独自改抵赖 → −3 变 −5,更糟;乙同理。
→ 谁都不想单方面动:这就是纳什均衡(书里的定义见 [^3])。
格 (抵赖,抵赖):两人合计最好(−2 总刑期),但甲独自改坦白 → −1 变 0,有便宜可占。
→ 它帕累托更好(书里:没有别的选择能让一人更好而无人更糟 [^4]),却不稳定。

这就是社会困境的机括:对每个人理性的选择(坦白),加总成对集体的坏结果 (比合作差)。自动驾驶里「各自抢道、都不让」是同构的困境2。 书里把解的词汇表给全了:纳什均衡——任何一方在别人策略不变时单方面偏离 都讨不到好3;它不唯一、复杂情形可能算不出来,于是有放宽版 ε-纳什均衡(允许偏离,但好处必须超过 ε 才值得)3; 帕累托最优——不存在让一方更好而不让别人更糟的改法4记住两者的分工:纳什管稳定,帕累托管好坏;稳定的未必好(囚徒困境正是如此)。

3.2 怎么训:各自为战,还是集中学、分散用

书里给了两条路线5:

  • 各自独立训练: 每个智能体把其余所有智能体当成环境的一部分, 各学各的、完全分散;
  • CLDE(集中学习、分散执行): 学习时把全局状态与所有智能体的联合动作 一起输入,学出一个面向全体的策略;执行时各智能体各自行动。

岔路的原因在 3.1 已经埋好:各自独立时,「别人」是非平稳的环境 (你把他当物理规则,他却在变),收敛性没有保证;集中学习能看见全局, 但执行时又指望不上全局信息(通信有成本、有延迟)。 书里在第 6 章算法表里也点过一句:多智能体情形下,集中式因状态-动作数 随智能体数指数增长而迅速不可行6——** CLDE 是折中:学的时候用全局, 跑的时候各顾各。**

3.3 一个能落地的实例:把战场摊成 4 通道图像

书里给了一个具体到张量(好几根轴的数表——一张彩色图片就是 3 根轴的例子)的设计,值得整段走一遍7。设定:二维网格、 时间离散、两方智能体(盟友与对手)。全局状态表示成 4×W×H 的张量—— 像一张 4 通道的图片,每个通道管一类信息:

通道 1 背景:障碍物 通道 2 对手:每个非零像素 = 该格对手数
通道 3 盟友:每个非零像素 = 该格盟友数 通道 4 自己:决策者本人

走查(3×3 网格,自己在中格,东侧一个盟友、西南角一个对手):
[ · · · ] 背景通道:全 0(无障碍)
[ · 自 盟] 对手通道:左下角=1,其余 0
[对 · · ] 盟友通道:(2,3) 格=1;自己通道:中心=1
→ 四张 3×3 的小图拼起来,就是「智能体看到的世界」。
(书里的通道划分照原文;网格内容为演示。)

这样表示的收益:可以整套借来处理图像的卷积网络——书里明说正是为了 蹭图像分类的成熟 machinery7。书里还给了两个配套招:

  • 训练节奏: 一次只训一个智能体、其余全部冻结(参数原地不动、暂不学习);训若干遍后, 把学到的策略分发给全部同类盟友。学习是集中的,执行是分散的 (每个智能体自带网络控制器),而且不必把意图告诉队友8;
  • 同位破对称: 两个盟友站进同一格 → 看到的状态完全相同 → 会做同样的动作。 解法是随机策略(按网络 Q 值的 softmax 抽动作):同样的局面, 两个智能体也能走出不同的步子9——第 03 章「随机策略不是没主见」在此兑现。

3.4 奖励机:把长任务拆成阶段

多智能体任务常常是非马尔可夫的:奖励取决于「任务进行到哪一步」, 而不只是当前状态。书里给的工程件叫奖励机(Reward Machine): 用一类叫Mealy 机的有限状态机把奖励结构编进去——输入是环境的 高层事件,输出是分数;机器的状态本身就是「任务进度」10

收益是可拆分:团队级任务被分解成一串子任务,每个子任务各自学; 配套的 QRM 算法给奖励机的每个状态学一个 Q 函数(相当于每个阶段 一份估价表),书里注明表格版收敛到最优有保证,且可与深度 RL 组合11。 走廊类比(自造的):「先到 B,再到 C,才算赢」——单看每一步都没有奖励, 奖励机把「在 B」编成一个机器状态,「到 C」编成下一个,奖励按阶段发放; 每个阶段各学各的 Q,合起来就是完整任务。

3.5 两个延伸方向

神经符号(把「懂规则」接回来): 书里的出发点是人类的两层加工—— 感知(把感觉输入翻译成符号)与认知(把符号变成知识,支持抽象、类比、 长期规划)12。纯符号方法(逻辑推演三件套:演绎/归纳/溯因)对付不了 真实世界的噪声;纯联结主义(神经网络)缺泛化(换个没见过的组合就不会了)、说不清为什么这么决定, 书里点名医疗诊断、自动驾驶这类要担责任的场景因此麻烦13。 于是有六种「神经+符号」的组合套路(符号进出的 S-N-S、神经网络给符号系统 打下手的 S[N]、两者平级的 N|S 等)14——书里自己承认:这是快速演化的领域, 尚无公认做法14

多目标 RL(奖励不止一个数): 真实决策往往要同时优化多个目标 (疗效要最大、副作用要最小)。偷懒做法是把所有目标加权重成一个标量(单个数), 书里批评它「缺可解释性、需求一变就重训」15;正路是把 Q 值存成向量、 学出一互不支配的策略,让使用者按偏好挑(书里给了六种场景: 效用未知、决策支持、效用已知、交互式、偏好会变、执行前复审)15; 书里还点了多臂赌博机的推广——把「后悔」从单目标推广成「选了被帕累托 支配的动作的次数」16

4. 作者的判断与证据

  • 书里给证据的: 三种利益格局及其例证、纳什/帕累托/ε-纳什的定义、 4 通道张量与训练节奏、奖励机与 QRM 的收敛承诺,均为书中明写内容2371011
  • 书里的立场句: 「MARL 评估社会指标」1与「纯合作会收敛到约定」2 是书的定位陈述;囚徒困境的具体收益数字为通用版本(已在主走查处声明)。
  • 书里的坦白: 神经符号「没有公认路线」14;多目标「压成一个数就不可解释、 难应对变化」15——两处都照实保留。
  • 书里没做连接的: §5.5 那一节「MARL for A2C/A3C」内容与第 4 章 A3C 一节 高度重复(多线程、全局网络)17,我们并进第 08 章不再展开。

5. 边界与局限

  • 均衡不是终点。 纳什均衡可能很多个、可能算不出;学习动力学 (多个学习者同时更新会不会收敛到均衡)书里完全没碰——这是 MARL 理论的 真正难点,照实标注。
  • 对手建模缺席。 书里的实例里对手只是「另一类像素」;真正的对手建模 (推测对手策略并加以利用)只在零和格局的描述里暗示,没有算法。
  • 奖励机依赖事件可枚举(能一一数清、列全)。 高层事件集要人来设计——奖励设计的难题 (第 03 章 §5)在这里换了个形式回来。
  • 通信与信用分配两大经典难题,书里没有正面讲。 多智能体里「这份奖励 归功于谁」(信用分配)是核心痛点,书里的实例靠「冻结其他、分发策略」绕开, 没有一般解法——照实指出。

6. 可带走的

  1. 第二智能体 = 会变的环境:别人也在学,静态分析全部失效——这是 MARL 与「复制 N 份单智能体」的质的区别;
  2. 利益三格局:零和(下那手最防你)、纯合作(收敛到约定)、混合(社会困境);
  3. 纳什管稳定,帕累托管好坏,稳定的未必好——囚徒困境一格看穿: (坦白,坦白)是纳什,(抵赖,抵赖)帕累托更优却不稳;
  4. 训练的折中是 CLDE:学习看全局,执行各顾各;纯集中式被指数爆炸否决;
  5. 表示的巧劲:把多智能体状态摊成 4 通道图像,白拿卷积网络的全部积累;
  6. 两个盟友同格同状态会撞车——随机策略(softmax)是破对称的工具;
  7. 奖励机 = 用有限状态机编「任务进度」,把长任务拆成有各自 Q 表的阶段 (QRM),表格版收敛有保证;
  8. 多目标的正路:Q 存成向量,学一组互不支配的策略让用户挑, 而不是拍脑袋加权重;
  9. 神经符号是「感知+规则」的联姻——书里自己承认尚无公认路线,跟踪即可, 别押注某一型。

7. 原文地图

主题原书章原文位置
MARL 定义、社会指标5.1 Cooperation versus Competitiontext/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:16(搜「shared environment」) · text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:31(搜「social metrics」)
三种格局与例证5.1 Cooperation versus Competitiontext/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:46(搜「zero-sum」) · text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:51(搜「conventions」) · text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:56(搜「Mixed-sum」)
训练两路线(独立 / CLDE)5.1 Cooperation versus Competition(§5.2)text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:78(搜「fully decentralized」) · text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:83(搜「Decentralized Execution」)
4 通道张量表示5.1 Cooperation versus Competition(§5.2.5)text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:278(搜「4 W H」) · text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:282(搜「Background Channel」)
训练节奏与策略分发5.1 Cooperation versus Competition(§5.2.5)text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:304(搜「distributes its policy」)
同位歧义与 softmax 破对称5.1 Cooperation versus Competition(§5.2.5)text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:309(搜「break this symmetry」)
奖励机与 Mealy 机5.1 Cooperation versus Competition(§5.3)text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:318(搜「non-Markovian」) · text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:376(搜「Mealy」)
QRM 与收敛保证5.1 Cooperation versus Competition(§5.3.4)text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:447(搜「one for each」) · text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:565(搜「guaranteed to converge」)
纳什均衡定义、不唯一、ε-纳什5.1 Cooperation versus Competition(§5.3.3)text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:438(搜「unilaterally」)
帕累托最优5.1 Cooperation versus Competition(§5.3.2)text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:429(搜「Pareto-efficient」)
神经符号:两层加工与三推理5.1 Cooperation versus Competition(§5.4)text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:574(搜「two-tiered」) · text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:607(搜「Deductive」)
联结主义的短板5.1 Cooperation versus Competition(§5.4)text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:648(搜「very problematic」)
六种组合、无公认路线5.1 Cooperation versus Competition(§5.4)text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:656(搜「six broad types」) · text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:691(搜「universally agreed」)
多目标:标量化之苦与六场景5.1 Cooperation versus Competition(§5.6)text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:709(搜「scalar and additive」) · text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:713(搜「unsatisfactory approach」)
多目标:Q 向量与多策略5.1 Cooperation versus Competition(§5.6)text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:778(搜「vectors rather than as scalars」) · text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:808(搜「Pareto-Q-learning」)
A3C 一节(与第 4 章重复)5.1 Cooperation versus Competition(§5.5)text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:700(搜「own set of network parameters」)

Footnotes

  1. 出处:「5.1 Cooperation versus Competition」第 16–31 段(text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:16,搜「shared environment」)。MARL 研究共享环境中多个学习智能体的行为;结合重复博弈理论;评估合作、互惠、公平、社会影响、语言与歧视等社会指标(第 31 段)。 2

  2. 出处:「5.1 Cooperation versus Competition」第 46–58 段(text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:46,搜「zero-sum」)。纯竞争(围棋、国际象棋、AlphaGo、深蓝);纯合作(Overcooked、真实机器人场景;收敛到「约定」);混合(自动驾驶各抢时间但共同怕撞车;囚徒困境、Diplomacy、StarCraft II;产生交流与社会困境)。 2 3 4

  3. 出处:「5.1 Cooperation versus Competition」§5.3.3 第 434–438 段(text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:438,搜「unilaterally」)。纳什均衡:任何个体单方面偏离策略都无法提高期望回报;不唯一、复杂情形可能算不出;ε-纳什放宽为「偏离收益超过 ε 才偏离」。 2 3

  4. 出处:「5.1 Cooperation versus Competition」§5.3.2 第 425–429 段(text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:429,搜「Pareto-efficient」)。帕累托改进的定义与「不被任何其他策略组合支配」;最大化总福利而不强调个体理性。囚徒困境的收益矩阵为通用版本(补充,不在书里,来自通用知识),书里只点名其为混合格局例子。

  5. 出处:「5.1 Cooperation versus Competition」§5.2.1 第 78–83 段(text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:78,搜「fully decentralized」)。

  6. 出处:「5.1 Cooperation versus Competition」§5.3.4 第 451 段(text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:451,搜「exponential scaling」)。原文:把全队当单个智能体学集中策略,因状态-动作数随智能体数指数增长而迅速不可行。

  7. 出处:「5.1 Cooperation versus Competition」§5.2.5 第 276–299 段(text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:278,搜「4 W H」)。二维离散环境、盟友/对手两类;4×W×H 图像式张量,四通道各载背景/对手/盟友/自己;通道稀疏、非零像素为数量;目的是利用卷积网络。 2 3

  8. 出处:「5.1 Cooperation versus Competition」§5.2.5 第 304 段(text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:304,搜「distributes its policy」)。一次训一个、其余冻结;策略分发给盟友;学习不分布而执行分布;不必告知意图。

  9. 出处:「5.1 Cooperation versus Competition」§5.2.5 第 309 段(text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:309,搜「break this symmetry」)。同位同状态同策略 → 用随机策略(对 Q 值 softmax)破对称。

  10. 出处:「5.1 Cooperation versus Competition」§5.3 第 318–376 段(text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:318,搜「non-Markovian」)。奖励机把非马尔可夫奖励编成有限状态机;取 Mealy 机形式;把团队任务分解为子任务(第 376 段)。 2

  11. 出处:「5.1 Cooperation versus Competition」§5.3.4 第 447 段与第 447 段(text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:447,搜「one for each」)。QRM 对每个奖励机状态学一个 q 函数;表格 QRM 保证收敛到最优;可与深度 RL 组合(第 376 段)。 2

  12. 出处:「5.1 Cooperation versus Competition」§5.4 第 574–621 段(text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:574,搜「two-tiered」)。感知→符号、符号→知识两层;符号路径的三种推理(演绎、归纳、溯因)见第 601 段。

  13. 出处:「5.1 Cooperation versus Competition」§5.4 第 648 段(text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:648,搜「very problematic」)。联结主义缺组合泛化、缺可验证的逻辑链、不解释决策;在医疗诊断、自动驾驶、数学推理上应用困难。

  14. 出处:「5.1 Cooperation versus Competition」§5.4 第 656–691 段(text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:656,搜「six broad types」)。S-N-S、S[N]、N|S、N:S→N、N_S、N[S] 六型;「快速演化、尚无公认路线」见第 691 段。 2 3

  15. 出处:「5.1 Cooperation versus Competition」§5.6 第 709–748 段(text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:709,搜「scalar and additive」)。多目标现实;标量化要反复试权重、缺可解释性(第 713 段);六种场景见第 723–748 段;「有限策略覆盖无穷效用函数」见第 743 段。 2 3

  16. 出处:「5.1 Cooperation versus Competition」§5.6 第 762 段(text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:762,搜「regret」)。多臂赌博机的后悔推广为「最小化被帕累托支配的动作数」。

  17. 出处:「5.1 Cooperation versus Competition」§5.5 第 700 段(text/23-ch05-01-5-1-x2002-cooperation-versus-competition.txt:700,搜「own set of network parameters」)。与第 4 章 A3C 一节(text/13-ch04-06-4-6-asynchronous-advantage-actor-critic-a3c.txt:39,搜「asynchronous」)内容重复,合并处理。