跳到主要内容

应用案例 — 从双陆棋到 AlphaGo,再到机房与人类决策

这一章讲五个案例,按谱系读: Samuel 的跳棋(1950s,TD 思想萌芽)→ TD-Gammon(1992,TD+神经网络首夺冠军级)→ Watson 与内存控制(非游戏应用)→ DQN(2013-15,49 个 Atari 游戏共用一套原始输入)→ AlphaGo/Zero(2016-17,合龙)。 读完你会看清:每个里程碑换的都是「函数逼近」与「经验来源」,核心更新式从未换过。

1. 谱系的起点:Samuel 的跳棋

Samuel 1959 年的跳棋程序是这个谱系的共同祖先:它通过与自己对弈学习,评估函数的参数随对局修正——时间差分思想第一次落地。书里把它列为案例第一章,并且点明 TD-Gammon、AlphaGo 全是它的后裔1

2. TD-Gammon:让业界改打法的一盘棋

Tesauro 的 TD-Gammon(1992)是「RL 史上最令人印象深刻的应用之一」(设定与数字来自书)2:

任务:西洋双陆棋。骰子带来运气,分支因子约 400 —— 象棋式启发搜索废掉;
状态完全可观测、终局有输赢 → 天然适配 TD:棋局=一局,胜负=预测目标。

方法:TD(λ) + 多层神经网络(反向传播 TD 误差),v̂(s,w)=从 s 出发的获胜概率;
自我对弈累积经验;几乎不需要人类跳棋知识。

成绩:TD-Gammon 0.0(输入几乎「生肉」棋盘)≈ 此前最好的程序;
加入特征后的 1.0 压过所有程序、与世界冠军过招接近。

书里记了两笔外溢效应:一是它的打法影响了人类职业棋手——人类照它改了双陆棋的开局定式;二是它直接启发了后面所有「自弈+自估」的系统2。架构要点:奖励只在终局出现,TD 误差把信用沿整局回传——这正是第 06 章那个「井字棋」放大到 10^20 状态3

3. 非游戏应用:Watson 与内存控制

Watson 的下注(2011,Jeopardy!):Daily-Double 出现时该押多少?IBM 团队用动作值估计+对状态空间做插值(用邻近已知点估出中间取值),学出一条平滑的下注曲线——比手写规则更贴数据。决策空间小、模拟便宜,是 RL 的舒适区4

内存控制(IBM 机房):访存调度——决定把哪一路访存请求交给哪个内存控制器。状态与动作集都大、环境随机,利用 λ-return 的离线策略评估,离线学出比当时生产规则 FR-FCFS(最老请求优先)更好的策略:九个负载上提升 7%–33%、平均 19%,都由书给出5

这一案例的看点:奖励直接用系统指标(衡量快慢好坏的数字),RL 就这样嵌进了工程闭环。

4. DQN:特征设计的自动化

此前所有成功应用(含 TD-Gammon 1.0)的输入特征都靠人类手工设计。DeepMind 的 DQN(Mnih et al. 2013/2015)把这个环节交给了卷积(小窗口在图上滑动扫描的神经网络结构)网络——书里的定性是:「一项令人印象深刻的演示:深度多层神经网络能把特征设计过程自动化6

实验设计才是重点(数字来自书):49 个 Atari 2600 游戏,同一个原始输入(屏幕像素)、同一套网络架构、同一组超参数;每个游戏重新随机初始化权重从头学。结果在一大半游戏上达到或超过人类水平。意义拆开看:游戏之间的状态转移、动作后果、最优策略天差地别——共用的只有「从像素学值」这一条流水线;深度网络负责把原始像素变成各游戏各自需要的特征6

书里同时给了工程细节的清醒剂:DQN 不是裸 Q-learning——经验回放(把历史转移存池子随机抽)与目标网络等补丁是稳定训练的必要件;而第 10 章讲过的离策发散阴影,正是这些补丁存在的背景音7

5. AlphaGo 与 AlphaGo Zero:合龙

围棋难在哪?书里替读者排了雷:不是搜索空间大小——穷举对 chess 和 Go 都不可行,9×9 小棋盘照样难倒程序;真正的关口是写不出像样的局面评估函数(引 Müller 2002 的判词:「简单而合理的评估函数对围棋不存在」)8

AlphaGo(Silver et al. 2016)的四合一:深度网络+监督学习(人类棋谱)+MCTS+强化学习。战绩:胜欧洲冠军樊麾 5:0;胜 18 连霸世界冠军李世石 4:1——书里记录了当时 AI 研究者的集体预期:「本以为还要很多年,也许几十年」9

AlphaGo Zero(2017)做减法:只用强化学习,零人类数据(名字里的 Zero),仅凭规则自弈;成绩更高、成分更纯。书里把谱系挑明:Samuel→TD-Gammon→AlphaGo 系,全是「自弈+自估」这条血脉;Zero 版等于把监督学习的拐杖也扔了10

6. 作者的判断与证据

有数字/实验的: 分支因子 400、49 个游戏、5:0 与 4:1、TD-Gammon 0.0/1.0 的分档、Watson 与内存控制的对照实验,书里都给了出处(多位当事作者还是本章致谢对象——Sutton 感谢名单里有 Tesauro、Silver、Theocharous 等)11

作者的立场: 案例选择本身是立场——前言明说选材反映作者「对便宜的无模型方法的长期兴趣,它们才能 scale 到大应用」12;所以本书没有收基于精确求解的炫耀案例,收的全是「在线、增量、自估」路线的胜利。

坦白与预防针: 书里反复强调每个案例都有大量工程补丁(特征、回放、协调超参),不是「算法自动赢」;TD-Gammon 对罕见局面可能下臭棋(第 03 章已预告)——评估口径要看它遇到的分布,不看全部状态空间

7. 边界与局限

  • 案例全部是「奖励信号能被清晰定义」的场景(胜负、吞吐(单位时间处理量)、下注收益);奖励难定的任务(第 16 章的主题)一个都没解决。
  • AlphaGo 系依赖完美模拟器:每步可以无限试错;真实世界没有 reset 键(第 16 章正面讨论)。
  • DQN 时代的方法在 49 个游戏之外泛化有限;同一架构换游戏仍要重学——「通用」是相对于「手工特征」而言。
  • 成书于 2018:此后的发展(更大规模自弈、离线 RL、RLHF 用于语言模型)不在书内——引用本书谈应用时注意年代。

8. 可带走的

  1. 谱系一句话:Samuel 自弈→TD-Gammon 自弈+网络→AlphaGo Zero 自弈+深度网络+MCTS;六十年的进步全在「估计器」与「搜索」上,TD 更新式没变。
  2. 分支因子 400 的教训:运气大的游戏废掉搜索,逼出「学评估」这条路;评估函数 quality 决定上限。
  3. 自弈的前提:规则已知+可无限模拟;满足这两条,RL 可以从零到达超越人类的水平(Zero 的「零」指人类数据)。
  4. DQN 的真正卖点:特征自动化——同一套像素流水线吃下 49 个游戏;手工特征时代自此谢幕。
  5. 非游戏案例(Watson/内存控制):奖励=业务指标时,RL 就是「会自己在数据里调参的控制器」。
  6. 每个案例都有补丁阵列(经验回放、目标网络、特征工程);复现成功案例=搬整套系统,不是搬一行公式。
  7. 引用纪律:本书的应用结论只覆盖 2018 年前的战场;RLHF、大规模语言模型时代的事,书里没有。

9. 原文地图

主题原书章原文位置
TD-Gammon 定位Applications and Case Studiestext/19-fm-applications-and-case-studies.txt:19(搜「grandmasters」)
双陆棋、分支 400Applications and Case Studiestext/19-fm-applications-and-case-studies.txt:62(搜「400」) · text/19-fm-applications-and-case-studies.txt:65(搜「good match」)
方法(TD(λ)+ANN+自弈)Applications and Case Studiestext/19-fm-applications-and-case-studies.txt:20(搜「TD(」)
人类棋手改打法、0.0/1.0 分档Applications and Case Studiestext/19-fm-applications-and-case-studies.txt:17(搜「backgammon」) · text/19-fm-applications-and-case-studies.txt:375(搜「TD-Gammon 1.0」)
SamuelApplications and Case Studiestext/19-fm-applications-and-case-studies.txt:422(搜「Samuel」)
WatsonApplications and Case Studiestext/19-fm-applications-and-case-studies.txt:537(搜「Watson」)
内存控制Applications and Case Studiestext/19-fm-applications-and-case-studies.txt:667(搜「Memory Control」)
DQN 定性Applications and Case Studiestext/19-fm-applications-and-case-studies.txt:852(搜「automate the feature design」)
49 游戏、同一套输入Applications and Case Studiestext/19-fm-applications-and-case-studies.txt:878(搜「49 different」) · text/19-fm-applications-and-case-studies.txt:880(搜「raw input」)
AlphaGo 组合与战绩Applications and Case Studiestext/19-fm-applications-and-case-studies.txt:1090(搜「combining deep」) · text/19-fm-applications-and-case-studies.txt:1096(搜「Lee Sedol」)
AlphaGo Zero、谱系Applications and Case Studiestext/19-fm-applications-and-case-studies.txt:1104(搜「AlphaGo Zero」) · text/19-fm-applications-and-case-studies.txt:1106(搜「descendants」)
围棋难在评估函数Applications and Case Studiestext/19-fm-applications-and-case-studies.txt:510(搜「evaluation function」) · text/19-fm-applications-and-case-studies.txt:1145(搜「No simple yet reasonable」)

Footnotes

  1. 出处:「Applications and Case Studies」第 422 段(text/19-fm-applications-and-case-studies.txt:422,搜「Samuel」);谱系关系另见第 1110 段(搜「descendants」)。

  2. 出处:「Applications and Case Studies」第 19 段(text/19-fm-applications-and-case-studies.txt:19,搜「grandmasters」);「最令人印象深刻」的定性在第 15 段(搜「most impressive」);0.0/1.0 分档在第 856-862 段(搜「TD-Gammon 1.0」);对人类双陆棋界的影响在第 190 段邻近(搜「the game」)。 2

  3. 出处:「Applications and Case Studies」第 62 段(text/19-fm-applications-and-case-studies.txt:62,搜「400」)与第 66 段(搜「good match」)。

  4. 出处:「Applications and Case Studies」第 537 段(text/19-fm-applications-and-case-studies.txt:537,搜「Watson」)。

  5. 出处:「Applications and Case Studies」第 667 段(text/19-fm-applications-and-case-studies.txt:667,搜「Memory Control」)。

  6. 出处:「Applications and Case Studies」第 852 段(text/19-fm-applications-and-case-studies.txt:852,搜「automate the feature design」)与第 863 段(搜「49 different」)、第 871 段(搜「raw input」)。 2

  7. 出处:「Applications and Case Studies」第 916 段(text/19-fm-applications-and-case-studies.txt:916,搜「experience replay」)。

  8. 出处:「Applications and Case Studies」第 510 段(text/19-fm-applications-and-case-studies.txt:510,搜「evaluation function」)与第 1147 段(搜「No simple yet reasonable」)。

  9. 出处:「Applications and Case Studies」第 1090 段(text/19-fm-applications-and-case-studies.txt:1090,搜「combining deep」)与第 1099 段(搜「Lee Sedol」);「很多年、也许几十年」在第 1102 段(搜「decades」)。

  10. 出处:「Applications and Case Studies」第 1104 段(text/19-fm-applications-and-case-studies.txt:1104,搜「AlphaGo Zero」)与第 1110 段(搜「descendants」)。

  11. 出处:「Preface to the Second Edition」第 145 段(text/01-fm-preface-to-the-second-edition.txt:145,搜「Tesauro」)。

  12. 出处:「Preface to the Second Edition」第 60 段(text/01-fm-preface-to-the-second-edition.txt:60,搜「inexpensive」)。