跳到主要内容

落地现场 — 强化学习的应用版图

这一章讲三件事: 一条贯穿全部应用的判据;自动驾驶这个「旗舰案例」的 state-action-reward 完整设计(含奖励设计的两难);其余领域各拿一个真实约束 或一次诚实的暗面记录。 读完你应能对任何一个「AI 落地」的新闻快速判断:这里面 RL 干的是哪一段、 瓶颈在哪。

1. 这一章讲什么

原书第 7 章罗列了 RL 的应用:自动驾驶、游戏、医疗、营销、图像、机器人、 NLP、能源……每节一段概述1。清单没法带走,判据可以。

第 01 章立的判据在这里兑现成三条必要条件——一个任务适合 RL,当且仅当:

  1. 正确动作写不出来(写得出就用监督,第 02 章);
  2. 好坏事后看得见(得有奖励信号,第 03 章);
  3. 动作会改变世界(你做的决定影响下一步看到什么——这是监督学习 结构性处理不了的)。

原书在自动驾驶一节给了这条判据最完整的论证,值得先看它。

2. 顶层全景:一张应用地图,按「难在哪」着色

应用 主角算法(书里点名) 真正的瓶颈
─────────────────────────────────────────────────────────
自动驾驶 DDPG / LQR / iLQR 奖励设计仍是开放问题 [^2]
电子游戏 策略梯度(DQN 一族) 稀疏奖励(整局才给分)
医疗 RL 建模动态治疗方案 数据嘈杂、有偏、不完整(ICU「3C」)
营销推荐 DRL 推荐 / 竞价 暗面:奖励冲动、加剧社会撕裂
机器人 sim-to-real 流水线 真实试错不安全、仿真造不真
NLP RL 调对话/翻译策略 训练与使用的目标不一致
能源 DRL 调数据中心 (书里报的唯一硬数字在这:−40%)

图说:每个领域的瓶颈都不是「算法不够好」,而是「信号不够干净」。

主走查:自动驾驶的一秒半——第 3 节。

3. 核心原理

3.1 主走查:一辆车的 2.1 秒怎么变成学习信号

书里先论证了为什么自动驾驶的很多任务监督学习接不住2,三条: 动作会改变未来的观测(你选的车速决定下一秒的路况);监督信号本身 (碰撞时间 TTC、横向偏差)刻画的是动力学与不确定性,要配的是随机代价函数; 环境组态是高维的,必须边开边学新配置。

把这三条翻译成一次具体的决策(状态、动作、奖励数值全部为演示编的; 状态特征的清单与「奖励设计仍是开放问题」的判断是书里的3):

① 状态 s:ego 车(装备 RL 的那辆)的特征向量
[ 自车速度 12 m/s , 前车距离 25 m , TTC = 2.1 s ,
所在车道 2 , 信号灯 = 绿 ]
TTC(time-to-collision,碰撞时间)= 距离 ÷ 相对速度:照当前速度
再过 2.1 秒会追上前车 —— 书里把它列为状态特征的一员 [^4]

② 动作 a:连续控制量 [ 油门 −0.3 , 转角 0° ]
—— 书里特意说明:转向/油门/刹车是连续量,可以切成档位离散化,
但「档太粗动作发抖、档太细评估不起」,这个两难书里原话点破 [^5];
或者干脆像 DDPG 那样直接学连续策略(第 09 章)

③ 执行,世界改变:自车减速 → 前车距离从 25 m 涨到 28 m →
下一帧的 TTC 从 2.1 s 回升到 2.6 s
—— 「动作改变未来观测」,监督学习里没有这种事

④ 奖励 r(书里:安全高效驾驶 +、违章危险 −)[^6]:
本次 r = +0.8(安全跟车,小减分:慢了);若 TTC 曾跌破 1.5 s,
那一步会吃到大负分(演示口径:−5)

学到的不是「这一步该怎么打方向」的标注,而是**「怎样的速度策略在长时段里 安全分最高」**。这就是判据三条在同一个例子里聚齐。 书里还给了配套件:运动规划用 DDPG 或经典的 LQR/iLQR(线性/非线性情形的 最优控制老将)4;模仿学习(LfD) 直接拿人类演示喂 CNN—— 把单目前置摄像头的原始像素直接翻译成转向指令,少量数据就能在有无车道线的 道路上开;逆强化学习(IRL,从专家数据反推人在优化什么奖励)负责 「行人的意图预测」这类任务5

3.2 游戏:为什么「超过人类」必须靠 RL

书里拿 Pong 论证得很干净6:监督学习路线在这里天花板就是人—— 标签要高手来打、数据要覆盖所有局面、性能上限=标注者; RL 没有标签,只有 +1/−1,上限不受标注者限制(第 07 章走查过它的更新一步)。

游戏章真正的承重概念是两个,都超出「会玩 Pong」:

  • 信用分配: 一局输了,整串动作都该挨罚吗?书里原话:不能因最后的负分 把整个动作序列一棍子打死——中间可能有好步,坏的是后面几步7 (第 04 章的价值波纹、第 09 章的优势函数,都是在解这道题);
  • 稀疏奖励: 《Montezuma's revenge》这类游戏通向奖励的动作序列极少, 随机探索几乎撞不上正反馈;书里给的应急是奖励塑形——手工往奖励函数里 添中间分,并当场承认「这不是最优做法」8(这是全书少有的 「方法不好但先用着」时刻;今天的主流替代是内在好奇心奖励,补充, 不在书里,来自通用知识)。

3.3 医疗:奖励就是疗效,数据却是脏的

书里最成体系的落地章。动态治疗方案(DTR) 把「每个时点该给什么治疗」 建成 RL 问题,书里给了一张漂亮的三对应:决策规则序列=策略;治疗结局= 奖励函数;临床观测=状态,治疗选项=动作9。慢性病(糖尿病、高血压、 癌症、HIV、精神疾病)与重症监护(ICU)两大场景10

瓶颈书里照实写了:ICU 数据的「3C」——分隔(compartmentalization)、 损坏(corruption)、复杂(complexity)——导致数据嘈杂、有偏、不完整11。 对照第 11 章的多目标视角,医疗奖励天然是多目标的(疗效 vs 副作用), 书里在 DTR 一节也点了「用专家知识精心设计奖励,在疗效与副作用之间 做多目标优化」12

3.4 营销与推荐:应用与暗面各记一笔

机制侧书里给的都对:实时竞价自动选最划算的广告位;用户点击作为强化信号, 「点过的公司关联同类继续推」;「经常一起购买」「猜你喜欢」;Netflix 用 RL 决定下一个推什么13暗面书里也写了,值得原文级别的诚实: 这些系统「奖励基于情绪的冲动行为, 不利于批判性思维」;用在新闻与社交媒体上加剧了社会碎片化、固化了 意识形态分裂;书里说社会将来可能不得不重新审视这些问题14。 ——作者没有停在功能介绍,这一笔让应用章立得住。

3.5 机器人、NLP、能源:各取一刀

  • 机器人: sim-to-real 两难,书里原话两点——在物理世界直接试错低效且 不安全;真实世界不可能被精确仿真15。已落地的标杆:冠军级无人机竞速、 四足运动控制进入量产系统(书里点名 ANYbotics、Swiss-Mile、Boston Dynamics)16。操作类任务(抓放、灵巧手)的四难:探索空间大且不安全、 奖励设计要领域知识、任务长时程、真实环境没法瞬时重置17;
  • NLP: 书里把 NLP 任务按 MDP 分五类——对话系统、句法(句子成分怎么搭配)分析 (把句子的成分搭法当目标状态的序贯搜索)、语言理解、文本生成(动作=加删词)、 机器翻译18。给出一个真实影响案例:2016 年斯坦福/俄亥俄州立/微软用 两个 RL 智能体互相对话(以连贯、信息量、易答性为奖励),成果被客服 部门广泛采用19;机器翻译的特有病:暴露偏差——训练时看真值、 使用时看自己的输出,两者不一致20;
  • 能源: 书里报了全书应用部分唯一的硬数字:谷歌用 RL 做数据中心节能, 能耗开销降低 40%,无需人工干预——流程是每 5 分钟喂一次快照、 预测不同组合的未来能耗、在安全标准内挑最省电的动作、由本地控制系统 复核执行21。参照物:数据中心是出了名的电老虎,省下的 40% 是净运营成本。

4. 作者的判断与证据

  • 书里给证据的: 自动驾驶的三条「监督接不住」、离散化两难、模仿学习与 IRL 的分工、Pong 的监督三病、DTR 的三对应、ICU 3C、sim-to-real 两难、 谷歌 40%,均为书中明写内容222569111521
  • 书里给数字的只有一处:−40% 能耗(有流程叙述支撑);其余应用全是 定性描述——清单 ≠ 战绩,书里自己也没伪造数字,读时保持同一标准。
  • 作者的判断: 营销暗面与社会反思14、尾声的警告(RL 可被用于害人, 防范需全社会努力)23、以及希望(RL 或能帮助解决环境退化与不平等)23 ——三句都是立场,不是结论,照实标注。
  • 书里的时代快照: 「西海岸部分城市已允许自动驾驶上路」24是 2025 年的 坐标;「四足已进量产系统」同。

5. 边界与局限

  • 应用章没有失败案例。 全部是「已应用/有潜力」叙事;实际部署里 RL 的脆弱性(奖励钻空、分布漂移、验证困难)书里只在机器人一节间接承认 (「导航方案缺可解释性与安全保证,因此尚未广泛部署」25)。
  • 医疗部分没有一组临床试验数字。 DTR 的框架漂亮,疗效证据书里没给; 「SMART 试验」被引用为数据来源设计9,但没有任何结果。
  • 游戏一节的「超人类」停在 2016-2017 的战绩(AlphaGo/扑克)26, 与第 01 章时间线重复使用,没有新证据。
  • 书里没讲的安全层: 自动驾驶的验证与责任归属、奖励黑客的具体案例, 均未出现——这一层缺口由第 13 章的对齐视角部分补上。

6. 可带走的

  1. 三条判据复述一遍:正确动作写不出、好坏事后可见、动作改变世界—— 三条不齐,慎用 RL;
  2. 自动驾驶的完整模板:状态=自车+他车+TTC+车道+信号;动作=连续油门转向; 奖励=安全效率加减分;奖励设计至今是开放问题(书里的原话);
  3. 连续动作的两难:档粗了抖、档细了贵;要不成离散化,要不成 DDPG 直学;
  4. 监督学习在序贯任务里的天花板=标注者——想超过人,只能换 RL;
  5. 信用分配:别因结局一棍子打死整串动作——中途的好步要靠价值/优势拆账;
  6. 稀疏奖励是《Montezuma 类》游戏的死结;奖励塑形是手工绷带,不是解法;
  7. 医疗 DTR 的三对应(规则=策略、结局=奖励、观测=状态)+ ICU 3C 的数据现实;
  8. sim-to-real 两难是机器人 RL 的总闸门:真试错不安全、假环境不保真;
  9. 全书应用部分唯一的硬数字:谷歌数据中心能耗 −40%(5 分钟快照→预测→ 安全约束内选最省→本地复核);
  10. 尾声的三句立场(可滥用、需社会防范、愿助环境与公平)是作者的态度, 引用时标注为立场而非结论。

7. 原文地图

主题原书章原文位置
交通实时学习、自动驾驶上路7.1 Self-Driving Carstext/25-ch07-01-7-1-self-driving-cars.txt:25(搜「traffic density」) · text/25-ch07-01-7-1-self-driving-cars.txt:29(搜「west coast」)
监督接不住的三条7.1 Self-Driving Carstext/25-ch07-01-7-1-self-driving-cars.txt:40(搜「future sensor observations」) · text/25-ch07-01-7-1-self-driving-cars.txt:44(搜「time to collision」) · text/25-ch07-01-7-1-self-driving-cars.txt:48(搜「high-dimensional space」)
ego 状态特征清单、TTC7.1 Self-Driving Cars(§7.1.1)text/25-ch07-01-7-1-self-driving-cars.txt:107(搜「Position, heading」) · text/25-ch07-01-7-1-self-driving-cars.txt:132(搜「time-to-collision」)
数据三形态、鸟瞰中层表示7.1 Self-Driving Cars(§7.1.1)text/25-ch07-01-7-1-self-driving-cars.txt:157(搜「mid-level representation」)
离散化两难、DDPG 直学7.1 Self-Driving Cars(§7.1.1)text/25-ch07-01-7-1-self-driving-cars.txt:161(搜「jerky or unstable」)
奖励设计开放问题7.1 Self-Driving Cars(§7.1.1)text/25-ch07-01-7-1-self-driving-cars.txt:161(搜「open question」)
运动规划 DDPG、LQR/iLQR7.1 Self-Driving Cars(§7.1.2)text/25-ch07-01-7-1-self-driving-cars.txt:170(搜「Linear Quadratic Regulator」)
LfD 像素→转向、max-ent IRL7.1 Self-Driving Cars(§7.1.4)text/25-ch07-01-7-1-self-driving-cars.txt:188(搜「front-facing camera」)
Pong 规则、监督三病、+1/−17.2 Video Gamestext/25-ch07-01-7-1-self-driving-cars.txt:256(搜「at best be equal」) · text/25-ch07-01-7-1-self-driving-cars.txt:264(搜「+1」)
信用分配7.2 Video Gamestext/25-ch07-01-7-1-self-driving-cars.txt:268(搜「credit assignment」)
Montezuma 稀疏奖励、塑形非最优7.2 Video Gamestext/25-ch07-01-7-1-self-driving-cars.txt:272(搜「reward shaping」)
DTR 三对应、SMART7.3 Healthcare(§7.3.1)text/25-ch07-01-7-1-self-driving-cars.txt:330(搜「decision rules」) · text/25-ch07-01-7-1-self-driving-cars.txt:324(搜「SMART」)
慢性病清单、ICU 3C7.3 Healthcare(§7.3.2–3)text/25-ch07-01-7-1-self-driving-cars.txt:362(搜「chronic diseases」) · text/25-ch07-01-7-1-self-driving-cars.txt:375(搜「3C」)
疗效-副作用多目标7.3 Healthcare(§7.3.1)text/25-ch07-01-7-1-self-driving-cars.txt:349(搜「multi-objective」)
营销机制(竞价、推荐、Netflix)7.4 Marketing and Advertisingtext/25-ch07-01-7-1-self-driving-cars.txt:393(搜「Real-time bidding」) · text/25-ch07-01-7-1-self-driving-cars.txt:410(搜「Netflix」)
营销暗面7.4 Marketing and Advertisingtext/25-ch07-01-7-1-self-driving-cars.txt:414(搜「dark side」)
机器人 sim-to-real 两难7.6 Automated Robots and Dronestext/25-ch07-01-7-1-self-driving-cars.txt:655(搜「inefficient and/or unsafe」)
四足落地(公司点名)7.6 Automated Robots and Dronestext/25-ch07-01-7-1-self-driving-cars.txt:664(搜「ANYbotics」)
操作类四难7.6 Automated Robots and Dronestext/25-ch07-01-7-1-self-driving-cars.txt:711(搜「Reward function design」)
导航缺保证未广部署7.6 Automated Robots and Dronestext/25-ch07-01-7-1-self-driving-cars.txt:688(搜「not been deployed widely」)
NLP 五类 MDP 任务7.7 Natural Language Processing (NLP)text/25-ch07-01-7-1-self-driving-cars.txt:772(搜「five main categories」)
双 RL 智能体对话、客服采用7.7 Natural Language Processing (NLP)text/25-ch07-01-7-1-self-driving-cars.txt:778(搜「two RL agents」)
暴露偏差7.7 Natural Language Processing (NLP)text/25-ch07-01-7-1-self-driving-cars.txt:834(搜「exposure bias」)
谷歌数据中心 −40%、五分钟快照7.8 Some Other Areastext/25-ch07-01-7-1-self-driving-cars.txt:849(搜「40%」)
尾声:可滥用、防范、愿景Epiloguetext/26-fm-epilogue.txt:17(搜「unsavory ends」) · text/26-fm-epilogue.txt:21(搜「environmental degradation」)

Footnotes

  1. 原书第 7 章应用清单的章节结构(自动驾驶、游戏、医疗、营销、图像、机器人、NLP、其他),见 text/25-ch07-01-7-1-self-driving-cars.txt 各节标题;「清单式概述」是对写法的概括。

  2. 出处:「7.1 Self-Driving Cars」§7.1 第 33–48 段(text/25-ch07-01-7-1-self-driving-cars.txt:40,搜「future sensor observations」)。三条:动作改变未来观测;监督信号(TTC、横向误差)刻画动力学与不确定性、需随机代价函数;环境组态高维、须即时学新配置。 2

  3. 出处:「7.1 Self-Driving Cars」§7.1.1 第 161 段(text/25-ch07-01-7-1-self-driving-cars.txt:161,搜「open question」)。原文:为自动驾驶 DRL 智能体设计奖励函数仍是非常开放的问题,但许多方法正在出现。

  4. 出处:「7.1 Self-Driving Cars」§7.1.2 第 170 段(text/25-ch07-01-7-1-self-driving-cars.txt:170,搜「Linear Quadratic Regulator」)。DDPG 处理动态环境路径规划;经典 RL 做随机最优控制:LQR 线性、iLQR 非线性。

  5. 出处:「7.1 Self-Driving Cars」§7.1.4 第 188 段(text/25-ch07-01-7-1-self-driving-cars.txt:188,搜「front-facing camera」)。LfD:CNN 将前置单摄原始像素直接映射为转向指令、数据量小、不显式教也学出路侧表示;最大熵逆强化学习为所用方法之一;意图预测见 §7.1 任务清单第 83 段(搜「inverse RL」)。 2

  6. 出处:「7.2 Video Games」第 240–266 段(text/25-ch07-01-7-1-self-driving-cars.txt:256,搜「at best be equal」)。监督三病:要高手标注、数据要覆盖全部动作序列、性能上限=标注者;DRL 无目标标签,策略网络+策略梯度最有用(第 264 段)。 2

  7. 出处:「7.2 Video Games」第 268 段(text/25-ch07-01-7-1-self-driving-cars.txt:268,搜「credit assignment」)。原文:不能因最后的负分丢弃整个动作序列——中间步骤可能有益,差的只是后面几步。

  8. 出处:「7.2 Video Games」第 272 段(text/25-ch07-01-7-1-self-driving-cars.txt:272,搜「reward shaping」)。Montezuma's revenge 的稀疏奖励;奖励塑形=手工设计奖励引导策略,书里自注「不是最优方法」。内在好奇心奖励为补充(不在书里,来自通用知识)。

  9. 出处:「7.3 Healthcare」§7.3.1 第 324–345 段(text/25-ch07-01-7-1-self-driving-cars.txt:330,搜「decision rules」)。DTR 的决策规则序列=策略、结局=奖励、观测=状态、治疗选项=动作;SMART(序贯多assignment随机试验)数据来源(第 324 段)。 2 3

  10. 出处:「7.3 Healthcare」§7.3.2–3 第 358–375 段(text/25-ch07-01-7-1-self-driving-cars.txt:362,搜「chronic diseases」)。慢性病清单(癌症、糖尿病、贫血、HIV、精神疾病);ICU 场景(镇静、营养、机械通气等)。

  11. 出处:「7.3 Healthcare」§7.3.3 第 375 段(text/25-ch07-01-7-1-self-driving-cars.txt:375,搜「3C」)。分隔、损坏、复杂;重症数据嘈杂、有偏、不完整。 2

  12. 出处:「7.3 Healthcare」§7.3.1 第 349 段(text/25-ch07-01-7-1-self-driving-cars.txt:349,搜「multi-objective」)。精心设计奖励,在疗效与副作用之间做优雅的多目标优化。

  13. 出处:「7.4 Marketing and Advertising」第 393–410 段(text/25-ch07-01-7-1-self-driving-cars.txt:393,搜「Real-time bidding」)。实时竞价/A-B 测试/自动广告优化;点击强化;「经常一起购买」类推荐;Netflix 下一部推什么(第 410 段)。

  14. 出处:「7.4 Marketing and Advertising」第 414 段(text/25-ch07-01-7-1-self-driving-cars.txt:414,搜「dark side」)。奖励冲动情绪行为、不利批判性思维;加剧社会碎片化与意识形态分裂;社会可能须重新审视。 2

  15. 出处:「7.6 Automated Robots and Drones」第 653–660 段(text/25-ch07-01-7-1-self-driving-cars.txt:655,搜「inefficient and/or unsafe」)。成果多在仿真/游戏环境;物理世界两大挑战:直接试错低效且不安全、真实世界不可能被精确仿真。 2

  16. 出处:「7.6 Automated Robots and Drones」第 664 段(text/25-ch07-01-7-1-self-driving-cars.txt:664,搜「ANYbotics」)。冠军级无人机竞速;四足运动控制整合进量产级系统(ANYbotics、Swiss-Mile、Boston Dynamics)。

  17. 出处:「7.6 Automated Robots and Drones」第 702–726 段(text/25-ch07-01-7-1-self-driving-cars.txt:711,搜「Reward function design」)。操作类四难:观测动作空间大、奖励设计要领域知识、任务长时程、环境瞬时重置不现实。

  18. 出处:「7.7 Natural Language Processing (NLP)」第 772–795 段(text/25-ch07-01-7-1-self-driving-cars.txt:772,搜「five main categories」)。对话、句法分析(解析树为目标状态的序贯搜索)、语言理解、文本生成(动作=加删词,奖励取自标注语料或人类反馈)、机器翻译。

  19. 出处:「7.7 Natural Language Processing (NLP)」第 778 段(text/25-ch07-01-7-1-self-driving-cars.txt:778,搜「two RL agents」)。2016 年斯坦福/俄亥俄州立/微软研究:策略梯度奖励连贯性、信息量、易答性;成果被企业客服广泛采用。

  20. 出处:「7.7 Natural Language Processing (NLP)」第 834 段(text/25-ch07-01-7-1-self-driving-cars.txt:834,搜「exposure bias」)。训练依赖真值的预测与测试依赖模型输出的预测之间的落差;训练与测试目标不一致。

  21. 出处:「7.8 Some Other Areas」第 849–877 段(text/25-ch07-01-7-1-self-driving-cars.txt:849,搜「40%」)。谷歌数据中心:五分钟快照→预测未来能耗→安全标准内选最省动作→实施→本地控制系统核验;能耗开销降 40%,无需人工干预;「数据中心是电老虎」为参照物,补充(不在书里,来自通用知识)。 2

  22. 出处:「7.1 Self-Driving Cars」§7.1.1 第 161 段(text/25-ch07-01-7-1-self-driving-cars.txt:161,搜「jerky or unstable」)。转向/油门/刹车为连续执行器,档位离散;档距太大轨迹抖动,步数太多选择评估代价过高;替代:DDPG 直接学连续策略。

  23. 出处:「Epilogue」第 17、21 段(text/26-fm-epilogue.txt:17,搜「unsavory ends」)。可被用于害人、防范需集体意识与社会努力;愿景:帮助解决环境退化与不平等。 2

  24. 出处:「7.1 Self-Driving Cars」第 29 段(text/25-ch07-01-7-1-self-driving-cars.txt:29,搜「west coast」)。

  25. 出处:「7.6 Automated Robots and Drones」第 688 段(text/25-ch07-01-7-1-self-driving-cars.txt:688,搜「not been deployed widely」)。导航方案缺可解释性与安全保证。

  26. 出处:「1.1 Artificial Intelligence (AI)」时间线(AlphaGo、Libratus)见第 01 章出处;第 7 章的「超人类」表述见 text/25-ch07-01-7-1-self-driving-cars.txt:197(搜「super-human-level」)。