落地现场 — 强化学习的应用版图
这一章讲三件事: 一条贯穿全部应用的判据;自动驾驶这个「旗舰案例」的 state-action-reward 完整设计(含奖励设计的两难);其余领域各拿一个真实约束 或一次诚实的暗面记录。 读完你应能对任何一个「AI 落地」的新闻快速判断:这里面 RL 干的是哪一段、 瓶颈在哪。
1. 这一章讲什么
原书第 7 章罗列了 RL 的应用:自动驾驶、游戏、医疗、营销、图像、机器人、 NLP、能源……每节一段概述1。清单没法带走,判据可以。
第 01 章立的判据在这里兑现成三条必要条件——一个任务适合 RL,当且仅当:
- 正确动作写不出来(写得出就用监督,第 02 章);
- 好坏事后看得见(得有奖励信号,第 03 章);
- 动作会改变世界(你做的决定影响下一步看到什么——这是监督学习 结构性处理不了的)。
原书在自动驾驶一节给了这条判据最完整的论证,值得先看它。
2. 顶层全景:一张应用地图,按「难在哪」着色
应用 主角算法(书里点名) 真正的瓶颈
─────────────────────────────────────────────────────────
自动驾驶 DDPG / LQR / iLQR 奖励设计仍是开放问题 [^2]
电子游戏 策略梯度(DQN 一族) 稀疏奖励(整局才给分)
医疗 RL 建模动态治疗方案 数据嘈杂、有偏、不完整(ICU「3C」)
营销推荐 DRL 推荐 / 竞价 暗面:奖励冲动、加剧社会撕裂
机器人 sim-to-real 流水线 真实试错不安全、仿真造不真
NLP RL 调对话/翻译策略 训练与使用的目标不一致
能源 DRL 调数据中心 (书里报的唯一硬数字在这:−40%)
图说:每个领域的瓶颈都不是「算法不够好」,而是「信号不够干净」。
主走查:自动驾驶的一秒半——第 3 节。