抄专家的作业(上) — 把示范当数据用
这一章讲三件事: 「照着专家做」这句话的正式说法到底在优化什么; 为什么这个办法在训练时看起来完美、一部署就崩; 以及怎么把一份示范塞进强化学习里,才既省样本又不被示范限死。
它在全书链条里的位置:第 11 章那八个障碍的第一味药。 第 11 章说样本效率是头号障碍,并给了三条出路。 这一章和下一章走的是第一条:借人的示范。(第 14 章走第二条:借学出来的环境模型。) 这一章讲「不反推奖励」的那些做法,下一章讲「反推奖励」的。
顶层全景:一条五步的驾驶示范,以及照着它开出去会怎样
这一章从头到尾用同一个例子:有人开过一段路,把每一帧画面和当时的方向盘角度记了下来。 你拿这份记录训一个网络,然后让它自己开。
手上的示范:5 帧画面,每帧配一个方向盘角度。
训练时的成绩:5 帧全部预测准确,平均误差 2 度。★ 看起来很成功。★
实际开起来:
第 1 步 它比示范偏了 2 度 画面和 示范里的很像 → 还能开
第 2 步 偏差累到 5 度 示范里最接近的画面已经差得远 → 输出开始不靠谱
第 3 步 车头压线 ★ 示范里根本没有这种画面 ★ → 输出没有任何意义
第 4 步 半个车身出界 更没见过 → 乱打方向
第 5 步 彻底出界 —— → 结束
★ 训练误差 2 度,五步之后车在沟里。这两件事不矛盾 —— 这一章要讲的就是为什么。★
图说:这就是本章的主走查。第 3 节讲第 3 步那个「示范里根本没有」是什么病,
第 4 节讲 2 度怎么变成出界,第 5 节让同一条轨迹重跑一遍、这次救得回来。
(2 度、5 度这几个角度是**为演示编的**,不是书里的数值;两个病名和机制都是书里的。)
1. 「照着专家做」的正式说法是什么
这一节回答:为什么要给一句大白话找一个数学说法。
先看现象
书里给这件事的定位很直接:为了缓解低样本效率的问题,可以利用专家示范来更快地优化策略1。
这个思路书里叫模仿学习,也叫学徒学习1。 它的道理书里说得很朴素:人和动物天生就有模仿同类的能力2。
而它省样本的机理书里也点了:相比强化学习,监督学习在数据使用上更高效, 因为它可以利用有标签的数据2。「有标签」就是「这一帧的正确答案已经写在旁边了」。