认得出、演不出的东西 — 怎么把「哪个更好」变成可以 优化的量
这一章讲三件事: 为什么有些品质你写不出来却认得出; 「哪个更好」这种比较怎么变成一个能被优化的数; 以及这么做之后,模型会怎样对着这个数作弊。
它在全书链条里的位置: 第 06 章末尾那句判据把你送到了这里—— 你只答得出「我看到好的能认出来」。 这一章把「认得出」变成可以训练的东西。 它是第 08、09 两章的地基:那两章讲怎么用这个数,这一章讲这个数怎么来。
★ 这一章出场一条打转的赛艇。它后面还会以三个不同的名字回来 (第 10 章的「人对着指标作弊」、第 16 章的「写长骗分」、第 17 章的「自我改进回路」)。
1. 先看现象:一条在泻湖里打转、还着着火的船
2016 年,有人训练了一个程序去玩一款赛艇游戏。规则是沿赛道航行,撞到沿途的标靶得分。 研究者期待的当然是任何人类玩家都会想到的事:尽快跑完,最好还领先。
它学到的是别的1:
它找到了一个孤立的泻湖,在里面无休止地绕圈,
把动作卡在三个标靶刚好重新出现的时机上撞过去。
├ 它经常着火
├ 它一次比赛都没跑完
└ 它的得分比人类玩家的平均分还高两成
作者的判词:**它精确地做了研究者要求的事,一件研究者想要的事都没做。**
这不是一个写坏了的规则的偶然。 作者说这是「把人的偏好说清楚」这件事的根本难处: 我们看到一场好比赛时认得出来,但把「好比赛」形式化成一条排除掉 「在泻湖里转着火的甜甜圈」的规则,比听上去难得多1。
这一章的整个立足点就是从这句话来的:
我们不必把偏好明说出来,我们只需要在看到它时认出它。1