跳到主要内容

寒冬与反向传播 — 被判死刑的想法怎么活下来

这一章讲三件事: 那本「杀死」神经网络的书到底证明了什么(比传言窄得多); 权重怎么调才调得动多层网络——1970 到 1986 年卡住所有人的那道数学题是怎么解开的; 以及一个剑桥辍学生怎么在没人要这个方向的年代,把「旧的想法也是新的」活成职业。 第 01 章的机器只有一层权重;这一章回答:层多了之后,权重还调得动吗。

1. 明斯基的书:证明了什么,没证明什么

1969 年,明斯基和同事佩珀特出版《感知机》1。它对感知机的描述之精确, 甚至超过了罗森布拉特本人2。他们的打击点是一个小到可以写在纸巾上的问题——异或

异或是什么: 纸板上两个点,只问一句话:「它们颜色不同吗?」 (同黑或同白答「否」,一黑一白答「是」。)这就是异或—— 「不同才为真」的逻辑。第 01 章的感知机是单层的:每个感光点的权重直接加总、过线判决。 把四种情况摆开(黑黑/白白/黑白/白黑),你会发现没有任何一组一层权重 能把「同色」和「异色」用一条直线分开——这就是「异或问题」3

书的杀伤力在哪: 它证明的只是「单层网络学不会异或」,顺带让政府资金转去了别处4。 原书特意记了两件被忽略的事:

  • 罗森布拉特生前已在研究多层方案来修这个缺陷5;
  • 辛顿读后的反应相反:精确指出缺陷,反而让解决问题变容易了6

判断(我们的,不是书里的): 「被一本书杀死的技术」这个流传甚广的说法, 准确的版本是「被一本书掐断了经费的技术」。数学上被堵死的只是单层;经费上被冻死的才是整个方向。 如果错,会错在: 如果当年多层网络的训练方法其实已经存在并可用, 那「书证明了此路不通」的责任判定就要反过来——但第 2 节会看到,那道数学题当时没人解得动。

2. 核心机制:多层网络的权重,为什么调不动、后来怎么调动的

解决什么问题: 想让网络认一只小狗,一层不够。原书给出的分层图景是: 第一层看每个像素的明暗,第二层在这些像素里找短线、弧线这样的小图形, 第三层把小图形拼成耳朵、牙齿、眼睛,最后拼出一只小狗7。 但这里立刻撞上一个问题:第二层神经元的输入,是第一层神经元的输出; 你调第一层的某个权重,会同时改变它喂给上层的一切。第 01 章「看错题挪数字」的土办法 只在单层成立——每层的责任缠在一起,你不知道该怪谁8

怎么做的: 答案是一个叫反向传播的过程—— 用微分把「最终答案错了多少」这份责任,沿着层倒着一层层分摊回每个权重9。 (微分在这里只干一件事:算出「这个权重挪动一丁点,总误差会跟着变多少」—— 变多少知道了,该往哪边挪、挪多大,就都知道了。) 这样每层每权重的「责任份额」都能算出来,不再是糊涂账。

但这条路在 1960 年代被罗森布拉特本人证明过「走不通」:如果所有权重从零开始, 调来调去它们会校平——没有任何一个神经元比别人更重要,数学上叫「无法打破对称性」10

破局只有一句话。 辛顿当年对鲁梅尔哈特说这数学把戏不会成,鲁梅尔哈特问: 「如果没有将权重设置为零呢?如果数字是随机的呢?」11

这就是本章的主走查。拿异或那个两层小网络走一遍(下面的数全是为演示编的):

任务:两点颜色不同 → 答「是」
结构:2 个输入 → 中间层 2 个神经元(各带权重)→ 输出 1 个

方案 A(全零起步): 左右两个输入点拿到的权重完全一样 → 两边
算出来的东西永远一样 → 网络退化成第 01 章的单层 → 异或学不会

方案 B(随机起步): 中间神经元 1 拿到 (0.7, -0.2),神经元 2 拿到 (-0.5, 0.6)
→ 两个神经元从第一轮起就「看法不同」
→ 反向传播把误差责任分摊下去后,一个偏向管「左边是黑」,另一个偏向管「右边是白」
→ 训练几百轮后,四种情况(黑黑/白白/黑白/白黑)全部答对

为什么有效: 随机数让神经元一开始就不同;反向传播让这种不同沿着「对误差有用的方向」放大。 两个零件各解决一半:「随机」给了差异,「反向传播」给了差异该去的方向。

边界在哪: 1986 年那次成功的网络仍然很小——它能学家谱里「约翰的母亲是维多利亚, 维多利亚的丈夫是比尔,所以比尔是约翰的父亲」这类关系12, 但离狗、猫、汽车还很远。工具到位了,数据和算力还差二十年(第 03、04 章)。

3. 人:辛顿怎么在寒冬里没饿死

出身: 乔治·布尔(布尔逻辑,每台计算机的数学基础)的玄孙; 父亲是皇家学会昆虫学家,留下一句他记了一辈子的话——「只要工作得足够努力,也许当你 的年纪是我现在年龄的两倍时,你就能实现我一半的成就了」13

绕路的求学历程: 剑桥想研究大脑,发现生理学、化学、物理学、心理学都没人能回答 大脑怎么工作;转哲学、转实验心理学,最后干脆退学,去伦敦当了一年木匠14。 当木匠那年他读了心理学家赫布的《行为组织》——「神经元一起发射,并连接在一起」, 学习就是神经连接被使用所改变15。每周六上午他带着笔记本泡在伊斯灵顿的公共图书馆, 把自己的想法写在上面,后来这些笔记把他带回学术界16

博士与寒冬: 爱丁堡大学读 AI 博士。入学那年(1971),英国政府一份报告判定 25 年的 AI 研究令人失望,经费被砍——研究者后来管这叫人工智能的寒冬17。他的导师也在此时改信符号 AI, 两人「每周见一次面,有时会以一场大喊大叫的争论结束」18。 毕业时只有一所大学给他面试机会19。父亲在他成功之前去世——这家人对概率(发生的可能性有多大)有职业性的敏感,他补充说: 「不仅如此,他还得了一种具有高度遗传性的癌症。他做的最后一件事情,就是增加我的死亡概率。」20

加州的同道: 博士后在加州大学圣迭戈分校,他撞上了 PDP 小组 (「并行」——许多小计算同时干活——「分布式处理」的缩写,其实就是神经网络换了个不惹事的名字)—— 里面有心理学家,还有发现 DNA 结构的克里克在隔壁研究所呼吁科学界研究大脑21。 「在英国,学术界秉持一种知识上的单一文化;在美国……这些观点都可以存在。」22

卡内基-梅隆与多伦多: 1982 年前后,法尔曼以「对冲」名义把辛顿招进只做符号 AI 的 卡内基-梅隆。面试后系主任纽厄尔当场给工作,辛顿先坦白「实际上,我对计算机科学一无所知」, 对方答「我们这里有人懂这个」;被问工资,他说「我做这些不是为了钱」—— 后来发现只有同事的四分之三(2.6 万美元对 3.5 万美元)23。 1987 年,因为不满经费依赖军方(以及妻子不肯再住里根的美国),他去了多伦多大学。 妻子后来确实去过伯克利,并留下一句被原书引为笑谈的话:「那不是美国,是加州。」24

4. 同期的两次小胜利与一次搬家

  • 玻尔兹曼机(1985 前后): 辛顿与神经科学家谢诺夫斯基合作, 在一种基于百年前物理学(加热气体中粒子平衡)的数学上造出会自己生成图像和声音、 再拿生成物与真实数据对比来学习的网络——直觉上像人做梦25。 谢诺夫斯基的原话:「这是我一生之中最激动人心的时刻……我们确信我们已经弄清楚了大脑是如何工作的。」 原书立刻补了冷水:它「没有做任何有用的事情」,多年徘徊在学术边缘26;
  • 1986 年《自然》论文: 反向传播论文由鲁梅尔哈特、辛顿、威廉姆斯署名, 辛顿在婚礼当天早上把稿子寄了出去27。这是整门技术「复活」的时间戳(把事件钉死在时间轴上的那一点);
  • ALVINN(1987): 卡内基-梅隆一年级博士生波默洛把反向传播装上卡车: 车顶摄像头看人类开车,学着人类司机怎么打方向。贴纸是「车上没有人」; 1991 年一个周日清晨,它以近 60 英里的时速自己从匹兹堡开到了伊利市28—— 在明斯基的书出版 20 多年后,做了他们说神经网络做不到的事

5. 作者的判断与证据

书里给了证据的: 异或的数学极限;反向传播论文的发表;ALVINN 的行驶记录; 辛顿与明斯基 1985 年那场波士顿演示(辛顿发论文、演讲,明斯基起身离场, 论文页整齐留在桌上——辛顿后来把它们寄回明斯基办公室,附条「你可能是不小心把这些东西落下的」)29

属于作者转述的当事人判断,要分开标:

  • 「明斯基是失落的神经网络追随者」——辛顿的个人解读,原书转述;
  • 「神经网络的情况也是如此」(大陆漂移类比)——那是辛顿在 AlexNet 之后的话,第 05 章再引;
  • 玻尔兹曼机「弄清了大脑如何工作」——谢诺夫斯基当年的兴奋,后被原书自己的修正压住。

6. 边界与局限

  • 原书没讲反向传播的数学细节(链式法则——微积分里把复合变化逐层拆开的规则——怎么逐层展开),只给了「反馈向下传」的直觉。 想真正动手实现,这本书不够;
  • 1986 年之后还有第二次寒冬(90 年代),本章没展开——那是下一章的事;
  • 书中人物回忆均系多年后口述(「我花了 5 年时间才想到这一点」这类),回忆可能自我美化, 作者用双源核实事实,但没法核实心态。

7. 可带走的

  1. 明斯基的书证明的是单层网络的极限,不是神经网络不行——引用这条历史时要精确到「单层」「异或」;
  2. 多层网络的困难是记账问题:层与层的责任缠在一起,必须靠微分把误差责任逐层分摊回去,这就是反向传播;
  3. 随机初始权重是必要零件:全零起步会让网络退化为单层(对称无法打破)——这个坑今天的初学者仍然会踩;
  4. 「旧的想法也是新的」:一个想法被证伪(被证明是错的)的往往只是它的一种实现,不是它本身;
  5. 寒冬的资金机制:政府报告 → 经费撤离 → 研究者改行;学术界的单一文化比美国的多容忍更致命;
  6. 技术日历:1971 第一次寒冬开始 → 1986 反向传播登上《自然》 → 1987 辛顿落户多伦多;
  7. 反向传播落地极快:1987 年就有一辆会自己学开车的卡车(ALVINN),虽然是玩具级的。

8. 原文地图

主题原书章原文位置
明斯基离场、玻尔兹曼机演示02 辛顿与第一次寒冬text/03-p41-60.txt:218(搜「玻尔兹曼机」) · text/03-p41-60.txt:224(搜「走出房间」)
家世(布尔)、父亲的话、木匠02 辛顿与第一次寒冬text/03-p41-60.txt:263(搜「布尔逻辑」) · text/03-p41-60.txt:300(搜「一半的成就」) · text/03-p41-60.txt:306(搜「以木工为生」)
赫布定律、周六图书馆02 辛顿与第一次寒冬text/03-p41-60.txt:315(搜「神经元一起发射」) · text/03-p41-60.txt:320(搜「伊斯灵顿」)
导师改宗、每周大喊大叫02 辛顿与第一次寒冬text/03-p41-60.txt:361(搜「大喊大叫的争论」)
1971 报告、「人工智能的寒冬」得名02 辛顿与第一次寒冬text/03-p41-60.txt:401(搜「人工智能的寒冬」)
父亲之死、只有一所大学面试02 辛顿与第一次寒冬text/03-p41-60.txt:409(搜「老家伙在我取得成功」) · text/03-p41-60.txt:416(搜「面试机会」)
PDP 小组、克里克、多元观点02 辛顿与第一次寒冬text/03-p41-60.txt:422(搜「并行分布式处理」) · text/03-p41-60.txt:441(搜「不同的观点」)
分层识别(像素→线弧→耳朵)02 辛顿与第一次寒冬text/03-p41-60.txt:461(搜「第一层神经元」)
反向传播定义、对称校平、随机的呢02 辛顿与第一次寒冬text/04-p61-80.txt:18(搜「反向」) · text/04-p61-80.txt:34(搜「对称性」) · text/04-p61-80.txt:39(搜「数字是随机」)
异或被两层攻克、家谱学习02 辛顿与第一次寒冬text/04-p61-80.txt:54(搜「异或」) · text/04-p61-80.txt:150(搜「家谱」)
玻尔兹曼机做梦、谢诺夫斯基兴奋、无用处02 辛顿与第一次寒冬text/04-p61-80.txt:84(搜「做梦」) · text/04-p61-80.txt:87(搜「最激动人心的时刻」) · text/04-p61-80.txt:92(搜「边缘」)
纽厄尔面试、工资 3/402 辛顿与第一次寒冬text/04-p61-80.txt:122(搜「一无所知」) · text/04-p61-80.txt:135(搜「3.5 万美元」)
《自然》论文、婚礼寄稿02 辛顿与第一次寒冬text/04-p61-80.txt:169(搜「婚礼当天早」)
ALVINN、车上没有人、60 英里02 辛顿与第一次寒冬text/04-p61-80.txt:200(搜「ALVINN」) · text/04-p61-80.txt:214(搜「车上没有人」) · text/04-p61-80.txt:216(搜「60 英里」)
搬多伦多、那不是美国02 辛顿与第一次寒冬text/04-p61-80.txt:240(搜「伯克利」) · text/04-p61-80.txt:247(搜「那不是美国」)

Footnotes

  1. 出处:「02 辛顿与人工智能的第一次寒冬」(text/03-p41-60.txt:145,搜「西摩·佩珀特」)。明斯基与佩珀特合著《感知机》(Perceptrons)。

  2. 出处:同章(text/03-p41-60.txt:151,搜「超越了罗森布拉特自己」)。原文:这些细节「在很多方面超越了罗森布拉特自己的描述」。

  3. 出处:同章(text/03-p41-60.txt:157,搜「两种不同的颜色」)。原文:感知机可以判断两点是否都黑、都白,却答不了「它们是两种不同的颜色吗?」。

  4. 出处:同章(text/03-p41-60.txt:162,搜「政府资金转移」)。

  5. 出处:同章(text/03-p41-60.txt:160,搜「修复」)。原文:包括罗森布拉特在内的研究人员已在探索修复该缺陷的新型感知机。

  6. 出处:同章(text/03-p41-60.txt:388,搜「变得更加容易」)。辛顿的读法:精确定位局限性使解决问题更容易;「但这还需要 10 年的时间」。

  7. 出处:同章(text/03-p41-60.txt:461,搜「第一层神经元」)。第一层查像素明暗,第二层找直线弧线,第三层拼耳朵牙齿,最终拼出小狗。

  8. 出处:同章(text/04-p61-80.txt:15,搜「过于广泛和复杂」)。原文:改变一个神经元的权重意味着改变所有依赖其行为的神经元,需要更强大的数学方法。

  9. 出处:同章(text/04-p61-80.txt:18,搜「反向」)。原文:基于微分的算法,发送数学反馈沿神经元层次结构向下传递。

  10. 出处:同章(text/04-p61-80.txt:34,搜「对称性」)。原文:权重全零则系统无法打破对称性,每个神经元永远不会更重要。

  11. 出处:同章(text/04-p61-80.txt:39,搜「数字是随机」)。鲁梅尔哈特的原话。

  12. 出处:同章(text/04-p61-80.txt:150,搜「家谱」)。输入家谱碎片,推出「比尔是约翰的父亲」。

  13. 出处:同章(text/03-p41-60.txt:300,搜「一半的成就」)。

  14. 出处:同章(text/03-p41-60.txt:295,搜「离开了学术界」)与(text/03-p41-60.txt:306,搜「以木工为生」)。

  15. 出处:同章(text/03-p41-60.txt:315,搜「神经元一起发射」)。赫布《行为组织》,学习是电信号引起物理变化连接神经元。

  16. 出处:同章(text/03-p41-60.txt:320,搜「公共图书馆」)。每周六上午在伦敦北部伊斯灵顿公共图书馆写笔记。

  17. 出处:同章(text/03-p41-60.txt:401,搜「人工智能的寒冬」)。1971 年英国政府研究判定领域成果令人失望,资金削减。 补充(不在书里,来自通用知识):「寒冬」一词是对「核冬天」的套用——核战之后烟尘蔽日、连续多年阻挡阳光。

  18. 出处:同章(text/03-p41-60.txt:361,搜「大喊大叫的争论」)。导师朗吉特-希金斯读了明斯基的书后放弃类脑架构。

  19. 出处:同章(text/03-p41-60.txt:416,搜「面试机会」)。原文:只有一所大学给他提供面试。

  20. 出处:同章(text/03-p41-60.txt:409,搜「老家伙在我取得成功」)。

  21. 出处:同章(text/03-p41-60.txt:422,搜「并行分布式处理」)与(text/03-p41-60.txt:431,搜「克里克」)。PDP 是感知机/神经网络/连接主义的另一说法,也是当时一种芯片名的双关。

  22. 出处:同章(text/03-p41-60.txt:441,搜「不同的观点」)。

  23. 出处:同章(text/04-p61-80.txt:122,搜「一无所知」)与(text/04-p61-80.txt:135,搜「3.5 万美元」)。

  24. 出处:同章(text/04-p61-80.txt:222,搜「罗纳德·里根」)与(text/04-p61-80.txt:247,搜「那不是美国」)。

  25. 出处:同章(text/04-p61-80.txt:84,搜「做梦」)。名字源自玻尔兹曼的气体粒子平衡理论;系统自创声音图像再与真实数据对比学习。

  26. 出处:同章(text/04-p61-80.txt:87,搜「最激动人心的时刻」)与(text/04-p61-80.txt:92,搜「做任何有用的事情」)。

  27. 出处:同章(text/04-p61-80.txt:169,搜「婚礼当天早」)。作者鲁梅尔哈特与威廉姆斯,当年年底发表于《自然》。

  28. 出处:同章(text/04-p61-80.txt:200,搜「ALVINN」)、(text/04-p61-80.txt:214,搜「车上没有人」)与(text/04-p61-80.txt:216,搜「60 英里」)。1991 年周日清晨匹兹堡到伊利。

  29. 出处:同章(text/03-p41-60.txt:221,搜「依次展开」)与(text/03-p41-60.txt:258,搜「你可能是不小心把这些东西落下」)。