跳到主要内容

神经网络简史 — 被一本书打入寒冬,又被物理学家救活

这一章讲三件事: 感知机怎么学习(一条具体到数字的更新规则),以及明斯基那本 《感知机》凭什么用一个小小的 XOR 把它打进寒冬;物理学家的回归(霍普菲尔德网络、 玻尔兹曼机)和通用逼近定理为什么"给了一针安慰剂";深度学习怎么翻身—— 2006 年的逐层预训练、2012 年的 ImageNet、2017 年的 Transformer。 这一章是全书技术含量最高的一章:今天所有大模型的前世,都在这一章里。

1. 这一章讲什么

第 01 章说过,达特茅斯会议当天就是两条路线同台。这一章是"模拟大脑"那条路线的 完整传记。原书的开场判语值得先钉在墙上:

神经网络"既不是来自生物学的刺激,也没有给生物学送去任何慰藉。倒是它来源于 物理学家,并引起了物理学家的关注"1

这句话反直觉,却解释了本章的全部走向:这门"仿脑"的学问,几次生死都由外部学科 (逻辑学、物理学、统计学、芯片工艺)决定,而不是由神经科学决定。

2. 顶层全景

1943 麦卡洛克-皮茨:神经元的数学模型(开山之作,参考文献只有 3 本逻辑书)

1949 赫布学习规则:一起激活的细胞建立关联

1957 罗森布拉特:感知机(IBM 704 上实现,学习规则收敛性有证明)
↓ ↓
1969 明斯基-佩珀特《感知机》: 1974 沃波斯:反向传播的
单层学不会 XOR → 资助撤离 博士论文(生不逢时)
↓ "漫长寒冬"近 20 年
1982 霍普菲尔德网络(物理学家进场) ── 1983-86 玻尔兹曼机(辛顿+谢诺夫斯基)

1986 PDP 文集:分布式表示(词向量的源头)+ 反向传播普及

1987-89 通用逼近定理:三层网络可逼近任意连续函数(理论平反,但工程未跟上)

2006 辛顿《科学》:逐层预训练 → 深度学习实用化

2012 AlexNet:ImageNet 错误率 26% → 15% 以下(领先第二名 10 个百分点)

2017 Transformer:注意力取代循环 → 大语言时代的底座

2024 霍普菲尔德、辛顿获诺贝尔物理学奖

图说:过山车的四段——开山(1943-57)、寒冬(1969-86)、复兴(1982-2006)、
革命(2006-至今)。主走查在第 3.2 节:感知机学习规则。

3. 核心原理

3.1 开山之作:把神经元变成逻辑门

1943 年,神经生理学家麦卡洛克与 17 岁的流浪数学少年皮茨合写了一篇后来被称为 神经网络开山之作的论文。它的做法今天看来仍然惊人:把神经元抽象成一个开关—— 多个输入各带权重(权重,就是每个输入的重要程度),信号加总超过门槛就输出 1,否则输出 0。

两个细节原书特意点出。第一,这篇文章的参考文献只有 3 本,全是逻辑与数学著作 (卡尔纳普、希尔伯特-阿克曼、罗素《数学原理》),没有一篇神经科学论文2—— "仿大脑"的学科,诞生于数理逻辑,这是一个预言:它后来的每次崛起都靠数学和算力, 而不是靠更了解大脑。 第二,文中专有一节证明了:带足够长存储的神经网络, 与图灵机、λ演算、递归函数等价3神经网络的最高 ambitions 从第一天起就锁死在 计算理论的边界内——第 09 章讨论"人是机器吗"时,这条等价性是全部论证的地基。

3.2 主走查:感知机怎么学习,以及 XOR 为什么杀死了它

1957 年,康奈尔的心理学家罗森布拉特在 IBM 704 上实现了感知机(perceptron): 一个只有一层可调权重的网络。它在理论上被证明:对线性可分的问题—— 能用一条直线把两类点分开的问题——学习过程一定收敛(反复调整后必然停在一条正确的直线上)4

感知机的学习规则,拿一个最小例子走一遍。 任务:分清二维平面上的两类点 (以下所有数值是为演示编的,机制与书一致):

模型: 输出 = 1,若 w1·x1 + w2·x2 + b > 0;否则输出 0
(w1、w2 是权重,b 是偏置——三个可以调的数)

初始: w1=0, w2=0, b=0
训练样本(两个):
A 类(应输出 1):x=(1, 1)
B 类(应输出 0):x=(0.5, 0.1) ← 这两类确实能被一条直线分开

第 1 轮:
样本 A:加权和 = 0×1+0×1+0 = 0,不大于 0 → 输出 0,错(应输出 1)
规则:错了就"加强" → w1=0+1×1=1, w2=0+1×1=1, b=0+1=1
(每个权重朝输入方向加一拍,学习率取 1)
样本 B:加权和 = 1×0.5+1×0.1+1 = 1.6 > 0 → 输出 1,错(应输出 0)
规则:反向"减弱" → w1=1-0.5=0.5, w2=1-0.1=0.9, b=1-1=0
第 2 轮:
样本 A:0.5+0.9+0=1.4 > 0 → 输出 1,对
样本 B:0.5×0.5+0.9×0.1+0=0.34 > 0 → 输出 1,错
减弱 → w1=0, w2=0.8, b=-1
第 3 轮:
样本 A:0+0.8-1=-0.2 ≤ 0 → 输出 0,错 → 加强 → w1=1, w2=1.8, b=0
样本 B:0.5+0.18+0=0.68 > 0 → 输出 1,错 → 减弱 → w1=0.5, w2=1.7, b=-1
……第 6 轮收敛于 w1=1, w2=1, b=-1.2:
A:1+1-1.2=0.8>0 → 输出 1 ✓ B:0.5+0.1-1.2=-0.6≤0 → 输出 0 ✓

图说:学习 = "对了不动,错了朝输出应有的方向拧权重"。
直线 1·x1+1·x2-1.2=0 把两类分开——感知机自己"走"出了这条线,
没有任何人事先告诉它线在哪。

这就是最早的机器学习:没有人编写规则,规则是从错误里拧出来的。 罗森布拉特 1962 年把全部成果写成一本书,成了"吃啥补啥"一派的圣经; 国防部和海军都投了钱,媒体称之为"头版头条的抢眼消息"4

然后,1969 年,明斯基与佩珀特出版《感知机:计算几何学》,证明了一件精确的事: 单层感知机连 XOR(异或)都表示不了。 XOR 是"相同为 0、不同为 1"的基本逻辑运算, 拿真值表看,问题一目了然:

x1 x2 → x1⊕x2 平面上四点的位置:
0 0 0 (0,0)→0 (1,1)→0 ← 两个 0 类在对角线上
0 1 1 (0,1)→1 (1,0)→1 ← 两个 1 类在另一条对角线
1 0 1
1 1 0 要把两类分开,需要一条直线;
而这两类恰好是交叉的两个对角——任何直线都做不到。

XOR 的四个点在平面上是对角交叉的:不存在一条直线能同时把两个 1 和两个 0 分开。 单层感知机只会画直线,所以它学不会 XOR——这是数学事实,明斯基没证错。 问题出在呈现方式:原书引《感知机》第 1 版原话"罗森布拉特的论文大多没有科学价值"—— 一个技术性结论被写成了死刑判决,资助随即撤离,罗森布拉特 1971 年在自己 43 岁 生日那天划船溺亡(原书说"很多人认为他是自杀"),神经网络进入近二十年寒冬5

解药其实 1974 年就有了:哈佛的沃波斯在博士论文里证明,给网络多加一层, 并用"反向传播"(back-propagation,从输出与正确答案的差距——误差——出发,逐层往回推每个权重该往哪拧的算法)来练,就能解决 XOR——多加的那层叫隐藏层,它学出的中间表示不再是一条直线,而可以是两条直线的组合(先判 x1≠x2,再取反)。

但论文发表时正值寒冬,无人问津6。所谓训练(拿大量例子反复调整、练到会),在这篇论文里第一次有了完整的现代形态。 缺的不是原理,是气候。 (原书参考文献指南里补了一句公道话:施密特休伯考证 反向传播更早的源头是林纳因马 1970 年的硕士论文——优先权之争至今未了。)7

3.3 复兴:物理学家的两次入场

神经网络 80 年代的复兴,主角不是神经科学家,是凝聚态物理学家。 霍普菲尔德——1969 年就拿了凝聚态物理最高奖之一巴克利奖——1982 年提出一种新网络: 把记忆(一被勾起就浮出全部的模式)构造成一个能量地形,网络从任意初始状态出发,像球滚下山坡一样 滑进最近的记忆凹点,从而完成联想记忆,还能给一类"在无数组合里挑最好方案"的问题找近似解8

原书特别强调这次复兴的诡异之处:"神经网络的这次复兴和生物学其实没啥关系"—— 它是复杂系统物理学救了仿脑工程1。随后他的学生辈谢诺夫斯基与辛顿在原始模型里 引入隐藏单元(额外加进去、负责中间加工的零件),并给网络装上骰子——用概率(一件事有多大把握的数)决定神经元开还是关——提出玻尔兹曼机(名字借自统计物理)——辛顿后来回忆说, 当时他们真以为大脑就是这么工作的,该去领诺贝尔生理学奖;结果大脑被证明不是 这么工作的,他们却因此得了诺贝尔物理学奖(2024 年)9

同一时期,连接主义运动在加州大学圣地亚哥分校产出两卷本 PDP 文集,其中第 3 章 **"分布式表示"**最值得单独记:一个词不用一个编号表示,而用它与其他所有词的关系、 以一串数来表示——这串数就叫向量10

这一段是日后一切"把词变成数"的做法的源头:词向量(把词变成一串数)就是最初的样子。

词嵌入(把这类表示学出来的方法),直至大语言模型表示含义的做法——第 07 章的 word2vec、第 10 章的"学习即压缩",都是这条线上的两站。

3.4 理论平反:通用逼近定理救了名誉,没救寒冬

数学这边还有一条暗线。希尔伯特第十三问题(七次方程的解能否用二元函数叠加表示) 引出的柯尔莫哥洛夫-阿诺德叠加定理说:任意连续函数都可以由一元函数和加法叠加构成。 1987 年,企业家赫克-尼尔森在一届神经网络大会上用一篇 3 页的短文指出: 这个定理可以被三层神经网络实现11。随后赛本科(1988)等人证明了带 S 形激活函数(sigmoid,即神经元的开关规则:输入多大火就开多大火)的单隐层网络可以逼近任意连续函数——这一族结论统称通用逼近定理

它给了神经网络数学上的名誉:表达能力不是问题。 但原书把两个硬边界也照实列出: 第一,这些证明是存在性的,不是构造性的——"一个思路可行,还得伴之以算法和实现"; 第二,激活函数的选择"目前还是'玄学',缺乏理论依据"12。而且波焦很快指出 实现 KA 定理的网络不平滑,会撞上维数灾难——KA 网络在工程上没走通13理论许可证 ≠ 施工图。 神经网络真正翻身,靠的还是 2006 年之后的算法+数据+芯片。

3.5 深度学习革命:三块燃料

深度学习这个词的机制含义朴素得惊人:把神经网络的层数加深(原书:"所谓深度学习, 就是用由很多层神经元构成的神经网络实现机器学习的功能")14。深度的代价是训练难度 急剧上升,它翻身靠三块燃料:

第一块,算法。 辛顿和学生在 2006 年发表于《科学》的文章提出降维(把庞杂信息压得更小更稠)与逐层预训练, 让深网络的训练第一次可行15

第二块,数据+比赛。 2012 年 ImageNet 大赛(ILSVRC):用 1000 万张图像训练、 15 万张测试,识别动物、花、船等;2012 年之前参赛方法的普遍错误率在 26% 左右, 辛顿团队的 SuperVision 首次参赛就把错误率压到 15% 以下——超过 10 个百分点的 领先,在竞技体育里叫碾压16。三个月后微软的拉希德在天津现场演示英文演讲实时 中文翻译,深度学习拿下语音识别(把人说的话变成文字);原书补了一句:"此后,语音识别问题一度被认为彻底解决了。"17

第三块,芯片。 人脑的神经连接约 100 万亿到 1000 万亿个;擅长大规模并行矩阵(把数排成行列的表格)运算 的 GPU 与神经网络结构天然合拍,谷歌自研的 TPU 思路可以追溯到孔祥重 80 年代在 卡内基-梅隆的脉动阵列18。原书对这味燃料的总结只有一句:硬件的进步,让以往的不可能成为可能18

2018 年图灵奖颁给辛顿、本吉奥、杨立昆;2024 年诺贝尔物理学奖颁给霍普菲尔德与辛顿。 原书对斯坦福 AI 实验室的观察最有历史讽刺味:铁杆符号派麦卡锡创办的实验室, 后来的主任是吴恩达和李飞飞——两个做神经网络的19

3.6 从 CNN/LSTM 到 Transformer:两代专用架构与一次统一

深度学习在具体问题上长出两代专用架构。空间问题(图像)卷积(只把相邻小块连起来看,省掉全图两两相连)网络:源头是 胡贝尔-威瑟尔 1959 年的"感受野"(视觉细胞只看局部区域)→ 福岛邦彦 1980 年的 新认知机 → 杨立昆在贝尔实验室的手写数字识别。原书记了一个细节:杨立昆不喜欢 "卷积神经网络"这个名字,更愿意叫"卷积网络"——这样可以撇清与生物物理先驱的关系20

**时间问题(语言)**走循环网络——RNN,即把上一步的输出接回下一步输入的网络。

改良 LSTM(1997)解决了梯度(误差往回传时逐层衰减的"坡度信号")不稳的问题。但语言的串行本质限制了训练的并行性——一个词接一个词处理,再多的芯片也使不上力。

2017 年,谷歌团队发表《Attention is All You Need》,提出 Transformer: 用注意力机制(每个 token 直接"看"句中所有其他 token,按相关度取用信息) 取代逐词递归,训练速度大幅加快21。原文点明:今天的大语言模型绝大多数只用其中的解码器(只负责生成的那一半)。

自注意力(只保留"看前文猜词"的那一半注意力)的数学原理,原书指向它的第 11 章, 我们的第 10 章会用所罗门诺夫归纳正面回答。

原书还记了 Transformer 的两个余波:它的 8 位作者全部离开谷歌创业("X is All You Need" 成了论文标题模板);2024 年底伊利亚在 NeurIPS 回顾十年,承认 Seq2Seq 最重要的贡献 是"用 GPU 实现了并行化"22

4. 作者的判断与证据

史实层:M-P 论文的等价性证明、感知机的收敛定理、XOR 的不可能性、霍普菲尔德 1982 论文、通用逼近定理谱系、AlexNet 的错误率,全部有论文可查。本书此章的强项是 人事史的考据:明斯基与罗森布拉特是布朗克斯科学高中前后届校友、在校时重叠两年且 彼此认识5——这为"恩怨"的解读提供了史料级别的事实底座。

作者观点层(要分开):

  • 作者对明斯基-罗森布拉特之争给出了动机解释(嫉妒、资助竞争、派系立场), 并引用再版删句、手写"纪念罗森布拉特"的细节——解释是作者的,删除与题词是事实5;
  • "感知机的失败导致神经网络式微近二十年,所谓搬起石头砸了自己的脚"—— 这是作者对符号派的判词(明斯基层本也是神经网络出身)23;
  • 2024 诺贝尔奖的定性是作者的分类学:物理学奖算 Science4AI(物理学基础救活了 AI), 化学奖(AlphaFold)算 AI4Science(AI 当科学的工具)24

原书自己注明存疑处:罗森布拉特溺亡"很多人认为他是自杀"——原书照录传闻原文5; 作者还顺手给了一组他自谦"不深刻"的对比(平克对神经网络学过去式的批评, 作者评"这种观察并不深刻,罗森布拉特 30 年前就探索过")25

5. 边界与局限

  • 本章(原书)是史书,不是教程:反向传播的数学细节——链式法则(一次算清所有环节的联动)——原书一笔带过;要看机制请配我们书架的深度学习教材(nndl 系列)。

  • 同样只提了一名的还有梯度下降(沿着坡往下小步调数)。

  • "通用逼近"不等于"学得出来":存在性证明不保证样本效率与泛化(对没见过的例子也管用)。

  • 原书明确指出工程上"鲜有科学理论研究支撑,现有算法多是经验算法加参数(可以调的数)调优"26

  • 深度学习的机制至今没有令人满意的解释——原书原话27,这也是第 11 章哲学之争 (可解释性)的引信。

  • Transformer 之后仍在演进:原书写到 ViT(视觉 Transformer)与多模态(图文语音混在一起学)的做法, 但 2024-2026 的推理模型(o1/R1)只在第 2、11 章各提一句。

  • 数字核对:原书说 ImageNet"用 1000 万张图像训练,用 15 万张图像测试"16; 这是赛会口径,引用时不要与常见教程里"训练集 128 万张"的子集口径混用。

6. 可带走的

  1. 神经网络生于逻辑学,兴于物理学,成于统计学与芯片——没有一次转折是 神经科学推动的;"仿脑"与"懂脑"是两件事;
  2. 感知机学习规则一句话:对了不动,错了朝应有方向拧权重——"没有人编写规则, 规则是试错拧出来的"这一大模型时代的常识,1957 年就有了;
  3. XOR 杀死的是"单层",不是"神经网络":加一层隐藏层即可解决—— 技术结论被写成死刑判决,是寒冬的直接死因;
  4. 分布式表示(词=向量=关系)是 1986 年 PDP 第 3 章的遗产,今天一切嵌入技术的源头;
  5. 通用逼近定理给的是"表达许可证",不是"训练施工图"——理论和工程的落差, 在深度学习、大模型上反复重演;
  6. 深度学习翻身的三块燃料:算法(逐层预训练)、数据+比赛(ImageNet)、芯片(GPU/TPU) ——三者缺一,2006-2012 的任何一步都走不动;
  7. Transformer 的本质动机是并行:注意力让每个词同时看全句,吃满 GPU; 串行的循环网络输在物理结构,不输在想法;
  8. 诺贝尔物理学奖(2024)是对这段历史的盖棺:一个被逼出学科的交叉领域, 最终由物理学界为其正名;
  9. 人事史读法:明斯基与罗森布拉特的高中校友关系、再版删句与题词—— 恩怨有史料,动机靠推断,引用时要分清。

7. 原文地图

主题原书章原文位置
两派绰号:想啥来啥/吃啥补啥第5章 神经网络简史text/09-ch05.txt:11(搜「想啥来啥」)
M-P 1943 与 3 本参考文献第5章 神经网络简史text/09-ch05.txt:17(搜「1943」) · text/09-ch05.txt:42(搜「参考文献」)
M-P 证明与图灵机等价第5章 神经网络简史text/09-ch05.txt:683(搜「等价」)
赫布学习规则第5章 神经网络简史text/09-ch05.txt:83(搜「Hebb学习规则」)
感知机 1957、收敛定理、圣经第5章 神经网络简史text/09-ch05.txt:88(搜「感知机」) · text/09-ch05.txt:96(搜「线性可分」) · text/09-ch05.txt:101(搜「圣经」)
明斯基-佩珀特 XOR第5章 神经网络简史text/09-ch05.txt:113(搜「XOR」) · text/09-ch05.txt:113(搜「异或」)
罗森布拉特之死、寒冬第5章 神经网络简史text/09-ch05.txt:119(搜「溺亡」) · text/09-ch05.txt:158(搜「漫长寒冬」)
高中校友、嫉妒第5章 神经网络简史text/09-ch05.txt:125(搜「布朗克斯」) · text/09-ch05.txt:139(搜「妒忌」)
再版删句、纪念罗森布拉特第5章 神经网络简史text/09-ch05.txt:159(搜「删除」) · text/09-ch05.txt:160(搜「纪念罗森布拉特」)
搬起石头砸自己的脚第5章 神经网络简史text/09-ch05.txt:143(搜「魔鬼搭档」);同主题判词见第 10 章第 398 段(text/14-ch10.txt:398,搜「衰败」)
维德罗 Adaline第5章 神经网络简史text/09-ch05.txt:149(搜「Adaline」)
沃波斯 1974 反向传播第5章 神经网络简史text/09-ch05.txt:203(搜「沃波斯」) · text/09-ch05.txt:481(搜「反向传播」)
施密特休伯的优先权考证第5章 神经网络简史text/09-ch05.txt:740(搜「林纳因马」)
复兴与生物学无关、物理学家第5章 神经网络简史text/09-ch05.txt:281(搜「这次复兴和生物学」)
霍普菲尔德网络 1982/1984第5章 神经网络简史text/09-ch05.txt:267(搜「霍普菲尔德网络」) · text/09-ch05.txt:268(搜「集成电路实现了自己提出」)
玻尔兹曼机与诺贝尔戏言第5章 神经网络简史text/09-ch05.txt:271(搜「玻尔兹曼机」) · text/09-ch05.txt:126(搜「诺贝尔」)
PDP 与分布式表示第5章 神经网络简史text/09-ch05.txt:297(搜「PDP」) · text/09-ch05.txt:302(搜「分布式表示」)
平克批评、"观察并不深刻"第5章 神经网络简史text/09-ch05.txt:336(搜「平克」) · text/09-ch05.txt:342(搜「并不深刻」)
希尔伯特第十三问题与 KA 定理第5章 神经网络简史text/09-ch05.txt:390(搜「第十三问题」) · text/09-ch05.txt:413(搜「柯尔莫哥洛夫」)
赫克-尼尔森 3 页论文、HNC第5章 神经网络简史text/09-ch05.txt:436(搜「赫克-尼尔森」) · text/09-ch05.txt:437(搜「三层神经网络」) · text/09-ch05.txt:433(搜「反欺诈」)
通用逼近定理、赛本科第5章 神经网络简史text/09-ch05.txt:465(搜「赛本科」) · text/09-ch05.txt:471(搜「通用逼近定理」)
存在性非构造性、激活函数玄学第5章 神经网络简史text/09-ch05.txt:477(搜「存在性」) · text/09-ch05.txt:479(搜「玄学」)
波焦:不平滑、维数灾难第5章 神经网络简史text/09-ch05.txt:494(搜「不平滑」) · text/09-ch05.txt:495(搜「维数灾难」)
KAN 2024第5章 神经网络简史text/09-ch05.txt:85(搜「KAN」)
深度学习定义、2006 科学论文第5章 神经网络简史text/09-ch05.txt:519(搜「深度学习」) · text/09-ch05.txt:529(搜「逐层预训练」)
ImageNet 数字第5章 神经网络简史text/09-ch05.txt:538(搜「1000万张」) · text/09-ch05.txt:540(搜「26%」)
语音突破、天津演示第5章 神经网络简史text/09-ch05.txt:543(搜「邓力」) · text/09-ch05.txt:545(搜「天津」)
DNNresearch 被谷歌收购第5章 神经网络简史text/09-ch05.txt:553(搜「DNNresearch」) · text/09-ch05.txt:555(搜「几千万美元」)
加拿大三团队、2018 图灵奖第5章 神经网络简史text/09-ch05.txt:558(搜「加拿大」) · text/09-ch05.txt:580(搜「图灵奖」)
脑突触数量、GPU/TPU/脉动阵列第5章 神经网络简史text/09-ch05.txt:563(搜「100万亿」) · text/09-ch05.txt:571(搜「TPU」) · text/09-ch05.txt:572(搜「Systolic Array」)
斯坦福实验室主任变天第5章 神经网络简史text/09-ch05.txt:598(搜「李飞飞」)
2024 诺贝尔、AI4Science/Science4AI第5章 神经网络简史text/09-ch05.txt:363(搜「诺贝尔物理学奖」) · text/09-ch05.txt:361(搜「AI4Science」)
感受野→新认知机→平移不变第5章 神经网络简史text/09-ch05.txt:607(搜「感受野」) · text/09-ch05.txt:609(搜「新认知机」) · text/09-ch05.txt:611(搜「平移不变性」)
杨立昆不认"卷积神经网络"第5章 神经网络简史text/09-ch05.txt:622(搜「卷积神经网络」)
LSTM、词嵌入、Seq2Seq第5章 神经网络简史text/09-ch05.txt:631(搜「长短期记忆」) · text/09-ch05.txt:635(搜「词嵌入」) · text/09-ch05.txt:639(搜「彻底取代」)
Transformer、自/交叉注意力、解码器第5章 神经网络简史text/09-ch05.txt:648(搜「Attention is All You Need」) · text/09-ch05.txt:651(搜「自注意力」) · text/09-ch05.txt:652(搜「只使用解码器自」)
8 作者离开谷歌、标题模板第5章 神经网络简史text/09-ch05.txt:653(搜「8名作者」) · text/09-ch05.txt:648(搜「All You Need」)
ViT 与多模态 token第5章 神经网络简史text/09-ch05.txt:39(搜「ViT」) · text/09-ch05.txt:664(搜「token」)
伊利亚 NeurIPS 2024 演讲第5章 神经网络简史text/09-ch05.txt:668(搜「NeurIPS」) · text/09-ch05.txt:673(搜「并行化」)
深度学习机制无解释第5章 神经网络简史text/09-ch05.txt:487(搜「机制一直没有令人满意」)
工程缺理论支撑第5章 神经网络简史text/09-ch05.txt:525(搜「计算复杂性的研究并不多」)

Footnotes

  1. 出处:「第5章 神经网络简史」第 281 段(text/09-ch05.txt:281,搜「这次复兴和生物学」)。原文:"神经网络的这次复兴和生物学其实没啥关系……倒是它来源于物理学家,并引起了物理学家的关注"。 2

  2. 出处:「第5章 神经网络简史」第 42 段(text/09-ch05.txt:42,搜「参考文献」);三本书的清单见"参考文献指南"第 677-679 段(text/09-ch05.txt:677,搜「卡尔纳普」)。

  3. 出处:「第5章 神经网络简史」第 683 段(text/09-ch05.txt:683,搜「等价」)。原文:该文第 3 节"论证了神经网络(配备足够长的存储纸带)和图灵机、λ演算和递归函数等装置是等价的"。

  4. 出处:「第5章 神经网络简史」第 88 段(text/09-ch05.txt:88,搜「感知机」)与第 96 段(搜「线性可分」)、第 102 段(搜「圣经」)。演示走查中的数值(权重、坐标、轮次)为编造,机制与原文一致。 2

  5. 出处:「第5章 神经网络简史」第 113 段(text/09-ch05.txt:113,搜「XOR」)、第 118 段(搜「溺亡」)、第 125 段(搜「布朗克斯」)、第 144 段(搜「魔鬼搭档」)、第 159-160 段(搜「纪念罗森布拉特」)。寒冷时长:"经历了近二十年的低谷期"见第 158 段(text/09-ch05.txt:158,搜「漫长寒冬」)。 2 3 4

  6. 出处:「第5章 神经网络简史」第 201-202 段(text/09-ch05.txt:203,搜「沃波斯」)。原文:"1974年,哈佛大学的一篇博士论文证明了在神经网络中多加一层,并且利用'反向传播'学习方法,可以解决XOR问题……文章不合时宜"。

  7. 出处:「第5章 神经网络简史」第 740 段(text/09-ch05.txt:740,搜「林纳因马」)。施密特休伯认为反向传播原创应属林纳因马 1970 年硕士论文与沃波斯 1974 年博士论文。

  8. 出处:「第5章 神经网络简史」第 209 段(text/09-ch05.txt:209,搜「霍普菲尔德」)与第 265 段(搜「霍普菲尔德网络」)、第 267 段(搜「模拟集成电路」)。

  9. 出处:「第5章 神经网络简史」第 271 段(text/09-ch05.txt:271,搜「玻尔兹曼机」)与第 274 段(搜「诺贝尔」)。原文:"但最后大脑被证明不是这样工作的,他们却因此得了诺贝尔物理学奖"。

  10. 出处:「第5章 神经网络简史」第 302 段(text/09-ch05.txt:302,搜「分布式表示」)。原文:"词可以用词-词之间的关系以向量的形式表示"。

  11. 出处:「第5章 神经网络简史」第 436 段(text/09-ch05.txt:436,搜「赫克-尼尔森」)与第 438 段(搜「三层神经网络」)、第 439 段(搜「3页」)。

  12. 出处:「第5章 神经网络简史」第 477 段(text/09-ch05.txt:477,搜「存在性」)与第 479 段(搜「玄学」)。

  13. 出处:「第5章 神经网络简史」第 493-496 段(text/09-ch05.txt:494,搜「不平滑」)。

  14. 出处:「第5章 神经网络简史」第 519 段(text/09-ch05.txt:519,搜「深度学习」)。原文:"所谓深度学习,就是用由很多层神经元构成的神经网络实现机器学习的功能"。

  15. 出处:「第5章 神经网络简史」第 529 段(text/09-ch05.txt:529,搜「逐层预训练」)。

  16. 出处:「第5章 神经网络简史」第 538 段(text/09-ch05.txt:538,搜「1000万张」)与第 540 段(搜「26%」)。 2

  17. 出处:「第5章 神经网络简史」第 543-549 段(text/09-ch05.txt:543,搜「邓力」);天津演示在第 545 段(搜「天津」),"彻底解决"在第 548 段(搜「彻底解决」)。

  18. 出处:「第5章 神经网络简史」第 563 段(text/09-ch05.txt:563,搜「100万亿」)与第 571-572 段(搜「TPU」);判语"硬件的进步让以往的不可能成为可能"见第 567 段(text/09-ch05.txt:567,搜「硬件的进步」)。 2

  19. 出处:「第5章 神经网络简史」第 598 段(text/09-ch05.txt:598,搜「李飞飞」)。

  20. 出处:「第5章 神经网络简史」第 606-611 段(text/09-ch05.txt:607,搜「感受野」)与第 622 段(搜「卷积神经网络」)。

  21. 出处:「第5章 神经网络简史」第 648 段(text/09-ch05.txt:648,搜「Attention is All You Need」)与第 651-652 段(搜「自注意力」)。原文:"语言的串行本质限制了训练过程的并行性……极大地加快了训练速度""现在的大语言模型绝大多数只使用解码器自注意力机制,这个问题的数学原理见本书第11章"。

  22. 出处:「第5章 神经网络简史」第 653-656 段(text/09-ch05.txt:653,搜「8名作者」)与第 667-673 段(搜「NeurIPS」)。

  23. 出处:「第6章 向自然学习:从遗传算法到强化学习」第 72 段(text/10-ch06.txt:72,搜「第一次低潮的起因」)。原文:"尤其是明斯基对罗森布拉特'感知机'的批判导致了神经网络的衰落,在某种意义上这也是人工智能第一次低潮的起因,所谓搬起石头砸了自己的脚"。

  24. 出处:「第5章 神经网络简史」第 363 段(text/09-ch05.txt:363,搜「诺贝尔物理学奖」)与第 376 段(搜「AI4Science」)。

  25. 出处:「第5章 神经网络简史」第 336 段(text/09-ch05.txt:336,搜「平克」)与第 342 段(搜「并不深刻」)。

  26. 出处:「第5章 神经网络简史」第 525 段(text/09-ch05.txt:525,搜「计算复杂性的研究并不多」)与第 526 段(搜「经验算法加参数调优」)。

  27. 出处:「第5章 神经网络简史」第 487 段(text/09-ch05.txt:487,搜「机制一直没有令人满意」)。