从一个神经元到一张网
这一章讲三件事: 一个神经元不够用,是卡在哪一道具体的题上; 叠成很多层之后信号是怎么一路算过去的(带全部数字); 以及 —— 为什么每层中间非要插一道「掰弯」的手续,不插会怎样。 它在全书链条里的位置是第 6 级台阶: 会算的单元有了、 参数会学了, 现在问「一个不够怎么办」。 遇到的生词都在当场解释。
1. 顶层全景
一个神经元
│ 只画得出一条直线 ⇒ 有一类题它永远做不对
▼
叠成很多层
│ 理论上能拼出任意复杂的形状
▼
但如果每层只是「乘一乘加一加」……
│ ⚠️ 一百层 = 一层。整张网退化成一个神经元
▼
所以每层后面插一道非线性的手续(激活函数)
│ 可它选谁? 最直觉的那个 sigmoid 有毛病:信号往回传几层就没了
▼
换成 ReLU(第 02 章那个 max(0,x))
│ 代价:负半轴那边会「死」掉一批神经元
▼
于是又有了 Leaky-ReLU 和 ELU
图说:整条链上每一步都是被上一步的毛病逼出来的——
和第 06 章那把尺子推三版是同一个形状。
本章主走查: 书给的那个小网络的前半程。两个输入 i₁ = 0.02、i₂ = 0.7, 中间一层两个神经元,最后一层两个神经元,十个参数全部给定。
(中间那种夹在里面、你既看不到它输入也看不到它输出的层叫隐藏层,第 3 节细讲。)
我们把信号从输入一路算到输出,每一步写出具体的数。 这条走查的后半程在第 08 章 —— 那是同一组数字的下半场。