Handbook of Deep Learning Models — 全书拆解
30 秒导读: 原书是一本 2025 年出版的深度学习——让机器自己从数据里找规律的技术——实验手册。 六位背景悬殊的作者合编,主体是「概念 + 能跑的代码 + 优缺点清单」,每个架构一章。 我们这份拆解做了两件原书没做的事: 把八个互相独立的章节重新排成一条主线(下面第 2 节), 以及逐章核对内容可靠性、把哪些章能引、哪些章草率如实标出。 读完不必看原书。
1. 这是谁在什么时候写的
作者: 六位——两位印度高校计算机教授、一位分布式系统工程师、一位做机器学习(让机器从数据里自己找规律)应用的工程师、一位 AI 数据科学家,以及一位刚高中毕业、即将入学 UCLA 的本科生。
出版: 2025 年;工作标题是「Let's WorkOut With Deep Learning Models」——一本「跟着代码做」的手册,不是理论教材。
时代坐标: 写在 Transformer——今天业界的底层架构之王——已统治行业之后,但全书几乎不讲它。
Transformer 管着大语言模型(ChatGPT 这类)。
1.1 先认一下全书讲的四个更早的家族
管图像的是 CNN(名字来自它的核心操作,下面马上讲)。
CNN 靠卷积(拿一小块模板在图上滑动找图案)干活。
序列(一段有先后的数据,如文本、语音)有专门的家族管。
管它的叫 RNN——循环网络。
管造数据的是 GAN——生成对抗网络。外加 RBF、SOM 两个更早的时代。
利益相关: 无产品推销;但多章改写公开材料而不署名(第 06 章 §5 有证据),读时按「二手教材」定价。
2. 全书一条主线(读完这一节,你就懂了这本书)
2.1 一句话
每一次架构升级,都是往机器里塞进一条关于数据的假设。 假设越贴合数据,机器要自己摸索的东西就越少——要调的数更少、要喂的样本更少、学得更快。
「假设」这个词值得停一下。它不是猜,而是设计者提前写进结构里的信念, 行话叫先验。比如「图里的猫挪个位置还是猫」就是一条假设——
写进结构,就是让整张图共用同一套参数(网络里那些可以调的数),而不是每个位置各学一套。
调这些数靠成套的计算步骤(行话叫算法)。这本书讲的全部架构,共用下面四段历史。
2.2 从人到机器
第一段:不塞假设的时代。 人把数据里的门道亲手挑出来——挑出来的数叫特征。
模型(一条从输入算出输出的规则)只做最后一步判断。这套打法在表格数据上至今能打。
但图像一来就崩——图像是高维(特征多到没法直接看)数据,门道藏在几百万个像素的组合里,人挑不出来。
第二段:把「挑门道」也交给机器。 深度学习用的家伙什是神经网络——许多简单部件层层相连、连接强弱可调的结构。它堆很多层,让门道自己长出来。
长出来的方式是训练(反复喂数据、按对错调参数)。
这一步的账原书算得极清楚:同样处理一张图,不加假设的接法需要约一万亿个可调的数,加两条关于图像的常识后只要几百个——约十个数量级的差距,全部来自两条假设。
这也是全书最大的一课:结构里的每一条假设,都是在替数据省力气。
2.3 调数的战争
第三段:机器接手之后,真正的战场变成「怎么调」。
于是有了优化——把「往哪调、调多少」持续算出来再落步。
干这件事的专职算法叫优化器,它自成一条进化链:每一代都在修上一代的病——走不动就借惯性,瞎冲就先看路,一刀切就分别对待,步子越走越小就加折旧,最后合体成今天人手一份的 Adam。
但优化器只管把训练数据学像;在没见过的数据上的表现(行话叫泛化)要靠另外一套工具,这个分工原书讲对了。
2.4 四条假设,四个家族
第四段: 卷积网络假设「图案与位置无关」,循环网络假设「上一步影响下一步」,生成对抗网络假设「分不出真假就是学到位」。
RBF 与自组织映射(把高维数据摊到一张网格上看的无监督方法)假设「离得近就是像」——最后这对是同一思想的监督/无监督两副面孔。
每个家族一章,讲它解决什么、怎么做、为什么有效、死在哪。
最后一段是元知识: 这本合编书章节质量参差。最好的章(卷积)推导完整到可以逐数复算,最差的章代码和标题都对不上、甚至有打印结果违反自己约束的例子。
第 01 章给了一张核对过的质量地图——读这本书,先看地图。
3. 章节地图
01 这是一本什么书 — 这书什么来头?AI/ML/DL 什么关系?哪些章可信?先读。
02 画线的家族 — 神经网络之前的主力算法怎么工作?各自死在哪?按序。
03 问问题的家族 — 树和森林怎么工作?模型训完怎么验收?按序。
04 神经元与激活函数(每 个部件算完后的输出规则) — 网络的最小零件是什么?为什么不能只学成一条直线?按序。
05 优化器进化链 — 训练到底在优化什么?Adam 为什么是默认?按序。
06 卷积的诞生 — 卷积为什么非如此不可?约十个数量级是怎么省出来的?全书锚点。
07 卷积层的配件 — 搭真网络时每个旋钮拧下去会怎样?跟 06。
08 记忆(记住前文)与门 — 网络怎么记住前文?LSTM 的门在守什么?按序。
09 生成对抗网络 — 没有标准答案怎么学?GAN 为什么难训?按序。
10 RBF 网络 — 不用反向传播(把对错逐层往回分摊的算法)能训练网络吗?按序。
11 自组织映射 — 没有标签怎么画出数据的地图?按序。
只想拿结论:第 01 章质量地图 + 本页第 2 节 + 第 06 章。 按原书章找内容:原书 1→01,2→02+03,3→04+05,4→06+07,5→08,6→09,7→10,8→11。