跳到主要内容

导论 — 这是一本什么样的速成课,怎么读它

这一章讲三件事: 这本书承诺给读者什么、它是谁在什么背景下写的、 以及原书 14 章怎么组织、我们建议按什么顺序读。 读完你会知道接下来 15 个拆解章各自站在全书的哪个位置。 不需要任何基础,遇到的生词都在当场解释。

1. 先看现象:这本书凭什么自称「速成课」

市面上的深度学习教材大多从数学讲起:先矩阵(数排成的表格)、再微积分、然后才碰到第一行代码。 这本书反着来——它在导论里给出的入门判据只有一句话: 会写 for 循环、会定义函数,就可以开始读了1

这不是营销话术,它把代价明说了:全书的项目要在普通电脑上跑, 大多数例子几分钟出结果,贵的例子几个小时;只有两类例外—— GAN 和扩散模型(第 11、12 章的主角)——没有显卡会慢到没法用, 作者建议这种时候去 Google Colab 或 Kaggle 借免费的云端算力(租用云上的计算硬件)2

「速成」的意思不是「浅」,是「把不可省的东西压缩到最小」。 原书的做法是:每一章先手写最小实现(用最基础的 NumPy 库拼出一个能跑的东西), 再换成正式框架(PyTorch)做工程版,最后用项目验证。 我们这份拆解保留这个顺序,因为「先手写一遍再换工具」正是这本书的教学主张: 作者明确说,他们认为学深度学习最好的方式就是写代码3

2. 主走查:一个零基础读者从打开书到跑出第一个结果

拿原书给读者的路径走一遍,每一步都是原书明说的、可核对的动作:

① 读者的起点判断
「会写 for 循环 + 会定义函数?」
→ 是:直接开始。还用过 NumPy/Matplotlib 更好,没用也不拦
→ 数学要求:高中代数/概率/统计;线性代数和微积分到后面章节才需要,
而且「以直观层面引入,不堆数学记号」(原书原话的意思)[^4]
② 装环境
从 python.org 装最新稳定版 Python
终端里敲:pip install numpy matplotlib ← 全书最先用到的两个库
可选:Jupyter Notebook(逐块执行代码的交互界面)或 VS Code
③ 拿代码和数据
git clone <该书开源代码库,地址见脚注>
每章一个文件夹,里面代码、数据、README 齐全[^5]
④ 跑通第一个项目
第 1 章第一个例子:10 个数据点、1 个可调的数、训练 100 轮
→ 终端打印 100 行「第 i 轮、权重是多少、错误是多少」
→ 这就是全书的第一课:训练 = 看着错误一点点变小(第 02 章拆)

①②③④里的每一条承诺都能在原文里找到—— 判据在导论1,数学要求4,两个库的名字在装环境一节,代码库地址5这本书的契约就是:读者出代码,书出讲解;讲解不替读者写代码,代码不替读者懂原理。

3. 三个词的边界:AI、机器学习、深度学习

新闻里这三个词经常混着用——AI 是指人工智能,机器学习是指让计算机从数据里学规律,深度学习是指其中用多层神经网络的那一支——原书在导论里专门划了界,值得原样带走6。最容易记错的边界案例是决策树:一串「如果…就…」的规则拼成的模型,它是机器学习,但不是深度学习:

定义(按原书口径)不属于它的例子
人工智能让系统做通常需要人类智能的认知任务(认脸、听语音、做决策、翻译)的一切技术只靠人写规则的系统、早期医疗诊断专家系统也算——「记得 IBM Watson 吗?」
机器学习人工智能的分支:用算法从数据里学规律并做预测2000 年代流行的决策树、支持向量机(画一条最宽的分界线)是机器学习,但不是深度学习
深度学习机器学习的分支:用多层人工神经网络学,「深」就深在层数单层模型再大也不算「深」

三层的包含关系是:人工智能 ⊃ 机器学习 ⊃ 深度学习。 「深」不是形容词,是结构描述——后面第 03 章会看到,两个隐藏层以上的网络 才开始被这个行业叫「深」,而且这个门槛是有实际后果的(能拼出多复杂的形状)。

「神经网络」这个词在第 02 章才会正式定义,这里只需要一个粗粒度的图景: 它是一堆简单计算单元连成的网络,每个单元存着几个可以调的数,「学习」就是调这些数。

4. 时代坐标:这场革命为什么发生在 2012 年前后

深度学习的组件——神经网络研究本身——1950 到 1980 年代就有了。 它等到 2010 年代才爆发,原书把功劳记在两件看似无关的事上7:

  • 游戏业造出了越来越强的显卡(为渲染游戏画面设计的芯片);
  • 社交网络攒出了海量带标注的图片数据(用户自己上传、自己打标签)。

转折点是 2012 年:一个叫 AlexNet 的深度学习模型赢了 ImageNet 大规模视觉识别挑战赛。 ImageNet 是一个大型标注图片数据库,比赛就是看谁的模型认得准7。 AlexNet 赢得毫无悬念,几年之内深度学习就铺开了。

判断(我们的,不是书里的): 这段历史有一个值得专门点破的结构—— 深度学习的三个必要条件(可调的大模型、算得动的芯片、喂得饱的数据)分别来自 学术界、游戏业和社交网络,没有任何一方是为了「做 AI」而准备的。 这解释了为什么这个领域的时间线由产业事件而非论文节点推动。 如果错,会错在: 如果后来发现算法创新(而非硬件与数据)才是主要瓶颈, 这个「三条线汇合」的叙事就会夸大产业的作用——但 2012 年这个具体节点的成因, 原书与我们的判断一致。

原书还补了一句态度,放在导论里有点意外但很诚实: 尽管有各种末日预言,「我们生活和职业中最具创造性、最有目的性的部分, 在很长时间里仍将独属于人类」8。这是一本实操书的作者们给读者的预期管理。原书也刻意不谈 AGI(即通用人工智能:能做人类能做的一切智力工作的那种系统)的宏大叙事,专注能跑的小项目。

5. 这是谁写的:一群物理学家和他们的显微镜

七位作者,六位来自瑞典(哥德堡大学、查尔姆斯理工、卡罗林斯卡医学院),一位来自西班牙9:

作者背景
Giovanni Volpe哥德堡大学物理系教授,软物质实验室负责人;写了 DeepTrack(显微)、Deeplay(深度学习)等开源库
Benjamin Midtvedt哥德堡大学博士,方向就是「用深度学习增强显微镜」;DeepTrack 和 Deeplay 的主力开发
Jesús Pineda哥德堡大学物理博士,深度学习与计算机视觉(让机器看懂图像)交叉;DeepTrack/Deeplay 核心开发
Henrik Klein Moberg查尔姆斯理工博士,纳米流体显微与 AI 结合
Harshith Bachimanchi哥德堡大学博士,全息显微 + 深度学习研究海洋微生物
Joana B. Pereira卡罗林斯卡医学院副教授,阿尔茨海默病生物标志物
Carlo Manzo西班牙 Vic 大学副教授,定量生物成像实验室负责人

这张表解释了全书项目为什么长这样。 数一数后面 15 章的项目名单: 光镊里的微球、疟疾血涂片、显微粒子定位、果蝇神经组织、量子点、细胞计数、 虚拟染色、全息↔明场转换、分子性质、颗粒物质模拟、细胞追踪、显微镜超分辨率、Lorenz 混沌—— 大半是显微镜和物理场景。这不是巧合,是作者群的研究日常。 对读者的影响是双向的:想拿深度学习处理科学图像的读者会得到罕见的高质量示范; 想只学「互联网场景」(推荐系统、对话机器人)的读者要自己迁移。

利益相关声明: 原书全程使用作者自己维护的 Deeplay 库(以及 PyTorch 和 Lightning)10。 书里对它的用法没有藏私——每个用 Deeplay 的地方,前面几乎都有一遍手写等价物。 但我们引数据集、比较方法时,要记得「这个库是作者自己的」这一层。

6. 全书地图:14 章怎么组织、按什么顺序读

原书自己把结构说得很清楚11:前两章是地基,必须按顺序读; 中间各章由浅入深、依次进阶;最后三章相对独立,是补全视野用的。 我们比照原书结构,拆成 16 章(导论独立成章,结论并入末章):

我们的书原书一句话
01 导论导论本章
02 单个神经元ch1 前半训练到底在做什么
03 从神经元到深度网络ch1 后半「深」字的实际含义
04 回归与训练工程ch2三份数据、过拟合、数字孪生
05 卷积ch3图像怎么进网络
06 编码器-解码器ch4压缩、去噪、生成、查异常
07 U-Netch5逐像素的图像变换
08 自监督学习ch6没有标注时,监督信号从对称性里来
09 循环神经网络ch7网络的记忆
10 注意力与 Transformerch8动态决定看哪里
11 生成对抗网络ch9用博弈定义「像不像」
12 扩散模型ch10加噪容易去噪难
13 图网络ch11没有网格的数据怎么做卷积
14 主动学习ch12标注预算花在刀刃上
15 强化学习ch13试错、奖励与决策
16 储层计算 + 结论ch14、结论不训练的网络怎么预测混沌

推荐读法: 01–04 顺序读,这是全书唯一的硬依赖链; 05 起每章自带前置回顾,可以按需跳读; 和系统教材(比如按数学体系组织的《神经网络与深度学习》)比, 这本书不追求覆盖全,追求每章结束时读者手里有一个能跑、能改的东西—— 拿它建第一遍的工作心智模型,缺的理论细节再去教材里补,是它设计出来的用法。

7. 可带走的

  1. 入门判据:会写 for 循环就能开始,数学按需补,原书承诺在直观层面引入;
  2. 人工智能 ⊃ 机器学习 ⊃ 深度学习,三层的包含关系,「深」指网络层数;
  3. 2012 年 AlexNet 赢 ImageNet 是行业转折点,燃料来自游戏显卡和社交网络数据;
  4. 作者是一群显微镜方向的物理学家,所以全书项目偏科学成像——这是资产也是视角局限;
  5. 原书用作者自己的 Deeplay 库,好在每个用法前有手写等价物,读时要记得这层关系;
  6. 读法契约:读者出代码、书出讲解,01–04 硬依赖,05 起可跳读;
  7. 这本书与系统教材、理论原典是三种互补的入口:速成建模型、教材补体系、原典抠证明。

8. 原文地图

主题原书章原文位置
入门判据(for 循环)INTRODUCTIONtext/08-fm-introduction.txt:28(搜「write a for loop」)
数学要求(高中起点)INTRODUCTIONtext/08-fm-introduction.txt:32(搜「high school」)
AI/机器学习/深度学习定义INTRODUCTIONtext/08-fm-introduction.txt:10(搜「performing cognitive tasks」) · text/08-fm-introduction.txt:12(搜「decision trees」) · text/08-fm-introduction.txt:14(搜「hence the term deep」)
2012 转折与动力INTRODUCTIONtext/08-fm-introduction.txt:16(搜「AlexNet」)
「仍独属于人类」INTRODUCTIONtext/08-fm-introduction.txt:18(搜「uniquely human」)
动手导向、无先修要求INTRODUCTIONtext/08-fm-introduction.txt:20(搜「without assuming any prior knowledge」)
边写代码边学INTRODUCTIONtext/08-fm-introduction.txt:38(搜「best way to learn deep learning is by coding」)
工具栈(PyTorch/Lightning/Deeplay)INTRODUCTIONtext/08-fm-introduction.txt:40(搜「Deeplay」)
GAN/扩散需要 GPUINTRODUCTIONtext/08-fm-introduction.txt:52(搜「without a GPU」)
代码库INTRODUCTIONtext/08-fm-introduction.txt:56(搜「DeepLearningCrashCourse」)
14 章结构(前三章地基/末三章独立)INTRODUCTIONtext/08-fm-introduction.txt:90(搜「final three chapters」)
七位作者背景About the Authorstext/03-fm-about-the-authors.txt:4(搜「Soft Matter Lab」) · text/03-fm-about-the-authors.txt:14(搜「Karolinska」) · text/03-fm-about-the-authors.txt:16(搜「Quantitative Bioimaging Lab」)

Footnotes

  1. 出处:「INTRODUCTION」第 28 段(text/08-fm-introduction.txt:28,搜「write a for loop」)。原文:「If you know how to write a for loop and define a function, you're ready to start.」 2

  2. 出处:「INTRODUCTION」第 52 段(text/08-fm-introduction.txt:52,搜「without a GPU」)。原文说大多数例子几分钟跑完,贵的几小时;GAN 和扩散模型没有 GPU 「become too computationally expensive」。

  3. 出处:「INTRODUCTION」第 38 段(text/08-fm-introduction.txt:38,搜「best way to learn deep learning is by coding」)。

  4. 出处:「INTRODUCTION」第 32 段(text/08-fm-introduction.txt:32,搜「high school」)。原文承诺「introduce the necessary concepts you need at the intuitive level as we go along, without overwhelming you with too much mathematical notation」。

  5. 出处:「INTRODUCTION」第 56 段(text/08-fm-introduction.txt:56,搜「DeepLearningCrashCourse」)。仓库地址 github.com/DeepTrackAI/DeepLearningCrashCourse(查阅于 2026-08-27),每章文件夹含代码与数据。

  6. 出处:「INTRODUCTION」第 10 段(text/08-fm-introduction.txt:10,搜「performing cognitive tasks」)、第 12 段(text/08-fm-introduction.txt:12,搜「decision trees」)、第 14 段(text/08-fm-introduction.txt:14,搜「hence the term deep」)。

  7. 出处:「INTRODUCTION」第 16 段(text/08-fm-introduction.txt:16,搜「AlexNet」)。原文把革命归因于「fueled by gamers and social networks」,并说 2012 年 AlexNet 赢下 ImageNet Large Scale Visual Recognition Challenge 是转折点。 2

  8. 出处:「INTRODUCTION」第 18 段(text/08-fm-introduction.txt:18,搜「uniquely human」)。

  9. 出处:「About the Authors」第 4 段(text/03-fm-about-the-authors.txt:4,搜「Soft Matter Lab」)、第 14 段(text/03-fm-about-the-authors.txt:14,搜「Karolinska」)、第 16 段(text/03-fm-about-the-authors.txt:16,搜「Quantitative Bioimaging Lab」)。

  10. 出处:「INTRODUCTION」第 40 段(text/08-fm-introduction.txt:40,搜「Deeplay」)。原书主用 PyTorch,辅以 Lightning 和 Deeplay。

  11. 出处:「INTRODUCTION」第 90 段(text/08-fm-introduction.txt:90,搜「final three chapters」)。原文:「The first two chapters provide a fundamental introduction to neural networks, assuming no prior knowledge—essential reading for those new to the field. Best studied sequentially, the following chapters progress through increasingly advanced topics... The final three chapters are more independent.」