跳到主要内容

拆解大纲 — Deep Learning Crash Course

切分依据:原书 14 章 + 导论 + 结论。原书 ch1–2 是全书地基(必按顺序读),ch3–11 每章一个架构, ch12–14 相对独立(原书自己说的)。我们的章 1:1 对应原书章,只把导论独立成第 1 章、结论并入第 16 章。 「crash course」的定位=用最少的讲解量让读者做出能工作的东西,所以每章主走查都挑原书那条最小的具体输入。

对应原书主走查输入进来时以为 → 出去时知道
01-overview导论「学深度学习要什么基础?」进来以为学 AI 要先啃数学和论文 → 出去知道只需会写 for 循环;AI⊃ML⊃DL 三层套娃、2012 年 ImageNet 那一夜是分水岭、以及这本书「边写代码边学」的读法和全书地图
02-single-neuronch1 前半(单神经元)10 个 1D 数据点,1 个权重进来以为「训练」是玄学 → 出去知道一个神经元就是加权求和+门槛;训练=猜错就朝减小错误的方向微调这一个数;以及它为什么只能切一条直线
03-deep-networksch1 后半(激活函数/两层/三层/Project 1A)一张 2D 凸形散点图 → MNIST进来以为「深度」是营销词 → 出去知道一个隐藏层=用半平面拼形状,层数加一层能拼的形状复杂一阶;反向传播怎么把错误逐层分摊;从 0.67 到 0.97 的四步改进各改了什么
04-regressionch2(回归/批量/数据划分/Project 2A)光镊里一颗微球的位置→受力进来以为回归就是「拟合一条线」 → 出去知道分类和回归共享同一套训练机器,差别只在输出层;为什么要分训练/验证/测试三份;以及「网络学得比训练数据还准」是怎么回事
05-convolutionsch3(卷积/PyTorch/四个项目)9 个数的信号卷 [0.5,0.5]进来以为 CNN 是图像专属黑箱 → 出去知道卷积就是拿着小滤波器在数据上滑窗做乘加;滤波器从手工设计变成训练学出来;池化/上采样/卷积基+密集顶层的标准组装
06-encoder-decoderch4(编码解码器/去噪/VAE/WAE/异常检测)一张加噪的显微镜粒子图进来以为「输入=输出」的网络没意义 → 出去知道瓶颈是刻意压的:挤过去的东西逼网络学本质;潜空间是什么、怎么采样生成、怎么用它查异常
07-u-netch5(U-Net/分割)一张果蝇神经组织电镜图进来以为分割就是把图变糊 → 出去知道 U 形+跳连=把「是什么」和「在哪里」两条信息各走各的路再合并;分割其实是逐像素分类;IoU 怎么算
08-self-supervisedch6(自监督/LodeSTAR)一张单细胞裁剪图(无标注)进来以为没标注就没法训练 → 出去知道数据的对称性本身就是监督信号:平移图片,预测的位置必须跟着平移;一张图训练出十万张标注的效果
09-rnnch7(RNN/GRU/LSTM/seq2seq)耶拿气温序列,过去 2 天→明天中午进来以为神经网络没有记忆 → 出去知道隐藏状态就是记忆;为什么简单 RNN 输给「明天=今天」;门怎么解决记不住/忘不掉;seq2seq 的上下文向量瓶颈
10-attentionch8(注意力/Transformer/ViT)「she improved」指谁?进来以为注意力是 LLM 专属 → 出去知道它就是「按相关度打分再加权取用」;Q/K/V 各是什么;Transformer 靠并行取代循环;图也能切 patch 走同一条路
11-ganch9(GAN/条件 GAN/CycleGAN)一个 100 维噪声向量进来以为生成模型就是「背下训练集」 → 出去知道 GAN 用另一张网现场定义损失,生成器和判别器在博弈中共同变强;为什么训练难稳;不配对的图怎么换域
12-diffusionch10(扩散/DDPM/文生图/超分辨)一张手写数字,逐步加噪进来以为扩散模型是纯黑魔法 → 出去知道加噪是公式、去噪是网络;网络学的只是「这步加了什么噪声」;为什么同一噪声起点能生成不同图;CLIP 怎么把文字接进来
13-graph-networksch11(图卷积/消息传递/MAGIK)5 节点环图上 1 个「1」进来以为图数据没法做卷积 → 出去知道卷积被重定义为「沿边聚合邻居信息」;A@x 一步传一格;自环和归一化两处修正;边属性怎么进消息
14-active-learningch12(主动学习)200 个点里只能标 25 个进来以为标注越多越好 → 出去知道标注预算有限时「挑着标」胜过「随机标」;不确定性=模型最没把握的点;多样性怎么由判别器补上;3% 数据逼近全量
15-reinforcement-learningch13(RL/Q-learning/DQN)俄罗斯方块的一步落子进来以为 RL 是遥不可及的 AlphaGo → 出去知道 Q 值就是「这步以后总共能赚多少」的记账;查表版为什么被 26 万个状态压垮;双网络+经验回放怎么救
16-reservoir-computingch14+结论Lorenz 方程,初始条件差 0.000001进来以为所有网络都要训练 → 出去知道有一类网络储层完全随机冻结、只训一层读出;混沌系统只能预测到 Lyapunov 时间,但蝴蝶吸引子的形状学得会

自查记录

  • 两行「出去时知道」是否同一件事:逐行过了一遍。02(单神经元/一个权重)与 03(多层/深度)分层清楚; 04 的「三份数据/过拟合」与 02 的训练循环不重叠;06(潜空间压缩)与 11(对抗生成)、12(去噪生成) 是三种不同的生成路线,各章已点明互相的差别;09(RNN 记忆)与 16(储层记忆)一个是「训练出来的记忆」 一个是「白送的记忆」,16 章需明确对比——已写入大纲行。
  • 新词密度:每章一个架构族,内部再按小节分;预计配额压力最大的是 10(attention)和 12(diffusion), 写作时把 Q/K/V、softmax、公式细节各占独立小节。
  • 原书 ch12(主动学习)无 Seminal Works 小节(文件里没有),引用以正文与 summary 为准。