跳到主要内容

01-outline — little-book-of-deep-learning 章节切分

切分原则:按新词密度切,对着原书 8 章(1 Machine Learning / 2 Efficient Computation / 3 Training / 4 Model Components / 5 Architectures / 6 Prediction / 7 Synthesis / 8 Compute Schism + Missing Bits)走,把原书第 3、4 章按密度拆开。

12 章,每行「进来时以为…→出去时知道…」:

  1. 01-learning-from-data.md(原书 ch1)— 进来时以为「让机器学」是写一个聪明的程序 → 出去时知道:它其实是「收集例题 + 造一个带可调数的通用机器 + 定义什么叫答得好 + 把那些数调到最好」四件事;「容量 vs 数据量」决定它学到的是规律还是背诵;任务分回归/分类/密度建模三类。
  2. 02-compute-substrate.md(原书 ch2)— 进来时以为深度学习是数学问题 → 出去时知道:它首先是「把海量数据搬来对地方」的工程问题——GPU 为什么恰好合用、为什么一批和一条一样快、为什么一切都要装成张量。
  3. 03-losses.md(原书 §3.1–3.2)— 进来时以为「损失」就是答错扣分 → 出去时知道:损失是「能算梯度的替身」,按任务选型(均方/交叉熵/对比),还能加料(权重衰减);序列数据靠概率链式法则拆成「一次猜一个词」,交叉熵、困惑度、分词器各管一件事。
  4. 04-gradient-descent-backprop.md(原书 §3.3–3.5)— 进来时以为「训练」神秘 → 出去时知道:它就是「下山走一步看一步」加上一条让几百层各自的「该往哪挪」都能一次算清的记账法;为什么深度值钱、梯度为什么会消失、这笔账的算力和内存开销各是多少。
  5. 05-training-in-practice.md(原书 §3.6–3.8)— 进来时以为模型练到训练题全对就成了 → 出去时知道:训练集全对可能正是病(过拟合),要三套数据、学习率先大后小、拿现成模型改(微调);并且「越大越好」有幂律撑腰,大到一张卡装不下就拆开练(DDP/FSDP/流水线/张量并行)。
  6. 06-linear-layers.md(原书 §4.1–4.4 前半)— 进来时以为网络里装的是「神经元」→ 出去时知道:现代模型是标准「层」的复合;主力是仿射变换(全连接)与它的本地化版本(卷积),卷积靠「同一算子处处用」省参数还自带平移等变;池化、转置卷积、感受野各管什么。
  7. 07-layers-for-trainability.md(原书 §4.3 激活 + §4.5–4.7)— 进来时以为深网络堆起来就能练 → 出去时知道:堆深了练不动,是靠一批「不含知识、只为可训练性」的零件救回来的:激活函数给非线性、dropout 防团伙作弊、归一化层稳住尺度、残差连接给梯度留旁路。
  8. 08-attention.md(原书 §4.8–4.10)— 进来时听说「注意力」是大模型的心脏但很玄 → 出去时知道:它就是「每个位置拿一个提问向量去和全序列的钥匙向量对分,按分加权取回值向量」一件事;多头是并行多套;掩码让它只能看过去;词元嵌入与位置编码补齐「词怎么进机器、顺序怎么进去」。
  9. 09-architectures.md(原书 ch5)— 进来时以为 LeNet/ResNet/Transformer/GPT/ViT 是五个东西 → 出去时知道:它们是三种搭法(MLP、卷积塔、注意力塔)的代表作,各自回答「这一类数据的结构怎么变成层的排布」;ResNet-50 与原版 Transformer 各是一条能从头走到尾的流水线。
  10. 10-prediction.md(原书 ch6)— 进来时以为「应用」就是换个数据集 → 出去时知道:每类预测任务都是「任务结构 → 输出头 + 损失 + 复用前面哪种塔」的一次组装(去噪/分类/检测/分割/语音/图文对齐/打游戏)。
  11. 11-synthesis.md(原书 ch7)— 进来时以为「生成」和「预测」是两门手艺 → 出去时知道:文本生成就是第 03 章的自回归模型放大到千亿参数,再靠 RLHF 把「续写器」掰成「助手」;图像生成是学会逆转一个解析定义的加噪过程(扩散)。
  12. 12-compute-schism.md(原书 ch8 + Missing Bits)— 进来时以为「模型小了就跑不动、改不了」→ 出去时知道:算力分裂成「训得起的人 vs 用得起的人」之后,一整架省钱技术把使用权还给了个人:提示工程/思维链/RAG(不动参数)、量化、LoRA、模型合并;外加原书自认没写的五块(RNN/Mamba、自编码器/VAE、GAN、图网络、自监督)。

自查(任意两行「出去时知道」是否同一件事)

  • 03 的交叉熵 vs 04 的梯度:03 回答「什么叫答得好」,04 回答「知道了之后怎么调」,不同。
  • 06 卷积 vs 09 卷积塔:06 讲单个算子怎么算,09 讲算子怎么排成整机,不同。
  • 05 微调 vs 12 LoRA:05 讲「为什么要从现成模型出发」,12 讲「资源不够时怎么只动一小撮参数」,不同。
  • 11 RLHF 与 12 提示工程:11 是「改参数对齐」,12 是「不改参数引导」,不同。
  • 03 困惑度与 12 量化里的困惑度:03 定义它,12 只拿它当量化损表的读数,不同。

结论:无需合并。12 章,定稿按此写。