跳到主要内容

Dive into Deep Learning — 书籍拆解

读到哪:未读。 readState 不是 read/partial 的书不能当锚

作者Aston Zhang、Zachary C. Lipton、Mu Li、Alexander J. Smola
版次持续更新(GitHub master @23d7a5ae,2026-08-23 取)
格式md | 文本源 raw
许可CC BY-SA 4.0
来源GitHub 仓库 d2l-ai/d2l-en @23d7a5ae markdown 源(作者团队在 GitHub 以 CC BY-SA 4.0 开放发布,2026-08-23 取)
清洗删页眉页脚 0 行、页码 0 行、断词接回 0 处

我们重写的拆解(0 章)

(还没写。拆解是这本书对我们的真正产出——底下的元数据只是索引。)

为什么收它

深度学习的开放教材,markdown 源、章节结构天然完整,是本书架里转码质量最好的一本。 讲义里要解释模型机制时可以直接锚到具体小节。

合法性

作者们以 CC BY-SA 4.0 在 GitHub 开放发布;上游 LICENSE 原文存在 library/dive-into-deep-learning/LICENSE.upstream。原始文本不入库。

它大概覆盖什么、不覆盖什么

覆盖:从线性回归到注意力/Transformer 的完整脉络,带可运行代码。 不覆盖:agent 架构、产品工程——那些在三个代码书架里。

它覆盖什么、不覆盖什么

(还没读到能下判断的程度。claims / notCovered 空着就是空着,不猜。)

怎么引用它

(依据: book=dive-into-deep-learning §Introduction)

章节名对不上会被 lab:validate 拦下;页码锚(§p.123)同样可用。

结构(168 段,共 3003k 字符)

章节规模
01Preface26.1k
02Installation6.1k
03Notation4.3k
04Introduction83.9k
05Data Manipulation22.6k
06Data Preprocessing7.2k
07Linear Algebra33.0k
08Calculus15.4k
09Automatic Differentiation18.0k
10Probability and Statistics43.9k
11Documentation4.6k
12Linear Regression32.3k
13Object-Oriented Design for Implementation21.4k
14Synthetic Regression Data11.7k
15Linear Regression Implementation from Scratch21.4k
16Concise Implementation of Linear Regression15.5k
17Generalization19.0k
18Weight Decay18.8k
19Softmax Regression25.3k
20The Image Classification Dataset12.3k
21The Base Classification Model9.4k
22Softmax Regression Implementation from Scratch13.4k
23Concise Implementation of Softmax Regression10.1k
24Generalization in Classification23.8k
25Environment and Distribution Shift33.0k
26Multilayer Perceptrons23.9k
27Implementation of Multilayer Perceptrons11.8k
28Forward Propagation, Backward Propagation, and Computational Graphs12.0k
29Numerical Stability and Initialization15.2k
30Generalization in Deep Learning16.7k
31Dropout17.8k
32Predicting House Prices on Kaggle17.6k
33Layers and Modules25.5k
34Parameter Management9.6k
35Parameter Initialization11.6k
36Lazy Initialization7.5k
37Custom Layers9.2k
38File I/O8.4k
39GPUs18.7k
40From Fully Connected Layers to Convolutions17.7k
41Convolutions for Images22.6k
42Padding and Stride15.8k
43Multiple Input and Multiple Output Channels14.2k
44Pooling14.9k
45Convolutional Neural Networks (LeNet)15.3k
46Deep Convolutional Neural Networks (AlexNet)28.8k
47Networks Using Blocks (VGG)14.2k
48Network in Network (NiN)12.0k
49Multi-Branch Networks (GoogLeNet)24.3k
50Batch Normalization44.7k
51Residual Networks (ResNet) and ResNeXt36.2k
52Densely Connected Networks (DenseNet)19.5k
53Designing Convolution Network Architectures25.3k
54Working with Sequences24.8k
55Converting Raw Text into Sequence Data12.5k
56Language Models16.3k
57Recurrent Neural Networks13.3k
58Recurrent Neural Network Implementation from Scratch26.7k
59Concise Implementation of Recurrent Neural Networks7.6k
60Backpropagation Through Time19.5k
61Long Short-Term Memory (LSTM)21.6k
62Gated Recurrent Units (GRU)15.3k
63Deep Recurrent Neural Networks12.8k
64Bidirectional Recurrent Neural Networks8.5k
65Machine Translation and the Dataset12.7k
66The Encoder--Decoder Architecture8.6k
67Sequence-to-Sequence Learning for Machine Translation34.5k
68Beam Search10.4k
69Queries, Keys, and Values11.2k
70Attention Pooling by Similarity12.8k
71Attention Scoring Functions29.9k
72The Bahdanau Attention Mechanism23.4k
73Multi-Head Attention18.4k
74Self-Attention and Positional Encoding18.4k
75The Transformer Architecture52.6k
76Transformers for Vision16.5k
77Large-Scale Pretraining with Transformers26.3k
78Optimization and Deep Learning11.4k
79Convexity21.0k
80Gradient Descent20.3k
81Stochastic Gradient Descent18.1k
82Minibatch Stochastic Gradient Descent28.9k
83Momentum19.2k
84Adagrad15.9k
85RMSProp7.8k
86Adadelta6.5k
87Adam12.3k
88Learning Rate Scheduling24.1k
89Compilers and Interpreters20.6k
90Asynchronous Computation12.4k
91Automatic Parallelism9.5k
92Hardware34.8k
93Training on Multiple GPUs20.6k
94Concise Implementation for Multiple GPUs12.1k
95Parameter Servers13.7k
96Image Augmentation18.2k
97Fine-Tuning15.6k
98Object Detection and Bounding Boxes5.9k
99Anchor Boxes42.8k
100Multiscale Object Detection9.0k
101The Object Detection Dataset8.8k
102Single Shot Multibox Detection31.9k
103Region-based CNNs (R-CNNs)12.5k
104Semantic Segmentation and the Dataset17.3k
105Transposed Convolution10.9k
106Fully Convolutional Networks15.6k
107Neural Style Transfer21.2k
108Image Classification (CIFAR-10) on Kaggle22.7k
109Dog Breed Identification (ImageNet Dogs) on Kaggle20.4k
110Word Embedding (word2vec)12.6k
111Approximate Training7.8k
112The Dataset for Pretraining Word Embeddings15.7k
113Pretraining word2vec11.7k
114Word Embedding with Global Vectors (GloVe)10.3k
115Subword Embedding10.0k
116Word Similarity and Analogy8.3k
117Bidirectional Encoder Representations from Transformers (BERT)27.2k
118The Dataset for Pretraining BERT18.9k
119Pretraining BERT13.1k
120Sentiment Analysis and the Dataset7.4k
121Sentiment Analysis: Using Recurrent Neural Networks9.7k
122Sentiment Analysis: Using Convolutional Neural Networks15.3k
123Natural Language Inference and the Dataset11.8k
124Natural Language Inference: Using Attention19.2k
125Fine-Tuning BERT for Sequence-Level and Token-Level Applications9.7k
126Natural Language Inference: Fine-Tuning BERT16.7k
127Markov Decision Process (MDP)7.2k
128Value Iteration14.7k
129Q-Learning13.4k
130Introduction to Gaussian Processes17.9k
131Gaussian Process Priors15.6k
132Gaussian Process Inference30.3k
133What Is Hyperparameter Optimization?15.4k
134Hyperparameter Optimization API13.2k
135Asynchronous Random Search10.9k
136Multi-Fidelity Hyperparameter Optimization12.2k
137Asynchronous Successive Halving10.0k
138Generative Adversarial Networks19.9k
139Deep Convolutional Generative Adversarial Networks24.4k
140Overview of Recommender Systems6.2k
141The MovieLens Dataset9.3k
142Matrix Factorization10.7k
143AutoRec: Rating Prediction with Autoencoders7.4k
144Personalized Ranking for Recommender Systems6.8k
145Neural Collaborative Filtering for Personalized Ranking14.2k
146Sequence-Aware Recommender Systems13.2k
147Feature-Rich Recommender Systems7.1k
148Factorization Machines7.6k
149Deep Factorization Machines7.0k
150Geometry and Linear Algebraic Operations39.6k
151Eigendecompositions22.2k
152Single Variable Calculus26.1k
153Multivariable Calculus43.7k
154Integral Calculus21.7k
155Random Variables44.0k
156Maximum Likelihood15.0k
157Distributions27.5k
158Naive Bayes20.1k
159Statistics33.0k
160Information Theory40.9k
161Using Jupyter Notebooks6.1k
162Using Amazon SageMaker5.4k
163Using AWS EC2 Instances10.7k
164Using Google Colab1.3k
165Selecting Servers and GPUs9.8k
166Contributing to This Book8.2k
167Utility Functions and Classes44.9k
168The d2l API Document2.9k

我们自己的读书笔记(0 篇)

(还没有。读完某章后写进 docs/dive-into-deep-learning/notes/,那才是这本书对我们的产出。)


本页由 node scripts/book-build.mjs 生成:表格来自转码结果,散文来自书卡正文。不要手改本页。