跳到主要内容

这本书讲的是深度学习 —— 不靠人一条条写规则,而是让机器从大量例子里自己把规律找出来的那一套方法。

神经网络与深度学习(第二版)— 全书拆解

1. 30 秒导读

这本书回答一个很具体的问题:一件人做得到、却说不清自己怎么做到的事,机器能不能学会?

比如认手写数字。你一眼就能认出那是 5,但你说不出「5 长什么样」的规则, 所以也写不出程序1。这本书的全部内容,都是在把「说不清」这件事变成一件能算的事。

它的办法朴素得出奇:给机器一道题 → 看它答得离正确答案差多远 → 把它内部的每个数 朝「差得少一点」的方向挪一丁点 → 换下一道题。重复几万亿次。

被挪动的那些数,叫参数——它们是机器内部可以被拧动的旋钮。 一个现代系统里有几千亿个。没有人告诉它规则,规则是这么试出来的副产品。

这套做法有个学科名字叫机器学习:从有限的观测数据里"猜"出一般性的规律, 再用这些规律去预测没见过的数据。

它是人工智能这门更老的学科在六十年里换到的第三种信念—— 前两种是「人来写规则」和「专家来灌知识」,都撞过墙。

真正让人一次次撞墙又一次次爬起来的,是同一件事:规律藏在哪一层,以及怎么把它挖出来。 这本书用十六章外加一份数学附录回答这件事。

「神经网络」这三个字指什么

神经网络就是这本书里那台机器的具体长相:一堆很简单的小零件, 每个零件把收到的几个数加权求和、再过一道弯,然后把结果传给下一批零件。

零件之间的连接强度就是上面说的那些旋钮。它受生物神经系统启发而来, 但它不是在模拟大脑——书里明确把它当成「一个由旋钮控制的复杂函数」来用。

谁该读它: 想真正搞懂这一行、而不是只会调库的人。 它是教科书,不是入门读物:每一处结论后面都有推导。 但我们这份拆解默认你什么都不知道——包括那份数学附录,我们把它拆成了最前面三章。

2. 这是谁在什么时候写的

作者邱锡鹏,复旦大学。这是第二版,2026 年在他自己的网站上公开发布,免费下载。

成书时间是理解这本书的关键。 第一版写在这一行刚站稳脚跟的年代; 第二版把 2018 年之后的事整个写进了主线。

那件事就是大语言模型——在海量文本上练出来、旋钮以百亿计的那一类系统。 以及围绕它长出来的一整套东西:怎么让它听懂指令、怎么让它答得让人满意。

再往前一步是智能体:以这类系统为大脑,再配上工具、外部记事本和计划机制的一整套装置。 它不只回答,还会去做事。

所以这本书其实有两种保质期。 前面那些章讲的是不会过期的东西—— 求导、算账、结构设计、怎么把学习过程跑起来;后面三章是一份 2026 年的技术现状快照, 读的时候要分开看。

利益相关:没有。 这是一本作者自己免费发布的高校教材,不推销任何产品或工具。 书里介绍具体工具时明确说明「采用与框架无关的数学形式」,不绑定任何一家。

还有一件事要先说清: 这本书是同一位作者 2026 年那套四本书里的一本, 四本内容互有重叠。哪本适合你,写在第 5 节。

3. 全书一条主线

下面十四步是这本书真正的骨架。只读这一节、不看任何一章,你也能把这本书讲给别人听。 每一步只回答一件事:上一步的结论逼出了什么新问题,这一步怎么回答。

① 人做得到却说不清的事,只能给例子

认字、听话、看图,这些事人做得又快又好,却说不出规则。 于是换个路子:不写规则,改成给机器看大量「题目 + 答案」,让它自己去凑。

第一个坎马上就来了:题目得先变成机器能算的东西。 一张照片要变成一串数,一句话也要变成一串数。这一串数里的每一项,叫一个特征—— 比如一个芒果的颜色、大小、产地各占一项。

② 这一串数是谁定的,决定了上限

早年这一串数是人手工设计的:该量颜色还是量纹理,靠经验拍。 结果是力气全花在这一步上,而且模型再好也超不过这串数本身携带的信息2

于是有了整本书里第一个真正重要的转向:能不能让机器自己决定该看什么。 一种颜色可以用「第 137 号颜色」这样一个只有一位是 1 的长串来记, 也可以用红绿蓝三个数来记。

后者短得多,还能算出「中国红」离「红」比离「黑」近。 把前者变成后者的那一步,行话叫嵌入。

③ 「学」这个动作,拆开只有四步

给一道题 → 看答得差多远 → 把每个旋钮朝差得少一点的方向挪一丁点 → 换下一道题。 这一整套重复的过程叫训练

「差多远」得先能算成一个数,这个数叫损失。 损失怎么定,直接决定了机器会朝哪个方向努力——这本书后面四个不同的做法, 判断规则一模一样,差别只在这个数怎么写。

④ 往哪边挪:一个坡度就够

站在山上蒙着眼睛下山,你不需要看见全景,只需要知道脚下这一小步哪边更低。 这个「哪边更低」的方向,数学上叫梯度

问题在于旋钮有几千亿个。逐个去试,试一遍的代价是平方级增长的——根本不可能。 后面第 11 章会讲那个让这件事在计算上成立的办法:算一遍正向、再算一遍反向, 几千亿个方向就全出来了。

⑤ 训练集上做得好,一点也不算数

一个模型在做过的题上考 99 分、在没做过的题上考 72 分,它什么也没学会, 只是把答案背下来了。

在没见过的数据上还成立,这个能力叫泛化,是全书唯一真正的目标。

于是所有事情都要重新算账:同一套数据要切成三份、复杂的模型要交税、 错误要拆成「本来就学不到」「学得不够」「换一批数据就抖」三块分别治。

⑥ 表示能力有了,训得动吗

把简单的部件摞起来,理论上能逼近几乎任何一件事。 但能表示不等于能训出来——这是全书最大的一次转折。

摞得深了会出三种死法:起点撒得不对、中间层的数值越走越偏、把训练集背了下来。 三种病因不同、药也不同(第 17、18、19 章分别讲)。

这件事很大程度上决定了这一行的实际进度:同一个结构,五年前训不动、五年后训得动, 变的往往不是结构,是这些配套的手段。 把「找到一组够好的旋钮」变成一门手艺的这个过程,统称优化—— 就是「在一大堆可能的取值里,想办法找出让目标最好的那一组」。

⑦ 结构就是先验:你告诉它该往哪儿看

同样是摞层,怎么连线决定了它天生擅长什么。 图片里相邻的像素相关、同一个花纹会出现在不同位置——把这两件事直接写进连线方式, 旋钮就能少几个数量级,效果还更好。

句子则是另一回事:它是一个序列——有先后顺序、长度还不固定的一串东西。 给网络加一条通向自己的回路,它就能把「刚才说过什么」带到下一步,但只带得动一小段。

⑧ 让每个位置直接够到每个位置

回路的问题在于信息要一步步传,传远了就散了。 于是换个想法:让每个位置直接去看其他所有位置,按「跟我多相关」加权取一点回来。 这套动态决定该看哪儿的机制叫注意力

代价很直白:任意两个位置一步可达,但要为每一对位置算一个分数, 一段话一长,这张分数表就撑不住。

⑨ 一套模板统一了几乎所有和顺序有关的任务

把上一步那个机制、位置信息、逐位置的加工、直连边和几件让数值稳住的手段组织成 一个可以反复堆叠的块,就得到了 Transformer——现在几乎所有语言系统的底座。

它的成功不只在于那个机制本身,更在于它给出了一种统一、可堆叠、能同时开算的组织方式。 从此往后,这一行的进展很大一部分变成了「同一个骨架,把内部每个零件重新设计一遍」。

⑩ 不靠人标答案也能学

前面所有步骤都假设有人把答案标好了。可互联网上的文本、图片是海量的, 人工标好答案的那部分是稀缺的。

能不能让数据自己给出答案? 能:遮住一个词让它猜、给前半句让它续、 把同一张图裁两次让它认出这两块是一家的。这类做法叫自监督

这一步是量变到质变的开关。规模一上去,同一个模型不必为每个任务重训, 换个说法就能干新活——而且这种提升在很宽的范围内可以预测(第 31 章讲那条规律和它的最优配比)。

⑪ 会答不等于答得好

在海量文本上练出来的东西,本质上只是个「续写器」:你问它中国的首都在哪, 它可能接着给你出一道题。让它听懂指令、好好回答,是另一个阶段的事。

再往后还有一层更难的:什么叫「答得好」?有用、诚实、无害之间怎么权衡? 这件事写不出标准答案,只能让人去比较两个回答哪个更好,再把这种比较变成可以优化的目标。 这一整段工作叫对齐。

⑫ 另一条并排的路:不去逼近一件事,而去学「数据是怎么长出来的」

到这里为止,所有模型做的都是同一件事:给定输入,给出输出。 另有一条并排的路子:直接学「这批数据是怎么被生出来的」,然后自己生一批新的。 这类模型叫生成模型

四种主流做法形式差得很远——有的先压到一个低维空间再放回来,有的让两个网络互相较劲, 有的把一张图一点点糊成噪点再学着一步步擦干净,有的干脆学一个把噪点"流"成数据的方向场。

但它们做的是同一件事:把一团随机噪点变成像真数据的东西(第 37、38 章)。

⑬ 从「答一道题」到「做一件事」

再往前一步,系统不再只是回答,而是要在环境里连续做事:查资料、跑代码、看结果、改计划。 这就要求它能从「做了之后的结果」里学,而不是从标好的答案里学—— 反馈往往还来得很晚,下完一整盘棋才知道输赢。

这一类学法叫强化学习。 它同时是两件事的地基:让机器玩游戏、控制机器人, 以及——把「人更喜欢哪个回答」变成可优化目标的那套对齐技术。

⑭ 还有一套平行的语言

全书讲到这里用的都是「逼近一件事」的说法。但同一批内容还可以用另一套语言重讲一遍: 把每个说不准的量看成随机的,用概率——一件事发生的可能性,取值在 0 到 1 之间—— 描述它们之间的依赖关系。

这不是换个说法而已。 一旦有一部分量根本看不见,前一套语言就说不下去了, 而这一套还能继续:先猜看不见的那部分是什么,再回过头更新旋钮。 后面五章(34~38)全都建立在它上面,现在的图像生成系统也是。

4. 章节地图

38 章分成七块。想按需读,先看你要解决哪一类问题。

打底:三章数学(01~03)

这三章是我们前置的。 原书把它们放在附录,但从正文第二章起就在承重使用—— 读者会在还不知道那些记号是什么的时候撞见它们。所以我们挪到了最前面。

它回答的问题
01一张图、一句话怎么变成一串数?这串数有多长、两串数有多像、哪些方向只被拉长不被转向
02蒙着眼睛怎么下山?坡度是什么、一串函数套一串函数怎么求导、有绳子拴着怎么办
03说不准的时候怎么算账?平均是多少、能飘多远、一条消息值多少、两种猜法差多远

没有基础也能读,遇到的生词都在当场解释。已经学过的可以跳, 但第 02 章第 4 节和第 03 章第 8 节后面天天用,建议至少扫一眼。

机器学习的语言(04~09)

这一块建立起后面所有章节共用的说法:什么叫样本、什么叫模型、 怎么判断「学得好不好」、怎么判断「是不是真学会了」。

它回答的问题
04这一行六十年里换过哪三次信念?为什么「该看什么」是真正的瓶颈
05一次完整的学习由哪五个零件组成?缺一个会怎样
06一条直线怎么被拟合出来?四种看起来完全不同的解法为什么是同一件事
07训练集 99%、验证集 72% 是怎么回事?错误能拆成哪三块
08100 个样本里只有 1 个属于我们要找的那类时,准确率为什么一文不值
09四个最基础的判别做法差在哪儿?只差那个「差多远」怎么写

神经网络的主体(10~22)

这是全书篇幅最大的一块,也是「神经网络」这三个字真正被讲透的地方。

它回答的问题
10把简单部件摞起来会怎样?为什么中间必须夹一道弯
11几千亿个旋钮怎么可能一次算清各自该往哪挪
12那道弯该长什么样?为什么换一个就能让很深的网络训得动
13图片凭什么不能一股脑全连上?只连相邻一小块、全图共用同一组旋钮能省多少
14从第一个能上生产的模型到二〇一五年那次突破,每一次结构改动到底改的是哪一件事
15怎么让网络记住「刚才说过什么」
16为什么间隔一拉长就学不动?三个软开关怎么救回来
17旋钮特别多的时候,真正卡住训练的是什么?十来种做法各治哪一种病
18起点该怎么撒?为什么把中间层的数值拉回来这么管用
19那些不能被自动调的设置怎么搜?七种让模型别把训练集背下来的办法
20一串数装不下一篇文章,怎么办
21一段文字进去、下一个词出来,中间到底经过了什么
22当模型更深、能看的历史更长、同时服务的人更多时,这套模板的每个零件被怎么重新设计了

别的结构、别的学法(23~30)

它回答的问题
23排不成网格的数据(社交关系、分子、引用网络)怎么办
24上面那套怎么搬到这类数据上?搬过来之后会遇到哪三个绕不开的问题
25完全没有答案的时候,能学出什么
26怎么知道「数据长什么样」、怎么判断「哪些该算一类」
27让数据自己出题、自己给答案,有哪四类做法
28手上已经有的知识怎么复用到新任务上?六种办法各自的收益和风险
29只知道最后输赢、不知道每一步对不对时,怎么学
30能不能跳过「先估价值」,直接学「该怎么做」

大模型这一段(31~33)

保质期最短的三章,但也是眼下最要紧的三章。

它回答的问题
31文本怎么切、规模怎么配、拿到一堆可能性之后怎么挑下一个词
32从「会续写」到「会回答」再到「答得好」,中间隔着哪三道工序
33让它去做事而不只是说话,需要补上哪六件东西

另一套语言与生成(34~38)

它回答的问题
34一百个是非题一起考虑有多大?怎么用一张图把它拆开
35看见了一部分想知道另一部分,精确算不动时有哪三条退路
36用「能量」定义一件事的可能性是什么意思?它在历史上起了什么作用
37生成的两条早期路线各自的机理和病根
38一步太难就分成一千步:现在的图像生成系统是怎么工作的

推荐顺序

第一次读: 01 → 03 →(跳过 02 的后半)→ 04 → 05 → 07 → 09 → 10 → 11 → 13 → 15 → 20 → 21 → 31。 这条线是一条完整的故事,读完就有了全局。

要动手做事: 加读 12、17、18、19(训得动),以及 22、32、33(用得上)。

要做研究或读论文: 补齐 02 全章、06、24、25、27、28、29、30、34~38。 其中 34、35 是理解 37、38 的前提,别跳。

5. 覆盖什么 / 不覆盖什么

先说清这四本书什么关系

这本书是同一位作者 2026 年那套四本里最大、最硬的一本。四本内容互有重叠,不是四个部分。

你的情况该读哪本
想真正搞懂原理、看得懂推导就是这本(教科书全本,数学密度最高)
只想知道这一行在干什么,不想碰公式《神经网络与深度学习(通识版)》——同一件事讲给非专业读者
想跟着敲代码、把东西跑起来《案例与实践》——这本书的配套实操
只关心大模型和智能体这一段《大模型与智能体》——题材最新,工程细节最多

四本各自独立完整,能单独读。 所以「什么是神经网络」这类概念在每本里都会重讲一遍, 这是有意为之,不是缺陷。这份指路只是不让你拿错书,不产生任何依赖。

这本书讲透了什么

推导链条完整。 每一处结论后面都有过程。它讲的不是「有这么个东西」,而是「为什么只能这样」。

把大模型写进了主线。 怎么在海量文本上先练一遍、怎么让它答得让人满意、 怎么让它多想几步再回答、怎么让它去做事——各占一节到一章,不是附录。

另一套语言给得很足。 概率图模型、变分推断、随机模拟、能量模型、四种生成路线, 这是很多同类教材缺的一大块。

坦白的地方多。 平坦最小值和泛化的关系「都是经验性的,并没有很好的理论证明」、 「能力好像突然冒出来」可能是评估口径造成的假象、对比散度是有偏近似——这类坦白比结论更值钱。

这本书不覆盖什么

具体框架怎么写。 书里明确说采用与框架无关的数学形式,一行可跑的代码都不给。

怎么把训练铺到几千张卡上。 怎么切开同时算、卡与卡之间怎么通信、断点续训,都不讲。

数据工程的实操。 清洗、去重、配比只给原则,不给做法。

模型压缩与在手机上跑。 只在扩展阅读里点名。

可解释性、因果推断。 书里明确说有向图的箭头默认不读成因果。

治理与法规的制度层面。 只在智能体那一章涉及工程边界:权限、留痕、回滚。

还有一条时间界:第二版落款 2026 年。 这之后的进展它给不了。

6. 我们的判断

判断(我们的,不是书里的):这本书最大的价值不在于它讲了多少模型, 而在于它反复演示了同一个动作——把一个含糊的要求,变成一个能被算出来的目标。

「学得好不好」变成一个数、「别太复杂」变成一个惩罚项、「答得好」变成两个回答的比较、 「像真数据」变成两堆样本之间的距离。这本书真正在教的是这个转换动作,模型只是它的产物。

如果错,会错在: 有可能这只是我们读出来的组织方式,而作者本意是按知识分类来组织的。 但书里那张「三个知识域」的关系图3支持我们这种读法。

判断(我们的,不是书里的):这一版最值得注意的改动,是它把「训不训得动」 从一个工程细节提到了和「能不能表示」同等的位置。

早就有定理说了「够宽就能逼近」,可这一行卡了二十年。真正的转折不是找到了更强的结构, 而是攒够了让很深的网络训得动的手段:换那道弯的形状、把中间数值拉回来、给回传留直连边、 自适应地调步长。第 12、17、18 三章讲的都是这件事。

如果错,会错在: 结构本身的贡献可能被我们低估了——直连边既是训练手段也是结构改动, 两者本来就分不开。

判断(我们的,不是书里的):第 31~33 章是全书里最该记着成书年份读的三章。

它们写得很实在,但描述的是 2026 年的状态。里面每一条具体做法——用哪种偏好优化、 能看多长的历史、做事的系统该怎么搭——都在快速变化。

不变的是它给出的那个提问框架: 反馈从哪来、样本从哪来、错会怎么累积、边界在哪。

如果错,会错在: 也可能某几条做法会稳定下来成为长期标准,那这三章的保质期就比我们估的长。

判断(我们的,不是书里的):书里最需要读者自己补一句的地方,是那个「能力突然出现」的说法。

书里已经很克制地写了这有可能是评估口径造成的统计假象, 但这句话的分量容易被前面那一长串能力清单盖过去。 我们的读法是:先把它当成一个观测到的现象,而不是一条机理。

如果错,会错在: 如果后续研究给出了机理层面的解释,那这条谨慎就显得多余了。

7. 兑现表

正文里每一处往后指的话,都在这里记一行。全书写完逐行核过两件事:那一章真的讲了吗? 讲的是不是许诺的那件事,而不是同名的另一件事?

许诺在哪应兑现在哪
index.md §3 ④「让这件事在计算上成立的办法,第 11 章讲」11 §3~§5「怎么往回传」
index.md §3 ⑥「三种死法,第 17、18、19 章分别讲」17 §3 · 18 §3 · 19 §6
index.md §3 ⑩「那条规律和它的最优配比,第 31 章讲」31 §9
index.md §3 ⑫「四种做法,第 37、38 章」37 §4~§12 · 38 §3~§12
index.md §4「第 02 章第 4 节后面天天用」02 §6「一串函数套一串函数怎么求导」
index.md §4「第 03 章第 8 节后面天天用」03 §10「用错的猜法要多花多少」
01 §7「第 16 章会拿真数字走一遍」16 §3
01 §9「第 38 章讲那条路线时会用到另一面」38 §11
01 §10「第 02 章判断一个平点是不是谷底」02 §5
02 §9「第 09 章那条结论正是从这里读出来的」09 §8
03 §5「语言模型逐字预测的数学就是这条拆解;从清单里随机抽一个」27 §4 · 31 §3、§5
03 §5.1「第 34 章的概率图模型整章都在处理这件事(条件独立)」34 §6
03 §4「第 18 章第一次真正用到它」18 §3
04 §5「第 25 章会讲怎么做」25 §3
04 §3「这条经验规律,第 31 章会展开」31 §9
05 §7「第 06 章会在一条直线上完整推一遍」06 §3~§8
05 §8「训练调不到的那类数,怎么搜在第 19 章前半章」19 §3~§4
05 §7「这个差就是第 07 章的全部内容」07 §3~§7
07 §4「这里说的对象不是数据而是模型」07 §4 当场写明
09 §5「后面要靠一个惩罚项把它管住」19 §5
10 §5「中间那道弯为什么必需」12 §4~§9
11 §8「中间结果为什么必须存着」17 §4 · 22 §7
12 §8「它在整个架构里的落点」22 §4
13 §7「替掉顶上那一大块」14 §5
15 §8「代价是什么」16 §3
16 §8「把那条递推式拉直会通往哪儿」22 §6
18 §8「在第 21 章那套模板上更自然」22 §3
20 §10「代价是那张两两之间的分数表」22 §5 · 22 §6
21 §8「怎么挑下一个词、怎么切词,留到第 31 章」31 §5、§7
23 §7「层数决定看多远」24 §9
25 §8「这条路线的祖先」27 §3 · 36 §10
26 §7「取决于在什么空间里算距离」25 §3
27 §4「这条推导只在这里做一遍」31 §3 只回指不重讲
28 §9「不更新参数的隐式元学习」32 §4 · 33 §4
29 §10「连续动作交给第 30 章」30 §3
30 §10「把模型当策略来训练,对齐由此而来」32 §7
31 §10「这两个数是怎么做到的」22 §8
32 §6「这个自由度在后面的推导中将起到关键作用」32 §8
33 §7「那三类东西:谁决定它何时被用」书架锚 mcp-spec#03-server-primitives.md
34 §11「后续四章的生成路线都能放进这个框架」37 §4~§5 · 38 §3
35 §8「摊销变分推断正是 VAE 的核心思想」37 §5
36 §4「和第 31 章那个旋钮是同一个数学形状」31 §5
37 §8「隐空间紧凑性是第 38 章隐空间扩散的前提」38 §9
38 §12「四条路线放在一起看」回收 3738 全章

Footnotes

  1. 出处:「第2章 机器学习概述」第 19 段(text/03-ch02.txt:19,搜「对人来说很简单」)。 原文写的是「手写数字识别是一个经典的机器学习任务,对人来说很简单,但对计算机来说却十分困难」, 并进一步说明「我们很难总结每个数字的手写体特征,或者区分不同数字的规则」。

  2. 出处:「第1章 绪论」第 308 段(text/02-ch01.txt:308,搜「模型性能的上限」)。 原文:「很多时候,模型性能的上限并不是由分类器或回归器本身决定的,而是由特征是否有效决定的。」

  3. 出处:「第1章 绪论」第 802 段(text/02-ch01.txt:802,搜「三个彼此联系的知识域」)。 原书用一张关系图把机器学习、神经网络、概率图模型这三块摆在一起, 并说明「现代深度学习中的不少内容,特别是深度生成模型,恰恰处在这些知识域的交汇处」。