跳到主要内容

通识版 — 邱锡鹏把同一件事讲给不写代码的人

30 秒导读: 这本书回答一个问题——过去七十年里,人们试过让机器变聪明的两条路, 为什么最后赢的是那条看起来最笨的? 那条笨路叫深度学习(不写规则,只给例子,让机器自己把规律从例子里试出来)。 作者不假设你会编程、不要求你先修统计,也不打算让你记住任何公式。

它的价值不在「介绍了哪些技术」,而在于它把每一步的因果讲清楚了: 上一步的做法撞上了什么墙,下一步为什么只能那样绕。 读完你会有一张地图——知道每一个听起来吓人的名字,当初是为了解决哪个具体的麻烦才被造出来的。

书里那台被反复讨论的机器,是一堆极简单的小单元(每个只做一件事: 把送进来的几个数按各自的重要程度加起来,再过一道开关决定要不要往下传)层层连起来的, 这样一台机器就叫神经网络。这个名字来自人脑,但它和人脑的相似程度, 远比这个名字暗示的要低——书里花了一整节澄清这一点。

而这两年最出圈的那类产品,你打字它答话的那种,行话叫大语言模型。 它不是另起炉灶的新物种,还是上面那台机器,只是被放大了几万倍、 喂了几乎整个互联网的文字,并且只练一件单调的事:猜下一个词。

这份拆解和原书的关系: 我们不是翻译,也不是缩写。 原书默认你已经知道的东西(比如什么叫「一次前向计算」),我们当场补上; 原书一句带过、但你出门一定会撞见的名字,我们留着名字、把事情讲透。 全书二十七章,每章一条从头走到尾的走查,每一步旁边都有具体的数。

1. 这是谁在什么时候写的

作者邱锡鹏,复旦大学。同一位作者的教科书全本在国内高校用了很多年
版本2026 年版,作者在自己的官网上免费放出 PDF
定位作者原话:「这本书不假设你会编程,不要求你先修过统计学」1
篇幅绪论之后十五章,连绪论共十六章2
有没有利益相关作者是学院派研究者,书里对产业界的乐观说法多次点名保留态度

有一件事必须先说清楚,否则你读别的资料时会撞车。

英文里的 inference 这个词,中文世界有两种译法,而这两种译法指的其实不是一件事。 作者在书里专门立了一条规矩:统一译作推断,指一台机器学完之后被拿来使用的那个阶段; 另一个英文词 reasoning 才译作推理(解题、论证、做逻辑判断这一类思考能力)3

这份拆解照办。 你在别处看到「推理成本降低了十倍」,说的其实是这里的「推断」; 而你看到「推理能力更强的那一代」,说的才是解题那个意思。两个词全书各只有一个意思。

还有一件事影响你怎么读它。 这本书出的时候,这一行正处在变化最快的一段时期。 所以书里凡是涉及具体产品、具体公司、具体排名的段落,保质期都很短; 而讲机制、讲因果、讲边界的段落,保质期很长。这份拆解按后者的比重重写。

2. 全书一条主线

这一节是整份拆解存在的理由。 只读它、不看任何一章,你也应该能把这本书讲给别人听。 十六步,每一步都交代「上一步的结论逼出了什么问题,这一步怎么回答」。

第 1–2 步:规则写不完,于是改成给例子

① 请你定义猫。 你会发现无论写多少条规则都有例外:有的猫三条腿, 有的猫天生不会叫,斯芬克斯猫没毛。一个三岁小孩一眼就认得出, 却没有人能把他脑子里那套办法写下来。这就是第一条路撞上的墙:开放世界里的规则写不完。

② 那就换个办法:不给规则,给例子。 这条路后来有了自己的名字,叫机器学习—— 把规律从例子里找出来,而不是把规律写下来。它的做法朴素得出奇: 先摆一个带着许多可调旋钮的公式,把一张图的数值送进去,看它答得离正确答案差多远。

接着算一件事:每个旋钮往哪边拧一丁点,「差多远」这个数会变小? 这个方向有个名字,叫梯度(把某个旋钮拧一丁点,答案会跟着变多少)。 它是一个能被算出来的量,不是靠猜。

顺着梯度的反方向,每个旋钮都挪一小步,再换下一道题,重复几万亿次—— 这个笨到不能再笨的办法叫梯度下降。整件事里没有一条规则是人写的, 规则是「试出来的副产品」。(为什么几千亿个旋钮能一起拧,第 05 章讲。)

先钉住三个后面每章都会出现的词

上面那段话里有三样东西,后面每一章都会出现,现在先各给一句话。

那些可调的旋钮,行话叫参数(网络里那些会被一点点改动的数)。 一个网络有多少参数,基本决定了它能装下多少东西——你在新闻里看到的「千亿」「万亿」,数的就是它。

那台被拧到能用的机器,行话叫模型(输入一样东西、输出一个答案的那套固定算式,加上它当前这一套旋钮值)。 换句话说,同一个结构配不同的旋钮值,就是不同的模型。

把旋钮从随机状态拧到能用的整个过程,行话叫训练(反复喂例子、反复往回拧那些旋钮,直到它答得够准)。 训练很贵、很慢、很耗电;而训完之后拿来用的那一下,便宜得多。

第 3–4 步:叠起来,再按数据的结构接线

③ 一个公式不够,得叠起来。 一层只能画出一条分界线, 碰到「两个开关恰好一个打开时灯亮」这种交错的情况就无能为力。 把许多层叠起来就能画出复杂的边界,但有个前提:每一层之间必须拐一下。 这个「拐一下」叫非线性(输入翻倍,输出不跟着翻倍)。去掉它,叠一百层和一层完全等价。

④ 不同的数据有不同的结构,于是有了不同的接线法。 图像的信息藏在「谁挨着谁」里, 所以有一种接线法让每个单元只看一小块、并且全图共用同一套旋钮,这叫卷积。 文字的信息藏在「谁在谁后面」里,所以有另一种接线法让网络带着一份随时被改写的小笔记往前读。 结构本身就是一种先验——你选哪种接线,等于你先替机器信了世界有哪种结构。 (卷积那一小块具体怎么算,第 06 章讲。)

第 5–8 步:从一步步传,到任意两点直连

⑤ 但「带着小笔记往前读」有个死结。 信息要从句首传到句尾,得经过几十上百次改写, 一路衰减,传到结尾就看不清开头了。解法是掀桌子:不再一步步传, 让句子里任意两个位置直接对话——每个位置都去问一遍其他所有位置「你跟我有多大关系」, 按这个关系把别人的信息掺一点进自己这份里。这个机制叫注意力。 (那几个分数具体怎么算出来,第 09 章讲。)

⑥ 直接对话带来一个意外的红利。 一步步传的时候,第 100 个位置必须等第 99 个算完; 直接对话则可以让所有位置同时开算,这种「同时开算」叫并行(把一件大事拆成互不等待的小事一起做)。 显卡最擅长的恰好就是这个,所以「训一个很大的」第一次从不可能变成了可能。

把注意力和另外三个配套件打包成一块标准积木,反复堆几十层,就是今天几乎所有大机器的共同底座, 这块积木叫 Transformer。今天被叫做大模型(参数多到以千亿计的那一类)的东西, 几乎都是拿它反复堆出来的。

⑦ 堆到足够大之后,一条经验直线出现了。 参数、数据、投入的计算三样同步放大, 模型答错的程度会沿着一条相当稳定的曲线往下掉,而且掉多少事先能估。 这条经验规律叫规模法则。它不是物理定律,只是一条反复出现的曲线; 但正因为它可估,一家公司才敢一次性投几亿美元去训一个。(这条曲线长什么样,第 15 章讲。)

⑧ 放大之后,出现了没人预料到的能力。 有些任务在机器小的时候一直趴在零附近, 过了某个规模突然变得可用:算术、多步推导、照着三行例子就学会一条新规则。 这类现象叫涌现。它有争议——争的不是「大机器有没有这些能力」, 而是「分数曲线是不是真的跳变」。(争在哪里,第 17 章讲。)

第 9–12 步:从会说到会做

⑨ 但刚训完的东西并不好用。 它的目标只是「往下续写」,你问它怎么做水果派, 它可能接着写「这是一道传统甜点,在欧美家庭很受欢迎」。要把它变成助手,还得再教两件事: 先用几万条「指令-回答」教它按指令答话,再用人的偏好教它什么样的回答更好。 这一整段叫后训练(在已经练好的底子上再补的那几道工序)。 (它为什么必须分两步,第 16 章讲。)

⑩ 它仍然只会写字。 要真的订一张机票、改一个文件、跑一次测试, 得在它外面配一段程序替它动手,再把结果送回去让它决定下一步。 「大脑 + 手脚 + 记性 + 计划 + 反馈」这一整套,叫智能体。 (这一圈具体怎么转,第 19 章讲。)

⑪ 手脚一装上,新问题立刻出现:可靠性。 单步做对九成五听起来很高, 但一个任务要连着做二十步,整体做对的机会只剩三成六。 长任务会把小错误滚成大错,这是今天这一类系统最硬的一道坎。 (这条曲线怎么算、有哪几条路能打破它,第 20 章讲。)

⑫ 换个目标,同一套东西能造图。 把一张清晰的照片一步步撒上噪点直到变成雪花屏, 再练一台机器专门认出「哪些像素是后撒上去的」;认熟之后从纯雪花屏出发, 一点一点把噪点拂掉,一张从不存在过的图就长出来了。这条路线叫扩散。 (为什么绕这么大一圈反而更容易,第 21 章讲。)

第 13–16 步:走出屏幕

⑬ 再换个目标,它能同时看、听、说。 关键一步简单得意外: 把图像切成一块块小方格,每块当成一个「字」,和真正的文字排进同一队,交给同一台机器处理。 声音也一样——先把波形画成一张「时间×频率」的图,再切块。 一台能同时吃几种信号的机器,叫多模态

⑭ 再往外一步,它开始进实验室和物理世界。 在科学里, 它最擅长的是在巨大的可能空间里先帮人筛掉不可能的那几百万种; 在物理世界里,它要面对摩擦、重量、滑动这些屏幕上没有的东西, 这一支叫具身智能它们共同的难处是同一件:纸面上的知识不等于手上的经验。

⑮ 能力越强,两个面越大:攻击面和问责面。 一张熊猫照片加上一层肉眼看不见的噪点, 机器会以 99.3% 的把握说它是长臂猿;一位律师照着机器给的六个判例写了状子, 结果六个全是编的,被法院罚了五千美元。 前者是「它和我们看到的世界不一样」,后者是「它说得像真的,不等于是真的」。

⑯ 于是最后一个问题:这条路通向真正的通用智能吗? 这里说的是通用人工智能 (在几乎所有认知任务上都达到甚至超过人的水平)。分歧大到罕见—— 同一批顶尖研究者给出的时间表从「明年」到「永远不会」都有。 分歧的根源不是数据,是三件事:这个词各人指的不是同一层意思、 对「继续放大还管不管用」的信心不同、以及立场不同。 这本书不给答案,它给你判断这件事需要的全部背景。

3. 章节地图

二十七章分五段。如果你只想走一条最短的路:01 → 03 → 09 → 15 → 17 → 19, 六章读完,今天新闻里九成的说法你都能自己判断。

第一段:地基(01–04)

讲什么什么时候来读
01七十年里试过的两条路,以及笨办法为什么赢想知道「这一切从哪来」时先读
02三个常被混用的名字到底什么关系;什么叫一份好的记法紧接着 01
03「学会」这件事拆开来只有三步,加上一整套判断它有没有真学会的尺子全书最该反复读的一章
04深度学习之外那一柜子还在用的老办法想知道「什么时候不该用它」时读

第二段:结构(05–11)

讲什么什么时候来读
05最基础的接线法,以及为什么必须叠层承上启下,别跳
06专门处理图像的接线法:只看一小块、全图共用一套旋钮对图像感兴趣就读
07专门处理文字和语音的接线法,以及它的死结09 章的前提,建议连着读
08让训练不炸掉的那一整套配套件想知道「为什么等了二十多年」时读
09让任意两个位置直接对话的那个机制全书最承重的一章
10一块标准积木里的六步,反复堆就是今天那些大家伙紧接着 09
11文本一长就变慢变贵,到底贵在哪两笔账上关心成本和长文档时读

第三段:范式与语言(12–17)

讲什么什么时候来读
12没人标过答案的数据怎么用起来想知道「素材从哪来」时读
13没有标准答案、只有分数的那一类学习对下棋、机器人、后训练感兴趣就读
14机器眼里的文字不是字,是一串编号想搞懂那些「数不清字母」的怪错时读
15造一个大家伙要多少素材、多少卡、多少钱关心产业格局时读
16从只会续写到会当助手,中间加了哪几道工序紧接着 15
17能力从哪儿冒出来、边界在哪、怎么把话问对日常使用最用得上的一章

第四段:落地(18–24)

讲什么什么时候来读
18撑起这一切的钢与硅:卡、机柜、电、地想知道「为什么这么贵」时读
19给只会写字的东西装上手脚关心「AI 替我干活」时读
20装上手脚之后,为什么它还是不太靠得住紧接着 19,别跳
21一句话怎么变成一张从不存在的图对画图、视频感兴趣就读
22让同一台机器同时看、听、说紧接着 21
23它在科学研究里到底干的是哪一段活对科研感兴趣就读
24走出屏幕之后多出来的那些麻烦对机器人感兴趣就读

第五段:风险与远景(25–27)

讲什么什么时候来读
25看不见的攻击面:骗它、毒它、掏它做任何真实系统之前都该读
26问责、偏见、黑箱,以及「让它做我们真正想要的」紧接着 25
27这条路通向哪里,以及人在其中的位置最后读,也可以最先读

4. 覆盖什么 / 不覆盖什么

这本书讲透了的

  • 每一步的因果:每个机制先说它解决了哪个具体的麻烦,再说怎么做的。这是它最大的长处。
  • 时代坐标:七十年里的三次高涨、两次低谷,以及每一次转折背后的人和事。
  • 新题材:扩散、多模态、智能体、具身、AI 遇上科学、风险与治理,各占一整章。这几块在教科书全本里没有。
  • 诚实的边界:凡是有争议的说法,书里几乎都点了名。这在通识读物里少见。

这本书不覆盖的

  • 任何可以照着敲的代码。全书零代码——这是作者有意的选择,不是遗漏。
  • 「答错了多少」这件事怎么从最后一层一层倒推回去。书里只说「框架会自动帮你算」,不展开。
  • 能照着跑的配置。全书没有一张写着具体数值的配置表。
  • 图结构数据上的那一类网络。作者明说「本书不会深入讲」。
  • 把数据压小再还原那一类做法背后的数学。书里只讲直觉,不推公式。
  • 2026 年之后的进展。书里多处自称「写作本书时」,时间锚定在 2025 到 2026 年初。

这份拆解补了什么: 上面第 2、3、5 条,我们从三个代码书架里补了真实数字和真实代码位置—— 一层积木在真实实现里长什么样、一次真实训练里那个「每步迈多大」的数怎么变、 一次真实的后训练用了多少张卡。每一处都单独标了「补充(不在书里)」。

这四本是一套,别拿错

作者 2026 年出的这一套有四本,内容互有重叠,但每一本都能单独读完:

适合谁
教科书全本(第二版)要推公式、要考试、要做研究的人
通识版(就是这一本)不写代码、但想真正搞懂这件事的人
案例与实践想照着敲一遍、把东西真跑起来的人
大模型与智能体只关心最新那一段:智能体与工程落地

怎么挑: 你想要的是「看懂新闻、能自己判断」,读这一本就够; 想要「会推导」,去看全本;想要「会动手」,去看案例与实践; 只想追最新的智能体,去看第四本。四本里的重复是有意为之,不是缺陷。

5. 我们的判断

判断(我们的,不是书里的):这本书最值得学的不是内容,是它的讲法。 它反复用同一个套路:先摆一个你已经见过的现象,再问「那怎么办」,最后才给出名字。 名字永远是最后出场的东西。 如果错,会错在: 这个套路在讲「已经做成的事」时很顺, 但讲到还在吵的问题时会显得两边都对、读者拿不到落点。书里最后两章确实有这个毛病。

判断(我们的,不是书里的):全书最承重的一条链是第 5 到第 8 步—— 直接对话 → 能并行 → 敢放大 → 出现没预料到的能力。 这四步里抽掉任何一步,今天这一波都不成立。 其余章节精彩,但都可以看成这条链的延伸,或者它的后果。 如果错,会错在: 这个看法把结构设计的地位抬得很高。 另一派认为真正的转折是素材规模和工程效率,结构只是恰好合用; 书里对这两派都留了余地,我们这里站队了。

判断(我们的,不是书里的):书里最容易被读者误读的一处,是「涌现」。 读者很容易读成「规模一大,新能力会自己冒出来」, 从而推出「继续放大就会通向通用智能」。 书里其实已经点明了这个争议,但那一节放得比较靠后、语气也比较轻。我们在第 17 章把它前置并写重了。 如果错,会错在: 如果后续几年真的又出现几次清晰的能力跳变,那我们这一处的谨慎就显得过头了。

6. 兑现表

正文里每一处往后指的话,记在这里,逐行核过。

许诺在哪应兑现在哪核过没有
index §2 第 ② 步「为什么几千亿个旋钮能一起拧,第 05 章讲」05 §9「那 154 行代码」
index §2 第 ④ 步「卷积那一小块具体怎么算,第 06 章讲」06 §5「卷积到底在算什么」
index §2 第 ⑤ 步「那几个分数具体怎么算出来,第 09 章讲」09 §4「打分、归一、加权求和」
index §2 第 ⑦ 步「这条曲线长什么样,第 15 章讲」15 §5「那条改变了投资观念的直线」
index §2 第 ⑧ 步「争在哪里,第 17 章讲」17 §2「这个词有争议」
index §2 第 ⑨ 步「它为什么必须分两步,第 16 章讲」16 §5「光听指令还不够」
index §2 第 ⑩ 步「这一圈具体怎么转,第 19 章讲」19 §4「想、做、看:一圈一圈往前推」
index §2 第 ⑪ 步「这条曲线怎么算,第 20 章讲」20 §1「每步 95% 听起来很高」
index §2 第 ⑫ 步「为什么绕这么大一圈,第 21 章讲」21 §4「唯一要学的那一件事」
01 §1「怎么绕开这堵墙,第 03 章讲」03 §1「一套房子值多少钱」
02 §2「这个词在第 18 章还会再出现一次」18 §11「从训练时代到推断时代」
03 §6「怎么治,第 08 章讲」08 §9「把尖谷磨成宽谷」
05 §5「为什么换掉 S 形是分水岭,第 08 章讲」08 §1「那三十年到底卡在哪」
07 §8「怎么把这个死结解开,第 09 章讲」09 §1「那只猫没过马路,因为它太累了」
09 §10「这块掩码在第 10 章还要用一次」10 §9「同一块积木的三种搭法」
10 §4「顺序怎么补进去,下一节讲」10 §5「给每个位置一个签名」
11 §1「这两笔账各是什么,第 4 节讲」11 §4「长文其实有两张账单」
12 §9「这条路线第 21 章会全部展开」21 §3「把一张图慢慢毁掉」
13 §13「用在大机器上是什么样,第 16 章讲」16 §8「用人的偏好当分数」
15 §7「怎么组织、坏了怎么办,第 18 章讲」18 §7「三种把模型切开的办法」+ §8「故障是常态」
17 §11「这条曲线第 20 章会用具体数字算一遍」20 §1「每步 95% 听起来很高」
19 §11「坐标这一步在第 24 章还有一个对照」24 §8「走查:把桌上的红苹果给我」
21 章首「它也是第 24 章机器人动作生成的前置」24 §5「动作怎么表示:三种切法」
24 §16「软件那一侧的五条路见第 20 章」20 §2「打破那条衰减曲线的五条路」
25 章首「偏见怎么从数据长出来,第 26 章讲」26 §7「偏见不是 AI 发明的」
26 §1「根因在第 17 章已经讲完」17 §8「一本正经的编造」
20 §9「这一问在第 26 章会放到更大的镜头下再看」26 §16「饭碗、权力与治理」
22 §14「医疗那一笔第 23 章专门展开」23 §5「结构预测之后:药物与蛋白质设计」
22 §14「机器人那一笔属于第 24 章」24 §14「数据从哪来」
24 §18「具身是否必要条件,这个悬念留给第 27 章」27 §12「从身体里学这条路」
26 §17「生存风险留到第 27 章」27 §13「时间表为什么差十倍」

Footnotes

  1. 出处:「第1章 智能的第三次浪潮」第 15 段(text/02-ch01.txt:15,搜「不假设你会编程」)。 原文接着说「不要求你先修过统计学,也不会一上来就把你扔进公式海里」。

  2. 出处:「第1章 智能的第三次浪潮」第 878 段(text/02-ch01.txt:878,搜「绪论之后还有十五章」)。 原文把这十五章分成四段:基础三章、核心模型与学习范式三章、大模型与广义应用六章、物理世界与风险未来三章。

  3. 出处:「第1章 智能的第三次浪潮」第 383 段(text/02-ch01.txt:383,搜「统一译作推断」)。 原文的分法是:「推断指模型被训练好之后拿来使用;推理则指解题、论证、做逻辑判断这一类思考能力」。