跳到主要内容

这就是 ChatGPT — 全书拆解

30 秒导读: 这是一本 5.6 万字的小书——我们这份拆解是它的两倍多—— 回答两个问题:ChatGPT 在做什么、它为什么能做到。 它的机制部分讲得极清楚,而真正的价值在最后那个反直觉的结论: 它之所以管用,原因可能不在这台机器这一侧,而在语言这一侧。

本组文档是我们重写的完整拆解,七章。读完不必看原书。

1. 先交代清楚:这是谁在什么时候写的

作者斯蒂芬·沃尔弗拉姆(Stephen Wolfram)——Mathematica 与 Wolfram|Alpha 的作者
写作时间2023 年 2 月 28 日,ChatGPT 发布约三个月后1
内容两篇长文:第一篇讲原理,第二篇讲怎么给它接上计算工具
作者的资历自称研究这类「让机器自己学」的东西 43 年;1983 年就动手写过一个,「但它做不了什么有趣的事情」2

两件事必须先说,否则会误读这本书:

第一,它写在一个非常早的时间点。 那时候,今天这些东西一样都还没有: 会一步步先想再答的、会自己先去查资料的、会自己接连做很多步事的。 书里所有具体数字都是当时那一代的,今天已经过时;但机制层面的讲解没有过时。

第二,作者是利益相关方。 第二篇整篇在论证「给它接上他自己的计算引擎」。 论证本身成立,但读的时候要把产品和论点分开。

2. 全书一条主线(读完这一节,你就懂了这本书)

这本书是一条从头贯到尾的推理链:每一步都是被上一步逼出来的。 下面把这条链完整走一遍 —— 不看后面任何一章,只读这一节,你也能把这本书讲给别人听。

细节全部留给对应的章节,这里只讲「发生了什么、为什么只能这样」。

① 你看到的:字一个一个往外蹦

那不是动画效果,那就是它真实的节奏。它每写一个字,都要把同一个问题重问一遍: 「照目前这段文字,下一个该是什么?」问一次,写一个,再问一次。

没有构思,没有打草稿,没有通盘规划。

而且它不总挑最有把握的那个词 —— 那样写出来会很平淡,写长了还会开始复读。 所以它故意留了点随机。同一句话问两遍答案不一样,根子就在这儿:随机是设计,不是毛病。

② 「下一个该是什么」是怎么定的?数是数不出来的

最直觉的办法是数数:翻遍所有文章,数每个词后面都跟过些什么。

这条路走不通 —— 而且不是「再努力一点就行」的那种走不通。

常用词大约四万个。任取三个词的排法就有六十万亿种;二十个词一组的排法, 比宇宙里的粒子还多。全人类写下的所有文字加起来,都不够数。

所以只剩一条路:别查表了,改成算。

③ 要「算」,就得先造一个会算的东西

「算」的意思是:找出一条规律,让没见过的情况也能推出答案。 就像与其把每层楼扔石头的时间都测一遍记成表,不如找出一条公式 —— 没测过的楼层也能算。 这条替代了一张列不完的表的规律,就叫一个模型——你听到的「大模型」,说的就是它。

问题是:语言没有现成的公式可用。

所以只能造一个能自己去凑规律的东西:一堆按层排开的简单零件, 中间装着几千亿个可以调的数——全世界人口才八十亿,这里的数比那还多几十倍 (人口数不在书里,是常识)。调对了,它就「会」了。这东西叫神经网络

④ 训练:反复试错,把那几千亿个数调对

做法朴素得出奇:

给它一道题 → 看它答得离正确答案差多远 → 把每个数朝「差得少一点」的方向挪一丁点 → 换下一道题

图说:重复几万亿次。没有人告诉它规则——规则是这么试出来的副产品。

这里有一件反直觉的事,正是这个行业能起飞的原因:要调的数越多,反而越容易调对。 (为什么会这样,第 02 章讲。)

⑤ 但文字得先变成数字 —— 这是全书的枢纽

上面那台机器从头到尾只会摆弄数字。那「猫」这个词,该是哪个数?

给每个词编个号是不行的,因为编号是随便定的:3542 号和 3543 号之间没有任何关系。

真正的办法是:不给一个数,给一串数;并且让意思相近的词,这串数也相近。 这样一来,「意思」就变成了「距离」—— 机器终于有东西可算了。

那这串数从哪来?靠一条朴素得像废话的观察:经常出现在同类句子里的词,意思就相近。 (鳄鱼和短吻鳄总能互换,芜菁和鹰不会。)

这一步做成了,后面所有计算才有意义。第 03 章专讲它。

⑥ 它的构造:三道工序,外加一个致命的结构性事实

整段文字 → 变成一串串数 → 穿过近百道处理工序 → 变回「下一个字」的可能性清单 → 挑一个

把挑中的字接到文末,整条流水线从头再跑一遍 ←──────────┘

图说:每吐一个字,这台机器就完整跑一遍。所以它写长文必然慢。

这套结构里真正的巧思不是「做得更大」,而是「不把所有东西连在一起」 —— 让它自己决定此刻该回头看前文的哪几个部分。

而那个致命的结构性事实是:它内部一路向前,不能回头重算。 唯一的「回头」发生在最外层 —— 它靠重读自己已经写出来的字来记事。 写出来的字,就是它仅有的草稿纸。(第 04 章)

⑦ 天花板在哪:有些事它原理上就做不到

有些事情没有捷径,必须一步一步算完才知道结果。

而「学习」的本质是找规律、把一大堆东西压缩成一条短规则。 两者天生打架:本来就没规律的东西,再多数据、再大的网络也学不到。

由此得出全书最硬的一条结论:

越能真正做复杂计算的系统,越难训练;越好训练的,计算能力越弱。

它站在哪一端?回头看第 ⑥ 步那件事:它内部一路向前,不能回头重算。 连「一直算到条件满足为止」这种最基本的计算结构,它都表达不出来 —— 所以它正正落在「极端好训练、计算能力极弱」那一端。

作者做过一个很硬的实验:造一种只有一条规则的玩具语言 ——「括号必须配平」。 规则只有一句话,一句话就写得完;喂了一千万个例子,它仍然会给出错误选择。 一条明确到不能再明确的规则,它学不牢。

由此得到一条极实用的判据:这件事是「一眼能看出」还是「必须一步步算」? 前者交给它,后者交给工具。(第 05 章)

⑧ 那它为什么还这么行?—— 全书最值得带走的一步

上面全是坏消息。但作者在这里做了一个反向推理:

写文章,曾被认为「本质上太难,计算机做不到」
而它的计算能力其实极其受限,却做到了
⟹ 该改的结论不是「计算机变强了」
⟹ 而是「写文章这件事,本来就比我们以为的容易」

图说:同一件事,换个方向推,结论完全相反。这条推理可以复用到任何一次技术突破上。

顺着这条推理,全书落到那句反直觉的主张上:

它之所以管用,不是因为这台机器多聪明,而是因为语言本身比我们以为的更简单、更有规律。 训练过程碰巧把这些我们还没写下来的规律摸了出来。

作者拿两条人类早就写下来的语言规律当例证(一条管「词怎么搭」,一条管「推理合不合规」), 并主张在它们中间还藏着一条更深的、还没被人写下来的规律 —— 它管的不是「这句话搭得对不对」,而是「这句话说不说得通」。(第 06 章)

⑨ 出路:一条远的,一条近的

远的: 既然那些规律现在只藏在机器内部、谁也读不出来, 那就想办法把它们明明白白地写下来 —— 这样才能又快、又准、又能被人看懂。 这是作者四十年的主张。

近的,也是现在真在用的:像人的那部分交给它,要算准的部分交给外部工具。 指望逐个去修它算错的题目是错的方向 —— 要修的错几乎无穷多。(第 07 章)

⑩ 一句话收尾

作者自己给的压缩版是:

拿人类写下的海量文字去训练一台机器,让它生成「与之类似」的文字; 给它一个开头,它就接着往下写「像训练数据的东西」。

这句话里没有「理解」「推理」「知道」。这是刻意的。 全书的立场是:你看到的一切能力,都是「接着往下写像样的东西」这一件事的结果。

3. 七章地图

这张表不用记任何术语 —— 每一章的名字后面,写的是「读完你能回答什么问题」。

读完你就能回答
01 一次只添加一个词它写字时到底在重复什么动作?为什么同一句话问两遍答案不一样?
02 神经网络与训练没人教它规则,它是怎么「学会」的?为什么训练要烧那么多钱?
03 意思怎么变成数字机器只会算数,那它凭什么看起来「懂」词的意思?这一章是全书枢纽,别跳
04 它内部长什么样你打的字进去之后经过了哪几道工序?为什么它写长文那么慢?
05 它做不到什么它文章写得好,为什么加减法会错? 这条界线为什么挪不动?
06 为什么它居然管用全书的落点:这件事凭什么成了?作者给的答案很反直觉
07 怎么让它靠谱一点它算不准的时候怎么办?今天那些「让它先查一下再答」的做法,在这一篇里长什么样?

推荐顺序: 01 → 02 → 03 → 04 → 05 → 06 → 07,这也是原书的推理顺序。 只想拿结论的话,读本页第 2 节加第 05、06 两章就够。

4. 这本书覆盖什么、不覆盖什么

这两张表和上面那张地图一个口径:不用记任何术语。

覆盖(而且讲得比多数材料清楚)—— 读完你能回答:

  • 它写字时到底在重复什么动作,为什么同一句话问两遍答案不一样;
  • 「模型」到底是什么意思,那几千亿个「可以调的数」调的是什么;
  • 没人教它规则,它是怎么自己试出规则的,为什么这件事要烧那么多钱;
  • 机器只会算数,它凭什么看起来「懂」词的意思(作者自称这是全书的中心思想, 中文版导读序称这是它见过最好的解释);
  • 你打的字进去之后经过了哪几道工序,它内部怎么决定该回头看前文哪几个字;
  • 它文章写得好,为什么加减法会错,这条界线为什么挪不动;
  • 一个关于「为什么这件事居然成了」的科学猜想;
  • 外加大量「我们不知道为什么这样有效」的坦白 —— 这些坦白比结论更值钱。

不覆盖(别指望在这本里找):

缺什么说明
怎么把它调得不胡说书里只讲了「让人打分」这一小段,而这件事真做起来后面还有好几步,一句没提——中文版导读序把这列为全书最主要的遗憾
真拿去用会遇到的事怎么上线、一次问答花多少钱、要等多久、怎么衡量它答得好不好——一个字没讲
让它自己接连做很多步事「让它自己说要查什么」有雏形,但「一次任务来回问答好几十次」「记住上周说过的话」「自己定计划」都不在
这本书之后出现的东西会一步步想的模型、能看图的模型、能一次读一整本书那么长的模型、任何人都能下载来自己跑的模型
能拿去验的东西最后那个猜想只有主张,没有任何算得出来的结果,也没有可以拿去验对错的预言

5. 今天读,要修正的三处

这本书写于 2023 年 2 月。 下面三处不是它写错了,而是它没跟上—— 有意思的是,三篇关键论文里有两篇其实早于本书,作者只是没有引用。

书里的说法该怎么修正依据
「那些数越多反而越好调」(第 02 章)要补一句「机器多大和喂多少字,得一起配平」。2022 年的 Chinchilla 论文指出,当时的大机器普遍喂得不够——机器每翻一倍,喂的字也该翻一倍《Training Compute-Optimal Large Language Models》https://arxiv.org/abs/2203.15556(查阅于 2026-08-25)
「一路向前 ⟹ 算不了深的东西」(第 05 章)结论没错,但这条界线可以往外挪:让它先把中间步骤一句句写出来再答,等于拿第 04 章那个外层循环换深度。2022 年已有论文证明这条路有效《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》https://arxiv.org/abs/2201.11903(查阅于 2026-08-25)
「给它接上算得准的工具」(第 07 章)方向被完全证实,但对接的方式换了:业界让模型写出格式固定的调用,不是书里设想的用大白话对接;而「把查到的资料塞回给它再让它答」这套做法,早有正式名字(见第 07 章)《Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks》https://arxiv.org/abs/2005.11401(查阅于 2026-08-25)

判断(我们的,不是书里的): 前两条有一个共同点值得注意—— 修正它们的证据在书出版之前就存在了。 这说明这本书的定位是「用第一性原理讲清机制」,不是「综述当时的研究前沿」。 拿它当机制教材读,它今天仍然极好;拿它当行业现状读,它从出版那天起就落后。 如果错,会错在: 如果作者是有意不引(比如认为那些工作与他的论证无关), 那这就不是「没跟上」,而是取舍——但书里没有交代,我们无从判断。

6. 我们的判断

判断(我们的,不是书里的): 这本书今天的价值排序是—— ① 机制讲解(不过时) > ② 关于语言的猜想(有启发,未证实) > ③ 第二篇的产品方案(已成历史)。 引用它的时候引①和②,别引里面那些具体的数字如果错,会错在: 如果后来的机器换了个造法(比如内部能回头重算、或者把想的过程明写出来), 让第 05 章那条「一路向前 ⟹ 算不了深的东西」的论证不再适用, 那么①里关于能力边界的部分也要跟着修正。

判断(我们的,不是书里的): 全书最该带走的一条思维方式,是第 ⑧ 步那个反向推理—— 当一件被认为很难的事突然变得可行,先怀疑的不该是「工具变强了」, 而是「这件事本来就比我们以为的容易」。 这条推理可以复用到任何一次技术突破上。 如果错,会错在: 如果某次突破确实来自机器本身或方法的质变、而不是任务本身简单, 这条反推就会把功劳归错地方。判据是:同样一台机器,换个任务还成不成立。

判断(我们的,不是书里的): 读这本书要注意区分三个声音—— Wolfram 本人(措辞极克制,「我强烈怀疑」「至少就我们目前所知」满篇)、 中文版编者注(补背景,比如「规则 30」是怎么回事)、 以及中文版导读序作者(转述更笃定,并补了大量 Wolfram 没写的行业背景与人物史)。 我们的拆解里凡是引自导读序的地方,都在当场说明了。 如果错,会错在: 如果把导读序里的行业判断当成 Wolfram 的观点去引用, 就会给这本书安上它没有的立场。

7. 许诺兑现表

这份拆解里每一处「第 N 章讲」「见下一节」,都在这里记一行、逐行核过。 核的是两件事:那一章真的讲了吗?讲的是不是许诺的那件事,而不是同名的另一件事。

许诺在哪许诺了什么应兑现在哪核过了吗
本页 §2 ④为什么要调的数越多反而越容易调对02 §6「2012 年那个反直觉的发现」
本页 §2 ⑤「意思变成距离」怎么做到03 §3、§4
本页 §2 ⑥写出来的字是它仅有的草稿纸04 §5「一个结构性事实:它没有循环」
本页 §2 ⑦「一眼能看出」还是「必须一步步算」这条判据05 §6 末的判断块
本页 §2 ⑧那条还没被写下来的语言规律06 §4(那条作者自造的「说得通」法则)
本页 §2 ⑨为什么逐个修错题是错方向07 §2「修 bug 的方向是错的」
本页 §3 地图 01它写字在重复什么动作;为什么问两遍答案不一样01 §1、§3
本页 §3 地图 02没人教它规则它怎么会的;为什么烧钱02 §1、§4、§7 第 9 条
本页 §3 地图 03机器只会算数,凭什么看起来懂意思03 §3、§4
本页 §3 地图 04经过哪几道工序;为什么写长文慢04 §1、§2、§4
本页 §3 地图 05它文章写得好,为什么加减法会错05 §6「把这条判据套回加减法」这次补的:此前整章只讲括号,加减法一直欠着
本页 §3 地图 06这件事凭什么成了06 §2「简单的不是模型,是语言」
本页 §3 地图 07今天那些「让它先查一下再答」的做法长什么样07 §4、§7 那张对照表这次改了措辞:原来许诺的是「今天那些做法是怎么来的」,而 07 §7 明确拒答来历,只给「长什么样」
本页 §5 第 3 行「把查到的资料塞回去」这套做法的正式名字07 §7 对照表与其后的补充块
01 §5 那张链条图语言有没有现成的公式可用01 §6「为什么语言不能照搬物理的做法」
02 §3 末「也许它本来就没有捷径可解释」05 §4(「有些计算没有捷径」那一节)
02 §6 判断块「越大越好」这个结论的硬上限05 §5「终极权衡」
02 §7 第 4 条那种「能往回看」的排布04 §3、§4
03 §3ChatGPT 训练用了多少字04 §6 那张讲文字量的表(几百亿个词)
04 §5 开头「它没有循环」这件事的后果05 §5「ChatGPT 站在这个权衡的哪一端」
04 §7 末「需要一步步算的规则学不会」05 全章
05 §7 末「简单的不是模型,是语言」06 §2
05 §8 末那条出路的具体实现07 全章

拆解写于 2026-08-25,依据 2023 年中文版(人民邮电出版社)。原始书籍文件不入库, 本组文档是我们自己的重写;每条引用都可用 node scripts/book-verify.mjs what-is-chatgpt-doing 回核。

Footnotes

  1. 出处:「前言」第 34 段(text/02-fm.txt:34,搜「2023年2月28日」)。作者在前言第 25 段(text/02-fm.txt:25,搜「两篇长文」)说这本书包含他「在 ChatGPT 问世后不久写的两篇长文」。

  2. 出处:「前言」第 22 段(text/02-fm.txt:22,搜「10亿倍」)。原文的对照很有意思:40 年后,一个「比我在 1983 年构建的神经网络大 10 亿倍」的网络能够生成有意义的人类语言。「研究了 43 年」这个说法见「ChatGPT和Wolfram|Alpha」第 21 段(text/20-fm-chatgpt-wolfram-alpha.txt:21,搜「43年」)。