另一个人的声音:七十年、三个学派、一笔电费账
这一章讲三件事: 这一行的七十年是怎么走过来的; 这一行为什么突然开始跟电力打交道;以及 2023 年春天真实发生过的几件事。
它在全书链条里的位置: 前六章讲的是「它是什么」。 这一章给的是时间坐标——你需要它,才能在第 08、09 章把这件事和工业革命并排放。 但它也是全书唯一一处不是作者本人写的正文。
1. 先说清楚:这是谁在说话
这一节必须放在最前面,否则你会把两套判断混在一起。
代序的作者是朱嘉明,落款 2023 年 5 月 9 日1; 本书作者的落款是 2023 年 5 月 11 日2。两个人,两篇文章,相差两天。
为什么必须分开记? 因为这两篇文章的口径不一样:
| 代序 | 正文 | |
|---|---|---|
| 写法 | 论文式,大量引文和脚注 | 情景剧 + 案例 + 对话 |
| 关心什么 | 思想史、知识论、文明尺度的风险 | 产业怎么落地、钱怎么算 |
| 对同一件事的说法 | 有几处对不上(见第 8 节) | — |
本组拆解的做法是:代序里的判断一律写明「这是代序作者的说法」,不并进正文的结论。
2. 七十年,以及一开始就分了三派
这一节给全书唯一一条完整的时间线。
代序从这一行的定义讲起:1956 年那次会议给出的说法是—— 让机器使用语言、形成抽象和概念、解决现在人类还不能解决的问题、提升自己; 而首要问题是让机器像人类一样能够表现出智能3。
从 1956 年算起,到这本书出版,这一行已经接近 70 年4。
而这 70 年一开始就分了三派5:
| 学派 | 主张什么 | 依靠什么思维 |
|---|---|---|
| 符号学派 | 用符号运算模拟人的认知过程和抽象逻辑思维 | 抽象思维,注重数学上说得清 |
| 联结学派 | 直接模拟大脑,靠一张网和它的学习方法产生智能 | 形象思维,仿人脑 |
| 行为学派 | 从进化论和控制论出发,行为是对环境变化的反应组合 | 感知思维,模拟身体和行为 |
关键的一句在后面:在相当长的时间里,符号那一派是主流。 代序给的转折点是:因为计算机只能处理符号、不可能具有人类最复杂的感知, 符号那一派在 20 世纪 80 年代末开始走向式微6。
这一条解释了第 03 章那个疑问的另一半: 第 03 章说的是「同一条路上两种练法的竞争」, 而这一条说的是「这条路本身在更早的年代就赢过一次」。
3. 三个里程碑
这一节是代序最有用的一段,也是最需要小心引用的一段。
第一个里程碑是机器学习——就是「不靠人一条条写死规则, 而是让程序自己从数据里找出规律」。 代序把它的源头追到 1950 年那篇论文和那个著名的测试; 而第一个实物是 1952 年一个下西洋棋的程序—— 它能从棋子的位置学出一个说不清的规律,为下一步提供比较好的走法7。
第二个里程碑是深度学习——就是把第 03 章那张网做得很多层; 代序说的「深度」指的就是层数8。 时间点是 2006 年,代序管它叫「深度学习元年」8。
中间那一段是它的生物学理由: 只有 1.5 千克重的大脑, 大约有 860 亿个神经元,与数万亿个突触相连9。
860 亿是个什么概念? 拿第 02 章那个数比:1750 亿个可调的数, 是这个数的两倍——但两者不是一回事,一个是生物细胞,一个是可调的数字。 (代序把它们并排放,但没有说它们等价。)
那「数万亿个突触」呢? 拿它自己除一下就有量感了: 数万亿 ÷ 860 亿 ≈ 几十——平均每个神经元往外接出去几十条线。 (这一步除法是我们做的,代序只给了两个数。)
真正让它出圈的是 2012 年:那一年一个网络在图像识别比赛上做出结果, 代序说这成为新一轮发展的起点10。
第三个里程碑:生成大模型 。 从 2018 年开始迅速流行, 做法就是第 02、04 章讲过的那两步:先在没人标过答案的海量数据上练,再用人标过答案的数据调11。 代序给了一个规模上的细节:训练用了数万台机器,既有普通处理器,也有显卡12。
4. 这三步一步比一步更靠堆规模,而堆规模会撞墙
这一节是我们补的一级台阶——不补上,下一节的电费账会显得突兀。
把上面三步连起来看,有一条线索:
第一步 机器学习 靠的是:找到一个能从数据里学规律的办法
↓ 规模不是主要矛盾
第二步 深度学习 靠的是: 把网做深、把数据做大
↓ 规模开始变成主要矛盾
第三步 生成大模型 靠的是:把规模一路推到极限
↓ 规模就是全部
一路堆规模,先撞上的是显卡。 代序说,那个东西是硬件那一层的核心, 而这一行的效率提升已经超越了摩尔定律—— 摩尔定律说的是「同样大小的芯片上,能装的元件数每隔一两年翻一番」, 这是这一行几十年来最可靠的一条经验规律13。 代序同时说,这条规律正在逼近物理极限14。
撞完显卡,再往后撞上的是电。 这就是下一节。 (显卡对这件事到底提了哪些要求、一次训练要花多少钱,第 16 章有具体的数。)
5. 那笔电费账(而且是转引的)
这一节给出代序独有的两个数,并且要把它们的来源说清楚。
代序给的两句话是:
这两个数必须打个标记再用。 代序给它们配的出处是两篇中文网络文章 (一篇百家号、一篇中国日报网),不是能源统计机构的报告原文。 第二个数尤其可疑:从 3% 到 15% 意味着两年内翻五倍, 而代序没有给出任何推导过程。 本组拆解的处理:这两个数只能当「有人这么说过」来引用,不能当事实。
为什么还要留着它们? 因为它们指出了一个真问题: 这一行的成本结构里有一项是电,而电是有物理上限的。 这一条在第 16 章会变成具体的机房和成千上万张卡,在第 18 章会变成每答一次的成本。
6. 代序的落点:知识是怎么被生产的
这一节讲代序真正关心的东西——它不是技术,是知识论。
代序关心的是知识本身:从记忆(就是把事实存住、要用的时候取出来) 一直到创造,这中间的每一层都被它重新过了一遍。
代序一共列了七条改变,其中最要紧的是第一条和最后一条: 第一条是知识生产的主体变了——从人类垄断,变成人和机器混合生产16; 最后一条是知识处理方式变了。
最后这一条给了全书一个很有用的框架:人对知识的处理分为六个层次—— 记忆、理解、应用、分析、评价和创造17。 这六层在第 10 章会被逐层走一遍,那一章还会给出一个真实的效率实验。
代序还提了一件与第 01 章直接相关的事: 如果它与外部知识源(例如搜索引擎)和工具(例如编程语言)结合, 将丰富知识体系并提高获取效率18—— 这正是第 06 章那两类插件在思想史上的位置。
顺带把两个名字挂上,因为你出门一定会撞见它们: 代序里点了一次它内部那套计算方法的名字——注意力: 说白了就是「算下一个字的时候,前面哪几个字该多看两眼」19。
这套方法出自一篇论文,而正文里也提过一次这篇论文的名字: 《注意力就是你所需的一切》——书里在原书第 14 章讲一家公司的创始人来历时, 把它称作「大模型基石级论文」20。
但正文里只是把它当一个人的履历带过。 唯一一次讲清「它是什么」的地方,是代序。 这两处加起来,就是全书对它的全部交代:一个名字、一句解释,连图都没有。
7. 主走查:同一个问题穿过七十年
这是本章的主走查。拿 1956 年那句定义当输入,每一站写出当时手里有多少东西。
输入:「让机器像人类一样能够表现出智能」。
| 年份 | 谁 | 手里有多少数据、多少算力 | 走到哪一步 |
|---|---|---|---|
| 1956 | 那次会议 | — | 把问题提出来,并分成三派35 |
| 1952 | 一个下西洋棋的程序 | 一副棋盘的局面 | 证明了程序能从数据里学出走法7 |
| 1986 | 那位后来的图灵奖得主 | 112 个句子(104 句训练、8 句测试),没有显卡 | 思想成立,但做不出 东西来21 |
| 2006 | 同一个人 | — | 提出把网做深这条路8 |
| 2012 | 一个图像识别的网络 | 一个大型图像数据集 | 图像识别做出结果,新一轮的起点10 |
| 2020 | 那一代生成大模型 | 数万台处理器、1750 亿个可调的数 | 突然会了没人教过的事12 |
看第 3 行和第 6 行的对比:同一个人、同一个思想,差的是数据和算力。 112 个句子对上千亿个可调的数——这就是第 03 章那句「比算力和数据更短缺的是相信」的量级。
8. 代序和正文对不上的地方
这一节是本组拆解替读者做的核对,书里没有。
| 事项 | 代序说 | 正文说 |
|---|---|---|
| 「大」的门槛 | 参数至少达到 1 亿22 | 只说上一代是 1750 亿,没有给门槛 |
| 产业分层 | 硬件、软件、模型即服务、应用四层23 | 第 16 章用的是同一套四层——这一处是对得上的 |
| 幻觉 | 用的词是**「AI 幻象」**24 | 用的词是「幻觉」 |
| 涌现 | 引的是同一篇论文25 | 第 04 章引的也是它——对得上 |
最要紧的一处不同不在数字上,在态度上: 代序把这件事放在文明尺度上谈(核武器、潘多拉盒子、火星迁徙), 而正文从头到尾在算账。 两种态度都有价值,但不要把代序的紧迫感当成正文的结论。
9. 那份 2023 年春天的风险清单
这一节把代序里那几件真事列出来,因为它们常被记混。
| 时间 | 事情 |
|---|---|
| 2023 年 3 月 29 日 | 一位科技企业家联名千余科技领袖,呼吁暂停开发26 |
| 2023 年 4 月 | 那位图灵奖得主向谷歌提出辞职,理由是想「自由地谈论这一行的风险」27 |
| 更早 | 控制论之父在《人有人的用处》里写下的那句话:这些机器的趋势是要在所有层面上取代人类28 |
代序给这一节的落点是一个问句:人是否或早或晚都会成为它的工具人。 这个问题书里没有回答,我们也不替它回答。
10. 作者的判断与证据
| 说法 | 性质 |
|---|---|
| 三个学派的划分与各自主张 | 学科史的通行说法 |
| 三个里程碑与年份 | 事实,可核 |
| 860 亿个神经元 | 神经科学的通行数 |
| 3% 与 15% 那两个能耗数 | 转引自两篇网络文章,没有推导 |
| 「大模型赋予它一种与人类近似、又很不同的思维能力」 | 代序作者的判断,没有证据 |
| 「弱人工智能、强人工智能、超人工智能的界限不复存在」 | 代序作者的判断,而且是一个很强的判断 |
| 知识处理六层 | 借用的现成教育学框架,不是这一行的东西 |
11. 边界与局限
- 代序不讲怎么做,只讲意味着什么。 它没有一个可操作的结论。
- 代序的引文密度极高,但多数是二手转引。 那两个能耗数是最典型的例子。
- 代序里的中国部分只有点名。 文心、通义、盘古三个名字之外没有任何拆解。
- 代序把「生成主义」这类哲学概念引进来,和正文完全接不上。 我们在这里不展开,因为它对读懂这本书没有帮助。
12. 可带走的
- 代序是另一个人写的,判断要分开记。
- 这一行从 1956 年算起接近七十年,一开始就分三派,符号那一派曾长期是主流。
- 三个里程碑:能从数据里学规律 → 把网做深 → 把规模推到极限。
- 一路堆规模,先撞显卡,再撞电。
- 那两个能耗数(3%、15%)是转引的,当「有人这么说过」用。
- 知识处理六层这个框架很有用,第 10 章会拿它当骨架。
- 2023 年春天那几件事是真的:千人联署、那位得主辞职。
13. 原文地图
| 主题 | 原书章 | 原文位置 |
|---|---|---|
| 那次会议的定义 | 代序 | text/01-fm.txt:8(搜「达特茅斯会议对人工智能」) |
| 接近七十年 | 代序 | text/01-fm.txt:131(搜「已经接近70年」) |
| 三个学派 | 代序 | text/01-fm.txt:141(搜「符号学派」) · text/01-fm.txt:156(搜「在20世纪80年代末开始」) |
| 第一个里程碑 | 代序 | text/01-fm.txt:159(搜「第一个里程碑」) · text/01-fm.txt:162(搜「西洋棋的程序」) |
| 第二个里程碑 | 代序 | text/01-fm.txt:186(搜「第二个里程碑」) · text/01-fm.txt:191(搜「2006年也因此成为」) |
| 860 亿个神经元 | 代序 | text/01-fm.txt:195(搜「大约有860亿个神经元」) |
| 2012 年那一次 | 代序 | text/01-fm.txt:208(搜「设计的AlexNet神经网络模型」) |
| 第三个里程碑与规模 | 代序 | text/01-fm.txt:212(搜「第三个里程碑」) · text/01-fm.txt:218(搜「OpenAI使用了数万台」) |
| 四层结构 | 代序 | text/01-fm.txt:410(搜「这个结构包括硬件基础」) |
| 超越摩尔定律 | 代序 | text/01-fm.txt:414(搜「AI算法效率已经超越了摩尔 定律」) |
| 那篇论文的名字 | 14 大模型产业拆解 | text/16-ch14.txt:934(搜「大模型基石级论文」) |
| 那两个能耗数 | 代序 | text/01-fm.txt:435(搜「能源消耗占全球能源消耗」) |
| 知识处理六层 | 代序 | text/01-fm.txt:467(搜「记忆、理解、应用、分析」) |
| 风险清单 | 代序 | text/01-fm.txt:525(搜「联名千余科技领袖」) · text/01-fm.txt:527(搜「向谷歌提出辞」) |