跳到主要内容

AI 四阶段史观 — 这本书的坐标系,和它靠不住的地方

这一章讲三件事: 这本书用什么尺子来量整个 AI 行业; 这把尺子从「规则驱动」一路量到「大模型」的时候都量出了什么; 以及这一章里哪几处不能信——它是全书史实错误最集中的地方。 后面七章全部建立在这套坐标系上,所以先把尺子本身看清楚。 不需要任何基础,遇到的生词都在当场解释。

1. 先看现象:满天飞的「几点零」和「什么智能」

你大概见过这类说法:「AI 已经进入 2.0 时代」「我们要从感知智能走向认知智能」 「下一步是自主智能」。会议 PPT 上、政府文件里、厂商发布会上,全是这套话。

问题是:没人告诉你这套划分是谁定的、按什么标准分的、边界在哪。

于是最常见的两种误用是:

  • 当成技术分类去用——以为「感知智能」和「认知智能」是两套不同的算法(算法就是一串固定的 计算步骤,机器照着做就能得出结果)。不是。 它们是按「机器表现得像人到什么程度」分的,而同一套东西可以同时落在两格里;

    同一套什么?叫神经网络——一层层排开的简单计算单元(每个单元只做一次乘、一次加)、 中间连着大量可以拧的数,靠反复喂数据把这些数拧对。 同一套神经网络,既能拿去认人脸(算感知),也能拿去答题(算认知), 所以按它根本分不出这两格来;

  • 当成时间表去用——以为「自主智能」是排好期的下一站。 书自己都说它「尚未在实际中应用」1

这一章的价值就是:把这把尺子的刻度、用法,以及它在哪儿会失准,都交代清楚。

2. 顶层全景:这本书的坐标系长什么样

┌── 起点:一个关于人的判断 ──────────────────────────────────┐
│ 人类智慧的路线是「先模仿自然,后创造工具」 │
│ ⟹ 机器智能被套进同一条路:从执行人写好的规则,到自己创造 │
└───────────────────────────┬──────────────────────────────┘

AI 1.0 计算智能 ── AI 2.0 感知智能 ── AI 3.0 认知智能 ── AI 4.0 自主智能
照规则办事 能看能听能说 能理解能推理 能自我进化
专家系统 人脸识别/自动驾驶 大模型(书说现在在这) 书说还在研究阶段
│ │ │ │
│ │ ┌─────┴─────┐ │
└── 转折点 ① ────┘ │ │ └─ 转折点 ③
规则驱动 → 数据驱动 决策式 AI 生成式 AI 能力 → 意识?
(判断) (创造)
└─ 转折点 ② ─┘
大模型让「生成」这条路
顺带把理解和推理也做了

图说:三个转折点是这一章的全部内容;四个阶段只是给这三个转折点挂的标签。

记住这张图,后面七章都可以往上面挂。

一条贯穿全章的主走查:一张猫的照片

这一章的每个承重机制,都会回到这张照片上占一步。 下面出现的数值和输出都是为演示编的,不是真实数值。

输入: 一张 1920×1080 的照片,画面里一只猫坐在一扇门前。

这台机器停在哪一格拿这张照片能吐出什么
计算智能2.1 MB 的一堆 0 和 1。它存得住、算得出这堆数的总和,但「画面里有什么」它一个字答不上来
感知智能一行能进表格的记录:「猫,框的左上角 (120,340),宽 260 高 310,置信度 0.87」。一张图变成了四个数加一个名字
认知智能一句话:「照片里的猫坐在门前,看起来在等人开门。」 它答的不再是画面里有什么,是这件事在讲什么
自主智能一串它自己决定要做的事:去查这扇门的门禁记录,发现主人 40 分钟前出门,于是给主人发了一条消息。 没有人让它去查

四格的差别就这么当场量出来了: 第一格到第二格,输出从 2.1 MB 缩成一行五个格子; 第二格到第三格,输出从「有什么」变成「在讲什么」; 第三格到第四格,输出从一句话变成一串动作。 书说我们现在站在第三格,第四格「尚未在实际中应用」1

但请留意第二格和第三格:它们用的很可能是同一套技术。 这正是下一节要说的事——这把尺子量的是表现,不是技术。

3. 尺子本身:四个阶段是按什么分的

这一节回答:这套划分的判据到底是什么。

书说得很直接:把「AI 技术的发展」和「智能化水平」一一对应起来,对出四段2 (把两样东西一一对应起来,数学上管这叫映射)。 「智能化水平」就是这把尺子的刻度——它量的是「机器表现得多像人」,不是「用了什么技术」。

四个刻度各自的定义,书给得挺具体:

阶段书里的定义一句话
计算智能超强的存储能力和超快的计算能力3算得快、记得多
感知智能视觉、听觉、触觉等感知能力;能把杂乱的原始材料整理成规规矩矩的表格数据4看得见、听得懂
认知智能理解、归纳、推理(推理就是一步步想出结论的那个过程)的能力,能运用知识5想得明白
自主智能能自我学习、自我适应、独立完成任务,甚至无人干预下自我改进6自己会变强

这里唯一的生词是非结构化——就是计算机没法直接拿去做统计的那种材料。 一张照片、一段录音、一篇文章都算;把照片变成「这里有一辆车,坐标是……」这样的表格数据, 就叫结构化。感知智能干的活就是这个转换。

这把尺子好在哪

它能一句话说清两个东西的差别。 比如:人脸识别和 ChatGPT 差在哪? 前者是感知(把图变成身份),后者是认知(理解意图再组织回答)。这个回答比讲两套算法快得多。

它不好在哪:这不是技术分类

同一套技术可以同时落进好几格。 举个书自己的例子就够了: 深度学习——就是把很多层这样的网络堆起来一块儿训,「深」说的就是层数多—— 既撑起了人脸识别(感知),也撑起了大模型(认知)。

所以「进入认知智能阶段」不意味着换了技术路线,只意味着同一条路线做出了新表现。

判断(我们的,不是书里的): 这把尺子是沟通工具,不是分析工具。 拿它跟人解释「AI 现在能干什么」很好用;拿它做技术选型、判断某个方案属于哪一代,会得出没有意义的结论。 判据是:如果一个问题的答案取决于「它属于哪个阶段」,那你多半用错了尺子。 如果错,会错在: 如果后续真出现一种只有在「认知」层面才成立的技术性质 (比如某类能力必须靠特定结构才能有),那这套划分就不只是描述性的,而是有预测力的。 目前还没有这样的证据。

4. 转折点①:规则驱动为什么死,数据驱动怎么活

这一节讲全书最扎实的一段历史。

先看现象:早期 AI 为什么下棋很行、别的都不行

书举了一个特别好的对照:早期 AI 在下棋上成绩突出,换到现实问题就不灵7

原因不在算力,在结构:

下棋:规则明确、环境封闭、可能性有限
⟹ 人可以把策略写成规则,机器照着算就行

现实:规则说不清、环境开放、总有没见过的情况
⟹ 规则写不完,写不到的地方机器就彻底束手无策

图说:规则驱动的天花板不是「规则不够好」,是「规则写不完」。

书的原话是:这些系统完全依赖于预设的规则,一旦问题不在规则范围内就无能为力, 缺乏自适应能力7

出路:让机器从数据里自己找规律

转折点是一类叫最近邻的算法出现了——就是「看谁离得最近,就跟谁归一类」。 它的想法朴素到一句话能说完:

一个新数据点属于哪一类?看它离哪个已知数据点最近,就归到那一类。

书点出了这件事真正的意义:它开启了一种全新的思维方式—— 利用数据本身,而不仅仅是人为设定的规则,来做决策和预测8

这句话是整条 AI 史的分水岭,值得记住。

数据驱动为什么到 2006 年之后才爆发

书归结为三件事凑齐了9:

条件具体是什么
算法2006 年之后的深度学习:一层层堆起来,每层把上一层的输出转成更抽象的概念
算力芯片、存储、云计算的进步,让处理海量数据成为可能
数据互联网、社交媒体、物联网产生了前所未有的数据量

而深度学习真正打动人的地方,书说得很准:它做到了端到端—— 从最原始的数据一路直通答案,中间不需要人插手10

这里有一个必须当场说清的词叫特征: 以前做图像识别,得由工程师告诉机器 「看边缘」「看颜色深浅」,这些人工指定的观察角度就叫特征。 端到端的意思是:从一个个像素点直接到答案,中间该看什么由机器自己决定。

这一步省掉的是「人得先懂这个问题」这个前提。 它是后面所有事情的基础。

5. 转折点②:决策式 AI 和它的反面,这本书最有用的一组对照

这一节的对照表是这一章最值得带走的东西。先把两个名字各自说清楚。

第一个叫决策式 AI——它就是替你做判断的那一类: 是不是垃圾邮件、这张脸是谁、这笔贷款该不该放,它给出的答案都是一个判断。

它的反面叫生成式 AI——它就是替你造东西的那一类: 给它一句话,它还你一段文本、一张图、一段音频。 下面把这两条路各自的来历和本事讲开。

先看现象:同样叫 AI,为什么差别这么大

推荐系统、人脸识别、风控——这些 AI 你用了十年,没觉得它们「聪明」。 ChatGPT 出来才两年,大家却觉得它像个人。

这不是程度差别,是两条不同的路。

决策式 AI生成式 AI
它在干什么判断是不是、区分是什么11造出一个原来不存在的东西
学什么数据的观察角度和标准答案之间的关系数据本身长什么样——哪些组合常见、哪些罕见,统计上管这叫分布
例子分辨猫和狗、判断是不是垃圾邮件、预测房价看过很多汽车照片之后,画出一辆新的汽车
输出一个类别或一个数一段文本、一张图、一段音频
成熟度(书写作时)更成熟,已在互联网、零售、金融、制造广泛落地起步晚,但 2014 年以来涨得极快

回到那张猫的照片,两边的活儿正好是反过来的。 决策式拿到照片,吐出走查第二格那一行:「猫,0.87」——一个名字加一个数。 生成式拿到的是这一行的反面:给它一句「一只猫坐在门前等人开门」, 它吐出一张原来不存在的照片,同样 1920×1080、2.1 MB,可世界上没有这只猫。 一头把图压成标签,一头把标签还原成图。

两边各自的看家本领12决策式那一侧只有一样,先说完它。

决策式最主要的做法,是拿一堆已经标好答案的数据去训:一万封标了 「是/不是垃圾邮件」的邮件,让模型学出「什么样的邮件是垃圾」这条关系,这叫监督学习—— 「监督」指的就是那些人给的标准答案。

生成式那一侧的三条路

这一侧的招数多一些。先立一个后面天天要用的词,再一条一条说。

一串数,在数学上叫向量。 一张照片、一个词、一封邮件,都可以先被压成一串数。 压成一串数之后有两个好处: 一是两样东西像不像,可以拿两串数直接比出来 (走查里那张猫的照片和另一张狗的照片,比的就是两串数); 二是机器只会算数——不压成数,后面所有的做法一个都开不了工。

第一条路是先攒一个什么都懂一点的底子,这叫预训练。 拿海量文字训一遍,训出来的东西对每个词都有一串数,什么都懂一点、什么都不精。 「预」字是关键:预训练是正式干活之前先打的那层底子,不是最终形态。

打完底子还要再训一遍,拿少量专门的数据,这一步叫微调—— 调的就是上面那层底子,第 02 章第 3 节专讲它。

第二条路是让两个网络互相较劲,这叫生成对抗网络(英文缩写 GAN:generative adversarial network)。 一个专门造假:给它一串随便凑的数,它还原出一张照片; 一个专门打假:看这张照片像不像真的。 造假的越练越像,打假的越练越挑剔,一来一去,造出来的东西就越来越真。

第三条路是先把输入压小、再从压小的那串数还原回去—— 训好之后随便给一串数,它就能造出一个新样本。

生成式这一侧起步晚,但 2014 年以来涨得极快——每过一小段时间就翻一番, 这种涨法叫指数级增长。

书里最好的一句话:模型本质上是一个函数

讲生成式 AI 的可解释性时,书顺手给了一句极准的定义:

本质上,AI 模型是一个函数。这个函数是通过训练获得的,而非单纯通过逻辑推导得到。 我们通过输入已有数据,使机器学会寻找最符合数据规律的函数。13

这句话把「训练」这件事说透了: 训练不是往机器里灌知识, 是在一个巨大的函数空间里搜一个最能对上数据的函数。 后面第 02 章讲微调、第 04 章讲算力(一堆芯片在单位时间里能做多少次运算), 都是在讲「怎么搜得更快、搜得更准」。

6. 转折点③:大模型是什么

这一节回答:「大模型」这个词,书给的定义究竟是什么。

先讲一段前情:那篇叫《苦涩的教训》的博客

2019 年 3 月,强化学习(让机器不停地试,做对了给奖励、做错了给惩罚, 它自己摸索出该怎么做)领域的 Richard Sutton 写了一篇短文,观点很刺人:

短期内,想让 AI 进步,研究者应该在模型里塞进人类的先验知识; 但从长远看,AI 发展的关键在于充分利用算力资源。14

「先验知识」当场解释: 就是人事先教给模型的东西——特征怎么设计、结构怎么搭、规则怎么定。

这篇文章当年被大量研究者反对,因为它等于说「你们精心设计的那些东西,最后都会被暴力算力碾过去」。 书的态度是:把时间线拉长看,Sutton 说得有道理。

支撑这个判断的对照

书给了一组很清楚的分类15先认一下统计学习那一侧的两个代表,表里会直接报名字。

一个叫决策树——像一串是非题一路问下去:「年收入超过十万吗?」→「有没有房贷?」, 问到底就落进某一类。它每一步都看得见,人能直接读懂它凭什么这么判。

另一个叫支持向量机——在两类数据中间划一条尽量宽的分界线, 新来的数据落在哪一边就算哪一类。

统计学习模型深度学习模型
例子决策树支持向量机多层神经网络堆起来
数学基础理论完备理论不够成熟
对芯片的态度用得克制靠海量的数硬凑答案,能让上万块芯片同时开工
2010 年前主流边缘
2010 年后边缘主流(因为 GPU——就是显卡里那种芯片,本行是画游戏画面,特点是能同时做成千上万次简单运算——终于跑起来了)16

这张表解释了一件很多人想不通的事: 为什么理论更漂亮的方法输给了理论更糙的方法? 因为后者能把算力花掉,前者不能。

书给的定义

综合各方意见之后,书落到这一句:

大模型指的是具有大量参数的神经网络模型,通常包含数百万到数百亿甚至数千亿的参数。17

注意这个定义只有一条:参数量——也就是那堆可以拧的数一共有多少个。 这是个重要的观察,后面会说它出了什么问题。

回到那张猫的照片,看这条定义在它身上是什么意思。 走查第二格那个只会答「猫,0.87」的模型,内部有 6000 万个可以拧的数; 写出第三格那句「看起来在等人开门」的模型,有 1750 亿个——差 2900 倍。 按这条定义,后者是大模型,前者不是,判据只有这一个数。 而定义里一个字都没提它读了多少张照片、多少段文字——这处缺口第 04 章会算给你看。

书还引用了一份斯坦福的报告,给这类模型起了另一个名字,叫基础模型 (意思是「别的应用都建在它上面的那个底座」),并点出两个性质18:

性质书里的定义为什么要紧
涌现(就是模型做大到某一步,突然会了一样谁也没教过的本事)书里的定义是:系统的行为由隐性因素驱动,而非显式构建你没教它,它却会了
同质化所有下游应用都建在同一个基座上好处会被继承,缺陷也会被全部继承

这两条同样落在那张照片上。 涌现: 6000 万个数的那个模型只会答「猫,0.87」;做到 1750 亿之后, 没有人教过它「等人开门」这种说法,它却答得出来。 同质化: 而医院用来读病历的那个模型,和刚才写出「等人开门」的是同一个底子—— 它把猫认成狗的那套毛病,和它在病历上认错药名的毛病,来自同一批数。

第二条比第一条重要得多,但书里只有一句话。 它是后面第 06 章「行业大模型全靠微调通用基座」那套做法的隐患所在—— 基座的偏见、爱一本正经编造事实的毛病(行话叫幻觉)、知识停在哪一天, 会原封不动地传给医疗、金融、政务的每一个应用。

补充(不在书里): 这份报告的正式名称是《On the Opportunities and Risks of Foundation Models》, 由斯坦福以人为本人工智能研究院下属的基础模型研究中心撰写,署名作者上百位, 第一作者是 Rishi Bommasani,2021 年 8 月 16 日发布。

书里写的是「李飞飞与 100 多位学者共同发表」——她是作者之一,但不是第一作者, 报告也不是以她的名义发的。 这类署名归属在中文转述里经常出错。

来源:《On the Opportunities and Risks of Foundation Models》 https://arxiv.org/abs/2108.07258(查阅于 2026-08-25)

大模型的三段发展史

书把它切成三段19这三段的分界线其实不是年份,是「机器拿什么当输入」变了三次—— 一次一段,一段一个名字。

第一次变化,是让机器看得了图。 拿一个小窗口在照片上一格一格地扫,每扫一处算出一个数, 这个动作叫卷积,这么干的网络就叫卷积神经网络。 走查第二格那张 1920×1080 的猫照片,靠的正是它—— 它把两百万个像素点压成了几百个能互相比对的数。

第二次变化,是让机器读得了词。 一个词本身不是数,没法算; 2013 年那个叫 Word2Vec 的工作把每个词变成一串数,这串数就叫词向量。 有了它,「北京」和「上海」这两串数就能比出「离得近」—— 上一节说的「一串数叫向量」,在文字这一侧的名字就是它。

第三次变化,是让机器一眼看全整句话。 这一步靠的是 2017 年 Google 提出的 Transformer——一种全新的造法: 读一句话的时候,让每个词一步就能直接看到句子里其他所有的词, 不必像老办法那样顺着从头一个传一个。 这带来两个后果——长句子不再丢三落四,而且整句话可以摊开来交给上万块芯片同时算。 第 02 章整章讲它。

2018 年还出了另一个模型,叫 BERT——Google 做的。 它和同年 OpenAI 的 GPT 用的是同一套底子(都是拿 Transformer 造的), 但各取了一半、朝相反的方向练20: GPT 只准看前文、一个字一个字往下写,练的是「往下接」; BERT 准它前后一起看,训练方式是把句子里的词随机挖掉几个让它填回来(就是做完形填空), 练的是「读懂一句话」,不擅长往下写长文先把差别记住:GPT 会写,BERT 会读。 后来赢的是 GPT 那条路——为什么,第 02 章讲。

把这三段摆到时间轴上

阶段时间标志
萌芽期1950—2005卷积神经网络等传统网络;1998 年的 LeNet-5——第一个真正被用起来的卷积神经网络,干的活儿是认支票上的手写数字,「机器看图」这条路从它起步
探索沉淀期2006—20192013 年词向量、2014 年 GAN、2017 年 Transformer、2018 年 GPT-1 与 BERT
迅猛发展期2020 至今2020 年 GPT-3(1750 亿参数)、2022 年底 ChatGPT、2023 年 GPT-4

第 02 章讲注意力(让模型自己决定该多看句子里的哪几个词)时,喂进去的就是词向量这种数。

大模型家族的四种切法

书给了四种切法21,这张表比前面那条时间轴实用。 先解释一个反复出现的词:模态——就是信息的类型,文字是一种模态,图片、声音、视频各是一种。

按什么分分成什么
参数规模预训练模型 → 大规模 → 超大规模;书说千亿级已是主流
技术架构主流是 Transformer,分出 GPT 和 BERT 两条路线——GPT 只看前文、专练往下写,BERT 前后一起看、专练读懂;书说 GPT-3 出来之后,几乎所有千亿以上的模型都走了 GPT 那条路
模态处理文字的 / 处理图像的 / 做科学计算的,并且正从「只吃一种、只干一件事」走向「什么都吃、什么都干」
应用领域通用大模型(相当于让 AI 完成「通识教育」)/ 行业大模型(「专业教育」)

最后一行的比喻很贴切,但用完就该拆掉: 通识/专业只是帮你记住区别, 实际的差别是「有没有拿行业语料(某个行业攒下来的大量文字材料)再训一遍」—— 这一点第 06 章会讲透。

7. AI 4.0:这一节是什么性质的内容

这一节回答:关于意识和硅基生命的那一段,该怎么读。

书自己划的界线很清楚

书先把两件事分开22:

自主智能侧重于 AI 的行为和反应,意识则侧重于更深层次的自我认知和主观体验。

这条切分是准的: 一个系统能自己拆任务、调工具、干完活,和它「知道自己在干活」,是两回事。

关于「AI 有没有意识」,书如实记了分歧

立场代表说法
可能有有「AI 教父」之称的杰弗里·辛顿认为这话题已跨出科幻边界23
还早另一些学者认为目前只是对大量数据的高效处理;意识可能需要由利益和欲望驱动,而这是 AI 不具备的

书还老实写了一句关键的话:意识的确切机制和定义仍然是一个未解之谜, 而且意识的核心特征是主观性——第一人称体验私有、无法被他人直接观察, 这让它难以用客观科学方法研究24

这句坦白比结论有价值: 连「意识是什么」都没定义清楚, 「AI 有没有意识」这个问题在当下就不是一个可判定的问题。

两个意识理论,以及它们在这里的作用

书介绍了两个25:

  • 综合信息论: 只要系统能高度整合信息,就可视为有意识。 按这个说法,参数上万亿、能整合海量信息的大模型「可能发展出意识」;
  • 全局工作空间理论: 意识像剧院——舞台上同时只能放有限的信息, 再广播给大脑里一片无意识的模块网络。若 AI 被设计成有类似的「全局工作空间」,可能具备某种意识形态。

书对这两个理论的态度是保留的: 明确说综合信息论「存在不少缺陷且目前仍有争议」25

硅基生命那一节

这一节的内容是:硅在元素周期表里就在碳下面、性质相似; 如果电子设备能产生意识,是不是可以叫硅基生命; 以及马斯克那句「人类社会本质上是一个引导程序」26

书自己给了定性: 紧接着就写了一句——这一设想目前仍属于科学幻想26

判断(我们的,不是书里的): 整个 1.6 节应该当作这本书的「视野声明」来读,不是内容。 它没有给出任何可检验的主张,引用的都是他人观点和一段元素周期表的类比。 它在书里的功能是:告诉读者「作者知道这条路能通到哪儿」,顺便给全书一个开阔的收尾。 拿它去支持任何论断都是误用。 如果错,会错在: 如果读者需要的正是「行业里的人怎么想这件事」这种氛围信息, 那这一节就有它的价值——只是不该被当成分析。

8. 这一章哪几处不能信

这是整个拆解里最重要的一节。 这一章是全书史实密度最高的一章, 也是错误最集中的一章。下面四处已经核对过,请直接按修正版记。

书里的说法实际是什么依据
「约翰·麦卡锡于 1956 年开发的逻辑理论家(LT)程序」27作者不是麦卡锡。 逻辑理论家由 Allen Newell、Herbert Simon、Cliff Shaw 三人在兰德公司完成,1955 年动工、1956 年完成。麦卡锡是「人工智能」这个词的提出者和达特茅斯会议的组织者之一,和 LT 没有开发关系——Newell 和 Simon 是带着 LT 去达特茅斯会议做展示的人补充(不在书里):《Logic Theorist》https://en.wikipedia.org/wiki/Logic_Theorist(查阅于 2026-08-25)
「BERT 是众所周知的,其最著名的落地项目包括谷歌的 AlphaGo」28先把两样东西各自是什么摆出来,再看那句话错在哪。BERT: Google 2018 年发布的语言模型,拿 Transformer 「读」的那一半造的,靠做完形填空练出来,干的是读懂一句话(搜索、分类、抽信息)。AlphaGo: Google 旗下 DeepMind 做的下围棋程序,靠「把棋局往下试很多步再挑一步走」,配两个看棋盘的卷积网络当参谋。于是错了两层:时间上,AlphaGo 2016 年 3 月就赢了李世石,比 BERT 早两年,不可能是它的落地项目;技术上,AlphaGo 不处理语言、也没用 Transformer,和 BERT 这条线一个零件都不共用补充(不在书里):《AlphaGo》https://en.wikipedia.org/wiki/AlphaGo(查阅于 2026-08-25)
四阶段的时间线自相矛盾书说「AI 1.0 对应 20 世纪 70 年代的计算智能」,又说「AI 2.0 对应 20 世纪的感知智能」2——后一个阶段的时间范围包含了前一个。而正文里讲决策式与生成式 AI 时,起点写的是「2006 年左右」29,已经是 21 世纪书内自相矛盾,不需要外部依据
「计算智能」的定义和它的时代对不上定义里写的是「机器基于海量数据进行深度学习」,例子举的是 AlphaGo 和电商推荐3——这些都是 2010 年之后的事,却被挂在「20 世纪 70 年代」那一格上书内自相矛盾,不需要外部依据

判断(我们的,不是书里的): 这四处错误有一个共同点—— 它们全都出现在「转述行业常识」的地方,而不是作者自己的分析里。 作者讲产业结构、讲算力测算的时候是准的;一讲技术史就开始出错。 这是一份产业研究报告的典型特征:强在它一手接触的领域,弱在它二手转述的领域。 实用推论:这本书的技术史部分一律不要引用,产业部分可以引用。 如果错,会错在: 如果后面几章里也出现同等密度的事实错误, 那问题就不是「二手转述」,而是整体的核查标准——那这本书的可信度要整体下调。 我们通读之后的结论是没有:第 3 章之后的数字大多标了来源,可回溯。

9. 作者的判断与证据:哪些有依据,哪些是推测

这一节把这一章的说法按可靠性分三档。

档次这一章里的例子
有明确依据图灵 1950 年的论文与图灵测试、1956 年达特茅斯会议、2012 年图像识别突破、GPT-3 的 1750 亿参数、Transformer 出现于 2017 年
转述他人观点Sutton 的《苦涩的教训》、斯坦福基础模型报告的涌现与同质化、辛顿关于意识的看法、综合信息论与全局工作空间理论、马斯克的「引导程序」
作者自己的推测「AI 将向更具意识的方向发展,逐步演化为自主智能」及其三条路径(一是让模型什么类型的信息都能吃,这叫多模态;二是让它说得清自己为什么这么答;三是模仿人脑的结构)30;「自主智能的发展路径是学习单一任务 → 举一反三 → 与环境动态交互的主动学习」31

第三档必须单独看待: 它们是作者对未来的判断,书里没有给出任何证据或可检验的判据。 把它们当成行业共识去引用是误用。

还有一类特别容易被误读:书里提到的「Q*」。 书写的是「2023 年 11 月据业内人士透露,OpenAI 正在训练名为 Q* 的下一代人工智能」32—— 这是转述当时的传闻,不是已证实的事实,书里也用了「据称」二字。

补充(不在书里): 2024 年 9 月,OpenAI 发布了 o1,这是第一个公开的「先推理再回答」的模型, 用大规模强化学习训练;2025 年 1 月,DeepSeek 发表 R1,论文公开了用纯强化学习激发推理能力的做法, 明确主张不需要人手把每一步怎么想的写成范例喂给它(把答案人工写好、贴到数据上,这道工序叫标注)。

这一类模型是不是当年传闻里的 Q*,官方从未确认, 但**「训练一个会自己一步步想的模型」这条路在书出版之后确实走通了**。

来源:《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》 https://arxiv.org/abs/2501.12948(查阅于 2026-08-25)

10. 边界与局限

这一章没覆盖的东西:

  • 大模型的定义只用了参数量这一条。 书说「数百万到数千亿参数」就叫大模型, 完全没提训练数据量。 这是全书最要紧的一处缺口,第 04 章会详细讲;
  • 涌现被当成既定事实。 书用它解释「为什么模型大了就突然会了」, 但没提这件事在学界有争议——第 05 章会补上;
  • 没有一句关于「这套四阶段划分是谁提的」。 书用了它,但没交代来源, 也没说它和别的划分法(比如按学习范式分、按模态分)有什么关系;
  • AI 1.0 那一节跳过了两次 AI 寒冬。 从「规则驱动碰壁」直接跳到「机器学习兴起」, 中间那两段资金枯竭、研究停摆的历史一个字没有——而那才是「为什么等了三十年」的答案。

已被时间冲刷的说法:

书里的说法现在怎么看
「参数规模每年至少提升 10 倍」33这条趋势在书出版前后就停了。 领跑的那几个模型,公开的参数量不再一年一个台阶地往上翻;力气转向了三处:训练材料怎么配比、把模型拆成一堆「专科医生」每次只叫醒几个(行话叫混合专家),以及上线之后回答问题时肯多花多少芯片时间
「千亿级参数规模的大模型已成为主流」33说法本身没错,但「主流」的含义变了——今天同一个模型家族会同时有几十亿到几千亿的多个尺寸,按场景选

11. 可带走的

  1. 这套四阶段划分量的是「像不像人」,不是「用了什么技术」——沟通好用,分析别用; 同一张猫的照片,四格分别吐出 2.1 MB 的原始数据、一行「猫,0.87」、一句「它在等人开门」、 一串「于是它自己去查了门禁记录」——四格的差别就是这四种输出;
  2. 书自己说自主智能「尚未在实际中应用」,所以 AI 4.0 是展望不是路线图;
  3. 规则驱动的天花板是「规则写不完」,不是「规则写得不够好」;
  4. 数据驱动的分水岭是那一句:利用数据本身,而不是人为设定的规则,来做决策;
  5. 端到端学习省掉的是「人得先懂这个问题」这个前提——这是深度学习真正的杀伤力;
  6. 决策式 AI 做「判断是不是」,生成式 AI 做「造一个新的」——这组对照全书通用;
  7. 模型本质上是一个函数,由训练搜出来,不是由逻辑推出来的;
  8. 《苦涩的教训》的判断:长期看,能吃满算力的方法会赢过精心设计的方法;
  9. 基础模型的两个性质里,「同质化」比「涌现」更值得警惕——基座的缺陷会被下游全部继承;
  10. GPT 会写、BERT 会读——2018 年同一年、同一套底子(都是 Transformer)分出来的两个方向, 后来赢的是 GPT;
  11. 这本书给大模型的定义只有参数量这一条,没提数据量,这是它最大的技术缺口;
  12. 这一章有四处硬伤:逻辑理论家的作者、AlphaGo 与 BERT 的关系、四阶段时间线自相矛盾、计算智能的定义与年代对不上——技术史部分一律别引

12. 原文地图

主题原书章原文位置
智慧=创造这条起点1.1 智慧的本质:创造text/04-ch01-01-1-1.txt:50(搜「人类智慧从模仿到创造」) · text/04-ch01-01-1-1.txt:59(搜「智慧既是基于神经器官的一种高级综合能力」)
四阶段的划分与定义1.2 AI的4个发展阶段text/05-ch01-02-1-2-ai-4.txt:16(搜「如果将AI技术的发展与智能化水平进行映射」) · text/05-ch01-02-1-2-ai-4.txt:22(搜「计算智能:涉及机器的超强存储能力」) · text/05-ch01-02-1-2-ai-4.txt:28(搜「认知智能:指机器具有人类的理解能力」)
自主智能尚未应用、三条演化路径1.2 AI的4个发展阶段text/05-ch01-02-1-2-ai-4.txt:37(搜「自主智能还处于研究和探索阶段」) · text/05-ch01-02-1-2-ai-4.txt:46(搜「多模态大模型将发挥出更加强大的认知能力」) · text/05-ch01-02-1-2-ai-4.txt:55(搜「迁移学习、元学习和自主学习」)
Q* 传闻与超级智能预测1.2 AI的4个发展阶段text/05-ch01-02-1-2-ai-4.txt:58(搜「读作“Q-star”」) · text/05-ch01-02-1-2-ai-4.txt:61(搜「超级人工智能可能在10年内出现」)
图灵测试、达特茅斯、逻辑理论家1.3 AI 1.0text/06-ch01-03-1-3-ai-1-0.txt:24(搜「计算机器与智能」) · text/06-ch01-03-1-3-ai-1-0.txt:33(搜「人工智能的元年被定为1956年」) · text/06-ch01-03-1-3-ai-1-0.txt:36(搜「逻辑理论家」)
规则驱动的死穴1.3 AI 1.0text/06-ch01-03-1-3-ai-1-0.txt:39(搜「它们完全依赖于预设的规则」)
数据驱动的分水岭1.3 AI 1.0text/06-ch01-03-1-3-ai-1-0.txt:45(搜「利用数据本身,而不仅仅是人为设定的规则」) · text/06-ch01-03-1-3-ai-1-0.txt:65(搜「端到端的学习方式」)
决策式与生成式的对照1.4 AI 2.0text/07-ch01-04-1-4-ai-2-0-ai-ai.txt:92(搜「判断是不是」) · text/07-ch01-04-1-4-ai-2-0-ai-ai.txt:30(搜「监督学习通过分析带有标签的训练数据集」) · text/07-ch01-04-1-4-ai-2-0-ai-ai.txt:89(搜「生成式AI的核心目标是生成与训练数据相似的新数据」)
模型本质上是一个函数1.4 AI 2.0text/07-ch01-04-1-4-ai-2-0-ai-ai.txt:122(搜「本质上,AI模型是一个函数」)
苦涩的教训、统计学习 vs 深度学习1.5 AI 3.0text/08-ch01-05-1-5-ai-3-0.txt:24(搜「The Bitter Lesson」) · text/08-ch01-05-1-5-ai-3-0.txt:30(搜「统计学习模型」) · text/08-ch01-05-1-5-ai-3-0.txt:33(搜「得益于GPU算力的快速发展」)
基础模型报告、涌现与同质化1.5 AI 3.0text/08-ch01-05-1-5-ai-3-0.txt:39(搜「On the Opportunities and Risk of Foundation Models」) · text/08-ch01-05-1-5-ai-3-0.txt:42(搜「同质化」)
大模型的定义1.5 AI 3.0text/08-ch01-05-1-5-ai-3-0.txt:48(搜「数百万到数百亿甚至数千亿的参数」)
三段发展史与大模型家族1.5 AI 3.0text/08-ch01-05-1-5-ai-3-0.txt:62(搜「萌芽期」) · text/08-ch01-05-1-5-ai-3-0.txt:80(搜「Word2Vec」) · text/08-ch01-05-1-5-ai-3-0.txt:104(搜「每年参数规模至少提升10倍」) · text/08-ch01-05-1-5-ai-3-0.txt:113(搜「通识教育」)
BERT/AlphaGo 那处错误1.5 AI 3.0text/08-ch01-05-1-5-ai-3-0.txt:107(搜「其最著名的落地项目包括谷歌的AlphaGo」)
自主智能与意识的分界1.6 AI 4.0text/09-ch01-06-1-6-ai-4-0.txt:24(搜「自主智能与意识之间存在着微妙而关键的差别」) · text/09-ch01-06-1-6-ai-4-0.txt:33(搜「意识的一个关键特征是主观性」)
两个意识理论1.6 AI 4.0text/09-ch01-06-1-6-ai-4-0.txt:54(搜「综合信息论」)
硅基生命1.6 AI 4.0text/09-ch01-06-1-6-ai-4-0.txt:89(搜「硅基生命的概念在19世纪就已经被提出」) · text/09-ch01-06-1-6-ai-4-0.txt:95(搜「这一设想目前仍属于科学幻想」)

Footnotes

  1. 出处:「1.2 AI的4个发展阶段」第 37 段(text/05-ch01-02-1-2-ai-4.txt:37,搜「自主智能还处于研究和探索阶段」)。原文的完整说法是「目前,自主智能还处于研究和探索阶段,尚未在实际中应用」。 2

  2. 出处:「1.2 AI的4个发展阶段」第 16 段(text/05-ch01-02-1-2-ai-4.txt:16,搜「如果将AI技术的发展与智能化水平进行映射」)。同一段里同时写着「AI 1.0 阶段对应于 20 世纪 70 年代的计算智能」和「AI 2.0 阶段对应于 20 世纪的感知智能」(搜「AI 2.0阶段对应于20世纪的感知智能」),两个时间范围互相包含。 2

  3. 出处:「1.2」第 22 段(text/05-ch01-02-1-2-ai-4.txt:22,搜「计算智能:涉及机器的超强存储能力」)。这一段里举的例子是 AlphaGo 和电商个性化推荐,都属于 2010 年之后的事,与「20 世纪 70 年代」这个定位对不上。 2

  4. 出处:「1.2」第 25 段(text/05-ch01-02-1-2-ai-4.txt:25,搜「感知智能:涉及机器视觉」)。

  5. 出处:「1.2」第 28 段(text/05-ch01-02-1-2-ai-4.txt:28,搜「认知智能:指机器具有人类的理解能力」)。

  6. 出处:「1.2」第 37 段(text/05-ch01-02-1-2-ai-4.txt:37,搜「自主智能:被视为“更高级别的超级人工智能”」)。

  7. 出处:「1.3.1 规则驱动」第 39 段(text/06-ch01-03-1-3-ai-1-0.txt:39,搜「它们完全依赖于预设的规则」)。下棋那个对照也在同一段。 2

  8. 出处:「1.3.1」第 45 段(text/06-ch01-03-1-3-ai-1-0.txt:45,搜「利用数据本身,而不仅仅是人为设定的规则」)。书举的两个标志性事件是 1967 年的最近邻算法和 1979 年的「斯坦福推车」(搜「斯坦福推车」在同一段与第 48 段)。

  9. 出处:「1.3.2 数据驱动」第 62 段(text/06-ch01-03-1-3-ai-1-0.txt:62,搜「2006年杰弗里·辛顿提出深度学习概念」)与第 74 段(text/06-ch01-03-1-3-ai-1-0.txt:74,搜「数据驱动AI的兴起与计算能力的显著增强」)。

  10. 出处:「1.3.2」第 65 段(text/06-ch01-03-1-3-ai-1-0.txt:65,搜「端到端的学习方式」)。同一段提到 2012 年 ImageNet 上的突破(搜「亚历克斯·克里兹希夫斯基」)。

  11. 出处:「1.4.2 生成式AI」第 92 段(text/07-ch01-04-1-4-ai-2-0-ai-ai.txt:92,搜「判断是不是」)。原文的完整对照是:决策式 AI「主要任务是『判断是不是』和『区分是什么』」,生成式 AI 则「在归纳和分析已有数据的基础上,创作出新的内容」,达到「举一反三」。

  12. 出处:「1.4.1 决策式AI」第 30 段(text/07-ch01-04-1-4-ai-2-0-ai-ai.txt:30,搜「监督学习通过分析带有标签的训练数据集」)。原文举的标签例子正是「垃圾邮件/非垃圾邮件」和房屋价格。

  13. 出处:「1.4.2」第 122 段(text/07-ch01-04-1-4-ai-2-0-ai-ai.txt:122,搜「本质上,AI模型是一个函数」)。这句话出现在讲可解释性的段落里,书没有展开,但它是全书对「训练」最准确的一次定义。

  14. 出处:「1.5.1 大模型:人类经验与充足算力」第 24 段(text/08-ch01-05-1-5-ai-3-0.txt:24,搜「The Bitter Lesson」)。补充(不在书里,来自通用知识):这篇短文由 Richard Sutton 发表于 2019 年 3 月,标题常译作《苦涩的教训》;Sutton 是强化学习领域的奠基者之一。

  15. 出处:「1.5.1」第 30 段(text/08-ch01-05-1-5-ai-3-0.txt:30,搜「统计学习模型」)。

  16. 出处:「1.5.1」第 33 段(text/08-ch01-05-1-5-ai-3-0.txt:33,搜「得益于GPU算力的快速发展」)。

  17. 出处:「1.5.1」第 48 段(text/08-ch01-05-1-5-ai-3-0.txt:48,搜「数百万到数百亿甚至数千亿的参数」)。同一段还写明广义的大模型包括机器视觉、多模态和科学计算大模型。

  18. 出处:「1.5.1」第 42 段(text/08-ch01-05-1-5-ai-3-0.txt:42,搜「同质化」)与第 39 段(text/08-ch01-05-1-5-ai-3-0.txt:39,搜「On the Opportunities and Risk of Foundation Models」)。注意书里把报告标题写成了 Risk(单数),原文是 Risks。「扩展法则」与「涌现能力」这两个词出自书转述的另一份综述(搜「涌现能力」在第 45 段)。

  19. 出处:「1.5.2 大模型的演变与谱系」第 59 段(text/08-ch01-05-1-5-ai-3-0.txt:59,搜「萌芽期」)、第 80 段(text/08-ch01-05-1-5-ai-3-0.txt:80,搜「Word2Vec」)、第 89 段(text/08-ch01-05-1-5-ai-3-0.txt:89,搜「GPT-3。该模型的参数规模达到了1750亿」)。

  20. 出处:「2.1.1 Transformer架构」第 63 段(text/11-ch02-01-2-1.txt:63,搜「GPT模型仅采用了解码器部分」)与第 66 段(text/11-ch02-01-2-1.txt:66,搜「BERT模型采用了双向Transformer编码器」)。原文的措辞是:BERT「分析整个输入序列的上下文,更接近于完形填空的模式」,GPT「遮盖下文,仅依据上文来生成新文本……更接近于人类的语言生成模式」。Transformer 那两个好处也出自同一节第 42 段(text/11-ch02-01-2-1.txt:42,搜「不受距离远近的限制」),原文说任意两个词的相互作用「不受距离远近的限制」,而且「各计算步骤不依赖于前一步骤的结果」,所以能并行。这些内容书放在第 2 章才讲,但第 1 章就先用上了这几个名字——所以我们提前给出。 补充(不在书里,来自通用知识):GPT-1 与 BERT 都发布于 2018 年,前者出自 OpenAI,后者出自 Google;LeNet-5 是 1998 年发表的卷积神经网络,当年被用于识别支票上的手写数字。

  21. 出处:「1.5.2」第 104 段(text/08-ch01-05-1-5-ai-3-0.txt:104,搜「每年参数规模至少提升10倍」)与第 113 段(text/08-ch01-05-1-5-ai-3-0.txt:113,搜「通识教育」)。

  22. 出处:「1.6.1 让机器拥有意识还有多远」第 24 段(text/09-ch01-06-1-6-ai-4-0.txt:24,搜「自主智能与意识之间存在着微妙而关键的差别」)。

  23. 出处:「1.6.1」第 39 段(text/09-ch01-06-1-6-ai-4-0.txt:39,搜「AI教父」)。书同时记了辛顿关于「AI 将在 2040 年达到无穷大的国民生产总值」的说法——这是转述,不是作者的判断。

  24. 出处:「1.6.1」第 33 段(text/09-ch01-06-1-6-ai-4-0.txt:33,搜「意识的一个关键特征是主观性」)与第 30 段(text/09-ch01-06-1-6-ai-4-0.txt:30,搜「意识的确切机制和定义仍然是一个未解之谜」)。

  25. 出处:「1.6.1」第 54 段(text/09-ch01-06-1-6-ai-4-0.txt:54,搜「综合信息论」)与第 60 段(text/09-ch01-06-1-6-ai-4-0.txt:60,搜「IIT仍为一个理论框架」)、第 66 段(text/09-ch01-06-1-6-ai-4-0.txt:66,搜「全局工作空间」)。 2

  26. 出处:「1.6.2 硅基生命的争议与想象」第 89 段(text/09-ch01-06-1-6-ai-4-0.txt:89,搜「硅基生命的概念在19世纪就已经被提出」)与第 95 段(text/09-ch01-06-1-6-ai-4-0.txt:95,搜「这一设想目前仍属于科学幻想」)。 2

  27. 出处:「1.3.1」第 36 段(text/06-ch01-03-1-3-ai-1-0.txt:36,搜「逻辑理论家」)。补充(不在书里):逻辑理论家由 Allen Newell、Herbert A. Simon 与 Cliff Shaw 于 1955—1956 年在兰德公司完成,证明了《数学原理》第二章前 52 条定理中的 38 条;Newell 与 Simon 是在 1956 年达特茅斯会议上展示它的人,麦卡锡是会议的组织者之一与「人工智能」一词的提出者。来源:《Logic Theorist》https://en.wikipedia.org/wiki/Logic_Theorist(查阅于 2026-08-25)

  28. 出处:「1.5.2」第 107 段(text/08-ch01-05-1-5-ai-3-0.txt:107,搜「其最著名的落地项目包括谷歌的AlphaGo」)。补充(不在书里):AlphaGo 由 DeepMind 开发,核心是蒙特卡洛树搜索加上策略网络与价值网络,两者都是十二层卷积神经网络,通过强化学习训练;2016 年 3 月以 4:1 胜李世石,2017 年 5 月胜柯洁。它与 BERT、Transformer 没有技术关系。来源:《AlphaGo》https://en.wikipedia.org/wiki/AlphaGo(查阅于 2026-08-25)

  29. 出处:「1.4.1」第 24 段(text/07-ch01-04-1-4-ai-2-0-ai-ai.txt:24,搜「从2006年左右开始」)。

  30. 出处:「1.2」第 46 段(text/05-ch01-02-1-2-ai-4.txt:46,搜「多模态大模型将发挥出更加强大的认知能力」)。三条路径分别是多模态、可解释的认知智能、类脑智能。

  31. 出处:「1.2」第 55 段(text/05-ch01-02-1-2-ai-4.txt:55,搜「迁移学习、元学习和自主学习」)。

  32. 出处:「1.2」第 58 段(text/05-ch01-02-1-2-ai-4.txt:58,搜「读作“Q-star”」)。原文用的是「据业内人士透露」和「据称」,书自己标明了这是传闻。同段后面「OpenAI 预测超级人工智能可能在 10 年内出现」见第 61 段(text/05-ch01-02-1-2-ai-4.txt:61,搜「超级人工智能可能在10年内出现」)。

  33. 出处:「1.5.2」第 104 段(text/08-ch01-05-1-5-ai-3-0.txt:104,搜「每年参数规模至少提升10倍」)。 2