AI 四阶段史观 — 这本书的坐标系,和它靠不住的地方
这一章讲三件事: 这本书用什么尺子来量整个 AI 行业; 这把尺子从「规则驱动」一路量到「大模型」的时候都量出了什么; 以及这一章里哪几处不能信——它是全书史实错误最集中的地方。 后面七章全部建立在这套坐标系上,所以先把尺子本身看清楚。 不需要任何基础,遇到的生词都在当场解释。
1. 先看现象:满天飞的「几点零」和「什么智能」
你大概见过这类说法:「AI 已经进入 2.0 时代」「我们要从感知智能走向认知智能」 「下一步是自主智能」。会议 PPT 上、政府文件里、厂商发布会上,全是这套话。
问题是:没人告诉你这套划分是谁定的、按什么标准分的、边界在哪。
于是最常见的两种误用是:
-
当成技术分类去用——以为「感知智能」和「认知智能」是两套不同的算法(算法就是一串固定的 计算步骤,机器照着做就能得出结果)。不是。 它们是按「机器表现得像人到什么程度」分的,而同一套东西可以同时落在两格里;
同一套什么?叫神经网络——一层层排开的简单计算单元(每个单元只做一次乘、一次加)、 中间连着大量可以拧的数,靠反复喂数据把这些数拧对。 同一套神经网络,既能拿去认人脸(算感知),也能拿去答题(算认知), 所以按它根本分不出这两格来;
-
当成时间表去用——以为「自主智能」是排好期的下一站。 书自己都说它「尚未在实际中应用」1。
这一章的价值就是:把这把尺子的刻度、用法,以及它在哪儿会失准,都交代清楚。
2. 顶层全景:这本书的坐标系长什么样
┌── 起点:一个关于人的判断 ──────────────────────────────────┐
│ 人类智慧的路线是「先模仿自然,后创造工具」 │
│ ⟹ 机器智能被套进同一条路:从执行人写好的规则,到自己创造 │
└───────────────────────────┬──────────────────────────────┘
▼
AI 1.0 计算智能 ── AI 2.0 感知智能 ── AI 3.0 认知智能 ── AI 4.0 自主智能
照规则办事 能看能听能说 能理解能推理 能自我进化
专家系统 人脸识别/自动驾驶 大模型(书说现在在这) 书说还在研究阶段
│ │ │ │
│ │ ┌─────┴─────┐ │
└── 转折点 ① ────┘ │ │ └─ 转折点 ③
规则驱动 → 数据驱动 决策式 AI 生成式 AI 能力 → 意识?
(判断) (创造)
└─ 转折点 ② ─┘
大模型让「生成」这条路
顺带把理解和推理也做了
图说:三个转折点是这一章的全部内容;四个阶段只是给这三个转折点挂的标签。
记住这张图,后面七章都可以往上面挂。
一条贯穿全章的主走查:一张猫的照片
这一章的每个承重机制,都会回到这张照片上占一步。 下面出现的数值和输出都是为演示编的,不是真实数值。
输入: 一张 1920×1080 的照片,画面里一只猫坐在一扇门前。
| 这台机器停在哪一格 | 拿这张照片能吐出什么 |
|---|---|
| 计算智能 | 2.1 MB 的一堆 0 和 1。它存得住、算得出这堆数的总和,但「画面里有什么」它一个字答不上来 |
| 感知智能 | 一行能进表格的记录:「猫,框的左上角 (120,340),宽 260 高 310,置信度 0.87」。一张图变成了四个数加一个名字 |
| 认知智能 | 一句话:「照片里的猫坐在门前,看起来在等人开门。」 它答的不再是画面里有什么,是这件事在讲什么 |
| 自主智能 | 一串它自己决定要做的事:去查这扇门的门禁记录,发现主人 40 分钟前出门,于是给主人发了一条消息。 没有人让它去查 |
四格的差别就这么当场量出来了: 第一格到第二格,输出从 2.1 MB 缩成一行五个格子; 第二格到第三格,输出从「有什么」变成「在讲什么」; 第三格到第四格,输出从一句话变成一串动作。 书说我们现在站在第三格,第四格「尚未在实际中应用」1。
但请留意第二格和第三格:它们用的很可能是同一套技术。 这正是下一节要说的事——这把尺子量的是表现,不是技术。
3. 尺子本身:四个阶段是按什么分的
这一节回答:这套划分的判据到底是什么。
书说得很直接:把「AI 技术的发展」和「智能化水平」一一对应起来,对出四段2 (把两样东西一一对应起来,数学上管这叫映射)。 「智能化水平」就是这把尺子的刻度——它量的是「机器表现得多像人」,不是「用了什么技术」。
四个刻度各自的定义,书给得挺具体:
| 阶段 | 书里的定义 | 一句话 |
|---|---|---|
| 计算智能 | 超强的存储能力和超快的计算能力3 | 算得快、记得多 |
| 感知智能 | 视觉、听觉、触觉等感知能力;能把杂乱的原始材料整理成规规矩矩的表格数据4 | 看得见、听得懂 |
| 认知智能 | 理解、归纳、推理(推理就是一步步想出结论的那个过程)的能力,能运用知识5 | 想得明白 |
| 自主智能 | 能自我学习、自我适应、独立完成任务,甚至无人干预下自我改进6 | 自己会变强 |
这里唯一的生词是非结构化——就是计算机没法直接拿去做统计的那种材料。 一张照片、一段录音、一篇文章都算;把照片变成「这里有一辆车,坐标是……」这样的表格数据, 就叫结构化。感知智能干的活就是这个转换。
这把尺子好在哪
它能一句话说清两个东西的差别。 比如:人脸识别和 ChatGPT 差在哪? 前者是感知(把图变成身份),后者是认知(理解意图再组织回答)。这个回答比讲两套算法快得多。
它不好在哪:这不是技术分类
同一套技术可以同时落进好几格。 举个书自己的例子就够了: 深度学习——就是把很多层这样的网络堆起来一块儿训,「深」说的就是层数多—— 既撑起了人脸识别(感知),也撑起了大模型(认知)。
所以「进入认知智能阶段」不意味着换了技术路线,只意味着同一条路线做出了新表现。
判断(我们的,不是书里的): 这把尺子是沟通工具,不是分析工具。 拿它跟人解释「AI 现在能干什么」很好用;拿它做技术选型、判断某个方案属于哪一代,会得出没有意义的结论。 判据是:如果一个问题的答案取决于「它属于哪个阶段」,那你多半用错了尺子。 如果错,会错在: 如果后续真出现一种只有在「认知」层面才成立的技术性质 (比如某类能力必须靠特定结构才能有),那这套划分就不只是描述性的,而是有预测力的。 目前还没有这样的证据。
4. 转折点①:规则驱动为什么死,数据驱动怎么活
这一节讲全书最扎实的一段历史。
先看现象:早期 AI 为什么下棋很行、别的都不行
书举了一个特别好的对照:早期 AI 在下棋上成绩突出,换到现实问题就不灵7。
原因不在算力,在结构:
下棋:规则明确、环境封闭、可能性有限
⟹ 人可以把策略写成规则,机器照着算就行
现实:规则 说不清、环境开放、总有没见过的情况
⟹ 规则写不完,写不到的地方机器就彻底束手无策
图说:规则驱动的天花板不是「规则不够好」,是「规则写不完」。
书的原话是:这些系统完全依赖于预设的规则,一旦问题不在规则范围内就无能为力, 缺乏自适应能力7。
出路:让机器从数据里自己找规律
转折点是一类叫最近邻的算法出现了——就是「看谁离得最近,就跟谁归一类」。 它的想法朴素到一句话能说完:
一个新数据点属于哪一类?看它离哪个已知数据点最近,就归到那一类。
书点出了这件事真正的意义:它开启了一种全新的思维方式—— 利用数据本身,而不仅仅是人为设定的规则,来做决策和预测8。
这句话是整条 AI 史的分水岭,值得记住。
数据驱动为什么到 2006 年之后才爆发
书归结为三件事凑齐了9:
| 条件 | 具体是什么 |
|---|---|
| 算法 | 2006 年之后的深度学习:一层层堆起来,每层把上一层的输出转成更抽象的概念 |
| 算力 | 芯片、存储、云计算的进步,让处理海量数据成为可能 |
| 数据 | 互联网、社交媒体、物联网产生了前所未有的数据量 |
而深度学习真正打动人的地方,书说得很准:它做到了端到端—— 从最原始的数据一路直通答案,中间不需要人插手10。
这里有一个必须当场说清的词叫特征: 以前做图像识别,得由工程师告诉机器 「看边缘」「看颜色深浅」,这些人工指定的观察角度就叫特征。 端到端的意思是:从一个个像素点直接到答案,中间该看什么由机器自己决定。
这一步省掉的是「人得先懂这个问题」这个前提。 它是后面所有事情的基础。
5. 转折点②:决策式 AI 和它的反面,这本 书最有用的一组对照
这一节的对照表是这一章最值得带走的东西。先把两个名字各自说清楚。
第一个叫决策式 AI——它就是替你做判断的那一类: 是不是垃圾邮件、这张脸是谁、这笔贷款该不该放,它给出的答案都是一个判断。
它的反面叫生成式 AI——它就是替你造东西的那一类: 给它一句话,它还你一段文本、一张图、一段音频。 下面把这两条路各自的来历和本事讲开。
先看现象:同样叫 AI,为什么差别这么大
推荐系统、人脸识别、风控——这些 AI 你用了十年,没觉得它们「聪明」。 ChatGPT 出来才两年,大家却觉得它像个人。
这不是程度差别,是两条不同的路。
| 决策式 AI | 生成式 AI | |
|---|---|---|
| 它在干什么 | 判断是不是、区分是什么11 | 造出一个原来不存在的东西 |
| 学什么 | 数据的观察角度和标准答案之间的关系 | 数据本身长什么样——哪些组合常见、哪些罕见,统计上管这叫分布 |
| 例子 | 分辨猫和狗、判断是不是垃圾邮件、预测房价 | 看过很多汽车照片之后,画出一辆新的汽车 |
| 输出 | 一个类别或一个数 | 一段文本、一张图、一段音频 |
| 成熟度(书写作时) | 更成熟,已在互联网、零售、金融、制造广泛落地 | 起步晚,但 2014 年以来涨得极快 |
回到那张猫的照片,两边的活儿正好是反过来的。 决策式拿到照片,吐出走查第二格那一行:「猫,0.87」——一个名字加一个数。 生成式拿到的是这一行的反面:给它一句「一只猫坐在门前等人开门」, 它吐出一张原来不存在的照片,同样 1920×1080、2.1 MB,可世界上没有这只猫。 一头把图压成标签,一头把标签还原成图。
两边各自的看家本领12。决策式那一侧只有一样,先说完它。
决策式最主要的做法,是拿一堆已经标好答案的数据去训:一万封标了 「是/不是垃圾邮件」的邮件,让模型学出「什么样的邮件是垃圾」这条关系,这叫监督学习—— 「监督」指的就是那些人给的标准答案。
生成式那一侧的三条路
这一侧的招 数多一些。先立一个后面天天要用的词,再一条一条说。
一串数,在数学上叫向量。 一张照片、一个词、一封邮件,都可以先被压成一串数。 压成一串数之后有两个好处: 一是两样东西像不像,可以拿两串数直接比出来 (走查里那张猫的照片和另一张狗的照片,比的就是两串数); 二是机器只会算数——不压成数,后面所有的做法一个都开不了工。
第一条路是先攒一个什么都懂一点的底子,这叫预训练。 拿海量文字训一遍,训出来的东西对每个词都有一串数,什么都懂一点、什么都不精。 「预」字是关键:预训练是正式干活之前先打的那层底子,不是最终形态。
打完底子还要再训一遍,拿少量专门的数据,这一步叫微调—— 调的就是上面那层底子,第 02 章第 3 节专讲它。
第二条路是让两个网络互相较劲,这叫生成对抗网络(英文缩写 GAN:generative adversarial network)。 一个专门造假:给它一串随便凑的数,它还原出一张照片; 一个专门打假:看这张照片像不像真的。 造假的越练越像,打假的越练越挑剔,一来一去,造出来的东西就越来越真。
第三条路是先把输入压小、再从压小的那串数还原回去—— 训好之后随便给一串数,它就能造出一个新样本。
生成式这一侧起步晚,但 2014 年以来涨得极快——每过一小段时间就翻一番, 这种涨法叫指数级增长。