跳到主要内容

请你定义猫 — 规则为什么写不完,以及那两个分水岭

这一章讲三件事: 让机器变聪明,七十年里试过哪两条路; 第一条路是被什么具体的东西挡住的;以及第二条路走到今天, 中间有哪两个瞬间真正改变了格局。

它在全书链条里的位置: 这是第一块地基。后面二十六章讲的全是第二条路怎么走通的, 而这一章负责说清楚为什么必须走第二条路。不需要任何基础。

1. 先做一件事:请你定义猫

这不是修辞,是一道真题。请你现在就试着把「什么是猫」写成一串计算机能照着执行的判断。

你大概会先写:四条腿。然后你想起有的猫失去了一条腿。 你补一条:会叫「喵」。然后你想起有的猫天生不会叫。 你再补:有毛。然后你想起斯芬克斯猫没毛1

你可以不断打补丁,但补丁永无止境。 一个三岁小孩一眼就能认出猫, 可没有人能把他脑袋里那套办法写下来——因为那根本不是一套规则,而是一种说不清的东西2

这道题就是这一章的主走查,后面每一节都会回到它。现在先记住它的形状:

你要教机器认猫,只有两种给法
─────────────────────────────
给法 A:告诉它规则 给法 B:给它例子
「四条腿 且 有毛 且 会喵」 一百二十万张标好的图,
→ 例外永远补不完 让它自己去找共同点
→ 这一章前半段的故事 → 这一章后半段的故事

这张图看的是同一件事的两种给法:左边是人把答案写下来,右边是人只给例子、答案让机器自己凑。 七十年 AI 史,基本上就是右边一点点吃掉左边的过程。(右边具体怎么操作,第 03 章讲。)

2. 第一条路:把知识写成规则

1956 年夏天,一群年轻科学家在美国一所叫达特茅斯的学院里开了八周的会。 就在这次会上,人工智能这个词被正式提出,并成了一门新学科的名字3

在那之前六年,一位英国数学家提出过一个绕开哲学争论的办法: 与其争「机器是不是真的在思考」,不如看它的行为和人有没有区别—— 让一个人隔着屏幕聊天,如果长时间分不清对面是人还是机器,就算它有智能。 这就是后来闻名于世的图灵测试4

会开完之后的二十年,主流相信一件事:智能的本质是对符号的操作。 人之所以聪明,是因为能用语言、公式、规则思考;那么只要把知识写成一套符号和规则, 让计算机照着推演,智能就出来了。这一派叫符号主义5

这条路真的做出过东西。1956 年的一个程序证明了《数学原理》里的 38 条定理, 其中一些证明比原书还漂亮6;1960 年代中期,MIT 做出了第一个聊天机器人 ELIZA, 它只会做关键词匹配、装成心理医生,却真的有人对它倾诉秘密7; 到 1970 年代,能辅助诊断血液感染、能分析化学分子、能给公司配电脑的专家系统 (把某一行专家的经验一条条写成规则的程序)开始在专业领域派上用场。

乐观情绪高到什么程度?1970 年,达特茅斯会议的发起人之一公开说: 「三到八年内,我们就会有一台具有人类平均智能的机器」8

3. 然后撞上了那堵墙

这一节回答:上面那条路是被什么东西挡住的。

挡住它的就是第 1 节那道题。世界太复杂,规则根本写不完。

同样的困境在每一个应用里反复出现:常识(「倒咖啡的时候别把杯子颠倒」这种显然的事很难写下来)、 语言(「小明说他没看见小红,因为她藏在桌子后面」,这里的「她」指谁)、 视觉(同一只猫从不同角度看差别巨大)。几乎所有需要直觉的问题,规则这条路都束手无策。

雪上加霜的是当时的机器:内存小得可怜,速度慢得令人绝望。 到 1970 年代后期,出钱的机构失去了耐心。1973 年英国政府发布的莱特希尔报告直接宣判: 这个方向没能交付它承诺的东西,建议大幅削减拨款9。美国也同步砍了经费。

于是有了 AI 寒冬(资助断掉、论文没人看、研究者纷纷转行的那几年)。 不少人干脆把「人工智能」这四个字从申请书里删掉,换成「模式识别」这类不扎眼的名字。

第一次浪潮的教训只有一句:手写规则应付不了开放世界。 连「猫」都定义不出来, 更复杂的事就更别提了。

4. 第二条路:不给规则,给例子

既然规则写不出来,那就换个思路——让机器自己学10

想让它认猫,不告诉它猫是什么,而是给它几千张已经标好「猫」和「狗」的图片, 让它自己去摸出区分的模式。想让它判断邮件是不是垃圾邮件,给它一堆已经分好类的邮件, 它自己会总结出「含『免费』『中奖』的更可能是垃圾」这类规律。 规律不再由人写下来,而是从例子里长出来。

和符号主义相对的那一派,主张智能不是几条规则能概括的, 而是从大量简单单元的相互连接中冒出来的——人脑就是这样: 单个神经元功能极简单,八百多亿个连起来就产生了语言、想象和自我意识。 这一派叫连接主义11。两派的分歧常被比作「飞机 vs 扑翼机」: 一个想复制推理的外在形式,一个想搞清底层的动力学。过去几十年的实际赢家是后者。

1990 到 2000 年代是这条路的黄金期。一批方法成熟起来, 今天工科生课程里那些名字大多是那时定下的。1997 年,一台叫「深蓝」的机器击败了国际象棋世界冠军; 同期,邮件过滤、手写数字识别、语音识别(把说出来的话自动转成文字)都进入了初步可用的阶段。

5. 但它自己也卡了二十年:例子里该看哪几个数

这一节是全章的转折点,也是最容易被跳过的一节。

问题出在一个很实际的地方:你不能把一张 1000 × 1000 的图片, 一百万个像素直接扔给当时那些方法——它们既吃不下也学不好12

所以中间必须加一步:请一位懂图像的专家,从图片里挑出几百个「人类认为重要的量」, 比如颜色的深浅、边缘的方向、纹理的疏密,打包成一串数再喂进去。 这些被挑出来的量叫特征(从原始数据里提炼出来、真正被送进机器的那几百个数)。 而这个挑选的过程,叫特征工程13

这一步是绝望的。 好特征要靠领域专家多年经验打磨; 识别人脸的特征对识别汽车没用,识别汽车的特征对识别猫没用。 每开一个新任务,就得从零设计一遍。一份典型的项目开发时间里, 大部分花在「想什么特征」上,只有一小部分花在别的地方。

作者对这二十年的总结只有一句:机器学会了用特征,却始终没学会找特征14

6. 第一个分水岭:2012 年那 10.9 个百分点

走查回到猫。 这一次,给机器的不再是规则,而是一百二十万张人工标好的图15

这批图叫 ImageNet,是李飞飞教授于 2007 年发起的项目16。 它背后没有什么神秘魔法,反而像一场大型体力活:先从互联网上搜来海量图片, 再通过众包平台让人一张张确认「这是不是狗」「这是不是校车」。 听起来不像前沿科学,倒像给全世界的照片贴便利签; 但正是这些便利签,给了机器第一次系统学习视觉世界的机会17

2012 年的那场比赛,评分方式是「模型给出 5 个候选答案,全不对才算错」。 走查的数落在这里:

五个候选全不对的比例差多少
第二名(还在用手挑特征那条路)约 26.2%
AlexNet(直接从像素里学)15.3%领先 10.9 个百分点18
三年后的 ResNet3.6%低于常被引用的人类成绩19

在机器学习比赛里,领先十个百分点几乎从未出现过。 更要紧的是它的做法: 它几乎不再依赖人工挑特征,而是直接从像素里学。

为什么偏偏是 2012 年? 这一步的答案不是「办法突然变聪明」,而是三个条件同时成熟20:

第一,例子够了。 互联网让海量标好的数据第一次成为可能,一百二十万张图在二十年前不可想象。

第二,算得动了。 当年那位研究生用的是两块 GTX 580 游戏显卡21—— 显卡里那块专管画面的芯片叫 GPU(它一次能把成千上万个一模一样的算式同时算完, 而普通处理器是一件一件按顺序做)。换成当时的普通处理器,同一件事要算上几个月。

第三,工具有了。 开源(把代码公开放出来,任何人都能拿去用、拿去改)的框架陆续出现, 搭一个复杂网络从「专家活」变成了「研究生活」。

三者缺一不可。它们凑齐的那一刻,就是这条路起飞的时刻。

7. 第二个分水岭:2022 年 11 月 30 日

作者在书里明确说,第三次浪潮里真正改变格局的瞬间有两个, 一个是 2012 年的 AlexNet,另一个是 2022 年的 ChatGPT22。 前者把这条路推上主流,后者把它推到了普通人手里。很多资料只讲前一个,这是漏的。

2022 年 11 月 30 日,一家叫 OpenAI 的公司悄悄上线了一个网页,允许任何人和一个程序免费聊天。 没有发布会、没有广告。发布前,公司内部对这个产品的预期低得出奇, 工程师估计可能有几千人试用就不错了23

然后:五天之内用户破一百万,两个月后过亿24。 作为参照:Instagram 用了两个半月破百万,TikTok 用了九个月破亿级25

这一天的意义不在技术。 技术还是同一条路——同一台机器,只是从图像换到了文字。 真正变的是这件事从技术圈的话题变成了每个人的日常判断题: 老师要决定学生能不能用它写作业,公司要决定员工能不能把资料贴进去, 立法者要决定生成的内容算谁的。

作者引的一份研究给了这场冲击的规模: 约 80% 的美国劳动力所在职业,至少有 10% 的日常任务可能被这类工具显著加速; 约 19% 的劳动者所在职业,一半以上的任务受影响26注意这个数说的是「任务暴露」,不是「岗位消失」——这两件事之间隔着企业怎么组织、 法律怎么定责、人多久学得会。

8. 三次浪潮的共同规律:笨办法赢

把七十年放在一起看,会看到一条反直觉但反复出现的规律: 「笨」方法加上足够的规模,胜过「聪明」方法加上有限的规模27

  • 1950–1980 年代,最聪明的人相信智能等于符号推理,设计了大量精巧的规则系统。小场景里好用,扩不出去。
  • 1980–2010 年代,一批数学上很漂亮的方法成为主流,每一个都有理论保证。 最后胜出的是「一个朴素的多层网络加大量例子加显卡」这种没什么理论保证、但简单能扩展的东西。
  • 2010 年代之后,那块标准积木的设计朴素得像「把所有位置两两关联」。 就是这种朴素,让它能一路扩下去。

这条规律有个名字叫苦涩的教训(Bitter Lesson),是一位在「试错中学习」这一支上深耕了几十年的研究者在 2019 年总结的28。 它的建议只有一句:押注在能扩展的方法上,而不是此刻效果最好的方法上。

苦在哪里? 苦在它一再证明:研究者花在「把领域知识灌进模型」上的心血, 长期看常常被「同一个笨办法乘以十倍规模」抹平。这对认真设计的人是件不痛快的事。

9. 今天它能做什么、不能做什么

书里在合上这一章前专门冷静地列了一份清单。这份清单比任何赞叹都值钱, 因为它决定你什么时候该信它、什么时候必须自己把关。

已经做得很好仍然做不好
认图、认脸、认语音、读医学影像长链条的严谨推导仍然不稳:能解竞赛难题,却可能在一道更简单的变体上出错29
下棋、打复杂电子游戏事实可靠性:会一本正经地编造不存在的人名、书名、事件
翻译、写作、编程辅助开放环境适应:实验室里能完美抓取物体的机器人,到你家可能对着没见过的家具手足无措
从文字生成图像、视频、音乐因果理解:它擅长发现「什么和什么一起出现」,但很难真正回答「为什么」

这四条「做不好」不是随口列的,后面各有一整章接住它: 长链条推导在第 17 与第 20 章,编造在第 17 与第 26 章, 开放环境在第 24 章,因果在第 23 与第 27 章。

10. 作者的判断与证据

有证据的部分。 三次浪潮的时间线、两次寒冬的起因、2012 年那场比赛的分数、 ChatGPT 的增长速度,这些都是可查的事实,书里给的数字与公开记录一致。

是作者判断、不是事实的部分,有三处要分开看:

  1. 「过去几十年的实际赢家是连接主义」。 这是对已发生事实的概括,成立; 但书里同时写了另一半——「大多数研究者相信最终可能需要两种思路的结合」。 别把这句读成「规则那条路已经死了」。
  2. 苦涩的教训。 这是萨顿 2019 年一篇两千字文章里的主张, 书里明确称它是「总结出来的规律」而不是定理。它解释力很强,但它是事后归纳。
  3. 「AI 更像一个随时在线的助理,让每个人的生产力翻倍,而不是替代人本身」。 书里把这句标成「乐观地说」,是一个立场,不是结论。

判断(我们的,不是书里的):这一章最值得记住的不是那些年份,是「定义猫」这道题。 它是一把尺子:以后你遇到任何一个 AI 应用,先问一句 「这件事能不能被写成一串规则」。能,那多半不需要机器学习; 不能,那才是它的地盘。 如果错,会错在: 有些能写成规则的事,机器学的版本反而更便宜—— 比如垃圾邮件过滤,规则能写但维护不起。这把尺子量的是「能不能」,不是「划不划算」。

11. 边界与局限

  • 这一章没有讲两条路各自的技术细节。 符号主义那一侧的推理机、 连接主义那一侧的感知器,书里都只给了名字。感知器在第 05 章会补上。
  • 「三次浪潮」这个分期法本身是叙事需要。 真实历史里各条线是交错的: 1980 年代专家系统正热的时候,连接主义那边也正在琢磨后来撑起这一切的训练办法。
  • 书里对寒冬的成因给的是外部视角(经费、报道)。 内部视角 (当时的方法在数学上卡在哪)这一版没展开,那是教科书全本的内容。
  • 时间锚定在 2025 到 2026 年初。 这一章末尾那份「能与不能」的清单, 是这个时间点的快照;你读到时,右边那一列可能已经短了一两条。

12. 可带走的

  1. 规则写不完,是第一条路失败的唯一原因。 记住「请你定义猫」这道题,它能解释后面很多事。
  2. 第二条路也卡过二十年,卡在「特征还得人来挑」。 深度学习真正的贡献是把这一步也交给了机器。
  3. 2012 年不是办法突然变聪明,是例子、算得动、工具三条线同时到位。 以后看到「某某技术突破」,先问这三条各到了哪。
  4. 分水岭有两个,不是一个。 2012 年改变了这一行,2022 年改变了所有人。
  5. 10.9 个百分点是这一行的历史刻度。 在比赛里领先十个点几乎不曾出现,记住这个量级,你就有了判断「大幅领先」的参照。
  6. 押注能扩展的方法。 这是七十年里被反复验证的一条,也是这本书后面每一章的暗线。
  7. 「任务暴露 80%」不等于「80% 的人失业」。 看到这类数字先查它统计的是任务还是岗位。

13. 原文地图

主题原书章原文位置
请你定义猫第1章 智能的第三次浪潮text/02-ch01.txt:191(搜「请你定义」) · :193(搜「补丁永无止境」)
图灵测试第1章 智能的第三次浪潮text/02-ch01.txt:63(搜「闻名于世的图灵测试」)
达特茅斯会议第1章 智能的第三次浪潮text/02-ch01.txt:107(搜「这个词被正式提出」)
符号主义与连接主义第1章 智能的第三次浪潮text/02-ch01.txt:128(搜「符号主义」) · :133(搜「连接主义」)
第一次浪潮的成果第1章 智能的第三次浪潮text/02-ch01.txt:168(搜「38 条定理」) · :170(搜「ELIZA」)
明斯基的预言第1章 智能的第三次浪潮text/02-ch01.txt:185(搜「三到八年内」)
莱特希尔报告与寒冬第1章 智能的第三次浪潮text/02-ch01.txt:202(搜「莱特希尔报告」)
换个思路让机器自己学第1章 智能的第三次浪潮text/02-ch01.txt:211(搜「让机器自己学」)
特征工程的困境第1章 智能的第三次浪潮text/02-ch01.txt:230(搜「扔给 SVM」) · :231(搜「特征工程」) · :239(搜「没学会找特征」)
2012 年那场比赛第1章 智能的第三次浪潮text/02-ch01.txt:326(搜「一举降到」) · :250(搜「压到 3.6%」)
三个条件与两块显卡第1章 智能的第三次浪潮text/02-ch01.txt:257(搜「三个关键条件」) · :260(搜「GTX 580」)
ImageNet 的来历第1章 智能的第三次浪潮text/02-ch01.txt:258(搜「120 万张」) · :318(搜「李飞飞教授于 2007 年发起」) · :323(搜「便利签」)
两个分水岭第1章 智能的第三次浪潮text/02-ch01.txt:308(搜「两个真正改变格局的瞬间」)
ChatGPT 的增长第1章 智能的第三次浪潮text/02-ch01.txt:338(搜「期望其实很低」) · :279(搜「五天之内」) · :341(搜「Instagram 用了 2.5 个月」)
职业暴露度第1章 智能的第三次浪潮text/02-ch01.txt:623(搜「约 19% 的劳动力」)
苦涩的教训第1章 智能的第三次浪潮text/02-ch01.txt:839(搜「方法加上足够的规模」) · :849(搜「苦涩的教训」)
能与不能第1章 智能的第三次浪潮text/02-ch01.txt:596(搜「长链推理仍然不稳定」)

Footnotes

  1. 出处:「第1章 智能的第三次浪潮」第 191 段(text/02-ch01.txt:191,搜「请你定义」)。 原文的三条反例依次是:失去一条腿的猫、天生不会叫的猫、没毛的斯芬克斯猫。

  2. 出处:「第1章 智能的第三次浪潮」第 193 段(text/02-ch01.txt:193,搜「补丁永无止境」)。 原文接着说:那根本不是一套规则,而是一种难以言说的「直觉」。

  3. 出处:「第1章 智能的第三次浪潮」第 107 段(text/02-ch01.txt:107,搜「这个词被正式提出」)。 会议是 1956 年夏天在达特茅斯学院开的,持续八周,发起人是麦卡锡、明斯基、香农和罗切斯特四位。

  4. 出处:「第1章 智能的第三次浪潮」第 63 段(text/02-ch01.txt:63,搜「闻名于世的图灵测试」)。 原文点出了这个测试的高明处:它把一个形而上的问题换成了一个可以操作的实验。

  5. 出处:「第1章 智能的第三次浪潮」第 128 段(text/02-ch01.txt:128,搜「符号主义」)。 原文形容它的思维方式「像数学家:优雅、严谨、可解释」。

  6. 出处:「第1章 智能的第三次浪潮」第 168 段(text/02-ch01.txt:168,搜「38 条定理」)。 那个程序叫「逻辑理论家」,作者是纽厄尔、西蒙和肖。

  7. 出处:「第1章 智能的第三次浪潮」第 170 段(text/02-ch01.txt:170,搜「ELIZA」)。 书里把由此得名的现象叫 ELIZA 效应:只要机器说话方式像人,人就很容易把理解、情感和意图投射到机器身上。 这个效应在今天读来比 1966 年更要紧——第 26 章讲问责时还会回到它。

  8. 出处:「第1章 智能的第三次浪潮」第 185 段(text/02-ch01.txt:185,搜「三到八年内」)。 同一段还记了西蒙 1965 年更激进的说法:「二十年内,机器将能做一切人能做的事」。

  9. 出处:「第1章 智能的第三次浪潮」第 202 段(text/02-ch01.txt:202,搜「莱特希尔报告」)。 美国的 DARPA 也在同期削减了经费。

  10. 出处:「第1章 智能的第三次浪潮」第 211 段(text/02-ch01.txt:211,搜「让机器自己学」)。 原文给的三个例子是认猫、过滤垃圾邮件、英译中。

  11. 出处:「第1章 智能的第三次浪潮」第 133 段(text/02-ch01.txt:133,搜「连接主义」)。 原文形容它的思维方式「像生物学家:不追求完美的公式,只要管用就行」; 「飞机 vs 扑翼机」这个比方在第 139 段(text/02-ch01.txt:139,搜「扑翼机」)。

  12. 出处:「第1章 智能的第三次浪潮」第 230 段(text/02-ch01.txt:230,搜「扔给 SVM」)。 原文说的是「这样的百万维向量,SVM 既吃不下也学不好」。

  13. 出处:「第1章 智能的第三次浪潮」第 231 段(text/02-ch01.txt:231,搜「特征工程」)。 原文列的特征包括颜色直方图、边缘方向、纹理频率、SIFT 特征点、Gabor 滤波器响应。

  14. 出处:「第1章 智能的第三次浪潮」第 239 段(text/02-ch01.txt:239,搜「没学会找特征」)。 这一句是全章的枢纽:它同时解释了第二次浪潮为什么卡住,和第三次浪潮凭什么突破。

  15. 出处:「第1章 智能的第三次浪潮」第 258 段(text/02-ch01.txt:258,搜「120 万张」)。 书里另一处(第 767 段)提到这个项目累计标注了 1400 万张图像——两个数不矛盾: 前者是比赛用的那一份,后者是整个数据集。

  16. 出处:「第1章 智能的第三次浪潮」第 318 段(text/02-ch01.txt:318,搜「李飞飞教授于 2007 年发起」)。 原文还记了当时同事的劝阻:「花几百万美元标那么多图有什么用?」

  17. 出处:「第1章 智能的第三次浪潮」第 323 段(text/02-ch01.txt:323,搜「便利签」)。

  18. 出处:「第1章 智能的第三次浪潮」第 326 段(text/02-ch01.txt:326,搜「一举降到」)。 原文写的是「从第二名的约 26.2% 一举降到 15.3%,领先超过 10 个百分点」; 26.2 − 15.3 = 10.9,本章表里的这个差是照原文两个数算出来的。

  19. 出处:「第1章 智能的第三次浪潮」第 250 段(text/02-ch01.txt:250,搜「压到 3.6%」)。 原文的措辞是「低于常被引用的人类基线」——这个「人类基线」本身是一次实验估出来的, 不是普查结果,书里在第 3 章讲 ResNet 时给了约 5% 这个数。

  20. 出处:「第1章 智能的第三次浪潮」第 257 段(text/02-ch01.txt:257,搜「三个关键条件」)。

  21. 出处:「第1章 智能的第三次浪潮」第 260 段(text/02-ch01.txt:260,搜「GTX 580」)。 原文说换成当时的 CPU「则要训上几个月」。 补充(不在书里,来自通用知识):GTX 580 是 2010 年上市的消费级游戏显卡, 当时零售价在四百多美元一块——这个价位对理解「两个学生就能做出来」很关键

  22. 出处:「第1章 智能的第三次浪潮」第 308 段(text/02-ch01.txt:308,搜「两个真正改变格局的瞬间」)。 书里这一节的小标题就叫「两个分水岭」。

  23. 出处:「第1章 智能的第三次浪潮」第 338 段(text/02-ch01.txt:338,搜「期望其实很低」)。 原文说它当时只是 GPT-3.5 的一个「研究预览」。

  24. 出处:「第1章 智能的第三次浪潮」第 279 段(text/02-ch01.txt:279,搜「五天之内」)。

  25. 出处:「第1章 智能的第三次浪潮」第 341 段(text/02-ch01.txt:341,搜「Instagram 用了 2.5 个月」)。 注意这三个数的口径不完全一样:前两个是「破百万」,TikTok 那个是「破亿级」; 书里并排放是为了给量感,不是严格对照。

  26. 出处:「第1章 智能的第三次浪潮」第 623 段(text/02-ch01.txt:623,搜「约 19% 的劳动力」)。 研究由 OpenAI 与宾夕法尼亚大学在 2023 年发表;这份研究在第 15 章讲经济影响时还会详细出现。

  27. 出处:「第1章 智能的第三次浪潮」第 839 段(text/02-ch01.txt:839,搜「方法加上足够的规模」)。

  28. 出处:「第1章 智能的第三次浪潮」第 849 段(text/02-ch01.txt:849,搜「苦涩的教训」)。 原文说这是理查德·萨顿 2019 年总结的;那篇文章只有两千字,书里另一处称它是 「AI 圈影响最深远的反思之一」。

  29. 出处:「第1章 智能的第三次浪潮」第 596 段(text/02-ch01.txt:596,搜「长链推理仍然不稳定」)。 原文接着列的四条依次是事实可靠性、开放环境适应、价值对齐、因果理解。