跳到主要内容

自然语言处理 — 四十年规则、二十年统计与大模型一统

这一章讲三件事: 规则时代的完整循环——1954 年六条规则的机器翻译亮相, 1966 年 ALPAC 报告把它打入冷宫;乔姆斯基对句子结构的分析(行话叫句法)怎么让"语言"变成可计算的 (拿一句英文拆一棵树),ELIZA 和 SHRDLU 怎么用小聪明骗过(和骗不过)人;

统计派怎么回来——贾里尼克那句火药味十足的名言背后,是双语语料(成对收集的原文与译文)+概率的胜利;

最后是深度学习到 ChatGPT 的一步到位时代,以及一条越走越陡的进步曲线。 本章是全书的枢纽:第 08 章的"语言=思维"之争,全部素材从这里来。

1. 这一章讲什么

语言被认为是人类独有的能力。原书第 8 章覆盖 1953-2025 年,跨度全书最大, 但叙事骨架极清晰——作者在前言里已经给了分期,本章末尾再确认一次: 专家语言学知识约 40 年 → 统计方法与浅层学习约 20 年 → 深度学习不到 10 年 → 大语言模型准备期约 5 年 → ChatGPT 之后按月计1

本章的隐藏论点:语言问题每换一次范式,上一代的核心资产就整体贬值一次—— 规则时代靠语法(语法,就是句子怎么搭的规则)搭出的句子结构,统计时代不要了;统计时代的词语对应表,神经时代不要了; 神经时代的拆词与析句步骤,大模型时代也不要了。每一次"不要了",都是一代人的 饭碗与研究纲领。

2. 顶层全景

1954 乔治敦-IBM 实验:6 条语法规则 + 250 个词,俄译英(公关秀)

1966 ALPAC 报告:机器翻译又慢又贵(约为人工两倍),停资助
↓ ↓
1957-65 乔姆斯基:句法分层 1966 ELIZA(模式匹配);1970 SHRDLU
(0-4 型文法 ↔ 自动机) (积木世界:语言+规划+知识表示)
↓ ↓
1988 IBM CANDIDE:统计机器翻译(加拿大议会双语记录)
贾里尼克:"每开除一名语言学家,系统性能就提高一点"

2011 沃森赢 Jeopardy(知识图谱+搜索的问答机器)

2013-17 word2vec → GNMT(神经翻译,误差比短语法降约 60%)→ Transformer

2018-20 BERT(双向)与 GPT(单向 next token prediction)之争 → GPT-3 反超

2022-11-30 ChatGPT;2023 LLaMA 开源;2024-09 o1 闭源

2025-01-20 DeepSeek R1 开源+技术报告:局面重开

图说:左干线上是"语言怎么被形式化"的四次换代;右支线是两个经典演示系统。
主走查:拿 "the man hit the ball" 走规则时代的解析树(第 3.2 节),
同一句话在统计与神经时代怎么处理,随后各节接上。

3. 核心原理

3.1 起点:六条规则的翻译秀与一盆冷水

1953-54 年,IBM 资助乔治敦大学做了史上第一次机器翻译实验:把几十个俄文句子译成 英文,总共定义了 6 条规则(规则描述句子怎么搭,行话叫语法)、250 个单词,领域是有机化学;俄文先罗马化编码, 句子打成打孔卡再输入2。注意时间:它比 1956 年的达特茅斯会议还早—— 第 01 章留下的"会议是命名之源,不是学科之源"的伏笔,在这里兑现。 参照物(补充:不在书里,来自通用知识):今天一部手机装的营养学词汇都远超 250 个—— 这是一个演示,不是系统。但它达到了目的:美国空军、原子能委员会纷纷装上 IBM 的翻译系统2

十二年后,冷水来了。1966 年 11 月,美国科学院的 ALPAC 委员会发布《语言与机器》: 机器翻译比人工翻译慢、更不准确,成本约为人工的两倍,"可预见的未来没法实用", 建议立即停止资助;这份报告顺手发明了"计算语言学"这个词3一次演示点燃的热情,要由一代人的冷冻来偿还——这个模式与第 01 章的预言生命周期 严丝合缝。

3.2 主走查:规则时代怎么处理一句话

规则时代的核心信念:先分析句子结构(行话叫句法),再谈意义。 这套信念的数学基础 来自乔姆斯基:先交代一个词——上下文(一个词周围的前后文)。他把文法分成 0-4 型,并与自动机一一对应——3 型文法(正则文法) 等价于有限自动机,2 型(上下文无关文法,即不用看前后词就能判定结构的文法)等价于下压自动机,1 型等价于线性有界 图灵机,0 型等价于图灵机4。这一对应是计算机科学的理论基石之一(第 09 章 还要回来)。

拿原书的例句 "the man hit the ball"(那人打了球)走一遍拆解,按上下文无关文法 的展开规则:

句子 S
├── NP(名词短语)
│ ├── T(限定词): the
│ └── N(名词): man
└── VP(动词短语)
├── V(动词): hit
└── NP(名词短语)
├── T: the
└── N: ball

图说:规则逐层展开——S → NP + VP;NP → T + N;VP → V + NP。
每一步展开都是人写好的规则;解析树就是"句子怎么搭出来"的证明。
(这就是第 01 章达特茅斯建议书里"抽象"一条的具象化:语言被还原成了结构。)

5

这套走查的力量与局限都在树里。 力量:歧义可被定位("我拿着望远镜看见那个男人" ——介词短语挂在哪根枝上,句义就不同);局限:真实语言无限不采样——乔姆斯基 反对统计方法的理由就是"语言的可能性是无限的,统计不可能解决问题"6。 规则学派因此写了几十年语法,每个新语料都推翻一批规则。

3.3 两个演示系统:ELIZA 与 SHRDLU

规则时代有两个至今被引用的演示系统,成色截然不同。

ELIZA(1966,魏森鲍姆)是超简单的程序:在一个按词频排序的词库里找匹配, 匹配到就在脚本库里选一条回复;它的心理医生脚本拿"你的男朋友逼你来的?"复读 病人的话,居然让很多来访者觉得"像刚和一位真的心理医生聊完一样,心情沉重"7。 原书记了两个真实的着迷案例:魏森鲍姆的秘书要支开旁人才肯和它聊; 一位 BBN 副总离开时对终端说"给我打电话,401-1850"——没打句号,机器一直在等输入, 副总被"傲慢"气走7ELIZA 的历史意义不在技术,在于它第一次证明: 人类会对任何会说话的东西投射心智。 2022 年谷歌工程师莱莫因认定对话模型 LaMDA 有意识而被解雇——同一个剧本,五十六年后重演8

SHRDLU(1970,维诺格拉德)是真材实料:一个虚拟积木世界,人用自然语言指挥 机器手拿起、摞放积木,机器能回答"盒子外有几个方块"这种问题,吃不准时还会反问 (它对"BY 'IT',I ASSUME YOU MEAN…"的指代消解至今被教科书引用)9。 它把自然语言理解、规划、知识表示整合在 Micro-Planner 语言上, 这是第一个把"语言+推理+世界模型"拼在一起的系统。1971 年它拿了第一届 "计算机与思维"奖;维诺格拉德后来转做人机交互,他的学生布林和佩奇创办了谷歌10。 SHRDLU 的天花板也预演了此后五十年的争论:批评者说它只能在"微世界"里表演—— 原书替它辩护:任何一门科学一开始不都是从小处着手吗?11

3.4 统计派回来:数据打败语法

1988 年,IBM 托马斯·沃森研究中心的机器翻译小组在计算语言学会议上发表统计机器 翻译,推出法英系统 CANDIDE;语料是加拿大议会的双语会议记录12

统计翻译解决的问题是:不再手写语法,而是从海量"原文-译文"配对里数出概率。 拿一句演示翻译走一遍机制(短语概率为演示编的):

任务:把法语 "la pomme verte" 译成英语。

模型两个部件:
翻译模型 P(f|e):短语之间怎么互译(从双语语料数出来)
"la pomme" ↔ "the apple" 共现 48 000 次 → P ≈ 0.9
"verte" ↔ "green" 共现 31 000 次 → P ≈ 0.8
"verte" ↔ "vert" 共现 400 次 → P ≈ 0.01
语言模型 P(e):英文里什么样算通顺(从英文语料数出来)
P("the apple green") ≈ 0.0001 ← 语法不对
P("the green apple") ≈ 0.02 ← 地道

解码:在所有候选译法里找 P(f|e)·P(e) 最大的那个
→ "the green apple" 胜出。
(这个"翻译模型×语言模型"的双部件结构,是原书对统计派工作的概括:
平行语料的左边是刺激、右边是反射——乔姆斯基因此嫌它像行为主义。)

13

这个走查解释了贾里尼克那句火药味名言的实质——"我每开除一名语言学家, 我的语音识别系统的性能就提高一点"12:语言学家带来的是"应该怎样"的先验, 数据带来的是"实际怎样"的分布(每种说法各占多少比例);两者冲突时,数据赢了。 统计派还有一个工程红利: 工程师不需要懂源语言或目标语言就能改进系统——谷歌翻译团队就没有科班语言学家, 欧赫(2004 年加入谷歌,博士论文就是用海量平行语料建模型)认为语言学知识 "有时还会起反作用"14

统计时代的顶点是 2011 年 IBM 沃森:在美国智力竞赛 Jeopardy! 里击败人类冠军。 它的配方是本章前半所有零件的总装——知识图谱(WordNet、DBpedia、YAGO, 后两者以维基百科为基础)做知识查询,搜索引擎做证据,浅层推理做裁决。 硬件参照物:90 台 Power 750 服务器(机房里的计算机主机)、720 核 2880 线程、16TB 内存里装着全部知识库, 知识库只有 4TB(含维基百科全部正文);算力约等于当年第 500 名超级计算机的一半, 300 万美元——按摩尔定律,同样的算力 2017 年约 20 万美元,2025 年不到 2 万美元15沃森是符号派方法的最后一场盛大凯旋:它赢了比赛,然后和深蓝一样,被追问 "这算理解吗",再然后,被下一代技术整个绕过。

3.5 深度学习时代:词向量到一步到位

统计翻译之后的三级跳,第 04 章已经铺了原理,这里按应用线收拢:

  1. 词变成向量。辛顿 80 年代的分布式表示(词=它与所有其他词的关系)在 2013 年 落地为 word2vec——词嵌入让"意义"变成可计算的距离16;

  2. 句子到句子。Seq2Seq 把一种语言的词序列(按顺序排好的一串词)编码成向量再解码成另一种语言的序列; 2016 年谷歌神经机器翻译 GNMT 取代统计翻译,误差比之前的短语方法降低约 60%, 翻译基本单位从短语变成整句17;

  3. 注意力统一一切。2017 年 Transformer 解决了串行训练的并行瓶颈(第 04 章已拆)。

  4. 两条路线。Transformer 分成两半:负责读入与理解的编码器(读入、理解那一半),和负责生成的解码器(只负责生成的那一半)。

  5. 双向路线。谷歌拿编码器做出 BERT——只读不写、靠完形填空式训练。

  6. 单向路线。OpenAI 拿解码器做出只写的 GPT——next token prediction18

BERT 与 GPT 之争是本章最值得回味的岔路。 直觉上双向(看完左边再看右边) 应该更强;2018-2019 年确实是 BERT 的天下。但 2020 年 GPT-3 用 next token prediction 实现反超,"人们又一窝蜂转向 NTP"18。原书留了一个开放问题(为什么单向更优), 并在第 11 章给出答案:单向预测就是所罗门诺夫归纳的工程形态——理论又一次 跑在直觉前面。

然后是 2022 年 11 月 30 日,ChatGPT。原书对随后三年的记录带着现场感: 大模型共同体"在感觉惊艳的同时,也有些绝望和愤世嫉俗";2023 年初 Meta 开源 LLaMA 缓解了焦虑;2024 年 9 月 OpenAI 发布推理模型 o1 时已全面不公开(不给参数不给论文); 2025 年 1 月 20 日,DeepSeek 开源了能力相当的 R1 并附上翔实技术报告——原书称这是 "全球人工智能共同体(OpenAI 除外)绝无仅有的对中国技术团队的由衷赞佩"19开放与封闭的拉锯,是这一章只记录不裁决的悬案。

3.6 进步曲线与两句判词

把本章的分期摆在一起看斜率:40 年 → 20 年 → 不到 10 年 → 5 年 → 按月1。 原书把这种加速比作"自然语言处理的摩尔定律"。

本章结尾有两句值得原文照录的判词。第一句:"一个人工智能问题一旦被解决, 就不再是人工智能问题"——语音识别 solved 之后退出核心议题,机器翻译正在路上, 就像哲学问题找到科学表述后就不再是哲学问题20。第二句针对端到端(一步到位、不再拆中间步骤)对语言学的冲击: "大语言模型对语言问题给出了端到端的解决办法……语言学家就是研究各种中间步骤的, 中间步骤就是解释"21——拆词、句法分析、语义分析这些中间任务被整体跳过, 研究它们的人失去了对象。原书还引了斯泰恩-罗素的温和版惋惜: "如今的自然语言处理不再研究语言,我认为这是非常不幸的"22

4. 作者的判断与证据

史实层:乔治敦实验的参数(6 规则/250 词)、ALPAC 报告的结论与时间、 CANDIDE 的语料来源、GNMT 的 60%、沃森的硬件清单、ChatGPT/R1 的日期,均有 一手文献(报告原文、IBM 专刊、技术报告)。

作者观点层(要分开):

  • 对乔姆斯基的刻画占了本章近四分之一的篇幅,褒贬交织:他让语言学变成科学, "语言学界因他开天辟地";但他对统计方法的排斥被原书类比为波普尔对卡尔纳普的批判, 并两次记载他被"打脸"(ChatGPT 答对了他举的反例句——这句留到第 08 章细说)23;
  • 对语义网与 W3C 的贬损(第 03 章已提)在本章再次出现,属于作者的固定立场;
  • "开源"被原书列为大模型进步的第一推动,并的地缘政治层(商战+中美)—— 这是作者 2026 年的现场判断,不是学术定论19

原书标注存疑处:莱莫因事件原书给了完整的时间线,并注明"当时主流学界支持谷歌, 认为该事件是人类对强人工智能的'拟人化错觉'"——作者保留了 Google 方的解释8

5. 边界与局限

  • 本章不含语音识别的机制(隐马尔可夫模型等),原书只给了邓力-辛顿合作的 里程碑时间点;语音与 NLP(自然语言处理的缩写)在 2010 年代是两条并行的线。
  • 沃森的"认知计算"营销与医疗失败(2022 年卖给私募)原书点到为止; 医疗 AI 的失败原因(数据、责任、业务流程)不在本章范围。
  • 对中文 NLP 着墨少:中文特有的拆词与句法任务原书未展开—— 这恰是被端到端冲击最重的领域之一。
  • "语言学的中间步骤整体消失"是 2026 年视角的判断;语言学是否真被"搞丢了" (原书引的原话21),学界仍有争论——LLM(大语言模型的缩写)时代,语言学转向了语料与模型探测研究。

6. 可带走的

  1. 语言处理的范式寿命在指数缩短:40 年 → 20 年 → <10 年 → 5 年 → 按月; 入行选方向时,这条例线比任何技术清单都重要;
  2. ALPAC 模式:一次演示点燃的热情由一代人的冷冻偿还——评估任何"首次演示" 都要用它对冲;
  3. 解析树(把句子逐层拆开画成的树)是规则时代的思维方式:先结构后意义;它优雅、可解释、 且永远覆盖不了真实语言;
  4. ELIZA 的真正发现是人类不是机器:人会向任何会说话的东西投射心智—— 从 1966 年的秘书到 2022 年的莱莫因,机制没变过;
  5. 统计派的胜利公式:平行语料 × 语言模型 × 解码,以及它的组织学后果 ——不需要懂语言的工程师;
  6. 贾里尼克名言的实质是先验输给了数据:领域知识(应该怎样)输给分布 (实际怎样)时,先开除的是专家;
  7. 沃森是符号派方法的最后一战:知识图谱+搜索+浅推理赢了智力竞赛, 输给了下一代范式——赢比赛和过时代是两回事;
  8. BERT 对 GPT 的直觉输了:单向 next token prediction 的胜利要到第 10 章 (学习=压缩)才有理论解释;
  9. "AI 问题被解决后就不再是 AI 问题":语音已走,翻译在路上—— 这句判词可以用来预测下一个"退出 AI 籍"的领域;
  10. 端到端(一步到位、不再拆中间步骤)抹掉的中间步骤就是"解释":这是第 08 章语言=思维之争的引信。

7. 原文地图

主题原书章原文位置
乔治敦-IBM 实验参数第8章 自然语言处理text/12-ch08.txt:15(搜「乔治敦」) · text/12-ch08.txt:24(搜「250个单词」)
军方安装翻译系统第8章 自然语言处理text/12-ch08.txt:31(搜「烧了把火」)
ALPAC 报告第8章 自然语言处理text/12-ch08.txt:37(搜「ALPAC」) · text/12-ch08.txt:40(搜「两倍」)
乔姆斯基地位与文法-自动机对应第8章 自然语言处理text/12-ch08.txt:45(搜「乔姆斯基」) · text/12-ch08.txt:54(搜「自动机」)
句法解析树 the man hit the ball第8章 自然语言处理text/12-ch08.txt:111(搜「hit the ball」) · text/12-ch08.txt:113(搜「句法解析树」)
乔姆斯基反对统计的理由第8章 自然语言处理text/12-ch08.txt:613(搜「统计不可能」) · text/12-ch08.txt:614(搜「行为主义」)
ELIZA 机制(词库匹配)第8章 自然语言处理text/12-ch08.txt:220(搜「ELIZA」) · text/12-ch08.txt:316(搜「超级简单」)
秘书上瘾、副总电话号码第8章 自然语言处理text/12-ch08.txt:319(搜「就上了瘾」) · text/12-ch08.txt:323(搜「401-1850」)
心理医生对话第8章 自然语言处理text/12-ch08.txt:243(搜「心理医生」) · text/12-ch08.txt:253(搜「男朋友」)
PARRY 与 ARPANET 对话第8章 自然语言处理text/12-ch08.txt:220(搜「PARRY」) · text/12-ch08.txt:412(搜「ICCC」)
莱莫因事件第8章 自然语言处理text/12-ch08.txt:763(搜「莱莫因」) · text/12-ch08.txt:772(搜「拟人化错觉」)
SHRDLU 与积木世界第8章 自然语言处理text/12-ch08.txt:424(搜「维诺格拉德」) · text/12-ch08.txt:454(搜「SHRDLU」) · text/12-ch08.txt:476(搜「Pick up」)
Micro-Planner 与整合第8章 自然语言处理text/12-ch08.txt:542(搜「Micro-Planner」) · text/12-ch08.txt:546(搜「整合」)
第一届计算机与思维奖、布林佩奇第8章 自然语言处理text/12-ch08.txt:564(搜「维诺格拉德在功成名就」) · text/12-ch08.txt:571(搜「布林」)
微世界之辩第12章 哲学家和人工智能text/16-ch12.txt:168(搜「微世界」) · text/16-ch12.txt:170(搜「就是维诺格拉德的积木世界」)
CANDIDE 与贾里尼克名言第8章 自然语言处理text/12-ch08.txt:594(搜「CANDIDE」) · text/12-ch08.txt:599(搜「开除一名语言学家」)
统计法不需要语言学家第8章 自然语言处理text/12-ch08.txt:623(搜「语言学知识」) · text/12-ch08.txt:625(搜「反作用」)
问答三件套、梁启超例子第8章 自然语言处理text/12-ch08.txt:634(搜「问答系统」) · text/12-ch08.txt:643(搜「梁启超」)
沃森硬件与成本第8章 自然语言处理text/12-ch08.txt:649(搜「沃森」) · text/12-ch08.txt:661(搜「90台」) · text/12-ch08.txt:663(搜「500」) · text/12-ch08.txt:666(搜「2万美元」)
word2vec、GNMT 60%第8章 自然语言处理text/12-ch08.txt:684(搜「词向量」) · text/12-ch08.txt:692(搜「60%」)
BERT/GPT、GPT-3 反超第8章 自然语言处理text/12-ch08.txt:708(搜「BERT」) · text/12-ch08.txt:716(搜「反超」)
ChatGPT、LLaMA、o1、R1第8章 自然语言处理text/12-ch08.txt:720(搜「2022年11月30日」) · text/12-ch08.txt:725(搜「o1」) · text/12-ch08.txt:730(搜「R1」) · text/12-ch08.txt:733(搜「赞佩」)
分期与进步速度第8章 自然语言处理text/12-ch08.txt:743(搜「持续了约40年」) · text/12-ch08.txt:745(搜「进步是以月计的」)
开源的原因第8章 自然语言处理text/12-ch08.txt:748(搜「开源」)
解决后就不再是AI问题第8章 自然语言处理text/12-ch08.txt:805(搜「不再是人工智能问题」)
端到端与语言学家的中间步骤第9章 语言等于思维吗?text/13-ch09.txt:212(搜「端到端的解决办法」) · text/13-ch09.txt:212(搜「中间步骤就是」)
罗素的惋惜第9章 语言等于思维吗?text/13-ch09.txt:218(搜「非常不幸的」)
瑞迪预言 35 年延迟、黑板系统改名第8章 自然语言处理text/12-ch08.txt:790(搜「瑞迪」) · text/12-ch08.txt:798(搜「多Agent系统」)
两种文化、弹弓与解释层级第8章 自然语言处理text/12-ch08.txt:824(搜「两种文化」) · text/12-ch08.txt:834(搜「弹弓」)

Footnotes

  1. 出处:「第8章 自然语言处理」第 742-745 段(text/12-ch08.txt:743,搜「持续了约40年」);四阶段划分的最早版本见「第3版 前言」第 19-24 段(text/02-ch03.txt:19,搜「四个阶段」)。 2

  2. 出处:「第8章 自然语言处理」第 15 段(text/12-ch08.txt:15,搜「乔治敦」)与第 23 段(搜「6条语法规则」)、第 31 段(搜「烧了把火」)。 2

  3. 出处:「第8章 自然语言处理」第 37 段(text/12-ch08.txt:37,搜「ALPAC」)与第 39 段(搜「两倍」)、第 41 段(搜「计算语言学」)。

  4. 出处:「第8章 自然语言处理」第 54 段(text/12-ch08.txt:54,搜「自动机」)。原文:3 型文法等价于有限自动机,2 型等价于下压自动机,1 型等价于线性有界非确定图灵机,0 型等价于图灵机。

  5. 出处:「第8章 自然语言处理」第 111 段(text/12-ch08.txt:111,搜「hit the ball」)与第 112 段(搜「句法解析树」)。原书给出该句的树形解析(S/NP/VP/T/N);上面的树形图按原文描述排版。

  6. 出处:「第8章 自然语言处理」第 613 段(text/12-ch08.txt:613,搜「统计不可能」)。原话:"语言的可能性是无限的,统计不可能解决问题"。

  7. 出处:「第8章 自然语言处理」第 316 段(text/12-ch08.txt:316,搜「超级简单」)与第 319 段(搜「上瘾」)、第 321 段(搜「401-1850」)、第 314 段(搜「心情沉重」)。心理医生对话见第 243-312 段。 2

  8. 出处:「第8章 自然语言处理」第 763 段(text/12-ch08.txt:763,搜「莱莫因」)与第 771 段(搜「拟人化错觉」)。 2

  9. 出处:「第8章 自然语言处理」第 454 段(text/12-ch08.txt:454,搜「SHRDLU」)与第 476-489 段(搜「Pick up」)。

  10. 出处:「第8章 自然语言处理」第 542 段(text/12-ch08.txt:542,搜「Micro-Planner」)、第 546 段(搜「整合」)、第 563 段(搜「计算机与思维」)、第 571 段(搜「布林」)。

  11. 出处:「第12章 哲学家和人工智能」第 168-170 段(text/16-ch12.txt:168,搜「微世界」)。原文:"但罗马不是一天建成的,任何一门科学一开始不都是从小处着手吗?所谓'微世界'就是维诺格拉德的积木世界"。

  12. 出处:「第8章 自然语言处理」第 594 段(text/12-ch08.txt:594,搜「CANDIDE」)与第 597 段(搜「会议纪要」)、第 599 段(搜「开除一名语言学家」)。 2

  13. 出处:「第8章 自然语言处理」第 592-597 段(text/12-ch08.txt:594,搜「CANDIDE」)。原书说明统计翻译使用平行语料(加拿大议会会议记录)构建语言模型和翻译模型;"左边是刺激、右边是反射"的行为主义类比见第 614 段(text/12-ch08.txt:614,搜「行为主义」)。走查中的短语概率为演示编的;翻译模型与语言模型双部件的机制是统计机器翻译的标准结构(补充:不在书里,来自通用知识)。

  14. 出处:「第8章 自然语言处理」第 617 段(text/12-ch08.txt:617,搜「欧赫」)与第 622 段(搜「语言学知识」)、第 625 段(搜「反作用」)。

  15. 出处:「第8章 自然语言处理」第 649-666 段(text/12-ch08.txt:649,搜「沃森」)、第 655 段(搜「95%」)、第 661 段(搜「90台」)、第 664 段(搜「500」)、第 666 段(搜「2万美元」)。

  16. 出处:「第8章 自然语言处理」第 684-686 段(text/12-ch08.txt:684,搜「词向量」)与第 686 段(搜「word2vec」)。

  17. 出处:「第8章 自然语言处理」第 688-691 段(text/12-ch08.txt:687,搜「GNMT」)与第 691 段(搜「60%」)。

  18. 出处:「第8章 自然语言处理」第 705-716 段(text/12-ch08.txt:708,搜「BERT」)与第 716 段(搜「反超」)、第 713 段(搜「next token prediction」)。 2

  19. 出处:「第8章 自然语言处理」第 720 段(text/12-ch08.txt:720,搜「2022年11月30日」)、第 723 段(搜「LLaMA」)、第 725 段(搜「不公开」)、第 731 段(搜「R1」)、第 732 段(搜「赞佩」)。 2

  20. 出处:「第8章 自然语言处理」第 805 段(text/12-ch08.txt:805,搜「不再是人工智能问题」)。

  21. 出处:「第9章 语言等于思维吗?」第 212 段(text/13-ch09.txt:212,搜「端到端的解决办法」).原文:"语言学家就是研究各种中间步骤的,中间步骤就是解释"。 2

  22. 出处:「第9章 语言等于思维吗?」第 218 段(text/13-ch09.txt:218,搜「非常不幸的」)。

  23. 出处:「第8章 自然语言处理」第 45 段(text/12-ch08.txt:45,搜「乔姆斯基」)与第 59 段(搜「波普尔」);被"打脸"的记载见「第9章 语言等于思维吗?」第 17-23 段(text/13-ch09.txt:18,搜「虚假承诺」)。