为什么它居然管用 — 简单的不是模型,是语言
这一章讲三件事: 全书真正的论点是什么、作者拿什么当证据、 以及这个论点的分量究竟有多重(比很多转述说的轻)。 前五章讲「它怎么做的」和「它做不到什么」,这一章回答书名的后半句:为什么它能做到。
1. 先看现象:这件事本来不该发生
这一节回答:为什么「它能写文章」值得惊讶。
把两个数字放在一起看:
| 数量级 | |
|---|---|
| 人类大脑 | 约 1000 亿个神经元、约 100 万亿条连接 |
| ChatGPT | 约 1750 亿条连接(权重) |
人类语言,以及背后的思维过程,一直被视为复杂性的巅峰。 过去人们甚至猜测:大脑里也许不只有神经元网络,还有某种尚未发现的物理机制。
而现在1:
一个连接数与大脑神经元数量相当的、纯粹的人工神经网络,就能够出色地生成人类语言。
这就是那条「重要的新信息」。问题是:凭什么?
先排除一个太容易的解释
有人会说:简单规则也能产生极复杂的行为 —— 第 05 章那个规则 30 就是最著名的例子, 所以「简单结构做出复杂行为」不奇怪。
但作者自己把这条路堵死了: ChatGPT 用的这种网络,恰恰是被特意构建来压制这种现象的 —— 压制计算不可约性,好让它更容易训2。
也就是说:不能用「复杂的行为自己冒出来了」来搪塞。
2. 核心主张:简单的不是模型,是语言
于是他给出这本书真正的论点3:
我认为基本答案是,语言在根本上比它看起来更简单。 这意味着,即使是具有简单神经网络结构的 ChatGPT, 也能够成功地捕捉人类语言的「本质」和背后的思维方式。 此外,在训练过程中,ChatGPT 已经通过某种方式隐含地发现了使这一切成为可能的 语言(和思维)规律。
「隐含地发现」是这句话里的关键词: 不是有人把规律教给它, 而是它为了做好「续写」这件事,顺带把规律摸了出来,而且这些规律只存在于权重里, 没有任何人能读出来。
再进一步,他把这件事提到科学发现的高度:
ChatGPT 的成功为一个基础而重要的科学事实提供了证据: 我们仍然可以期待发现重大的新「语言法则」,实际上是「思维法则」。 在 ChatGPT 中,由于它是一个神经网络,这些法则最多只是隐含的。 但如果我们能使它们变得明确,就有可能以更直接、更高效和更透明的方式做到它所做的事。
记住这三个词:更直接、更 高效、更透明。 这是全书后半段所有讨论的目标。
3. 两条已经知道的「语言法则」
这一节回答:「语言法则」到底长什么样。 作者用两个已知的例子来说明。
法则一:句法语法
句法语法就是「哪种词能接哪种词」的那套规则。 语言不是把词随机拼在一起:名词前面可以有形容词、后面可以有动词, 但两个名词通常不能挨在一起。这类规则可以画成一棵树来大致捕捉, 这棵树叫解析树(把句子逐层拆成成分:先拆成主语部分和谓语部分,再往下拆)4。
ChatGPT 并不明确「知道」这些规则,但训练中隐含地发现了它们,而且很擅长遵守。
作者给了一个「类自然科学」的观察,这句话分量不轻5:
Transformer 架构好像成功地学会了似乎在所有人类语言中都存在 (至少在某种程度上是近似的)嵌套树状的句法结构。
为什么英语语法学得会、括号却学不会
第 05 章那个括号实验就在这一节里。两者的对比是这一节最有教学价值的部分:
| 括号语言 | 英语语法 | |
|---|---|---|
| 规则的性质 | 严谨的、必须真的数一遍 | 靠局部的选词和其他提示去猜 |
| 神经网络表现 | 长序列必错 | 好得多 |
| 出错的时候 | 一定是错的 | 可能错过某些「形式上正确」的情况 —— 但人类也会错过 |
结论是:语言存在整体的句法结构,而且蕴含着规律性。 这就限制了神经网络需要学的东西「有多少」。
法则二:逻辑
语法只是约束之一。
像「好奇的电子为了鱼吃蓝色的理论」这样的句子,语法完全正确, 但不是人们通常会说的话 —— 用词的正常含义去读,它基本上毫无意义6。
有没有通用方法判断一句话是否有意义?没有传统的总体理论。 但作者认为,ChatGPT 在几十亿个(应该有意义的)句子上训练之后, 已经隐含地「发展出」了一个这样的理 论。
而这个理论的冰山一角,人类早在两千多年前就知道了:逻辑。 亚里士多德的三段论说明,遵循一定模式的句子是合理的,其他则不合理 (例:所有鱼都是蓝的;这个不是蓝的;所以它不是鱼)。
这里有一个想象力很好的类比7:
就像可以异想天开地想象亚里士多德是通过**「机器学习式」地研究大量修辞学例子** 来发现三段论逻辑一样,也可以想象 ChatGPT 在训练中通过查看大量文本 「发现」了三段论逻辑。
同时作者也给了边界:更复杂的形式逻辑它会失败,原因和括号匹配失败的原因相同。
4. 那条还没被写下来的法则:语义语法
这一节回答:语法和逻辑之间那一大块空白,靠什么管。
如果语法管「哪种词能接哪种词」,逻辑管「推理合不合规」,那中间那一大块 —— 「什么样的话说得通」 —— 靠什么管?
作者给这块东西起了个名字:语义语法8。
它和句法语法差在哪
| 句法语法 | 语义语法 | |
|---|---|---|
| 识别的单位 | 名词、动词、形容词 | 更精细的分级:比如「移动」这个概念、「换了位置也还是它自己的东西」这个概念 |
| 规则长什么样 | 名词后面可以跟动词 | 「东西」可以「移动」 |
| 预设了什么 | 只预设「语言由词构成」 | 必然预设一个「世界模型」 —— 一副骨架,语言搭在上面 |
作者立刻给了一个重要的澄清,免得这个概念被误解9:
即使一句话在语义语法上完全没问题,也不意味着它已经或者能在实践中成真。 「大象去了月球」毫无疑问会通过语义语法,但在现实世界中还没有成真 —— 虽然它绝对可以在虚构的世界中成真。
也就是说:语义语法管的是「说得通」,不是「是真的」。这两件事必须分开。
主走查:拿两句话过三道关
这三条法则怎么用?挑两句话,一道关一道关地过。 这是本章的主走查。 (第一句是我们编的例子,第二句是书里给的。)
第一句:「桌子吃掉了星期二」。
| 过哪一关 | 这一关判什么 | 结果 |
|---|---|---|
| ① 句法语法 | 名词动词形容词搭得对不对 | 过 ——「桌子」名词、「吃掉」动词、「星期二」名词,名词+动词+名词是合法的搭法 |
| ② 语义语法 | 「吃掉」要求前面是个能吃东西的活物、后面是个能被吃的东西 | 不过 —— 桌子不是活物,星期二不是东西,两头都不合 |
| ③ 逻辑 | 推理有没有自相矛盾 | 没走到这一步 —— 第 ② 关已经把它拦下了 |
第二句:「大象去了月球」。
| 过哪一关 | 这一关判什么 | 结果 |
|---|---|---|
| ① 句法语法 | 名词动词形容词搭得对不对 | 过 |
| ② 语义语法 | 「去」要求前面是个能移动的东西、后面是个地方 | 过 —— 大象能移动,月球是个地方 |
| ③ 逻辑 | 推理有没有自相矛盾 | 过 |
| 那事实上呢 | 真发生过吗 | 没有 |
最后一行就是作者那句澄清的全部内容:三道关全过,不等于这件事是真的。 而上面那张表里的「能吃东西的活物」「能移动的东西」「地方」—— 这些就是「更精细的分级」的实际长相:不是名词动词形容词,而是「什么样的东西能干什么」。