跳到主要内容

语言等于思维吗 — 乔姆斯基之问与大语言模型的冲撞

这一章讲三件事: 那次著名的对撞——乔姆斯基 2023 年在《纽约时报》宣称 ChatGPT 不懂"John is too stubborn to talk to",网民把它丢给 ChatGPT,答对了; "思维即语言"这个立场的完整论证——洪堡、合并、刺激贫乏,以及它为什么其实 隐含着"图灵机可以思维";反方的最新版本(麻省理工:语言只是交流工具)为什么 原书判定"没有提出什么新东西"。 这一章几乎没有算法,却决定了你如何理解前面所有章节:语言模型到底是在"说话", 还是在"思考"。

1. 这一章讲什么

原书第 9 章是第 3 版新增的两章之一,它的位置很讲究:第 8 章刚讲完 ChatGPT 怎么 赢得语言战场,这一章立刻追问"赢得语言战场算不算会思考"。

问题的两边各站着一个巨人:

  • 乔姆斯基:语言学七十年来的掌门人,核心立场一句话——思维是由语言生成的 (原书简称"思维即语言"或"语言即思维"),七十年没变过1;
  • 大语言模型:用统计与算力端到端解决了语言问题(第 07 章),而它完全不需要 乔姆斯基的语法。

戏剧性在于:"语言模型能流利使用语言"这件事,只有在"思维即语言"为真的世界里 才意味着"机器会思维"——而证明这一点最力的乔姆斯基,恰恰是大模型最著名的否认者。

2. 顶层全景

柏拉图之问:经验如此贫乏,人类怎么获得如此丰富的知识?
│(乔姆斯基:语言能力是天生的——刺激贫乏论)

"思维即语言":语言是思维的形成器官(洪堡)
│ │
▼ ▼
支持证据: 反方:
· 合并=原始递归 · 麻省理工 2023:语言=交流工具,
· 猴子实验的文法分界 LLM 只有形式能力没有功能能力
· 脑膜炎儿童靠触觉 · 辛顿:不需要先天结构,数据驱动即可
补偿语言


大对撞:ChatGPT 用统计答对了乔姆斯基的反例句


两个工程推论:
· 学习=压缩(不是记忆) · 多模态应以语言为基座(火星停车标志)

图说:本章的逻辑是"一个立场 + 它的证据 + 它的反方 + 它的工程后果"。
主走查在第 3.1 节:一句歧义句的两种命运。

3. 核心原理

3.1 主走查:一句歧义句的两种命运

2023 年 3 月 8 日,近 95 岁的乔姆斯基在《纽约时报》发表《ChatGPT 的虚假承诺》。 文中用了一个"几乎在他所有著作中都出现过"的例句2:

John is too stubborn to talk to.

这句话在英语里有两种读法:

读法一(语法形式暗示的):"John 太固执了,不愿意和人谈话"
——John 是"不肯谈"的人(too stubborn to talk to anyone)。
读法二(真实语义):"John 固执得没法跟他谈话"
——John 是"没法被谈"的对象,固执的是他、受苦的是别人。
(比较:"John is too stubborn to talk to Bill"——
谁跟谁谈,介词 to 后面的成分说了算。)

乔姆斯基的论断:机器按统计相关性会选读法一,而人类凭深层语法知道是读法二。
网民把这个例句丢给 ChatGPT:ChatGPT 准确地给出了读法二。
原书的评语只有四个字:乔姆斯基被"打了脸"。

2

这次打脸为什么重要? 因为这个例句是乔姆斯基论证"人类语言能力不可能来自 统计学习"的标准武器:句子的深层解读无法从表面词序统计出来,必须依赖先天的 语法结构——这是"刺激贫乏论"的标志性证据。ChatGPT 答对,意味着统计模型至少 在大量真实语料上习得了这类结构。注意分寸:一次答对不能证明模型"有语法", 但足以推翻"统计模型必然读不懂"的全称否定。

原书同时记下了阵营的另一端:斯坦福计算语言学家曼宁的推文—— "看到一位年轻时极具洞见的创新者,现在却保守地阻碍激动人心的新方法,真是令人悲伤。 这大概也是崇拜过乔姆斯基的两代人的普遍失望:乔老爷老了。"3

3.2 两条提问路线:柏拉图与奥威尔

原书给乔姆斯基的学术人生画了两条主线,这个框架后面会反复用到4:

柏拉图之问奥威尔之问
内容可借鉴的东西极端贫乏,人类怎么获得如此丰富的知识?可借鉴的东西如此之多,人类所知为何如此之少?
学名刺激贫乏论(poverty of stimulus)——
侧重的世界语言能力的天生结构政治与社会的失败

乔姆斯基做学问时贴近柏拉图,搞政治时遵循奥威尔。 这个框架解释了他为什么 必须反对经验主义的行为主义与统计学习:如果语言结构是学出来的(经验主义), "天生语法"就不存在,他七十年的理论大厦就空了。

3.3 "思维即语言"的完整论证

这一立场有三个支点,原书逐一给出:

支点一:合并(merge)是唯一的语言机关。 洪堡说语言是"有限手段的无限运用", 乔姆斯基把这个"无限"归因于一个极简操作:两个句法单位 a、b,合并后成为集合 {a,b}。原书拿例句走一遍5:

句子:Guess what boys eat(猜猜男孩们吃什么)

第 1 步:合并 eat、apples → {eat, apples}
第 2 步:合并 boys 与上一步 → {boys, {eat, apples}} ——「男孩们吃东西」
第 3 步:疑问词 what 被从宾语位置"提出"——
把 what 与整个 {boys,{eat,apples}} 再合并:
{what, {boys, {eat, what}}}
第一个 what 变成量词:整句=「for what x,boys eat x」
用一阶逻辑写:(∀x)eat x(boys,x)

原书点破:所谓"合并"不就是 LISP 中最基本的算子 cons 吗?
(把一个元素挂到表头,正是构造一切嵌套结构的那一个动作。)

5

递归出无限:合并可以无限自我嵌套,所以有限的词能造无限的句子。 原书的判语一针见血:合并"其实是一种原始的递归机制,考虑到广义递归函数等价于 图灵机,我们便不惊奇'合并'机制可以解释所有的语法现象"6—— 换句话说,乔姆斯基的"语言机关"在计算理论里并不神秘,它就是"能构造一切可计算 结构"的那个能力的语言学化身。

支点二:生物证据的方向。 认知神经科学家弗里德里希的专著总结了支持合并的脑证据; 其中一个实验设计原书细讲:绒顶柽柳猴能识别相邻依存的正则语言(乔姆斯基 3 型文法), 却识别不了短语结构文法(2 型)——人类与近亲灵长类的语言鸿沟,恰好落在 自动机谱系的某一级上7

支点三:语言比感官更基础。 乔姆斯基的妻子、生物语言学家卡罗尔研究过两岁前 得过脑膜炎的儿童:他们丧失了视觉和听觉,只剩触觉,却仍能通过触觉补偿语言能力、 从而能思维——语言官能可以脱离视听而存在,反之不成立8

3.4 这场争论里真正的赌注:学习是记忆还是压缩

原书在这一章埋了一句看似轻描淡写、实则承重的话:

经验主义者会把学习看作记忆,而承认丘奇-图灵论题的人会把学习看作压缩9

把两种世界观摊开:

学习=记忆(极端经验主义/行为主义)学习=压缩(丘奇-图灵论题下的学习)
模型在做什么把训练数据存下来,要时翻出来拼上找出能重新生成数据的最短程序
对新数据的预期相似才能复用抓住了规律,未见过也能外推(举一反三)
对应的 AI 路线早期专家系统、翻查式方法大语言模型的 next token prediction

ChatGPT 答对"John is too stubborn to talk to"用哪张表解释都行—— 争论恰恰在于你选哪张表。 而原书替"压缩"一方补了一个哲学合流:乔姆斯基的 "先天内生文法",本质上是所罗门诺夫归纳里的先验概率分布——理性主义与经验主义 之争,在丘奇-图灵论题底下"只是修辞的,而不是本质的"10。(所罗门诺夫归纳 是第 10 章的主角。)

3.5 反方:麻省理工新贵的"功能能力"

ChatGPT 之后,麻省理工的塔南鲍姆等人提出反命题:大语言模型解决了语言问题, 但不能思维。论文标题一目了然:《分离语言与思维》。《自然》的精简版改题为 "语言主要是交流工具而非思维"11

他们的核心区分:形式能力(formal competence,语法、造句——LLM 已经拿到) 对功能能力(functional competence,用言语与世界打交道——放在今天,就是能执行代码、调用外部程序去做事,行话叫工具调用——LLM 没有)。

原书对这对概念的处理很有趣:"其实,他们对语言能力的划分是乔姆斯基玩剩下的"—— 乔姆斯基早有内部语言(I-语言,天生的能力)与外部语言(E-语言,用于行为)之分, "小塔的'功能能力'对应于乔老爷的外部语言"12。原书的判语是: "小塔并没有提出什么新东西。"

我们补一个原书没有展开的观察(我们的判断,不是书里的): "形式/功能"之分真正的威力不在哲学,在工程路线——它预测"纯语言模型永远差一口气", 并主张把钱投向具身与多模态。这条路线与"语言即思维"派(以语言为基座建多模态) 构成今天多模态大模型的两大流派。如果错,会错在: 若功能能力最终能由纯文本训练自生自长——比如靠代码执行、工具调用这类"文本可表达的交互"长出来——则这条分界会被推翻,语言基座路线通吃。

3.6 图灵 1948 年的先见与两个工程推论

这一章最出人意料的一手材料,是图灵 1948 年报告《智能机器》里的"人作为机器"一节: 图灵指出,即使用麦克风、喇叭、摄像机把人的感官在机器上实现,机器对人感兴趣的 食物、运动、社交仍然无所适从;他建议研究那些不太需要与外部世界交互的功能—— 游戏、语言学习、语言翻译、密码学和数学13

原书从中拉出两个工程推论:

推论一:多模态以语言为基座。 承认思维即语言的团队,会把语言模型作为基座, 其他模态搭在语言之上、通过语言沟通;否认派则试图在任意模态之间直接建映射—— "这明显不经济"。"多模态模型的好坏取决于基础语言模型的能力"14

推论二:改世界不如改提示词(给模型的一句指令)。 原书的火星思想实验:如果火星上所有停车标志 (STOP sign)都是绿色的,人类驾驶员一句"注意!停车标志是绿色的"就适应了; 对大语言模型,一句提示——"把所有停车标志的颜色替换成绿色"——理应实现同样的 适应15。语言是压缩世界规则的最经济界面——这又是"学习=压缩"的世界观 在工程上的投影。

3.7 黑盒、白盒与大是大非的共识

本章收在一个少有人点破的共识上。辛顿批评乔姆斯基的理性主义(语言不需要先天结构, 数据驱动即可习得);乔姆斯基批评神经网络的端到端(黑盒,不提供解释)。 但原书指出:黑盒是相对的——就像调用子程序,子程序对调用者是黑盒, 对编写者是白盒;而更重要的是,辛顿的学习理论同样假设学习机器是图灵机, 图灵机与乔姆斯基 0 型文法等价。"最重要的是,他们在'语言=思维?'这一 大是大非问题上是有共识的。"16

翻译成一句总结:争论的双方其实共享同一个前提——语言能力就是(或等价于)一种 计算;吵的只是这种计算是先天的还是学出来的。 大语言模型的成功,是在"学出来的" 这一侧投下的一票,但它投的票恰恰只有站在"语言=思维"的世界里才算数。

4. 作者的判断与证据

史实层:《ChatGPT 的虚假承诺》的发表日期与例句、曼宁的推文、塔南鲍姆团队的 论文与《自然》改题、弗里德里希的猴子实验、图灵 1948 报告的建议清单,均有文献。

作者观点层(要分开,这一章作者观点密度很高):

  • "乔姆斯基被打了脸"是作者的现场判断;
  • "小塔并没有提出什么新东西"是对麻省理工论文的贬损——作者甚至补了一句对 马斯克的赞许("自动驾驶是狭隘形式"比讨好大众的观点更有洞见)17,立场鲜明;
  • "错失了大语言模型发展的人开始提'空间智能''世界模型',是理论和实践上都无能的 借口"——这是全书火药味最重的段落之一,显然针对特定人物,属于作者的个人论战, 不是学界共识18;
  • 作者对"一维语言不如三维空间"论的反驳有硬核支撑:"一维图灵机模拟 n 维图灵机的 成本几乎是可忽略的"(这是计算理论的标准结论,与第 09 章的相似性原则同源)18

原书标注存疑处:《普遍唯理语法》是否被乔姆斯基误读,"有语言学史家认为"—— 原书照录学术分歧19

5. 边界与局限

  • "ChatGPT 答对反例句"不构成对刺激贫乏论的反驳:一次行为不足以判定系统内部 有无语法;后续研究(探测模型内部的句法表征)原书未提。
  • "合并"的生物学解释至今缺位:乔姆斯基本人也只把毕生工作称为"计划" (program)而非"理论"(theory)20——原书照实记录了这份谦逊。
  • 形式能力/功能能力的实验基础(语言网络与思维网络的脑成像分离)原书没讲, 反方远非"旧瓶"这么简单——读者应读原论文再下判断。
  • 本章与第 10 章的分工:这里只给出"学习=压缩"的立场与推论;压缩的数学 (所罗门诺夫归纳、柯尔莫哥洛夫复杂性)全在下一章。

6. 可带走的

  1. "思维即语言"是大模型革命的哲学前提:语言模型的成功只有在这个前提下 才等于"机器会思维"——而最该欢迎这个前提的乔姆斯基,是它最著名的否认者;
  2. 歧义句测试的读法:一次答对推翻的是"统计必然读不懂"的全称否定, 不是证明模型有语法——评估 AI 的语言能力,先分清全称与个例;
  3. 合并 = cons:语言的无限生成力来自一个原始递归操作,而递归等价于图灵机—— 语言机关在计算理论里并不神秘;
  4. 人类与猴子的语言鸿沟落在自动机谱系上(正则语言 vs 短语结构语言)—— 文法分层不只是数学分类,是可做动物实验的实在分界;
  5. 学习=记忆,还是学习=压缩,是两种世界观:它决定你怎么解释模型的每一次 成功与失败(第 10 章给出压缩的数学);
  6. I-语言/E-语言 = 形式能力/功能能力:新论文的区分六十年前已有, 但它预言的工程路线之争(语言基座 vs 具身优先)是真实的;
  7. 图灵 1948 年就建议避开与世界的纠缠,先做语言与数学——今天"以语言为基座" 的多模态路线,七十八年前就画了草图;
  8. 改一句提示 vs 重训一个模型:火星停车标志实验是世界观(压缩)的直接推论;
  9. 黑盒是相对的,共识是实在的:辛顿与乔姆斯基吵的是先天与后天, 共享的是"语言=计算"——这个共识比任何一方的胜利都重要。

7. 原文地图

主题原书章原文位置
《虚假承诺》与例句第9章 语言等于思维吗?text/13-ch09.txt:18(搜「虚假承诺」) · text/13-ch09.txt:20(搜「stubborn」) · text/13-ch09.txt:23(搜「打了脸」)
曼宁的失望第9章 语言等于思维吗?text/13-ch09.txt:25(搜「曼宁」) · text/13-ch09.txt:27(搜「乔老爷老了」)
柏拉图之问与奥威尔之问第9章 语言等于思维吗?text/13-ch09.txt:34(搜「柏拉图之问」) · text/13-ch09.txt:35(搜「刺激贫乏」)
思维即语言七十年未变、斯金纳第9章 语言等于思维吗?text/13-ch09.txt:57(搜「思维即语言」) · text/13-ch09.txt:58(搜「斯金纳」)
洪堡、有限手段无限运用第9章 语言等于思维吗?text/13-ch09.txt:63(搜「洪堡」) · text/13-ch09.txt:88(搜「有限手段」)
合并机制与 LISP cons第8章+第9章text/12-ch08.txt:128(搜「boys eat apples」) · text/12-ch08.txt:135(搜「cons」) · text/13-ch09.txt:89(搜「原始的递归机制」)
合并=原始递归第9章 语言等于思维吗?text/13-ch09.txt:89(搜「合并」) · text/13-ch09.txt:89(搜「递归机制」)
猴子与文法分层第9章 语言等于思维吗?text/13-ch09.txt:99(搜「绒顶柽柳猴」) · text/13-ch09.txt:100(搜「短语结构文法」)
承认语言=思维即承认图灵机思维第9章 语言等于思维吗?text/13-ch09.txt:103(搜「图灵机可以思维」)
卡罗尔与脑膜炎儿童第9章 语言等于思维吗?text/13-ch09.txt:116(搜「卡罗尔」) · text/13-ch09.txt:118(搜「触觉」)
Colorless green ideas 与幻觉第9章 语言等于思维吗?text/13-ch09.txt:122(搜「Colorless」) · text/13-ch09.txt:124(搜「幻觉」)
学习=记忆还是压缩第9章 语言等于思维吗?text/13-ch09.txt:131(搜「白板」) · text/13-ch09.txt:137(搜「会把学习看作压缩」) · text/13-ch09.txt:137(搜「压缩」)
先天文法=先验分布、理性经验只是修辞第11章 什么是学习?text/15-ch11.txt:196(搜「先天内生文法」) · text/15-ch11.txt:198(搜「修辞的」)
塔南鲍姆与《自然》论文第9章 语言等于思维吗?text/13-ch09.txt:142(搜「塔南鲍姆」) · text/13-ch09.txt:149(搜「自然」,原文期刊名见同段「Language is Primarily」) · text/13-ch09.txt:154(搜「形式能力」)
小塔没提出新东西、I-语言第9章 语言等于思维吗?text/13-ch09.txt:157(搜「玩剩下的」) · text/13-ch09.txt:158(搜「内部语言」) · text/13-ch09.txt:170(搜「新东西」)
图灵 1948 人作为机器第9章 语言等于思维吗?text/13-ch09.txt:176(搜「人作为机器」) · text/13-ch09.txt:179(搜「游戏、语言学习」)
多模态语言基座第9章 语言等于思维吗?text/13-ch09.txt:187(搜「基座」) · text/13-ch09.txt:189(搜「多模态模型」)
火星停车标志第9章 语言等于思维吗?text/13-ch09.txt:200(搜「停车标志」) · text/13-ch09.txt:203(搜「prompt」)
世界模型是借口、一维模拟 n 维第9章 语言等于思维吗?text/13-ch09.txt:192(搜「世界模型」) · text/13-ch09.txt:193(搜「一维」)
傅京孙句法视觉第9章 语言等于思维吗?text/13-ch09.txt:205(搜「傅京孙」)
NLP 不再研究语言第9章 语言等于思维吗?text/13-ch09.txt:212(搜「中间步骤」) · text/13-ch09.txt:218(搜「非常不幸的」)
黑盒白盒、大是大非的共识第9章 语言等于思维吗?text/13-ch09.txt:235(搜「黑盒子」) · text/13-ch09.txt:235(搜「白盒子」) · text/13-ch09.txt:240(搜「大是大非」)
《普遍唯理语法》误读之争第9章 语言等于思维吗?text/13-ch09.txt:80(搜「普遍唯理语法」) · text/13-ch09.txt:80(搜「误读」)
乔姆斯基自谦为"计划"第9章 语言等于思维吗?text/13-ch09.txt:92(搜「计划」)

Footnotes

  1. 出处:「第9章 语言等于思维吗?」第 57 段(text/13-ch09.txt:57,搜「思维即语言」)。原文:"乔姆斯基的核心思想——思维是由语言生成的(这里简称'思维即语言'或'语言即思维')——从来没有变过"。

  2. 出处:「第9章 语言等于思维吗?」第 18 段(text/13-ch09.txt:18,搜「虚假承诺」)、第 20 段(搜「stubborn」)、第 22 段(搜「深层含义」)、第 23 段(搜「打了脸」)。两种读法的展开为解释性补充(补充:不在书里,来自通用知识),例句与结论均出自原文。 2

  3. 出处:「第9章 语言等于思维吗?」第 25-27 段(text/13-ch09.txt:25,搜「曼宁」)。

  4. 出处:「第9章 语言等于思维吗?」第 34-38 段(text/13-ch09.txt:34,搜「柏拉图之问」)。

  5. 出处:「第9章 语言等于思维吗?」第 125-135 段(text/13-ch09.txt:89,搜「合并」)与第 129 段(搜「boys eat apples」)、第 135 段(搜「cons」)。合并走查按原文的集合记法重排;原文另给出 "for what x,boys eat x" 的一阶逻辑表示(第 134 段)。 2

  6. 出处:「第9章 语言等于思维吗?」第 88 段(text/13-ch09.txt:88,搜「有限手段」)与第 90 段(搜「递归机制」)。

  7. 出处:「第9章 语言等于思维吗?」第 93 段(text/13-ch09.txt:93,搜「弗里德里希」)与第 98 段(搜「绒顶柽柳猴」)。

  8. 出处:「第9章 语言等于思维吗?」第 116-118 段(text/13-ch09.txt:116,搜「卡罗尔」)。

  9. 出处:「第9章 语言等于思维吗?」第 137 段(text/13-ch09.txt:137,搜「会把学习看作压缩」)与第 137 段(搜「压缩」)。

  10. 出处:「第11章 什么是学习?——大语言模型的理论与实践」第 196 段(text/15-ch11.txt:196,搜「先天内生文法」)与第 198 段(搜「修辞的」)。

  11. 出处:「第9章 语言等于思维吗?」第 142-150 段(text/13-ch09.txt:142,搜「塔南鲍姆」)与第 149-150 段(搜「Language is Primarily」)。

  12. 出处:「第9章 语言等于思维吗?」第 157 段(text/13-ch09.txt:157,搜「玩剩下的」)与第 158 段(搜「内部语言」)、第 171 段(搜「新东西」)。

  13. 出处:「第9章 语言等于思维吗?」第 176 段(text/13-ch09.txt:176,搜「人作为机器」)与第 179 段(搜「游戏」)。

  14. 出处:「第9章 语言等于思维吗?」第 187 段(text/13-ch09.txt:187,搜「基座」)与第 189 段(搜「多模态模型」)。

  15. 出处:「第9章 语言等于思维吗?」第 200 段(text/13-ch09.txt:200,搜「停车标志」)与第 203 段(搜「prompt」)。

  16. 出处:「第9章 语言等于思维吗?」第 235-240 段(text/13-ch09.txt:235,搜「黑盒子」)与第 240 段(搜「大是大非」)。

  17. 出处:「第9章 语言等于思维吗?」第 170 段(text/13-ch09.txt:170,搜「马斯克」)。

  18. 出处:「第9章 语言等于思维吗?」第 192 段(text/13-ch09.txt:192,搜「世界模型」)与第 194 段(搜「一维」)。 2

  19. 出处:「第9章 语言等于思维吗?」第 80 段(text/13-ch09.txt:80,搜「普遍唯理语法」)与第 80 段(搜「误读」)。

  20. 出处:「第9章 语言等于思维吗?」第 92 段(text/13-ch09.txt:92,搜「计划」)。原文:"他目前都以更加谦逊的'计划'(program)而不是'理论'(theory)来指称他的研究"。