本事与产品 — 它凭什么写得了文章却算错数,以及这些本事怎么变成钱
这一章讲三件事: 大模型的本事到底有哪几样、各自靠什么成立; 为什么它一本正经地编造是根除不掉的;以及这些本事怎么变成你手机里的产品。 前四章讲「它是怎么造出来的、要花多少钱」,这一章讲「它能干什么、卖给谁」—— 全书从技术转向生意,转折点就在这一章。
1. 先看现象:它写得了论文,却数不清一句话里有几个字
你大概都碰到过这种落差:
- 让它写一篇发言稿、改一段话、解释一个概念——相当好;
- 让它算一道多步的账、把几个数排序、数一数某段话有多少字——经常错,而且错得理直气壮;
- 让它说一件它不知道的事——它会编一个,连出处都编得像模像样。
这三件事不是三个 bug,是同一套机制的三种表现。 这一章讲清那套机制。
2. 顶层全景:从本事到钱,书走了五步
① 它有哪几样本事? ── 看得懂 · 写得出 · 想得清 · 记得住
↓
② 这些本事怎么用? ── 按「人和机器谁做主」分成三档
↓
③ 于是人机交互变了 ── 从「点按钮」变成「说人话」
↓
④ 于是钱多了三处 ── 多收钱 · 多拉人 · 多一种卖法
↓
⑤ 于是入口要换人 ── 大模型取代搜索引擎,顺手砸掉它的广告生意
图说:这五步是一条因果链, 不是五个话题。书的原章序也是这个顺序。
先说清第①步那四条是谁定的:是书自己归的。 它在 4.1 节把当时的评测体系摊开——一共 481 个细分任务—— 再把这些任务收成四类:看得懂、写得出、想得清、记得住1。 这不是学界公认的分法,是这本书自己的整理。 拿它当一张目录好用;拿它当分类学会出问题——下面那条走查里, 「数一数有几个字」这一道题就同时压在「看得懂」和「想得清」两条上。
一条贯穿全章的主走查:「数一数这句话有多少个字」
这一章的每个承重机制,都会回到这一个输入上占一步。 下面这些输出是这类模型的典型表现;写出来的具体数值是为演示编的,不是某一次真实对话的记录。
输入: 「数一数下面这句话有多少个字:『大模型不会数数』」。 正确答案是 7。
| 走到哪一条本事 | 它实际吐出来的东西 | 对不对 |
|---|---|---|
| 看得懂 | 「好的,我来数一数。」——它读懂了这是一道计数题,没有答非所问 | 对 |
| 写得出 | 「这句话共有 8 个字。」——一句语法完整、语气自然的中文 | 错。而且同一个问题问第二遍,它可能答 6,两次都「有效」 |
| 想得清 | 让它把中间步骤写出来:「大 / 模 / 型 / 不 / 会 / 数 / 数 —— 一共 7 个」 | 对了,但多吐了二十几个字 |
| 记得住 | 追问「这句话出自哪里」,它答:「出自《人工智能简史》第 3 章第 47 页。」 | 编的。书名、章号、页码,一样不缺 |
错到底错在哪一步?错在「写得出」之前的那一步:它看到的根本不是七个字。 这句话进模型之前会先被切碎——「大模型」很可能整个算一块,「不会」一块,「数数」一块, 一共三四块。它数的是块,不是字;而一块等于几个汉字,各家的切法都不一样 (第 07 章第 8 节会看到:混元一块约 1.8 个汉字,通义千问和千帆一块约 1 个)。
这条走查后面还会用到四次: 第 4 节看它为什么「看着会」(捷径学习)、第 6 节看「让它把中间步骤写出来」多花的那几十个字要付多少钱、 第 7 节看它凭什么编得出页码、第 8 节看三种协作模式各自兜不兜得住这个 8。
3. 先说「涌现」:这个词被用得太随便了
这一节回答:「模型大到一定程度就突然会了」这句话,能信到什么 程度。
书是怎么说的
书给的定义是:涌现指的是大模型在执行任务时展现出的出乎意料的行为、思想或想法2。 它还给了两个特征:
- 非线性——就是「不成正比」:投入翻一倍,产出不一定翻一倍, 可能几乎没变,也可能一下子跳很高。书说模型一大,性能可能发生这种不可预测的变化;
- 突发性——某个本事可能突然以意外的方式出现,没法靠简单往下推预测。
但这件事有争议,书没提
补充(不在书里): 2023 年 4 月 28 日的一篇论文 《Are Emergent Abilities of Large Language Models a Mirage?》(第一作者 Rylan Schaeffer) 提出了一个很有杀伤力的反驳:所谓「突然会了」,很可能是打分方式造成的错觉。
它的论证是:用「全对才算分」这类非连续的打分方式去量,就会看到断崖式的跳跃; 换成「离正确答案有多近」这类连续的打分方式去量,看到的是平缓、可预测的改善。 换句话说,变的可能是尺子,不是被量的东西。
来源:https://arxiv.org/abs/2304.15004(查阅于 2026-08-25)
判断(我们的,不是书里的): 这条质疑要不要接受,取决于你拿「涌现」干什么。 当描述用,它没问题——「模型做大之后确实多出了一些以前没有的用法」这件事是真的; 当解释用,它是空的——说「因为涌现所以会了」等于什么也没说。 判据很直接:一个说法如果换掉打分方式就消失了,它就不该被当成模型的性质。 如果错,会错在: 如果某项能力在所有连续打分方式下都仍然表现出突变, 那它就不是尺子的问题,「涌现」也就重新成为一个实质性主张。
顺带一提:「基座模型」这个词书用的是第 01 章那份斯坦福报告的定义—— 在大规模数据上训出来、能适应多个下游任务的基本模型3。 那条定义里点了两种训法的名字,一个一个说。
一种叫自监督: 不用人给标准答案,拿数据自己的一部分当答案去练—— 把一句话遮掉几个字让它填回来,答案就在这句话自己身上。
另一种叫半监督: 只有一小部分数据配了人给的标准答案, 剩下的大部分没有,两边混着一块儿练。
它和「基础模型」是同一样东西的两个中译名,本拆解统一叫基座模型。
4. 四条本事之一:看得懂
这一节最有价值的 不是「它有多强」,是「它可能是靠什么强的」。
先看成绩
书给的数字很硬:GPT-4 在一项覆盖大量学科的综合测试上准确率 86.4%, 模拟律师考试进入前 10%,SAT 数学 700 分(满分 800)4。
然后是这一章最好的一段:捷径学习
书难得地记下了一个反面证据,而且这个证据比上面所有成绩都重要5:
研究者发现:某些推断题里的线索词(比如英文的 "not")
能帮模型直接猜中答案,而不必真读懂句子
└─ 于是他们把这些线索词去掉,再考一遍
└─ BERT 模型的表现,与随机瞎猜没有区别
图说:这不是说模型什么都不会,而是说它拿到的高分里,有一部分是靠找题目的破绽拿的。
这种「靠数据里的假相关拿分」的现象,书里叫捷径学习。
「假相关」当场解释: 两件事经常一起出现,但其中一件并不是另一件的原因。 比如「题目里有 not,答案多半选否定」——这在题库里成立,在真实语言里不成立。
回到那条走查,捷径学习在这儿长什么样。 把问题改成「这句话一共有多少个字?」,它答对的概率反而高一些—— 不是因为它数得更准,是因为题库里带「一共」的题多半是加法题,它见过太多次。 把「一共」两个字去掉,这点优势就没了——这正是上面那个实验干的事: 去掉线索词,分数掉回瞎猜水平。
由此引出的那个追问,是全书少有的深刻处
书顺着问了一句:既然如此,用为人类设计的考试来考模型,是不是本来就不合适?6
它给的分析很准,但写得抽象。换成具体的东西说一遍:
人是先摸过、烫过、被挠过,才知道「烫」和「痒」是什么; 它是把「烫」这个字和它周围常出现的那些字之间的关系记了下来。 所以同一道 SAT 数学题,人做对是因为想通了, 它做对可能是因为题库里这类题的答案分布它见过—— 上一段那个「去掉 not 就掉到瞎猜水平」的实验,量的正是这个差别。
拿一张为人设计的考卷同时量这两种东西,分数一样,含义不一样。 书自己的原话是:人的语言理解反映的是「对现实世界经验的压缩与抽象」, 而模型强的是「把数据之间的相关性编码下来」。
书还老实记下了学界的分歧:一派认为模型可能已经真的理解了大量概念; 另一派认为它只学会了语言的形式,而没学会意义—— 并举了一个特别好的例子:**「挠痒痒」为什么会引人发笑,人是靠身体的感觉知道的;
模型能熟练使用这个词,却从未体验过那种感觉**7。
还有一派的说法最克制,也最实用:大模型更像是「打包和压缩了人类知识的存储库」7。 记住这句话,它是下面「记得住」那一节的伏笔。