跳到主要内容

幻觉 — 看起来对的错答案

这一章讲三件事: 它凭什么能编出一条格式完美的假引注; 这件事在它的工作方式里是哪一步产生的;以及为什么「把随机度调低」这个最常见的补救, 在原理上就不可能奏效。

它在全书链条里的位置: 第 01 章说了「内容对不对」是缺的那一维, 这一章说清这一维最典型的失效长什么样、从哪儿来。 后面十九章全都在治它——所以这一章是全书的敌人档案。

1. 顶层全景:一条假引注是怎么被造出来的

用户问:「有没有支持『雇员举报安全违规后被解雇』的判例?」


它开始一个词一个词地往下写
│ 每写一个,先算一张候选表:哪些词可能接在后面、各自可能性多大

写到案号那一段:它见过几十万条真引注,知道这里该接一个「卷宗号 + 缩写 + 页码」
│ 于是挑出格式完全正确的一串

一条完整、自洽、格式无可挑剔的引注 ←── 而这个案子不存在


整条链上没有任何一步去问:「这个案号,判例库里查得到吗?」

图说:每一步它都在忠实地执行「写得像」。**编造不是它失灵,是它照常工作的结果。**

这一章的主走查是这条引注,分四步走完。每一步挂在哪一节,先摆在这里:

走查在哪一节这一步看什么
第 ① 步第 2 节「一个词一个词地写」到底是什么动作
第 ② 步第 4 节四条成因分别落在这条链的哪一步
第 ③ 步第 5 节把随机度调到 0,再生成一遍这条引注
第 ④ 步第 6 节这条引注属于两类幻觉里的哪一类

第 3 节不在这条走查上:它单独回答一件事——它错的时候,为什么和对的时候一样自信。

2. 它写答案的时候,其实在做一道填空题

这一节解释全书最底层的一个动作。不懂这个动作,后面所有的「为什么」都接不上。

先看现象:字是一个一个冒出来的

你用这类 AI 的时候,回答不是「唰」地整段出现,而是一个一个往外冒。

那不是网页的动画效果,那就是它真实的工作节奏。 它在反复回答同一个问题:

「照目前这段文字,下一个该接什么?」 问一次,写一个,把加长后的文字整段重新读一遍,再问一次。

没有构思,没有打草稿,没有通盘规划。 每一步它都现算一张表: 哪些候选可能接在后面、各自的可能性有多大;然后挑一个接上去,再算下一张。

它一次添的不是「一个字」,是「一个词元」

严格说,它每次添加的东西是它切分文字的最小单位:可能是一个完整的英文单词, 也可能只是单词的一小截(pre、ing、ized 这样的词头词尾各算一个); 中文常常一个字就是一个。这个单位的中文名叫词元,英文名叫 token。

这个名字必须留下来,因为你出门到处都会撞见它: 按它的个数收费、上限按它的个数算、账单按它的个数出。 本章后面一律说「词元」,只在讲直觉的地方才说「词」——说的是同一件事1

还有一个词顺带说清楚:它每次重新读一遍的那整段文字——你的问题、之前的对话、 你贴给它的材料、它自己已经写出来的部分——统统叫上下文。 它一次能读多长是有上限的,这个上限后面好几章都会撞到。

走查第 ① 步:那条引注是怎么一个词元一个词元长出来的

假设它已经写到了这里(下面这条引注、以及所有百分比,都是为演示编的,不是真实数值, 也不是书里的数——这正好也是一次「编造的引注」示范):

已经写出: Hartley v. Northgate Logistics, 812
该接什么? 算出一张候选表 ↓

F.3d 62% ← 联邦上诉法院判例汇编第三辑的标准缩写
F. Supp. 14%
U.S. 9%
S. Ct. 5%
其他 10%

它挑中 F.3d,接上去 → 「…, 812 F.3d 」
下一张表: 447 / 1339 / 210 / … ← 三位数是这个位置最常见的形状
再下一张: (9th Cir. / (2d Cir. / (11th Cir. …
再下一张: 2016) / 2019) / 2021) …

最终:Hartley v. Northgate Logistics, 812 F.3d 447 (9th Cir. 2016)

图说:每一格它问的都是「这个位置最像的是什么」,**从来不是「这个案子存在吗」**。

看清楚这里发生了什么:每一步它都答对了。 「812 后面接 F.3d」——对,真实引注就长这样; 「F.3d 后面接三位数页码」——对;「再后面是法院和年份」——对。

每一格都对,拼起来的东西却整个不存在。 这就是这一章要解释的全部内容。

补充(不在书里,依据我们自己的书架): 「一个词元一个词元地续写、每一步先算一张候选表」 这个动作,原书只有一句话带过,没有任何展开;上面这一节的机制取自我们已经写完并验收过的 另一本书的拆解,那里用整整一章讲了这个动作、以及为什么它只能这样2

3. 幻觉:它错的时候和对的时候一模一样自信

这一节给这类错误一个准确的定义,并说清它和普通 bug 的差别。

先看现象:没有任何征兆

那位律师之所以中招,不是因为他粗心。是因为这六条引注没有任何一处不对劲: 案名符合命名惯例、卷宗号和页码格式规范、年份合理、法院层级和案由匹配、 连法律说理都读得通3

唯一的问题是这些案子不存在。

定义:什么算幻觉

幻觉 = 模型生成了事实上错误的、无意义的、或与所给材料不符的内容, 却用和它说对时完全一样的自信语气把它说出来。4

「一样的自信」是这个定义的重心。 原书连说了三句: 它不表示不确定;它不打折扣;它用陈述已核实事实的那种权威口吻,说出编造的信息

和传统 bug 的差别:一句话

传统软件的 bug幻觉
产出什么明显错的东西:报错、崩溃、乱码看起来对的错答案5
谁先发现系统自己(它会报警)没有人——直到有人去核
复现同样的输入,同样的错同样的输入,可能这次错、下次对
修法找到那行代码,改掉没有那行代码可改

最后一行是这本书存在的理由。 你没法给幻觉提一个缺陷单, 因为产生它的不是某一处写错的逻辑,是这台机器正常工作的方式

4. 四条成因,各在那条链的哪一步

这一节回答:既然不是 bug,那它到底从哪儿来。作者给了四条,而且它们不是并列的抱怨, 是同一条链上的四个不同位置。

原书的四条6,配上它们在第 1 节那张图里的位置:

#成因落在链条的哪一步
1它是一套模式匹配系统:学的是「权威内容长什么样」——引注的结构、用词、文风——而不知道具体某条事实是不是真的训练时。这决定了它的候选表长什么样
2按可能性一个词元一个词元地生成,追求的是「听起来合理」,不是「准确」每一次挑词时
3它读的是互联网规模的材料,这些材料本身就含错误、矛盾和空白训练时。候选表里本来就混着错的东西
4在生成之前,它没有任何内建机制拿输出去对照真相核验这一步根本不存在

第 4 条和前三条不是一个性质,这一点书没点破,但它决定了后面二十章的做法。

前三条说的是「候选表本身不完美」——它们是程度问题,可以靠更好的材料、 更大的规模去改善一点点。第 4 条说的是「整条链上缺了一整个环节」, 这是有无问题:核验这一步不存在,不是做得不好。

判断(我们的,不是书里的): 这本书之所以能成立,靠的就是这条区分。 它接下来二十章做的事,几乎都可以归结成一句话:把缺的那个环节从外面补进去。 先取回真材料再让它写(第 05–09 章)、让它去调真接口拿真数据(第 12–15 章)、 事后再拿一套东西去核它写的每一条主张(第 17 章)—— 这三件事的形状不同,补的都是第 4 条那个洞。 如果错,会错在: 如果将来的模型把核验做进了自己内部(比如生成过程中自带一次事实检查), 第 4 条就从「缺一个环节」退化成「这个环节做得不够好」, 那时这本书的第一层就要整个重写。判据是:模型能不能在开口前自己说出「这条我不确定」。

走查第 ② 步:四条成因怎么合力造出那条引注

回到 Hartley v. Northgate Logistics, 812 F.3d 447 (9th Cir. 2016):

  • 第 1 条让它知道「引注该长这个样」:名字 v. 名字、卷号、汇编缩写、页码、法院、年份;
  • 第 3 条让「812」「447」「9th Cir.」这些具体的数字和缩写都是它见过的真零件;
  • 第 2 条让它在每个位置挑出「这里最像的那一个」,而不是「这里对的那一个」;
  • 第 4 条让这条拼装出来的东西一路畅通地到达用户,中间没有任何一道关卡。

这四条里,前三条你改不动,第 4 条你能补。 这就是全书的落点。

5. 把随机度调到 0,治不了它

这一节处理一个几乎所有人都会试的补救,并说清它为什么在原理上就不成立。

先看现象:同一句话问两遍,答案不一样

你大概遇到过这件事。这不是它记性不好,是设计里故意留的随机。

第 2 节那张候选表上,F.3d 占 62%,F. Supp. 占 14%。 最自然的做法是永远挑最高的那个;但真实做法是「有时候故意挑排名靠后的」。

挑得多大胆,由一个可以调的设定控制,这个设定叫温度。 调到 0,它就永远挑候选表上最高的那一个,同一句话问一百遍答案一模一样; 往上调,冷门候选被选中的机会变大7。 (温度到底在数学上动了什么、实用值该取多少、调过头会怎样,第 03 章整节讲。)

走查第 ③ 步:把温度调到 0,再生成一遍那条引注

温度 0.7: 812 → [F.3d 62% / F. Supp. 14% / …] → 有时挑到 F. Supp.
结果:引注格式仍然完美,案号是编的

温度 0: 812 → 永远挑 F.3d(62% 那个)
结果:**引注格式更整齐、每次一模一样,案号照样是编的**

图说:温度改的是「照这张表怎么挑」,**它一个字都没改变这张表本身,
更没有凭空加出一道「这个案号存在吗」的检查。**

这就是原理上的答案:随机度和「有没有核对」是两件不同的事。 书里说得更直接:

确定性——同一个输入永远给出同一个输出——不等于事实准确。 一个确定的答案,可以像一贯正确那样一贯地错。8

书引的实测,以及我们没能核到的地方

作者不止讲道理,还引了一项实证工作:

把温度设成 0 并不能可靠地减少幻觉,在某些场景下甚至会提高编造率。9

但这条引用我们要如实报告一件事: 书给的编号是 arXiv:2603.08274 (一项号称跨不同温度、不同上下文长度、不同硬件平台的 1720 亿词元研究)。 这个编号的前四位表示 2026 年 3 月,我们没有核到这篇论文的原文。 所以这条请当成「书里的说法」读——道理那一半(温度不改变有没有核验)站得住,不依赖这个数据。

真正管用的是什么,书也直说了:要让回答真的落地,靠的是把外部资料取回来、 或者让它去调真实的工具,这些在后面的章节里讲10

6. 幻觉不是一种毛病,至少是两种

这一节做一个分类。它看着学术,却直接决定你该用哪一层的手段。

原书在定义之后列了四种形态:编造事实、编造引用、与所给材料矛盾与世界知识矛盾, 并明说「每一类需要不同的缓解手段」11后两种是关键的一刀:

类型它错在哪一个具体例子该用哪一层的手段
与所给材料矛盾(书里叫内在幻觉)已经把正确的材料给它了,它还是说错你把退货政策原文贴给它,写着「14 天」,它答「30 天」光取材料没用——要在生成之后再核一道(第 09、17 章)
与世界知识矛盾(书里叫外在幻觉)你没给材料,它自己编了一个那条不存在的判例先把真材料取回来再让它写(第 05–09 章)

走查第 ④ 步:那条引注属于哪一类

属于第二类。 律师没有给它一个判例库,它是凭「引注长什么样」自己拼的。 所以第一个该上的手段是:接一个真实的判例库,让它先查、再照着写。

但这里有一个必须现在就说清的陷阱:接了判例库,第一类幻觉照样会发生。 把正确的判例摆在它面前,它仍可能把年份写错、把持有意见张冠李戴。 「给对了材料它照样可能编」这句话,原书在讲取资料那一章里重复了两遍—— 我们在第 05 章会带着具体例子回到它。

一句话记住这个分类:第二类是「没材料」,第一类是「有材料也没用」。 前者靠取,后者靠核。 这本书的第一层解决前者,第三层解决后者。

7. 作者的判断与证据

书里给了证据的:

说法证据是什么
幻觉产出的是「看起来对的错答案」,不同于报错和崩溃一个具体场景(六条不存在的判例)+ 与传统 bug 的对照
温度调到 0 不能可靠减少幻觉,某些场景反而更糟引了一项实证研究(但编号我们没核到,见上文)
四条成因有一条道理上的推导,没有实验。 它是从「模型怎么工作」推出来的,不是测出来的

作者的推测或立场:

说法它是什么
「幻觉不是 bug,是机制的产物」一个立场。 它没法拿实验去验对错,但它决定了全书的解法方向:围堵而不是修复
内在 / 外在这对分类一个借用。 这是「让机器处理人类语言」这一行(行话叫自然语言处理)里的标准划分,书提了一次名字就再没展开——是书的一处缺口,我们在上一节补齐了它的用法差别
「每一类需要不同的缓解手段」一句预告。 书没有在同一处给出对照,散落在后面各章;我们把它整理成了上面那张表

8. 边界与局限

  • 书在这一章没有给出任何幻觉率的数字。 从头到尾没有一个「多少比例的回答含幻觉」, 这不是疏漏,是因为那个数字要到第 17 章才有办法算(那里给了一套四步的量法);
  • 内在 / 外在这对分类只提了一次名字。 全书后面基本没有系统地按这个分类展开, 上面那张对照表里「该用哪一层的手段」那一列是我们自己整理的,书里没有;
  • 「它为什么会自信」这件事,书只描述没解释。 为什么模型不会输出「我不确定」? 这涉及它被调教的方式,书一个字没提;
  • 温度那条实证的一手来源我们没核到(见第 5 节)。

9. 可带走的

全章那条走查,一行写完: 用户问判例 → 它一个词元一个词元往下写 → 写到案号位置时算出一张候选表(F.3d 62% / F. Supp. 14% / …,这些数是为演示编的)→ 挑出格式最像的那个 → 拼成 Hartley v. Northgate Logistics, 812 F.3d 447 (9th Cir. 2016)整条链上没有一步去查这个案号存不存在 → 把温度调到 0 再跑:格式更整齐,案号照样是编的。

  1. 它写答案的动作是「一个词元一个词元地续写」,每一步只在一张候选表里挑一个「像样的」;
  2. 词元(token)是它切分文字的最小单位,可能只是半个单词——收费、上限、账单都按它算;
  3. 幻觉 = 事实错误的内容 + 和说对时一模一样的自信语气。 后半句才是要害;
  4. 它和传统 bug 的根本差别:没有那行代码可改,因为产生它的是正常工作的方式;
  5. 四条成因里,前三条是「候选表不完美」(程度问题),第 4 条是「缺了核验这一环」(有无问题);
  6. 全书后面二十章几乎都在补第 4 条那个洞——取材料、调工具、事后核对,形状不同,补的是同一个洞;
  7. 温度调到 0 治不了幻觉:它改的是「照这张表怎么挑」,不是「这张表对不对」, 更没有凭空加出一道核验;
  8. 「确定的」不等于「对的」——一个确定的答案可以一贯地错;
  9. 分两类:没给材料时自己编(靠取材料治)/ 给了材料还说错(靠事后核对治)。 接上文档不等于万事大吉,第 05 章会带着例子回到这一条。

10. 原文地图

主题原书章原文位置
六条不存在的判例Chapter 1: AI Reliabilitytext/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:186(搜「none of the cases exist」) · text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:188(搜「proper legal naming conventions」)
幻觉的定义与「一样的自信」Chapter 1: AI Reliabilitytext/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:198(搜「factually incorrect」) · text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:200(搜「doesn't signal uncertainty」)
和传统 bug 的区别Chapter 1: AI Reliabilitytext/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:203(搜「wrong outputs like error messages」)
四种形态与内在/外在Chapter 1: AI Reliabilitytext/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:204(搜「invented citations」) · text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:206(搜「extrinsic hallucination」)
四条成因Chapter 1: AI Reliabilitytext/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:213(搜「pattern-matching systems」) · text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:216(搜「one token at a time」) · text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:218(搜「no built-in mechanism to verify」)
温度在调什么Chapter 2: Prompt Engineeringtext/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:95(搜「controls the randomness」) · text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:98(搜「more deterministic by favoring」)
确定性不等于准确Chapter 2: Prompt Engineeringtext/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:100(搜「determinism is not the same as factual accuracy」)
温度调 0 的实测Chapter 2: Prompt Engineeringtext/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:102(搜「does not reliably reduce hallucinations」) · text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:1449(搜「arXiv:2603.08274」)

Footnotes

  1. 出处:「Chapter 1: AI Reliability」第 216 段(text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:216,搜「one token at a time」)。原书全篇用 token 这个词而不解释它——这是书默认读者已经懂的东西之一,所以本节的解释是我们补的。中文里 token 有三种译法(标记 / 词元 / 令牌),本组文档统一用「词元」,遇到另外两种译法时说的是同一件事。

  2. 补充(不在书里,依据我们自己的书架):「一个词元一个词元地续写、每一步先算一张候选表、然后带点随机地挑一个」这套动作,原书只有第 216 段那一句话,没有展开。依据: shelf=ai-book-reference/what-is-chatgpt-doing#01-one-word-at-a-time.md 事实=那一章用整章讲了这个动作,包括「它追求的是像而不是对」、候选表上可能性掉得极快、以及为什么这张表只能靠算不能靠查。词元这个单位在同一章第 2 节有更细的说明。

  3. 出处:「Chapter 1: AI Reliability」第 188 段(text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:188,搜「proper legal naming conventions」)。原文逐项列了它们为什么像真的:命名符合法律惯例、引注里有像模像样的卷号页码年份、法律说理听着合理——「除了一个小细节:它们完全是 AI 编的」

  4. 出处:「Chapter 1: AI Reliability」第 198 段(text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:198,搜「factually incorrect」)与第 200 段(同文件 :200,搜「doesn't signal uncertainty」)。

  5. 出处:「Chapter 1: AI Reliability」第 203 段(text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:203,搜「wrong outputs like error messages」)与第 204 段(同文件 :204,搜「answers that look right」)。

  6. 出处:「Chapter 1: AI Reliability」第 213 段(text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:213,搜「pattern-matching systems」)、第 216 段(同文件 :216,搜「optimizing for what sounds」)、第 217 段(同文件 :217,搜「internet-scale data」)与第 218 段(同文件 :218,搜「no built-in mechanism to verify」)。「前三条是程度问题、第 4 条是有无问题」这个区分是我们加的,书里四条是平列的。

  7. 出处:「Chapter 2: Prompt Engineering」第 95 段(text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:95,搜「controls the randomness」)与第 98 段(同文件 :98,搜「more deterministic by favoring」)。原文说低温度让回答更确定,做法是偏向可能性更高的那些词元。

  8. 出处:「Chapter 2: Prompt Engineering」第 100 段(text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:100,搜「determinism is not the same as factual accuracy」)。

  9. 出处:「Chapter 2: Prompt Engineering」第 102 段(text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:102,搜「does not reliably reduce hallucinations」);书给的编号在第 1449 段(同文件 :1449,搜「arXiv:2603.08274」)。这条我们没核到一手来源,请当成「书里的说法」读。

  10. 出处:「Chapter 2: Prompt Engineering」第 103 段(text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:103,搜「True grounding requires techniques」)。原文点名的两条路是取回资料再生成、以及让它去调工具——分别是我们第 05–09 章和第 12–15 章的内容

  11. 出处:「Chapter 1: AI Reliability」第 204 段(text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:204,搜「invented citations」)与第 205 段(同文件 :205,搜「extrinsic hallucination」)。原文的括号里给了这两个学术名:与所给上下文矛盾叫 intrinsic hallucination,与世界知识矛盾叫 extrinsic hallucination。补充(不在书里,来自通用知识):这对划分是自然语言处理领域评价生成文本忠实度时的标准分法,不是这本书自造的词。