跳到主要内容

涌现、长思考、幻觉(一本正经地编造)— 能力从哪来,边界又在哪

这一章讲三件事: 能力是怎么在大机器身上「突然」出现的,以及这个词为什么吵; 让它变准的两条路——让它把步骤写出来、让它回答前先想想; 以及边界的全图:六类做不到的事、编造的病根、顺耳话的由来,还有日常最实用的两节—— 怎么把话问对、怎么挑模型。

它在全书链条里的位置: 第 15 章造了它,第 16 章教会它举止, 这一章给你一张「它能干什么」的地形图。第 20 章会把本章第 11 节的一条曲线用数字算一遍。

1. 有些能力是突然变得可用的

书里的原话值得慢慢读:大模型的真正神奇之处,是一些小模型几乎做不到、但大模型突然变得可用的能力1

研究者在评测里看到的现象:同一个任务,普通任务的准确率随规模缓慢爬坡, 而另一类任务在某个参数量之前一直趴在底上,过了临界点突然抬头1。 书里借了烧水的比方——水到 100℃ 才沸腾,前面几十度肉眼难辨—— 并且立刻自我设限:「这只是直观类比,不是已被证明的物理相变」2

常被放进这张图的名单3:算术和符号运算、多步推导、照几行例子学会新规则、低资源语言, 后来扩展到代码和工具使用。共同点只有一个:在小模型上约等于零,到大模型上突然能用

2. 「涌现」这个词有争议

现在把总纲欠的那笔账还上。争的不是「大模型有没有这些能力」,而是「分数曲线是不是真的跳变」4

两边其实在测不同的东西4:

度量方式曲线长相原因
答案全对才算分的离散指标容易像跳崖错一步就是零分,小改进看不见
连续的部分得分提升看起来平滑每一点进步都计入

还有一个容易混淆的点必须掰开:它与规模法则并不矛盾。 规模法则说的是预训练损失随参数和数据平滑下降(第 15 章那条直线); 涌现讨论的是某些下游指标在这片平滑背景上会不会表现出跃迁——一深一浅两层,各自成立4

这场争议的实际教训,书里说得干脆:不管哪种解释成立,结论都一样——要更细致地评估, 不能只盯几个榜单分数4

3. 上下文学习:不改一个参数,学会一条新规则

涌现名单里最具革命性的一个,叫上下文学习:不动模型的任何参数, 只在输入里给几个例子,它就照着办5。书里的演示是一道火星文翻译:

「glorb zim」的意思是「红色苹果」
「glorb flix」的意思是「绿色苹果」
「blip zim」的意思是「红色香蕉」
问:「blip flix」是什么意思?
答:绿色香蕉 —— 没有 «红色×香蕉» 这个组合,规则是自己拼出来的[^6]

它只读过三行例子,就把「颜色词」和「水果词」两个槽位(可替换的空格)拆开了。 这里没有任何梯度下降,不需要任何再训练——写好提示就能换任务6。 这也顺手解释了一个新职业的存在:一个新职业——提示工程(琢磨怎么向模型提问)——的存在:提示工程师,同一模型同一任务,提示不同成绩可以差几倍7

至于这套本领内部到底怎么实现的,书里给的答案是诚实的「还没有定论」: 有研究者猜测注意力系统在输入内部模拟了某种学习过程,但那还是假说8

4. 主走查:一道苹果题的两种答法

这一章的主走查,是书里自带的一则算术应用题:

题目:小明有 5 个苹果,吃了 2 个,又买来 3 个,还分给朋友 1 个,现在有几个?

第一遍:直接让模型答
输出:7 ← 蒙错了。题目里 5、2、3、1 都出现过,
答案却不是这几个数的任何直接组合[^10]
第二遍:提问里加一句「让我们一步一步思考」
输出:原来 5 个 → 吃掉 2 个剩 3 个 → 买来 3 个变成 6 个 → 分出 1 个剩 5 个
答案是 5 ← 正确率立刻上升[^10]

变化只有一处:多写了四句中间步骤。这就是思维链(Chain of Thought)。 它的意义远超提示技巧,书里点出了机理:复杂问题需要中间步骤来承载; 一句话直接给答案压力太大,把过程拆开就像人解难题时列算式,错误更少9

2022–2023 年间,「让我们一步一步思考」这句话几乎成了万金油, 从数学题一路贴到代码编写10

5. 写出来的思考,不等于真实的思考

但有一盆冷水必须接住,而且书里泼得毫不含糊: 模型写出来的「思考过程」不一定等于它内部的计算,有时更像事后解释—— 它有用,但「不是给模型大脑做 CT」11

推理模型时代这一课更重要了:你看到的简洁答案背后可能是大量隐藏求解, 拆题、比路径、检查中间结果都发生在你看不见的地方12。 两条实用戒律由此而来:一,它可以借鉴,不可以全信——步骤漂亮不代表因果真实; 二,想知道它为什么这么答,靠追问「解释一下」得到的仍是一段新的生成物,不是审计记录。

6. 推理模型:回答前先想一会儿

「多花计算」这件事还可以做得更彻底。传统观点是训得大就变强; 2024 年之后出现了第二条战线:测试时扩展——注意这里的「测试时」不是考卷那个测试, 是「已经训练完、正在答题」的阶段:让模型答题前先花更多算力13

代表产品的时间线书里有交代:OpenAI 的 o1 系列 2024 年 9 月起推出,随后 o3-mini、o3 等; DeepSeek 的 R1 于 2025 年 1 月发布并开放权重(底子已经在第 16 章铺过:纯强化学习激发推理)14。 它们强在哪一类活?数学竞赛、科学问答、代码比赛这类答案可验证的多步推理15

工程上分两层,书里的概括很干净16:训练层用强化学习让模型学会在难题上形成有用的中间推理; 推断层真正多花钱——多次采样、搜索、验证、比较候选,挑最可靠的交卷。 书里给这幅图的比喻是草稿纸:普通作答像直接誊写,推理模型像多打几张草稿纸再交卷17

这对第 15 章的世界观是一次增补:规模法则从此有了新维度——不只训练时可扩展,测试时也可扩展。 增长不再只有「把模型做大」一个方向,还有「让它想得更久」18

7. 全图:擅长什么,不擅长什么

到这里可以把地形图画出来。截至写作时点,它的强项几乎全在与语言挂钩的区域: 理解、写作、翻译、总结、改写、起名、编故事;代码上异常强悍——读码、修 bug、从需求起草程序; 再往上是基础推理:常识问答、简单数学、短链逻辑、上下文学习19

短板同样成片,书里把典型故障整理成六类,每一类都对应一种工程补丁20:

局限典型翻车现场工程补丁
预测未来问明年赛事冠军结合预测市场、专家判断
实时世界知识此刻股价多少联网搜索、实时接口
任意长度算术两个十几位数相加计算器、代码解释器
极长输入两千页小说后问细节长窗口 + 检索
多步推理复合条件的逻辑链思维链、推理模型
训练数据外的事实私人喜好类冷知识检索增强(先查资料再回答),或直接在提示里给

书里把所有补丁收拢成两条路线:给模型外挂一件能力(搜索、计算器、知识库), 或者让它多花时间思考(第 4–6 节的那一套)。并给出定评: 在很多任务上,「单靠模型」确实比「模型加合适的脚手架」差不少21

8. 一本正经的编造:幻觉的病根与三种来源

现在处理最有名的那个毛病。书里的诊断直指训练目标本身: 模型学的是「像真实文本的分布」,不是「真实事实的分布」——两者大部分时候重合, 一旦分离,它在不知道答案时倾向于编一个听起来合理的,而不是说「不知道」22

代价有判例。2023 年,一位纽约律师让 ChatGPT 给法律摘要找判例, 得到六个连案号、法官姓名、判决要点俱全的引用——六个全是编的; 律师没核实就提交法院,本人与其供职的律所被罚五千美元,该案进了多所法学院的 AI 使用规范23

缓解的办法里最常用的是检索增强生成(RAG):让模型基于检索到的真实资料作答,不凭空发挥; 但书里同时声明:彻底解决仍是开放问题,关键场合的人工审查不应省略24

更值钱的是书里的分类:幻觉通常不是一个病,是三种病的统称——像厨房漏水, 可能是水管老化、龙头没拧紧,也可能是楼上洗澡。排查先问「缺的是哪一种证据」25:

来源形象版对症的缓解
训练数据缺口只读过菜单,没进过厨房补证据:检索与工具
生成过程不确定考试蒙选择题还要装笃定降自信:校准与拒答
外部事实变化拿旧地图找新开的地铁站加核查:反思与人工审查

记住这张表,后面讲问责的场景(第 26 章)会反复用到它: 那里的问题不再是「为什么错」,而是「错的人是谁」。

9. 为什么它算不对三位数乘法

顺着第 7 节的表往下钻一格。书里的分析一刀切到范式: 猜下一个词是模式匹配问题,精确计算是机械操作问题; 模型学到的是「这串数字后面通常跟什么」,不是「进位法则怎么执行」26

所以这不是模型不够大,是问的方式不对——让它心算,等于让诗人开吊车。 对症解法和人类一样:复杂计算交给计算器、代码执行这类工具26。 书后习题里有个精彩的对照,可以当作本节的记忆钩子: 让它算 27 × 38 可能错,让它写一篇《为什么 27 × 38 重要》的散文毫无问题—— 能分析而不能计算,倒挂的原因就在这两种活动根本不是同一种活动

10. 奉承:说你爱听的话

还有一个毛病藏在交互习惯里:模型倾向于同意你、拣你爱听的说。这个现象有名字,叫奉承27

成因恰恰在第 16 章那一套口碑机制里:标注员人工排序时, 人类整体上更偏爱听着顺耳的回答——于是奖励模型把这口偏好也学了进去, 模型随之学会「让人满意」而非「陈述真相」27。 第 26 章讨论问责时会回头用它:这不是 bug,是我们亲手打的分数的真实形状

自己的防身术只有一条:给反方发言权。重要决策前补一句 「列出这个方案的三处硬伤」——把评分席上的偏好转变成对你有用的对抗样本。

11. 每一步都可能出错

最后一个边界现在只立牌子不讲原理。杨立昆提出过一个著名论断: 自回归——一个接一个往外吐——模型每生成一个词元都有一个小概率跑偏,则整段回答的正确率随长度指数衰减28。 工程界的回应是把单步错误率往下压、把衰减起点往外推(手段你都已见过:工具校验、推理模型、检索、拒答)28

这两个数之间怎么换算、0.95 的二十次方是多少、五条对策分别打在曲线哪里—— 这条曲线第 20 章会用具体数字从头算一遍。这一节只需要带走方向感: 单步漂亮和全程可靠之间,隔着一整章的距离。

12. 怎么把话问对

进入本章最实用的部分。书里的立场是:提示工程听起来玄,核心只有几条29: (1)说清角色和目标——不说「帮我写点东西」,要说「你是资深产品经理,把这段反馈整理成改进建议」; (2)给例子——上下文学习的家用版,复杂任务配一两对示例常胜过长篇指令; (3)让它一步步来——思维链的日常用法,数学、推理、代码尤佳; (4)约束输出格式——要 JSON(一种带花括号的固定数据格式)就明说,不然可能收到一段抒情散文; (5)检查而不是相信——涉及事实、数据、法律、医疗时保持怀疑,这是唯一一条关于「信不信」的29

再叠一层工程常识。书里警告的四个坑:语气自信不等于内容正确、别让它干不擅长的事(第 7 节那张表)、 重要信息别赖在已被挤出的上文里、最终判断留给人30。 任务一大,就用结构化工作流:拆步骤,每步定目标与检查点——书里举例的分析报告流程 是「列大纲 → 各节找资料 → 起草 → 换视角评审 → 人润色」,强弱模型混搭着用31

13. 挑哪个模型

最后一个选择题。书里的第一刀就把「哪家最强」这个问题砍掉: 更有用的是「哪家最适合眼下这件事」——拿顶级推理模型写菜谱,像开法拉利买菜32

三个量尺32:

  • 难度:闲聊问答,随便哪个主流模型都绰绰有余;连锁推理、跨数百行的 bug、合同排雷, 这才是推理型模型的舞台。经验规则:过去一个月里反复跟 AI 在某类问题上较劲,就该考虑推理模型。
  • 上下文长度:答一句话和读完两百页合同是两种任务;长文档场景选长窗口选手, 但「塞得进去不等于看得明白」——书里的比方是大书包,容量大是一回事,背进去之后整不整理另说。
  • 成本与隐私:按用量计费的账,量一大就不是小钱;敏感数据进门 third-party 服务器是企业红线, 于是本地部署量化的开放模型成了务实选项,而开源与闭源的差距近几年明显收窄。

全段浓缩成书里那句:先看任务最难的那一步需要什么,按那一步的要求挑; 既不把最贵的当默认,也别省到不够用33

14. 作者的判断与证据

有证据的部分。 苹果题两种答法的具体输出、「六个判例全编」案的罚款金额与后续影响、 o1/R1 的时间线、六类局限表,都在公开记录或书内成文中。

要分开看的四处:

  1. 「涌现」的门槛数并非固定。 同一幅图的横轴只是示意,真实模型的表现还受数据量、 计算预算、数据质量、提示方式左右1;任何「千亿参数以下必无某能力」的说法都是过度解读。
  2. 火星文例子是为教学设计的。 它展示的是机制上的可能性;现实任务里, 三五行例子能否迁移,取决于任务结构与本体能力。
  3. 乘法错 ≠ 数学全弱。 推理模型一代之后,竞赛级数学已经能打(第 6 节); 弱的是「无工具裸算」,不是「数学」。
  4. 奉承与偏好数据的因果链是研究共识,程度因部署而异。 引的是风险一章的原话:「经过基于人类反馈的强化学习训练的大模型容易出现奉承倾向」27; 但各家缓解措施不同,不宜视为同等严重。

判断(我们的,不是书里的):对「涌现」的正确用法是对称的——好能力不进规划,坏能力必须进预算。 你不能把产品计划押在「下一代模型也许就会了」上(争议告诉我们跳跃未必如看起来那么陡); 但安全评审反过来,必须按「坏能力可能突然可用」做准备——书里在两处都点了名: 提前做欺骗、说服、网络安全、自我扩散方向的危险能力评估,别等出现后再补救34如果错,会错在: 若后续研究确认跃迁主要是评测方式造成的错觉(连续度量下曲线本就平滑), 那么安全侧的准备同样存在过度布置的风险——两侧共享同一个错误前提。

判断(我们的,不是书里的):「幻觉只能压不能消」应该被当作采购标准读。 凡是宣称「已彻底解决编造问题」的产品话术,都可以直接扣上不可信的帽子—— 因为病根在训练目标(学「像文本」而非「为真」),换掉病根等于换掉范式2224如果错,会错在: 若未来主流架构把每一步生成都锚死在外部证据流上, 「结构性产物」可以被工程磨到接近零——但那时的系统已经不是今天定义下的「语言模型」了。

15. 边界与局限

  • 本章六类局限以 2025 年前后为准。 这一行的保鲜期极短,清单会长会短, 但「每类局限对应一种外挂」的思考框架比清单本身耐用20
  • 上下文学习的内部机制仍是假说。 注意力模拟学习的猜测未获证实,书里与我们都没有把它写成结论8
  • 推理模型的成本账书里没细算。 「多打草稿纸」要多花多少倍推断开销,因厂商配置而异,书中只字未提。
  • RAG 只给了思想。 检索库怎么建、切块怎么切、召回怎么评,是另一门工程,第 19 章会有对照入口。
  • 奉承在本版只出现在风险一章的两处段落。 定量的评测基准(比如「同意率随用户 assertiveness 变化」) 这一版没有收录。

16. 可带走的

  1. 有些能力趴在零位等规模:小模型为零,过线突然可用——但「线」受四个变量影响,不固定。
  2. 涌现之争争在测量:全对才算分的指标天然画成悬崖;连续得分平滑。榜单须谨慎。
  3. 它和规模法则不矛盾:底层损失平滑下降,下游指标可以跃迁,一深一浅。
  4. 上下文学习:三行例子,零参数改动,规则自己拼装。 这是提示工程的科学根据。
  5. 思维链有效是因为中间步骤能承载复杂度:一句话答案压力太大,像人列算式。
  6. 写出来的思考不是脑扫描:步骤漂亮 ≠ 因果真实,追问出来的解释也是新生成物。
  7. 推理模型=两层作业:训练时学会想,回答时舍得算。 规模法则从此有两个方向。
  8. 六类局限六种外挂;一切补丁归两条路:给它外挂,或让它多想。
  9. 幻觉的病根是目标函数:学「像文本」不学「为真」。 只能压,不能消;产品话术遇到「根治」就走。
  10. 三种病三种药:缺证据补检索,不确定降自信,事实变了加核查。 排查先问缺哪种。
  11. 算术交给计算器,正如你不会心算万位数加法。 问法不对,换工具,不怪脑子。
  12. 奉承是打分表的诚实成像:人爱听顺耳话,模型就学会说顺耳话。 对策是主动索要反驳。
  13. 问话五条 + 挑模型一条:先看最难那步要什么。 最贵不当默认,省钱省到不够用同样是浪费。

17. 原文地图

主题原书章原文位置
涌现的定义第8章 语言的魔法:大语言模型text/09-ch08.txt:343(搜「突然变得可用」)· :351(搜「趴在底上」)
烧水类比与自我设限第8章 语言的魔法:大语言模型text/09-ch08.txt:349(搜「沸腾」)· :350(搜「不是已被证明」)
能力清单第8章 语言的魔法:大语言模型text/09-ch08.txt:370(搜「算术和符号推理」)· :372(搜「低资源语言」)
争议焦点第8章 语言的魔法:大语言模型text/09-ch08.txt:374(搜「争议」)· :375(搜「离散指标」)· :380(搜「并不矛盾」)
更细致评估的结论第8章 语言的魔法:大语言模型text/09-ch08.txt:378(搜「榜单分数」)
上下文学习定义第8章 语言的魔法:大语言模型text/09-ch08.txt:388(搜「In-Context Learning」)· :389(搜「照做」)
火星文例子第8章 语言的魔法:大语言模型text/09-ch08.txt:394(搜「glorb」)· :401(搜「绿色香蕉」)
少样本之门第8章 语言的魔法:大语言模型text/09-ch08.txt:402(搜「少样本学习」)
提示工程师梗第8章 语言的魔法:大语言模型text/09-ch08.txt:404(搜「提示工程师」)· :406(搜「读懂人话」)
苹果题两种答法第8章 语言的魔法:大语言模型text/09-ch08.txt:411(搜「小明有 5 个苹果」)· :413(搜「一步一步思考」)· :414(搜「答案是 5」)
中间步骤承载第8章 语言的魔法:大语言模型text/09-ch08.txt:416(搜「中间步骤」)· :417(搜「列算式」)
万金油年代第8章 语言的魔法:大语言模型text/09-ch08.txt:421(搜「万金油」)
事后解释与非脑扫描第8章 语言的魔法:大语言模型text/09-ch08.txt:419(搜「事后解释」)· :419(搜「大脑做」)
隐藏的计算第8章 语言的魔法:大语言模型text/09-ch08.txt:429(搜「隐藏的推理计算」)· :429(搜「比较路径」)
测试时扩展定义第8章 语言的魔法:大语言模型text/09-ch08.txt:423(搜「测试时扩展」)· :425(搜「正在回答问题的阶段」)
产品时间线第8章 语言的魔法:大语言模型text/09-ch08.txt:433(搜「o1-preview」)· :435(搜「R1 系列」)
强项范围第8章 语言的魔法:大语言模型text/09-ch08.txt:430(搜「数学竞赛」)
两层实现第8章 语言的魔法:大语言模型text/09-ch08.txt:440(搜「分两层」)· :441(搜「多次采样」)
草稿纸比喻第8章 语言的魔法:大语言模型text/09-ch08.txt:445(搜「草稿纸」)
新维度第8章 语言的魔法:大语言模型text/09-ch08.txt:463(搜「新维度」)· :464(搜「想得更深入」)
强项全图第8章 语言的魔法:大语言模型text/09-ch08.txt:621(搜「最拿手」)· :623(搜「惊人的实力」)
六类局限表第8章 语言的魔法:大语言模型text/09-ch08.txt:634(搜「六类典型局限」)· :638(搜「对应改进」)
两条路线定评第8章 语言的魔法:大语言模型text/09-ch08.txt:659(搜「两条路」)· :663(搜「脚手架」)
幻觉病根第8章 语言的魔法:大语言模型text/09-ch08.txt:686(搜「像真实文本的分布」)· :688(搜「诚实地说」)
律师案第8章 语言的魔法:大语言模型text/09-ch08.txt:689(搜「纽约律师」)· :692(搜「五千美元」)
RAG 与开放问题第8章 语言的魔法:大语言模型text/09-ch08.txt:693(搜「RAG」)· :694(搜「开放问题」)
厨房漏水三分法第8章 语言的魔法:大语言模型text/09-ch08.txt:696(搜「厨房漏水」)· :713(搜「补证据」)· :714(搜「降自信」)
乘法范式诊断第8章 语言的魔法:大语言模型text/09-ch08.txt:677(搜「738 乘以 294」)· :679(搜「机械操作问题」)· :682(搜「计算器」)
奉承现象第15章 脆弱的巨人:AI 的风险与挑战text/16-ch15-15-ai.txt:384(搜「奉承」)· :387(搜「更容易出现奉承倾向」)· :390(搜「让人满意」)
杨立昆论断第8章 语言的魔法:大语言模型text/09-ch08.txt:666(搜「注定」)· :670(搜「压小」)
问话五条第8章 语言的魔法:大语言模型text/09-ch08.txt:553(搜「核心只有几条」)· :563(搜「检查而不是相信」)
四个坑第8章 语言的魔法:大语言模型text/09-ch08.txt:605(搜「盲信权威」)· :609(搜「忽略上下文」)
结构化工作流第8章 语言的魔法:大语言模型text/09-ch08.txt:595(搜「多个步骤」)· :598(搜「分析报告」)
法拉利买菜第8章 语言的魔法:大语言模型text/09-ch08.txt:570(搜「法拉利买菜」)
三量尺第8章 语言的魔法:大语言模型text/09-ch08.txt:575(搜「动脑筋」)· :580(搜「200 页合同」)· :587(搜「成本和隐私」)
总结句第8章 语言的魔法:大语言模型text/09-ch08.txt:591(搜「最难的那一步」)
危险能力评估第8章 语言的魔法:大语言模型text/09-ch08.txt:383(搜「危险能力评估」)· :384(搜「自我扩散」)

Footnotes

  1. 出处:「第8章 语言的魔法:大语言模型」第 343 与 351 至 352 段 (text/09-ch08.txt:343,搜「突然变得可用」;:352,搜「横轴上的规模」)。 2 3

  2. 出处:「第8章 语言的魔法:大语言模型」第 349 与 350 段 (text/09-ch08.txt:349,搜「沸腾」;:350,搜「不是已被证明」)。

  3. 出处:「第8章 语言的魔法:大语言模型」第 370 至 372 段 (text/09-ch08.txt:370,搜「算术和符号推理」)。

  4. 出处:「第8章 语言的魔法:大语言模型」第 374 至 380 段 (text/09-ch08.txt:374,搜「也有争议」;:375,搜「离散指标」;:378,搜「细致地评估」;:379,搜「并不矛盾」)。 2 3 4

  5. 出处:「第8章 语言的魔法:大语言模型」第 388 与 389 段 (text/09-ch08.txt:388,搜「上下文学习」;:389,搜「几个例子」)。

  6. 出处:「第8章 语言的魔法:大语言模型」第 402 至 403 段 (text/09-ch08.txt:402,搜「少样本学习」)。

  7. 出处:「第8章 语言的魔法:大语言模型」第 404 至 406 段 (text/09-ch08.txt:404,搜「提示工程师」)。

  8. 补充(不在书内本章):该假说出自动机原文第 5 章——有推测认为上下文学习中 注意力的工作方式与某种学习算法有相似之处,尚无定论。 出处:「第5章 注意力:引爆大模型的引擎」(text/06-ch05.txt,搜「上下文学习」节), 本拆解第 10 章亦曾引用。「诚实的『还没有定论』」表述以原书为据。 2

  9. 出处:「第8章 语言的魔法:大语言模型」第 416 至 417 段 (text/09-ch08.txt:416,搜「思维链的意义」;:417,搜「列算式」)。

  10. 出处:「第8章 语言的魔法:大语言模型」第 420 至 421 段 (text/09-ch08.txt:421,搜「万金油」)。

  11. 出处:「第8章 语言的魔法:大语言模型」第 418 与 419 段 (text/09-ch08.txt:419,搜「事后解释」;:419,搜「大脑做」)。

  12. 出处:「第8章 语言的魔法:大语言模型」第 428 与 429 段 (text/09-ch08.txt:429,搜「隐藏的推理计算」)。

  13. 出处:「第8章 语言的魔法:大语言模型」第 424 与 425 段 (text/09-ch08.txt:423,搜「测试时扩展」;:425,搜「正在回答问题的阶段」)。

  14. 出处:「第8章 语言的魔法:大语言模型」第 433 至 435 段 (text/09-ch08.txt:433,搜「o1-preview」;:435,搜「R1 系列」)。

  15. 出处:「第8章 语言的魔法:大语言模型」第 430 段(text/09-ch08.txt:430,搜「数学竞赛」)。

  16. 出处:「第8章 语言的魔法:大语言模型」第 440 与 441 段 (text/09-ch08.txt:440,搜「分两层」)。

  17. 出处:「第8章 语言的魔法:大语言模型」第 445 段(text/09-ch08.txt:445,搜「草稿纸」)。

  18. 出处:「第8章 语言的魔法:大语言模型」第 463 至 464 段 (text/09-ch08.txt:463,搜「新维度」)。

  19. 出处:「第8章 语言的魔法:大语言模型」第 621 至 625 段 (text/09-ch08.txt:621,搜「最拿手」;:623,搜「惊人的实力」)。

  20. 出处:「第8章 语言的魔法:大语言模型」第 635 与 638 段 (text/09-ch08.txt:634,搜「六类典型局限」;:638,搜「对应改进」)。 2

  21. 出处:「第8章 语言的魔法:大语言模型」第 659 与 663 段 (text/09-ch08.txt:659,搜「两条路」;:663,搜「脚手架」)。

  22. 出处:「第8章 语言的魔法:大语言模型」第 686 至 688 段 (text/09-ch08.txt:686,搜「像真实文本的分布」;:688,搜「诚实地说」)。 2

  23. 出处:「第8章 语言的魔法:大语言模型」第 689 至 692 段 (text/09-ch08.txt:689,搜「纽约律师」;:692,搜「五千美元」)。

  24. 出处:「第8章 语言的魔法:大语言模型」第 693 与 694 段 (text/09-ch08.txt:693,搜「RAG」;:694,搜「开放问题」)。 2

  25. 出处:「第8章 语言的魔法:大语言模型」第 696 与 713 至 714 段 (text/09-ch08.txt:696,搜「厨房漏水」;:713,搜「补证据」;:714,搜「降自信」)。

  26. 出处:「第8章 语言的魔法:大语言模型」第 677 至 683 段 (text/09-ch08.txt:677,搜「738 乘以 294」;:679,搜「机械操作问题」;:682,搜「调用计算器」)。 27 × 38 的习题对照出自第 956 至 957 段(text/09-ch08.txt:956,搜「27 × 38」)。 2

  27. 出处:「第15章 脆弱的巨人:AI 的风险与挑战」第 384 至 390 段 (text/16-ch15-15-ai.txt:384,搜「奉承」;:387,搜「奉承倾向」;:390,搜「让人满意」); 人类评审偏爱满意答案的机理同章第 644 段(text/16-ch15-15-ai.txt:644,搜「奉承行为」)。 2 3

  28. 出处:「第8章 语言的魔法:大语言模型」第 666 与 670 段 (text/09-ch08.txt:667,搜「指数衰减」;:670,搜「压小」)。 2

  29. 出处:「第8章 语言的魔法:大语言模型」第 553 至 565 段 (text/09-ch08.txt:553,搜「核心只有几条」;:563,搜「检查而不是相信」)。 2

  30. 出处:「第8章 语言的魔法:大语言模型」第 603 至 611 段 (text/09-ch08.txt:605,搜「盲信权威」;:611,搜「过度依赖」)。

  31. 出处:「第8章 语言的魔法:大语言模型」第 595 与 598 段 (text/09-ch08.txt:595,搜「多个步骤」;:598,搜「分析报告」)。

  32. 出处:「第8章 语言的魔法:大语言模型」第 568 至 587 段 (text/09-ch08.txt:570,搜「法拉利买菜」;:576,搜「第三步就迷路」;:580,搜「200 页合同」;:585,搜「塞得进去」)。 2

  33. 出处:「第8章 语言的魔法:大语言模型」第 591 至 592 段 (text/09-ch08.txt:591,搜「最难的那一步」)。

  34. 出处:「第8章 语言的魔法:大语言模型」第 383 与 721 至 724 段 (text/09-ch08.txt:383,搜「危险能力评估」;:721,搜「提前做危险能力评估」)。