跳到主要内容

「推理」到底指什么 — 一个不会推理的模型,把逻辑题做对了

这一章讲什么: 这本书的开场是一道小学逻辑题,而一个官方从没说过它会推理的程序把它答对了。 这一章要说清的是它答对不等于它在推理,并且给出这本书对「推理」这个词的定义 —— 不谈哲学,只谈工程:答出最终答案之前,先把中间步骤写出来。 顺带说清它凭什么答对,以及这套办法会在哪两种场合塌掉。

它在全书链条里的位置: 第一环。后面十三章全部在回答同一个问题的两半 —— 怎么让它多花力气在中间步骤上,以及多花的这些力气凭什么值。 不先把「推理」这个词钉死,后面每一次「涨了多少分」都无从谈起。

不需要任何基础,遇到的生词都在当场解释。

先交代一个用词口径,免得后面读岔: 中文里「推理」这两个字很容易被拿来指两件不同的事。 在我们这一组文档里,「推理」只有一个意思:模型在给出最终答案之前,先把中间步骤写出来 —— 就是这一章第 3 节要定义的那件事。至于「让机器算一遍、吐出下一个字」那个动作, 我们一律叫「跑一遍」或「跑一次前向计算」,绝不叫推理

顶层全景:这一章就是一道题走到底

整章只用一道题:「所有鸟都会飞。企鹅是鸟。企鹅会飞吗?」 下面这条链就是这一章的主走查,每一节往前推一步。

① 题面(书里的原文字串)
"All birds can fly. A penguin is a bird. Can a penguin fly?"

├─ ② 只认题面里那两句话 ⟹ 正确输出是 "Yes, a penguin can fly."
└─ ② 允许用常识 ⟹ 正确的不是一个答案,而是一个动作:
发现矛盾,反问澄清,或把第一句削弱成
"Most birds can fly, with exceptions such as penguins"


③ 一个官方从没说过它会推理的程序(GPT-4o),实际给出的是:企鹅不会飞 —— 判为答对
│ 可它既没反问,也没削弱前提。两条正路它一条都没走。

④ 那它走的是哪条路?一个词一个词往下接:手上有 "A penguin cannot",再算下一个词


⑤ 它凭什么接出 "fly"?因为它读过的文字里,"penguins cannot fly" 出现得够多


⑥ 所以它会在哪儿塌?情形是它没读到过的、或者要连着推好几层的时候

图说:这条链从「它答对了」一路走到「它为什么会塌」。
②③ 的字串是书里的原文,④⑤⑥ 是书给出的机制与归因。

1. 先看现象:一个官方说它不会推理的程序,把逻辑题做对了

这本书没有从定义开讲,它从一道题开讲。

先说清楚被考的是什么东西。你给它一段文字,它就一个字一个字地往后续, 续出来的东西读起来像人写的 —— ChatGPT 背后就是这么一个程序。

这一行管这种程序叫大语言模型,英文缩写 LLM:指的就是刚说的这件事,不是别的。 后面这个缩写你出门会天天撞见,所以记住它比记住中文名更有用。

它之所以会写,是因为事先让它读过极大量的文字并反复练习「猜下一个字」—— 这一行把这个过程叫「训练」,和「培训员工」那个训练不是一回事,它指的是 「反复调整机器内部的数,让它猜得越来越准」(具体怎么调,第 02 章讲)。

走查第 ① 步:题面。 书拿来开场的题是这样一道1:

All birds can fly. A penguin is a bird. Can a penguin fly? (所有鸟都会飞。企鹅是鸟。企鹅会飞吗?)

作者把它拿去问 GPT-4o —— 一个 OpenAI 官方从没把它归进「推理模型」那一类的程序 (官方归进那一类的是 o1、o3、o4-mini 和后来的 GPT-5)。

结果它答对了:企鹅不会飞2

这件事为什么值得用一整章来讲? 因为它同时把两个方向的路堵死了:

  • 如果「答对逻辑题」就算会推理,那这个官方说不会推理的程序算什么?
  • 如果它不算会推理,那「会推理」的判据到底是什么?这就是整本书要先回答的问题。

2. 这道题其实有两个正确答案,而它两个都没给

走查第 ② 步:先把两种读法分开。 在判断它答得对不对之前,得先知道这道题的正解是什么。书说:看你允许用什么。

第一种读法,只认题面里给的那两句话。 这两句话在逻辑里叫前提 (就是「我们先假定它成立、不再追究」的那种句子)。

只认这两条前提的话,结论是被逼出来的:所有鸟会飞 + 企鹅是鸟 ⟹ 企鹅会飞。 书把这种「只看题面」的读法叫闭世界读法,并明说在这种读法下, 正确答案就是 Yes, a penguin can fly.3

第二种读法,允许把题面之外的常识也算进来。 这叫开世界读法。 一旦允许用常识,「企鹅不会飞」这条事实就和上面推出来的结论撞上了。

书对这种情况给的要求很具体:一个合格的推理系统应当察觉到这处不一致, 然后做两件事之一 —— 要么反问一句请人澄清,要么把第一条前提削弱成 Most birds can fly, with exceptions such as penguins(大多数鸟会飞,企鹅之类除外)3

现在回到走查:GPT-4o 走的是哪条路?

读法正确的输出GPT-4o 实际做了什么
闭世界(只认题面)Yes, a penguin can fly.没给这个答案
开世界(允许常识)反问澄清,或削弱第一条前提既没反问,也没削弱前提
————直接给出「企鹅不会飞」,被判为答对

它两条正路一条都没走,却拿到了「答对」这个结果。 这就是这一章要解释的那件怪事 —— 而解释它,正好会把「推理」这个词逼出来。

3. 这本书给「推理」下的定义:答题之前,先把中间步骤写出来

作者第一句话就把哲学挡在门外。 他明说:这本书用「推理」这个词是 工程意义上的用法,不是哲学意义上的4

定义只有一句:

推理 = 模型在给出最终答案之前,先生成中间步骤。

就这么朴素。它不判断这台机器像不像人在思考,只判断它把力气花在哪 —— 是直接跳到结论,还是先花一段篇幅把过程写出来。作者把这层意思写得很直白: 要让模型把力气花在中间的解题过程上,而不是一步跳到结论5

中间步骤长什么样,书说两种都算5。第二种要先认一样东西: 插在文字里的一小段记号,本身也是普通字符、不表示任何意思, 只用来划出「从这里到那里是中间步骤」—— 这种成对出现的记号就叫标签

形态长什么样
写出来给人看「先把第一句改写成……再代入……所以……」这样一段可见的分步解释
裹起来藏着夹在 <think></think> 这一对标签之间,界面上不显示给用户

这种「先写一串中间步骤」的写法,在这一行有个通行的名字,叫思维链 (英文 chain-of-thought,常缩写成 CoT)。作者顺带把话说死: 他用「推理」「思考」这类词,是随大流的工程说法,不暗示这台机器真的像人那样在推理或思考6

顺着定义,「推理模型」这个词也就有了着落:被改造成会产出这种中间步骤的模型 —— 改造手段可以是训练,也可以只是换个问法7

走查第 ③ 步:拿这个定义去量 GPT-4o。 按定义,它要算在推理, 就该在给出「企鹅不会飞」之前,先写出一段中间步骤 —— 比如 「前提一说所有鸟会飞;可是企鹅是不会飞的鸟;这两句冲突了……」。 书没有说它写了这样一段。 书给的解释是另一回事,在第 5 节。

这里欠下一笔账: 「先把中间步骤写出来」听着只是多写几行字, 为什么它会让这台机器明显更慢、更贵?答案在第 03 章第 6 节 —— 那里要先讲清它是怎么一个字一个字吐出来的,这笔账才算得清。

4. 它是怎么把这些字写出来的:拿自己刚写下的字,接着往下写

这一节是作者在整章里设的主要防线,而且他设了三道。

第一道:摆一个真的会推理的东西出来做对照。 书举的是符号逻辑引擎 (也叫定理证明器)—— 那是一类按固定规则一步步走的程序,同样的输入必然给出同样的输出。 书用了做菜打比方:照方子一步不差地做,每次都得到同一道菜8。 (比方到此为止,下面一律用正式说法。)

第二道:说清这台机器写字的方式,和上面那种根本不是一回事。

它是拿自己刚写下的字当输入,再算下一小块,如此反复。 这个写法有个名字叫自回归(autoregressive)—— 「自」指的就是「拿自己的输出当输入」。

而每一步「下一块该是什么」,靠的不是规则,是它读过的那些文字里的统计规律 (哪些词经常跟在哪些词后面)。作者由此下了这一章最要紧的一句判词:

它写出来的那些「推理步骤」,没有逻辑上正确的保证,哪怕看起来很有说服力。9

第三道:把人和它摆在一起比。 书专门开了一段说:人的推理可以是所谓确定性的 —— 书自己就地下了定义:从同样的事实出发、走同样的步骤,永远得到同样的结论; 一道题今天算和明天算,结果不会变。

而这台机器不是这样。同一段开头,它这次接出这个词、下次可能接出另一个词, 各有各的可能性大小 —— 这种「有多大可能性」的说法,就叫概率。 书把这个区别写成:人是确定性的,它是概率性的;它一次算一小块,依据是训练文字里的统计规律, 不保证前后逻辑一致10

走查第 ④ 步:GPT-4o 那句「企鹅不会飞」是怎么长出来的。

它手上的字串:"A penguin cannot"
│ 算一遍 → 得到一张「下一个词该是谁」的可能性清单

挑一个接上去 → "A penguin cannot fly"
│ 把加长后的这段字重新当输入,再算一遍

……直到它算出「该停了」

图说:每一步都只是在续写,没有哪一步在「检查前提有没有互相冲突」。
所谓自回归,就是这个「把自己刚写下的字重新喂回去」的循环。

这就是第 2 节那件怪事的第一半答案: 它没有反问、没有削弱前提, 不是因为它选择不那么做,而是因为它的工作方式里根本没有「发现矛盾」这个动作。

5. 那它凭什么答对?模式匹配 —— 以及它会在哪两种场合塌

答案的第二半在这里。先看一个更简单、更露骨的例子。

书给了一个只有一行的对照实验11:

输入:The capital of Germany is…
输出:Berlin.

它答对了德国首都,但它显然没有在推理。 书的判词很干脆: 产出「Berlin」不是逻辑演绎,是回忆起一条很强的统计关联。 书给这种行为起了名字:模式匹配 —— 模型是照着学到的相关性把文字续下去,而不是套用有结构的推理步骤11

现在把这个解释套回企鹅题。 书的归因是:GPT-4o 并没有实现任何「检查矛盾」的机制; 它答对,是因为它读过的文字里,像「penguins cannot fly」这样的句子出现得够多, 于是「企鹅」和「不会飞」这两件事在它内部早就被绑在一起了12

书的原话值得记住:矛盾是被它隐式地识别掉的 —— 因为这一模一样的推理场景,它在训练时见得太多了。12

换句话说:矛盾不是被发现的,是被数据顺手抹平的。

书接着给了失效条件,这是这一节真正值钱的部分。 作者先承认这种大规模的模式匹配 「强得令人印象深刻」,然后指出它通常会在两种场合吃力13:

什么时候塌为什么
逻辑情形是新的训练时没见过这一类的例子,就没有现成的统计关联可以回忆
推理层数太多要连着推好几步、关系互相缠绕时,「照着见过的样子续写」接不住

走查第 ⑤、⑥ 步,整条链到此走完:

⑤ 归因:它读过的文字里 "penguins cannot fly" 够多 ⟹ 接出 "fly" 并否定它
⑥ 边界:换一道它没见过的、或者要连推五六层的题 ⟹ 这套办法不管用

(第 ④ 步的机制在上一节:手上是 "A penguin cannot",算一遍再接一个词。)

这就是后面十三章存在的理由。 既然靠「见得多」有明确的塌方条件, 那就得想办法让它真的多走几步中间过程。具体有哪几条路、各要付什么代价,第 02 章讲。

6. 「推理模型」不是一个开关,是一条连续谱

读到这里最容易产生的误解是:模型分两种,一种会推理,一种不会。书明确说不是。

作者的说法是:推理这件事在模型里是一条连续谱。 在 o1、DeepSeek-R1 这些专门的推理模型出现之前,普通模型就已经会表现出推理的样子了 —— 比如按上面那个定义,生成中间步骤然后得出正确结论。 今天被贴上「推理模型」标签的东西,本质上是这个能力的精修版14

这条判断在后面会兑现成一个具体的现象: 本书用的那个小模型, 明明是最原始的、没有做过任何调教的版本,拿到一道数学题时却自己写出了完整的分步解法。 这不是意外,是它在训练时就被掺进了带分步解法的数据。 (这个现象和它的归因,第 05 章第 2 节会摆出来。)

这条谱的另一端也有人在画。 书引了 OpenAI 的 Sam Altman 在 2025 年 2 月的一段表态, 说 GPT-4.5 将是他们最后一个非思维链模型,之后的目标是把两条产品线并成一个系统, 让它自己知道什么时候该多想一会儿、什么时候不用15

7. 补一个书里没讲的反方:苹果那篇《思考的幻觉》

这一节是我们补的,书里没有。为什么要补,先说清楚。

书花了整整一章论证「这台机器的推理不是逻辑推理」, 并且在书末的参考文献里列了一篇最有力的反方论文,还用一句话概括了它的结论: 推理模型是精巧(但很有能力)的模式匹配器16

但正文从头到尾一个字没提这篇论文。 这是这本书最大的一处「用了却没讲透」, 所以我们把它补进来。

那篇论文是苹果公司几位研究者 2025 年 6 月发表的 《The Illusion of Thinking》(思考的幻觉)。它的做法是把「一道题要连着推多少步」当成一根轴, 一档一档往上加,看推理模型在哪一档开始垮 —— 「要推多少步」这件事,行话就叫复杂度。三条结论17:

发现说的是什么
准确率会整段塌掉复杂度越过某个点之后,这些模型不是慢慢变差,而是完全崩掉
它反而会少想复杂度往上加,它花的力气先跟着涨;过了某个点之后,力气反而往回掉 —— 哪怕还允许它写更多字
三段行为简单题上,普通模型反而赢;中等复杂度上,推理模型占优;高复杂度上,两种一起归零

这三条和这本书讲的是同一件事的两面。 书说的失效条件是「情形新」「层数多」; 那篇论文用受控实验把「层数多」这一条量了出来,并且发现了一个书里没提的现象: 它在最该努力的时候反而放弃了。

判断(我们的,不是书里的): 把这篇论文补进来,不是为了推翻这本书,恰恰是为了坐实它。 作者在正文里反复设的那三道防线(不是符号逻辑引擎 / 没有正确性保证 / 概率性而非确定性), 全部是从机制上推出来的;而这篇论文是从行为上量出来的,两边指向同一个结论。 书把它只放进参考清单而不写进正文,我们认为是遗漏,不是回避。 如果错,会错在: 我们只读了论文的公开摘要页,没有逐节读全文, 也没有核对学界后来对它的反驳(这类论文通常会引出方法学上的争论)。 如果它的实验设计被证明有问题,那么「从行为上量出来」这半边就不成立, 但书自己那三道防线不受影响。

作者的判断与证据

这本书在这一章里做了很多断言。哪些有证据、哪些是他的立场,必须分开。

说法性质
GPT-4o 把企鹅题答对了有证据:书给了截图(图 1.7)
它答对是因为训练数据里纠正矛盾的句子够多作者的推断。书用的措辞是「这种做法在……情况下就够用了」,没有做实验去验证
模式匹配会在「情形新」和「层数多」时吃力作者的判断,书没有在这一章给出实验;第 05 章之后的分数表可以算旁证
它的推理步骤没有逻辑正确性保证从机制推出来的,不是实验结论 —— 依据是「它按统计规律一次算一小块」
推理是一条连续谱作者的立场。他给的支撑是「专门的推理模型出现之前,普通模型就会生成中间步骤」
「反正它答对了」不能当成会推理的证据这是整章的论点,也是全书方法论的起点

还有一处作者的诚实值得单独记: 书说这台机器的推理过程「表面上可能像人的思考」, 但底层机制差别很大,而且仍然是活跃的探索领域18他没有下结论说它到底算不算思考。

边界与局限

这一章没覆盖的、以及读的时候要当心的:

  1. 书没有回答「它到底算不算在思考」。 作者明说这是开放问题,本书不试图回答。 读者若想在这个问题上找立场,这本书给不了。
  2. 企鹅题只是一道题。 用一个例子说明「答对不等于在推理」是够的, 但不足以支撑「它一定不会推理」。书自己也没有走到那一步。
  3. GPT-4o 的实际回答,书是用截图给的。 正文只说它「看上去答对了」, 我们无法从清洗后的文字里拿到它逐字的回答 —— 所以走查第 ③ 步我们只写了状态,没编字串。
  4. 这一章一行代码都没有。 它是全书唯一的纯概念章;真正动手要从第 03 章开始。
  5. 最强的反方证据被留在了参考清单里(见第 7 节),这是书自己的缺口。
  6. 书没讲这台机器内部长什么样。 它明说那是作者前一本书的题目,本书当黑盒处理 —— 想补这一层的,见我们书架上的那本拆解19

可带走的

  1. 「答对了」不能当作「它在推理」的证据。 一个官方从没说过会推理的程序, 照样能把一道要发现矛盾的逻辑题答对 —— 靠的是见得多,不是想得清。
  2. 记住这个工程定义:推理 = 答出最终答案之前,先把中间步骤写出来。 它不问像不像人在思考,只问力气花在哪。全书后面所有的分数,量的都是这一件事。
  3. 中间步骤写出来给人看,和裹在标签里藏起来,两种都算。 界面上看不见「思考过程」,不代表它没写。
  4. 这套写法叫思维链 —— 出门在别人的文档、论文和产品说明里会天天撞见这个名字。
  5. 它写字的方式叫自回归:拿自己刚写下的字当输入,再算下一小块。 这一条是后面所有机制的地基:它慢在这里、贵在这里,能被改进也在这里。
  6. 「看着有说服力」和「逻辑上成立」是两件事。 按固定规则走的定理证明器有正确性保证,这台机器没有 —— 这不是它没调好,是机制决定的。
  7. 模式匹配有两个明确的塌方条件:情形是新的、要连推好几层。 判断一个任务该不该交给它,先拿这两条量一量。
  8. 「推理模型」不是开关,是连续谱。 所以「这个模型会不会推理」是个问错了的问题,该问的是「它在这条谱上走到了哪」。
  9. 别把中文的「推理」和「跑一遍模型」混为一谈。 这一行英文里是两个词(reasoning / inference),中文撞了车 —— 我们全书只用前一个意思。

原文地图

主题原书章原文位置
推理的工程定义1 Understanding reasoning modelstext/04-ch01-1-understanding-reasoning-models.txt:89(搜「practical engineering sense」) · :95(搜「jumping directly to the conclusion」)
推理模型的定义同上text/04-ch01-1-understanding-reasoning-models.txt:101(搜「improved, either through training or prompting」)
思维链这个名字同上text/04-ch01-1-understanding-reasoning-models.txt:120(搜「chain-of-thought」)
符号逻辑引擎的对照同上text/04-ch01-1-understanding-reasoning-models.txt:172(搜「symbolic logic engine」) · :178(搜「autoregressively」)
人的确定性 vs 它的概率性同上text/04-ch01-1-understanding-reasoning-models.txt:197(搜「deterministic reasoning」) · :209(搜「remain an active area of exploration」)
模式匹配(德国首都那例)同上text/04-ch01-1-understanding-reasoning-models.txt:449(搜「The capital of Germany」) · :459(搜「Berlin.」) · :467(搜「pattern matching」)
企鹅题与两种读法同上text/04-ch01-1-understanding-reasoning-models.txt:491(搜「All birds can fly」) · :502(搜「closed-world」) · :508(搜「open-world」)
GPT-4o 答对了同上text/04-ch01-1-understanding-reasoning-models.txt:579(搜「appears to answer correctly」)
归因:统计关联抹平了矛盾同上text/04-ch01-1-understanding-reasoning-models.txt:591(搜「penguins cannot fly」) · :597(搜「recognizes the contradiction implicitly」)
两个失效条件同上text/04-ch01-1-understanding-reasoning-models.txt:609(搜「usually struggle in scenarios」) · :618(搜「Reasoning complexity is high」)
推理是连续谱同上text/04-ch01-1-understanding-reasoning-models.txt:644(搜「exists on a spectrum」)
Altman 的表态同上text/04-ch01-1-understanding-reasoning-models.txt:670(搜「last non-chain-of-thought model」)
苹果那篇反方论文(只在附录)Appendix A. References and further readingtext/79-apx-a-appendix-a-references-and-further-reading.txt:57(搜「sophisticated (but very capable) pattern matchers」) · :63(搜「The Illusion of Thinking」)
架构当黑盒、指向前作1 Understanding reasoning modelstext/04-ch01-1-understanding-reasoning-models.txt:53(搜「Build A Large Language Model」)

Footnotes

  1. 出处:「1 Understanding reasoning models」第 491 段(text/04-ch01-1-understanding-reasoning-models.txt:491,搜「All birds can fly」)。这道题在原书里以提示词的形式给出,是第 1 章 1.5 节的主例。

  2. 出处:「1 Understanding reasoning models」第 579 段(text/04-ch01-1-understanding-reasoning-models.txt:579,搜「appears to answer correctly」)。原文的措辞是「appears to answer correctly」——「看上去答对了」,书用的是这个留了余地的说法,而不是断言它答对了。同一段还列出了 OpenAI 官方归进推理模型那一类的产品:o1、o3、o4-mini、GPT-5。

  3. 出处:「1 Understanding reasoning models」第 502 段(text/04-ch01-1-understanding-reasoning-models.txt:502,搜「closed-world」)与第 508 段(text/04-ch01-1-understanding-reasoning-models.txt:508,搜「open-world」)。「削弱前提」那句原文给的例子是「Most birds can fly, with exceptions such as penguins」。 2

  4. 出处:「1 Understanding reasoning models」第 89 段(text/04-ch01-1-understanding-reasoning-models.txt:89,搜「practical engineering sense」)。

  5. 出处:「1 Understanding reasoning models」第 95 段(text/04-ch01-1-understanding-reasoning-models.txt:95,搜「jumping directly to the conclusion」)。原文明确说这两种形态「核心想法是一样的」。<think> 这一对标签后面还会再出现:第 13 章会讲到,有人拿「有没有守住这对标签」直接当奖励来训模型,结果被模型钻了空子。 2

  6. 出处:「1 Understanding reasoning models」第 120 段(text/04-ch01-1-understanding-reasoning-models.txt:120,搜「chain-of-thought」)。这是书里一个边栏,专门用来给「thinking」这个说法划界。

  7. 出处:「1 Understanding reasoning models」第 101 段(text/04-ch01-1-understanding-reasoning-models.txt:101,搜「improved, either through training or prompting」)。原文还说这种改造「往往能提高复杂任务上的准确率,比如写代码、逻辑谜题和数学题」。

  8. 出处:「1 Understanding reasoning models」第 172 段(text/04-ch01-1-understanding-reasoning-models.txt:172,搜「symbolic logic engine」)。做菜那个比方是书里的,不是我们加的;按我们的行文规矩,比方用完即拆,后文一律用正式说法。

  9. 出处:「1 Understanding reasoning models」第 178 段(text/04-ch01-1-understanding-reasoning-models.txt:178,搜「autoregressively」)。原文的完整说法是:它「不保证逻辑上成立,哪怕看起来很有说服力」。

  10. 出处:「1 Understanding reasoning models」第 197 段(text/04-ch01-1-understanding-reasoning-models.txt:197,搜「deterministic reasoning」)。这是书里题为「LLM versus human reasoning」的边栏,「确定性」那句定义是书自己就地给的。

  11. 出处:「1 Understanding reasoning models」第 449 段(text/04-ch01-1-understanding-reasoning-models.txt:449,搜「The capital of Germany」)、第 459 段(text/04-ch01-1-understanding-reasoning-models.txt:459,搜「Berlin.」)与第 467 段(text/04-ch01-1-understanding-reasoning-models.txt:467,搜「pattern matching」)。这句 The capital of Germany is 后面会成为第 07 章和第 09 章的走查输入,书在那两处用它量了很多具体的数。 2

  12. 出处:「1 Understanding reasoning models」第 591 段(text/04-ch01-1-understanding-reasoning-models.txt:591,搜「penguins cannot fly」)与第 597 段(text/04-ch01-1-understanding-reasoning-models.txt:597,搜「recognizes the contradiction implicitly」)。原文说得很清楚:GPT-4o「不实现显式的矛盾检查」。 2

  13. 出处:「1 Understanding reasoning models」第 609 段(text/04-ch01-1-understanding-reasoning-models.txt:609,搜「usually struggle in scenarios」)与第 618 段(text/04-ch01-1-understanding-reasoning-models.txt:618,搜「Reasoning complexity is high」)。书列的第一条是「逻辑情形是新的」,第二条是「推理复杂度高、涉及多步交织的逻辑关系」。

  14. 出处:「1 Understanding reasoning models」第 644 段(text/04-ch01-1-understanding-reasoning-models.txt:644,搜「exists on a spectrum」)。同一段还点了这些能力是靠两类手段拿到的,正好对应本书后面的章节安排。

  15. 出处:「1 Understanding reasoning models」第 670 段(text/04-ch01-1-understanding-reasoning-models.txt:670,搜「last non-chain-of-thought model」)。书把这段表态整段引了出来。它的原始出处(Altman 本人的一条帖子)书写在附录里,见「Appendix A. References and further reading」第 52 段(text/79-apx-a-appendix-a-references-and-further-reading.txt:52,搜「sama/status」)——那个地址我们没有另行打开核对,这里只转述书的引文。

  16. 出处:「Appendix A. References and further reading」第 57 段(text/79-apx-a-appendix-a-references-and-further-reading.txt:57,搜「sophisticated (but very capable) pattern matchers」)与第 63 段(text/79-apx-a-appendix-a-references-and-further-reading.txt:63,搜「The Illusion of Thinking」)。这两段属于附录 A 里「第 1 章参考文献」那一节,而第 1 章正文没有提到它。

  17. 补充(不在书里):论文全名《The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity》,作者 Parshin Shojaee、Iman Mirzadeh、Keivan Alizadeh、Maxwell Horton、Samy Bengio、Mehrdad Farajtabar,2025 年 6 月发表。来源:苹果机器学习研究页 https://machinelearning.apple.com/research/illusion-of-thinking(查阅于 2026-08-29)。表格里三条结论对应页面上的原话:「complete accuracy collapse beyond certain complexities」「reasoning effort increases with problem complexity up to a point, then declines despite having an adequate token budget」,以及三段行为的划分。

  18. 出处:「1 Understanding reasoning models」第 209 段(text/04-ch01-1-understanding-reasoning-models.txt:209,搜「remain an active area of exploration」)。

  19. 补充(不在书里,依据我们的 book 书架):这本书明说模型内部结构不在范围内,是作者前一本书的题目(出处:「1 Understanding reasoning models」第 53 段,text/04-ch01-1-understanding-reasoning-models.txt:53,搜「Build A Large Language Model」)。那本书我们已有完整拆解。依据: shelf=ai-book-reference/build-large-language-model#03-attention-core.md 事实=该章从零讲清了注意力机制怎么把一句话里每个位置的信息按相关程度混合起来。