跳到主要内容

提示词的五级阶梯 — 每一级都是被上一级的失败逼出来的

这一章讲三件事: 一段提示词该有哪几个部件(其中最要紧的那个最容易被漏掉); 五级技法各解决上一级的什么失败;以及为什么今天这套阶梯有一半已经不必手动做了。

它在全书链条里的位置: 这是「让它说得准」这一层的第一级、也是最便宜的一级。 第 01 章那条阶梯说「先把话说清楚」,这一章就是把「说清楚」拆开来看。 读完你会知道它的天花板在哪——而那个天花板正是第 05 章存在的理由。

1. 顶层全景:一道小学题,把整条阶梯逼了出来

这一章的主走查从头到尾只有一道题:

「下面这组数里的奇数相加,和是不是偶数?15, 32, 5, 13, 82, 7, 1」

正确答案:奇数是 15、5、13、7、1,加起来 41,是奇数 → 所以答「否」。1

① 只给指令 → 它答「是」 ✗ 错
│ 加例子试试

② 给两个做好的示范 → 它还是答「是」 ✗ 错(书里的真实结果)
│ 例子里少了什么?——少了「怎么算的」

③ 示范里写出中间步骤 → 它照着算出 41,答「否」 ✓ 对
│ 可这些步骤得一条条手写,规模化不了

④ 让另一个模型自动生成步骤 → 能规模化了,但生成的步骤自己也可能是编的
│ 那怎么知道这一次答得可不可信?

⑤ 同一题问几遍,交叉比对 → 几次一致就更可信,分歧大就是警报
│ 可有些问题本来就不止一个合理答案

⑥ 铺开几条不同的思路,各评估一遍再择优

图说:每一级都是被上一级的一个**具体失败**逼出来的,不是按难度排的清单。

2. 一段提示词有五个部件,最要紧的那个最容易漏

这一节先给骨架。后面五级技法,动的都是这五个部件里的某一个。

书给的五件2:

部件是什么书给的例子
1. 清楚的指令说明要干什么、要什么格式,用祈使句,别留模糊「总结下面这段话的要点,只讲事实,不讲观点
2. 相关的背景把关键术语、定义、参照信息给它,让它有个可靠的坐标系——
3. 聚焦的输入输入数据要结构化,把最相关的部分突出出来,砍掉会把它带偏的细节——
4. 你要的输出格式长度、样式、结构说死;给个模板或样例最好「生成一份要点式摘要,限 5 条关键事实,每条一句话
5. 显式的质量标准明确要求:事实准确、逻辑自洽、不臆测、不脱离所给材料——

第 5 条是这张表里最容易被漏掉的,也是唯一一条直接对着幻觉去的。

前四条管的是「它答得对不对路」;第 5 条管的是「它在没把握的时候该怎么办」。 你不写这一条,它的默认行为就是第 02 章那个:照着「像样」往下写

一句可以直接抄走的话:「只依据我给你的材料回答;材料里没有的,直接说『材料里没有』,不要推测。」 这一句是这整章里性价比最高的一条,它不需要任何技法,只需要你写下来。

3. 第 ① 级:只给指令(零样本)

这一节讲最常见的用法,以及它的两个天花板。

只给一句指令、不给任何示范,这种用法叫零样本(「样本」在这里就是「做好的例子」的意思, 零样本就是一个例子都不给)3

它能干不少活: 判断一段评论是好评还是差评(这类活叫情感分类)、 改写一段话、归纳要点——这些任务的规矩已经在它读过的海量文字里了,不用你教。

但它有两个天花板,而且性质完全不同:

天花板具体是什么这本书怎么处理
它不知道你家的事它不知道你公司的退货政策、你的库存、你的合同条款这一条提示词永远救不了——它是第 05 章要解决的问题
多步逻辑不稳需要「先算这个、再算那个」的任务,它会跳步这一章后面四级都在治它

走查第 ① 步:只给指令

提示词: 下面这组数里的奇数相加,和是不是偶数?15, 32, 5, 13, 82, 7, 1
它的回答: 是
正确答案: 否(15+5+13+7+1 = 41,奇数)

图说:它没有算,它是「看着像」。**第 02 章那张候选表在这里原样起作用:
「是/否」这两个词,在这个位置上都很像样。**

4. 第 ② 级:在提示词里塞几个例子

这一节讲一件很反直觉的事:它没有被重新训练,凭什么看两个例子就学会了。

先看现象:它真的能从两个例子里学会一个新词

书里的演示很干净4:

你在提示词里写:
「fribble」是一种毛茸茸的可爱生物。用 fribble 造个句:
The fribble scurried up the tree to find nuts.
「blicket」的意思是用滑稽的姿势走路。用 blicket 造个句:

它接着写出:
Sarah blicketed down the sidewalk in her new shoes.

图说:fribble 和 blicket 都是编出来的词,训练材料里根本没有。
**它学到的不是这两个词,是「定义 → 例句」这个模式。**

在提示词里给几个做好的例子,这种用法叫少样本(给一个例子的叫一样本)。 书给的实操是:给 2–3 组「输入 → 输出」的例子5

为什么它没被重新训练也能学会

关键在第 02 章那句话:它每一步做的是「照目前这段文字,下一个该接什么」。

你写进提示词的例子,对它来说就是「目前这段文字」的一部分。 它看到「定义 → 例句」出现了两次,于是「第三次也该是例句」就成了这个位置上最像的延续。

所以少样本不是学习,是把模式摆在它眼前让它接着往下续。 这也解释了它的边界:能教会格式和风格,教不会「怎么算」。

走查第 ② 步:给两个示范,它还是答错

书里的原例6:

示范 1: 这组数里的奇数相加是偶数:4, 8, 9, 15, 12, 2, 1。 否
示范 2: 这组数里的奇数相加是偶数:16, 11, 14, 4, 8, 13, 24。 是
要它答: 这组数里的奇数相加是偶数:15, 32, 5, 13, 82, 7, 1。 ?

它的回答: 是 ✗ 仍然错

图说:示范里只有题目和答案,**没有一个字讲「怎么算出来的」**。
它照样只能「看着像」——两个示范里一个「否」一个「是」,它照猜。

这就是逼出下一级的那个具体失败:例子给了,格式对了,逻辑还是跳步。

5. 第 ③ 级:把中间步骤写进示范里(思维链)

这一节是全章最重要的一节,也是全书最好用的一个技法。

走查第 ③ 步:把「怎么算的」写进示范,它就算对了

改动小得出奇:只在示范的答案里,把「怎么算的」写出来一句。

示范: 这组数里的奇数相加是偶数:9, 15, 1
答:把奇数相加,9 + 15 + 1 = 25。所以答案是「否」。

要它答:这组数里的奇数相加是偶数:15, 32, 5, 13, 82, 7, 1

它的回答: 把奇数相加,15 + 5 + 13 + 7 + 1 = 41。所以答案是「否」。 ✓ 对

图说:题没变、模型没变、示范只多了一句「怎么算的」。
**这两段是书里的真实输出。**

在示范里写出中间推理步骤,这套做法叫思维链(第 03 章提过它一次,这里是它的正式登场)7

为什么它有效

回到第 02 章那个动作:它一次只能写一个词元,而且写出来就不能回头改。

「一步跨到答案」意味着:在写出「否」这个字之前, 41 这个中间结果必须凭空在某处被算出来——可它没有那个「某处」。

思维链把这个「某处」造了出来:它把中间结果写成正文。

没有思维链: 题目 ──────────────────────► 答案
(中间那一大步没有落脚点)

有思维链: 题目 → 「15 + 5 + 13 + 7 + 1」 → 「= 41」 → 「41 是奇数」 → 答案
每一步都写在纸上,下一步只需要读它

图说:**它写出来的字,就是它唯一的草稿纸。**
思维链做的事,是允许它打草稿。

书自己给的直觉是另一个说法:把难题拆成它跟得上的小步,就像人学难的技能也是先掌握基本步骤8两种说法指的是同一件事。

还有一个更省事的变体:一句话

连示范都不用给。 书引的一项研究发现: 只要在提示词末尾加一句「让我们一步一步想」,就有效9

这条值得单独记住,因为它的成本是零。

6. 第 ④ 级:让机器自己生成那些步骤

这一节讲上一级的失败:思维链好用,但它得手写。

每一类问题都要人手写一遍推理链——问题种类一多就写不过来。 于是有了「自动生成推理链」这条路:用一个模型先把中间步骤生成出来,再塞回主提示词10

走查第 ④ 步:那四步骨架不是人写的

书给的例子是一个法律助理:用户问「我举报安全违规之后被开除了,我能怎么办」, 系统先自动生成四步骨架——识别争点 → 检索相关法律 → 推理可能的诉由 → 给出可执行建议—— 再让主模型照着这四步答。

作者自己加的警告,必须留

生成出来的推理链必须大量验证,确认它逻辑上站得住, 否则它自己就会引入新的幻觉。11

这句话的分量在于:你现在有两条链会出错,不是一条。 主模型可能编,生成步骤的那个模型也可能编——而后者编出来的错,会被主模型当成正确的骨架照着走。

判断(我们的,不是书里的): 这是这本书里第一次出现「拿模型去修模型」这个模式, 而它在后面还会出现三次:让模型当评审(第 09、17 章)、让模型判读用户意图(第 16 章)、 让模型在训练时批评另一个模型(第 20 章)。 每一次,新引入的那个模型都自带同一个毛病。 这本书难得的诚实之处,就是每一次都当场把这句警告写上。 如果错,会错在: 如果某一天有一类专门做核验的模型,其出错率低到可以忽略, 这个「拿模型修模型」的循环就不再是隐患,而只是一层普通的流水线。 判据是:那个核验模型自己的错误率,有没有被独立地量过。

7. 第 ⑤ 级:同一题问几遍,交叉比对

这一节回答:上面那些都做了,怎么知道这一次答得可不可信。

做法

同一个输入,采样出好几个回答(换随机种子,或者换换提示词的说法), 然后交叉比对:几次说的一致,就更可信;分歧很大,就是幻觉的警报12

这套做法叫自洽(第 03 章提到过这个名字,这里是它的正式登场)。

书给的例子非常干净

问「推荐几道素食意面」,采样四次:

回答 1: 菠菜蘑菇千层面 …
回答 2: 蘑菇菠菜意面 …
回答 3: 烤蔬菜意面 …
回答 4: **「一道很受欢迎的素食意面是『鸡肉蘑菇千层面』」** ← 自称素食,里面有鸡

图说:光看第 4 条,它通顺、自信、格式正确,你抓不住它。
**可四条一起看,前三条的共同点是「素食」,第 4 条自己打自己——它就露出来了。**

这就是自洽的全部价值:它不需要外部真值,只靠「自己和自己对不上」就能抓到一部分幻觉13

走查第 ⑤ 步:拿自洽跑那道奇数题

第 1 次: 15 + 5 + 13 + 7 + 1 = 41 → 否
第 2 次: 15 + 5 + 13 + 7 + 1 = 41 → 否
第 3 次: 15 + 5 + 13 + 7 = 40 → 是 ← 漏了一个 1
────────────────────────────────────────
三次里两次说「否」→ 按多数取「否」 ✓ 对

图说:**这三次结果是为演示编的**;但「多数表决」这个做法就是第 03 章末尾
那条「跑多次取出现次数最多的」的正式形态。

「跑几次、哪个答案出现得最多就取哪个」这个动作叫多数表决,它是自洽最常见的落地形态。

注意它的代价:一次回答变成三次,钱和时间都乘以三。 (这个代价在第 17 章会被重新算一遍,那里它变成一种评测手段。)

8. 第 ⑥ 级:铺开几条思路,各评估一遍再择优

这一节讲最后一级,以及它适用的那类问题。

自洽解决的是「同一条路走几遍」;有些问题的麻烦在于「路本来就不止一条」。

走查第 ⑥ 步:一台坏电视,三条路一起铺开

书给的例子:顾客说「我上个月买的电视坏了」。这没有唯一正确答案,有三条都合理的路14:

分支 1: 走 30 天退货 ──→ 评估:已经超过 30 天了 ✗
分支 2: 走保修索赔 ──→ 评估:在保修期内,可行 ✓
分支 3: 走例外流程 ──→ 评估:要主管审批,慢 △


按这位顾客的具体情况选分支 2

图说:三条路各走一步、各评一句,再挑一条。
**这三条路是内部铺的,不给用户看**——用户只会看到最后那一条建议。

这套「铺开多条思路、逐条评估、再择优」的做法叫思维树。

书给的效果数字: 在一个叫「24 点」的数学游戏上, 同一个模型配思维链只解出 4% 的题,换成思维树到了 74%15

这个数有参照物:4% 到 74% 是十八倍多,而且模型完全没变,变的只是问它的方式。 这也是这一章最有力的一条证据:同一台机器,换个问法,能力天差地别。

9. 时代注脚:这条阶梯今天有一半不必手动做了

这一节是这本书最新、也最该带走的一条更新。

第 03 章说过,有一类模型答之前会先额外花一大段计算「想」一遍(推理模型)。 对这类模型,显式的思维链指令通常没有必要——因为它们内部已经在做这件事了16

你用的是思维链还要不要手动加
普通模型要。 书说在多步推理任务上通常有显著提升
推理模型通常不必。 它自己就在推
不确定书给的话是:永远在你自己的目标模型上实测一遍

判断(我们的,不是书里的): 这条注脚的意义超出思维链本身。 它说明这一行的「技法」有一个共同的命运:一旦某个技法足够有效, 它就会被做进模型里,然后从「你要做的事」变成「你不必再做的事」。 思维链是第一个走完这条路的。 所以读这一章的正确姿势不是背下五级技法,是记住每一级解决的是什么失败 ——失败不会消失,解法会换地方。 如果错,会错在: 如果推理模型内部那套推理和显式思维链其实不是同一件事 (比如它内部推的和你想让它推的方向不同),那显式指令仍然有独立价值。 判据就是书给的那句:在你自己的目标模型上实测。

10. 作者的判断与证据

书里给了证据的:

说法证据是什么
少样本能教会新词新格式一次真实运行(fribble / blicket)
少样本在多步逻辑上会塌一次真实运行(奇数题答错)
思维链能修好这道题一次真实运行(同一题,答对)
「一步一步想」这一句零样本就有效引了 2022 年的一篇论文
思维树把 24 点从 4% 推到 74%引了 2023 年的一篇论文

六篇论文的编号书都给全了,分别对应少样本、思维链、零样本思维链、自洽、自动思维链、思维树17我们没有逐篇打开核对,这一点如实写在这里。

作者的推测或经验:

说法它是什么
「给 2–3 组例子」经验值。 没有给出这个数是怎么定的
五个部件的划分一种组织方式。 好用,但不是某个标准
「生成出来的推理链必须大量验证」一句警告,没有给出任何数字。 多少算「大量」、怎么验,书没说
自洽能筛掉幻觉一个例子 + 一条道理,没有比例数据

11. 边界与局限

  • 五级技法一个都治不了「它不知道你家的事」。 这是这一章的硬天花板, 也是第 05 章存在的理由——书自己在这一章末尾就说了:提示词到这儿为止, 因为模型没有训练材料之外的知识18;
  • 没有讲这些技法怎么组合。 思维链 + 自洽能不能一起用?能,而且论文里就是这么做的, 但书没有把它们摆在一起对照过;
  • 成本一个字没提。 自洽把成本乘三、思维树乘更多,书在这一章完全没算这笔账 (要到第 18 章才有性能与成本那一节);
  • 示范里的例子该怎么挑,书没讲。 挑得不好的例子会把模型带偏,这是实践里很常见的坑;
  • 对推理模型那条注脚只有一段。 「内部已经在推理」到底是怎么回事,书不解释—— 它默认你知道

12. 可带走的

全章那条走查,一行写完: 「15, 32, 5, 13, 82, 7, 1 里的奇数相加是不是偶数?」→ 只给指令:答「是」,错 → 给两个示范:还是答「是」,错 → 示范里加一句「9+15+1=25」: 它算出 41,答「否」,对 → 同一题跑三次(两次「否」一次「是」,这三次是为演示编的), 多数表决取「否」 → 换成「电视坏了怎么办」这类多解问题,铺开三条路各评估再选。

  1. 提示词有五个部件,最容易漏的是「显式的质量标准」——它是唯一直接对着幻觉的那一条;
  2. 一句可以直接抄的话:「只依据我给你的材料回答,材料里没有的就说没有,不要推测。」
  3. 零样本的两个天花板性质不同: 「不知道你家的事」提示词永远救不了,「多步逻辑不稳」能救;
  4. 少样本不是学习,是把模式摆在它眼前让它接着续——能教格式和风格,教不会怎么算;
  5. 思维链的本质是给它一张草稿纸: 它写出来的字就是它唯一的中间存储;
  6. 最省事的变体是一句「让我们一步一步想」,成本为零;
  7. 自动生成推理链能规模化,但你从此有两条链会出错——生成步骤的那个模型也会编;
  8. 自洽:同一题问几遍,自己和自己对不上就是警报。 代价是成本乘以次数;
  9. 思维树:铺开几条路各评估再择优,内部用,不给用户看; 24 点从 4% 到 74%;
  10. 对推理模型,显式思维链通常不必要——技法一旦足够有效,就会被做进模型里;
  11. 这五级一个都治不了「它不知道你家的政策」。第 05 章从这儿接手。

13. 原文地图

主题原书章原文位置
提示词五部件Chapter 2: Prompt Engineeringtext/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:604(搜「Clear Instructions」) · text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:623(搜「Explicit Quality Criteria」)
零样本的定义与边界Chapter 2: Prompt Engineeringtext/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:749(搜「Zero-shot prompting involves」) · text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:777(搜「some context on likely customer queries」)
少样本与 fribble / blicketChapter 2: Prompt Engineeringtext/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:790(搜「Few-shot prompting allows」) · text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:801(搜「fribble」) · text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:813(搜「learned the pattern from the single」)
奇数题:少样本答错Chapter 2: Prompt Engineeringtext/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:851(搜「15, 32, 5, 13, 82, 7, 1」) · text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:858(搜「The correct answer should be False」)
思维链与那道题被修好Chapter 2: Prompt Engineeringtext/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:872(搜「Chain-of-thought」) · text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:896(搜「9 + 15 + 1 gives 25」) · text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:907(搜「gives 41」)
拆成小步这个直觉Chapter 2: Prompt Engineeringtext/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:911(搜「break down tricky reasoning tasks」)
零样本变体「一步一步想」Chapter 2: Prompt Engineeringtext/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:915(搜「Let's think step-by-step」)
自动思维链与它的警告Chapter 2: Prompt Engineeringtext/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:998(搜「Automatic chain of thought」) · text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:1033(搜「extensively」)
自洽与素食意面Chapter 2: Prompt Engineeringtext/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:1039(搜「Self-consistency techniques」) · text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:1064(搜「Chicken and」) · text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:1070(搜「filter out」)
思维树与 24 点Chapter 2: Prompt Engineeringtext/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:1094(搜「tree-of-thought」) · text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:1170(搜「Game of 24」)
推理模型的注脚Chapter 2: Prompt Engineeringtext/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:991(搜「explicit chain-of-thought instructions are often unnecessary」)
提示词的天花板Chapter 2: Prompt Engineeringtext/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:1178(搜「knowledge beyond」)
六篇论文的编号Chapter 2: Prompt Engineeringtext/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:1429(搜「Tree of Thoughts」) · text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:1433(搜「Chain-of-Thought Prompting Elicits」) · text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:1444(搜「Language Models are Few-Shot」)

Footnotes

  1. 出处:「Chapter 2: Prompt Engineering」第 851 段(text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:851,搜「15, 32, 5, 13, 82, 7, 1」)与第 858 段(同文件 :858,搜「The correct answer should be False」)。这道题在书里是英文的判断题(答 True / False),我们译成「是 / 否」,算式一字未改。

  2. 出处:「Chapter 2: Prompt Engineering」第 604 段(text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:604,搜「Clear Instructions」)起连续五条,第五条在第 623 段(同文件 :623,搜「Explicit Quality Criteria」)。第 5 条原文的措辞是「优先保证事实准确、逻辑连贯,避免臆测和无据主张」。

  3. 出处:「Chapter 2: Prompt Engineering」第 749 段(text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:749,搜「Zero-shot prompting involves」)。「不知道你公司的退货政策」这个边界在第 777 段(同文件 :777,搜「some context on likely customer queries」)。

  4. 出处:「Chapter 2: Prompt Engineering」第 801 段(text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:801,搜「fribble」)、第 811 段(同文件 :811,搜「Sarah blicketed」)与第 813 段(同文件 :813,搜「learned the pattern from the single」)。这个演示来自书引的 2020 年那篇少样本论文(书的参考文献 [10],标题是「Language Models are Few-Shot Learners」,编号 arXiv:2005.14165)。

  5. 出处:「Chapter 2: Prompt Engineering」第 790 段(text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:790,搜「Few-shot prompting allows」)。

  6. 出处:「Chapter 2: Prompt Engineering」第 847 段(text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:847,搜「4, 8, 9, 15, 12, 2, 1」)、第 849 段(同文件 :849,搜「16, 11, 14, 4, 8, 13, 24」)与第 856 段(同文件 :856,搜「True」)。书在第 860 段(同文件 :860,搜「struggles to reliably perform」)给的评语是:给了几个例子,它在多步逻辑上仍然靠不住。

  7. 出处:「Chapter 2: Prompt Engineering」第 872 段(text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:872,搜「Chain-of-thought」)、第 896 段(同文件 :896,搜「9 + 15 + 1 gives 25」)与第 907 段(同文件 :907,搜「gives 41」)。书引的原论文是 2022 年的「Chain-of-Thought Prompting Elicits Reasoning in Large Language Models」(书的参考文献 [6],编号 arXiv:2201.11903)。

  8. 出处:「Chapter 2: Prompt Engineering」第 911 段(text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:911,搜「break down tricky reasoning tasks」)。「它写出来的字就是它唯一的草稿纸」这个说法是我们的,书没有这么讲——书只说了「拆成小步」。

  9. 出处:「Chapter 2: Prompt Engineering」第 914 段(text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:914,搜「Kojima」)与第 915 段(同文件 :915,搜「Let's think step-by-step」)。书引的论文是 2022 年的「Large Language Models are Zero-Shot Reasoners」(参考文献 [7],编号 arXiv:2205.11916)。

  10. 出处:「Chapter 2: Prompt Engineering」第 998 段(text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:998,搜「Automatic chain of thought」)。书引的论文是 2022 年的「Automatic Chain of Thought Prompting in Large Language Models」(参考文献 [9],编号 arXiv:2210.03493)。

  11. 出处:「Chapter 2: Prompt Engineering」第 1033 段(text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:1033,搜「extensively」)。原文:必须大量验证生成出来的推理链,确保它们逻辑上站得住、不会引入额外的幻觉

  12. 出处:「Chapter 2: Prompt Engineering」第 1039 段(text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:1039,搜「Self-consistency techniques」)与第 1042 段(同文件 :1042,搜「different random seeds」)。书引的论文是 2022 年的「Self-Consistency Improves Chain of Thought Reasoning in Language Models」(参考文献 [8],编号 arXiv:2203.11171)。

  13. 出处:「Chapter 2: Prompt Engineering」第 1064 段(text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:1064,搜「Chicken and」)与第 1071 段(同文件 :1071,搜「filter out」)。

  14. 出处:「Chapter 2: Prompt Engineering」第 1094 段(text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:1094,搜「tree-of-thought」)。三条分支的具体内容见同一节后文;书特别说明这套推理是内部用的,不展示给用户。

  15. 出处:「Chapter 2: Prompt Engineering」第 1170 段(text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:1170,搜「Game of 24」)。书引的原论文是 2023 年的「Tree of Thoughts: Deliberate Problem Solving with Large Language Models」(参考文献 [4],编号 arXiv:2305.10601)。我们没有打开这篇论文核对这两个百分比,如实说明。

  16. 出处:「Chapter 2: Prompt Engineering」第 991 段(text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:991,搜「explicit chain-of-thought instructions are often unnecessary」)。原文最后一句是「Always test on your target model」。

  17. 出处:「Chapter 2: Prompt Engineering」第 1429 段(text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:1429,搜「Tree of Thoughts」)起的参考文献表,共六篇:思维树、思维链、零样本思维链、自洽、自动思维链、少样本。书只给了编号和标题,没有讲清每篇各解决了什么、边界在哪——这是这一章最大的缺口,我们在正文里按书给的信息补了「它解决上一级的什么失败」这一层。

  18. 出处:「Chapter 2: Prompt Engineering」第 1178 段(text/05-ch02-chapter-2-generating-trustworthy-responses-with-.txt:1178,搜「knowledge beyond」)。原文说的是:提示词技法到此为止,因为模型没有训练材料之外的知识——下一章用取回资料的办法接上外部知识源。