跳到主要内容

提示五原则 — 从「能跑」到「可靠」

这一章讲三件事: 一个随手写的提示为什么一上线就出问题; 作者用来修它的五条原则分别修哪里;为什么这五条对「写字的 AI」和「画图的 AI」同样成立。 这是全书的第一章,后面每一章都会回引这五条——它们是这本书的骨架。

1. 先看一个随手写的提示

给一个产品起名。你随手打一句话:

输入:能不能给「一双任何脚都能穿的鞋」起几个产品名?

输出:当然可以!以下是一些产品名:
UniFit SoleStrides
FlexiSize All-Fit Shoes
OmniFit FootFlex
……

第一次看到这个结果,感觉像魔法:几乎没花力气,就拿到一份像模像样的清单1

这一章的主走查就是这个起名任务。 我们会拿着这个随手写的提示,看它放进生产环境会坏在哪五个地方,然后一处一处修。修完,你就拿到了全书反复使用的五条原则。

先解释本章绕不开的词。这本书说的模型(model),指一台「吃进一段文字、算出下一段该接什么」的机器——它内部装着海量事先调好的数,第 02 章会拆开讲。

提示(prompt)就是你递给模型的那段输入——模型拿它当指令,去预测你想要的回应2。而提示工程(prompt engineering)指的是「不断尝试、找到能稳定产出可用结果的提示」这件事的全过程——重点在「稳定」两个字上:演示一次不算数,放进系统里跑一千次还得靠谱3

2. 顶层全景:一个提示,五个窟窿

随手写的提示

├─ 方向含糊 ──── 没说什么样算好名字 ────────→ 原则 1:给方向
├─ 格式漂移 ──── 这次编号列表,下次带开场白 ─→ 原则 2:定格式
├─ 没有例子 ──── 输出是「整个互联网的平均」 ─→ 原则 3:给例子
├─ 无法评测 ──── 好坏只能逐个用眼看 ────────→ 原则 4:评质量
└─ 一把梭 ────── 起名这件事全压在一次调用上 ─→ 原则 5:分工

图说:五个毛病和五条原则是一一对应的——原则是毛病逼出来的,不是拍出来的清单[^4]。

这五条的全名和一句话定义,原书给得很整齐4:

原则一句话定义
给方向(Give Direction)详细描述想要的风格,或指名一个要模仿的角色
定格式(Specify Format)规定输出要遵守的规则和结构
给例子(Provide Examples)放进若干「这个任务做对了」的样例
评质量(Evaluate Quality)找出错误、给回答打分,测试什么在驱动效果
分工(Divide Labor)把任务拆成多步,串起来完成复杂目标

在进入每一条之前,还有一件背景要知道:这本书讲的模型分两大类——一类是大语言模型(Large Language Model, LLM),读文字、写文字的那种,ChatGPT 是代表;另一类是扩散模型(diffusion model),读文字描述、生成图片的那种,Midjourney 和 Stable Diffusion 是代表5。五原则对两类都管用,这正是这本书和同题材其他书不一样的地方。

3. 核心原理:五个窟窿,一个一个补

3.1 为什么「随手写」在演示里够用、上线就不行

随手问一次,模型答得不错——因为今天最强的模型已经足够好,一次就中的可能性本来就高。一次性、用完即弃的对话,随手写就够了6

但如果你要把这个提示放进一个每天被几千用户调用的起名服务,情况就变了。你每跑一次都在付钱:这类服务按文字量计费——精确说,按标记(token)计费:模型不直接读字,先把文字切成小段,每段一个标记,大致相当于四分之三个词;你发去的提示和它回来的回答,都按标记算钱7

而且模型的每次回答都带随机:它往下写时不是在候选里挑定一个,而是按各自的可能性大小带随机地挑,多敢挑冷门的由一个旋钮控制,这个旋钮叫温度(temperature)——温度 0 永远挑可能性最高的,调高则更敢冒险7。这时随手提示的五个窟窿就全部暴露出来了:

  • 方向含糊:你没说想要什么样的名字。一个单词还是几个词拼的?能不能造不存在的词?要不要模仿某个起名高手?
  • 格式漂移:多跑几次你会发现,有时返回编号列表,有时开头还加一句「当然可以!」。下游程序想把这份清单读进代码,随时会崩8
  • 没有例子:它此刻是在拿「整个互联网的平均水准」续写你这句话——网上起名文章长什么样,你的答案就长什么样,包括网上所有的偏见9
  • 无法评测:哪个名字好?你没有一个可重复的判据,只能一个一个用眼睛看。
  • 一把梭:起名要考虑行业、好不好记、商标冲突……你把这些一次性全外包给了一次调用,它怎么权衡的,你看不见。

这五个窟窿与第 2 节那张表的五条原则一一对应。下面逐条拆。

3.2 原则一:给方向——不说要什么,它就猜不中

起名是一件主观的事。你不告诉模型你喜欢哪种名字,它猜中的可能性很低——换个真人来也一样:广告公司接单时要求客户写详细的任务简报,就是这个原因10

书里给的第一个修法是角色扮演:指名一个以起名著称的人,让它模仿。

输入:给「一双任何脚都能穿的鞋」起几个产品名,用乔布斯的风格。
(附带格式约定和三个例子,见原则二、三)

输出:iFitFoot, iPerfectFit, iShoeSize

只把「乔布斯」换成「马斯克」,其他一个字不动,输出立刻变脸:ShoeX, MarsFit, The Shoe Company11。同一条提示,指名的人不同,出来的东西就来自完全不同的命名哲学。

第二个修法更巧:让它自己先生成方向。先问「给产品起名有什么行业专家建议?」,它列出五条(好记、好读、有正面联想……);再在同一对话里说「按这些建议起名」。作者引了一项研究佐证,管这招叫预热(prewarming)——先让模型把相关知识自己捞出来,再让它照做12

第三个修法:把外部权威的判断直接贴进提示。比如把知名品牌咨询文章里的「起名五规则」整段放进去再提问。提示会变长、更贵,但质量提升可能值这个价13

方向的边界也要知道: 方向不是越多越好。模型的训练,即拿海量文字喂给它、让它从中学本领的那个过程,决定了它见过什么:要求太多太细,它读过的文字里可能没有同时满足所有条件的样本,模型会卡在互相矛盾的要求之间。书里的例子:图像提示里同时保留底图、「stock photo」字样、相机型号和「梵高」,梵高的风格就出不来——把其他元素删掉,只留梵高,风格立刻显现。发生冲突时,选最重要的那个,放弃其余14

3.3 原则二:定格式——输出不是给人看的,是给程序解析的

这类模型本质上是万能翻译器:不止法语译英语,也能把自然语言译成 Python 代码,或把一段话译成 JSON——一种程序间交换数据的通用文本格式,长得像 {"名字": ["甲", "乙"]} 这样的键值结构15。既然它几乎能输出任何格式,你就得明确说要哪一种。

看走查的主线推进到这一步。原则一修完后,输出内容是好了,但格式仍然不稳:这次是逗号分隔,下次是编号列表。修法是在提示里把格式钉死:

输入(节选):
……以逗号分隔的列表返回,格式如下:
Product description: A shoe that fits any foot size
Product names: [3 个产品名]

如果下游是程序,更进一步:直接要求返回 JSON,并且故意不让它写完——你给半个 JSON 骨架,让它接着补完。这样做有个隐藏福利:JSON 写错一个字(少个引号、多个逗号)就解析失败,而解析失败本身就是一个信号——程序捕获到这个错误,就知道该重试或报警,格式校验变成了免费的质量探针16

图像侧同样有「格式」这回事,而且更重要:图像可修改的方面近乎无限——构图、材质、风格、画幅,每一项都能拧。同一个「商务会议」,说「stock photo」(图库照片)是一种图,说「in Minecraft」(在游戏《我的世界》里)是完全另一种图17

作者特别区分了原则一和原则二的重叠处:格式管「输出的类型」(JSON 还是清单、照片还是油画),方向管「风格」(乔布斯式命名、梵高式笔触)。两者打架时,丢掉对最终结果较不重要的那个18

3.4 原则三:给例子——例子就是方向盘

回到走查。现在提示有了方向、有了格式,但模型对「好名字」的理解仍然是互联网的平均值。补上例子的效果立竿见影:

输入(节选):
## 例子
Product description: 会出啤酒的冰箱
Product names: iBarFridge, iFridgeBeer, iDrinkBeerFridge

Product description: 在太空也能准时的手表
Product names: iNaut, iSpace, iTime
……

研究界给这条路数起了名字,按例子的个数分级:不给例子叫零样本(zero-shot),给一个、给几个分别叫一样本、少样本(few-shot)。出名的 GPT-3 论文干脆就叫《语言模型是少样本学习者》,书里引了其中一组结果:某些任务上,只加一个例子,正确率从约 10% 跳到接近 50%19

但例子是双刃剑,而且刃口很锋利。 书里做了个对照实验:把提示里的例子全部换成带动物的名字(Fast Panda、Healthy Bear、Compact Koala……),任务本身一个字没变,输出就只剩下带动物的名字:FlexiFox、ChameleonStep、PandaPaws20。例子不只是「教它格式」,而是在它脑子里圈出一块允许活动的区域——例子的多样性决定了输出的多样性

作者给的使用口径是:一到三个例子几乎总是划算的;三到五个以上,可靠性继续升,但创造力开始被锁死,还可能漏掉不符合例子的好答案。所以例子数量和例子之间的差异度,都要试验着调21。另外有一条值得记住的研究结论:有证据表明,把方向说清楚可能比堆例子更有效,而且好例子收集起来并不便宜——所以先试原则一,再动原则三22

图像侧,「给例子」有对应物:直接传一张底图进去。保持提示文字不变、只换底图,生成结果被整张拽向新底图的风格——开源(源代码公开、人人可改可用)的 Stable Diffusion 社区管这招叫 img2img,图生图23

3.5 原则四:评质量——盲提示不是评测

到这里,提示已经像样了。但有个问题一直没回答:你怎么知道改动让结果变好了?

作者把「改一句、跑一遍、看一眼」的做法叫盲提示(blind prompting)——没有反馈环,往好里调就等于蒙眼飞行24。这一节只立概念,书里搭的最小反馈环长这样:

  1. 同一任务写两个提示变体(A 不带例子,B 带两个例子);
  2. 每个变体各跑 5 次,把 10 份回答存进表格;
  3. 打乱顺序、遮住来源,你对着一份份回答只按「赞 / 踩」;
  4. 统计:变体 A 得分 0.2,变体 B 得分 0.625

两轮下来,「带例子值不值多花的字数」就有了数据答案,而不是感觉。作者的经验是:一个提示跑不到 10 次,通常就会暴露一个你上线后才会撞见的偏差26

评测可以走得更远:用程序自动评(比如答案里有没有冒出提示里没给过的新名词——那是幻觉——模型一本正经地编造不存在的东西——的信号),用更强的模型评更弱的模型,甚至两两对比打分。这些展开在第 07 章。图像侧的对应做法是把提示里想试的选项写成 {选项1, 选项2} 的排列组合,一次生成全部搭配,摊在网格里对比——书里用「3 种格式 × 2 种人数」演示,6 条提示各出一张图27

3.6 原则五:分工——一次调用干不完的事,拆成多次

最后一个窟窿:起名这件事本身是一串子任务——想名字、筛名字、描述产品、配图。书里先演示了最小的一次拆分:让它给自己的输出打分

输入:给这份产品名清单逐个打分(10 分制),分数跟在名字后面:
UniFit SoleStrides
FlexiSize All-Fit Shoes
……

输出:UniFit SoleStrides: 7/10
FlexiSize All-Fit Shoes: 8/10
……

多跑几次,它稳定地把 OneSize Glovewalkers 评为最差,追问后给理由:手套的概念放进鞋的语境会误导28

这里藏着一个值得停下来的机制问题:它既然知道这是烂名字,一开始为什么还写出来? 作者的回答是:模型生成时是逐段往下接的,写的时候不知道整篇最终长什么样;而拿到一段完整的输出之后,判断「这段像不像好答案」反而容易29生成和评判是两种难度不同的活——这就是「让它自评」之所以有效的根源。

拆分还能发生在同一次调用内部。在评分提示前面加一句「让我们一步步想」(Let's think step by step),让它先把理由写出来再打分——打出的分会变,而且更贴合评分标准。OpenAI 官方管这叫「给模型思考的时间」;让模型把思考步骤逐条写出来的这类技巧,统称思维链(chain-of-thought)30

再往下拆,就出了单次调用的边界:起名 → 给选中的名字写产品文案 → 把文案转成图像模型的提示 → 调图像模型出图。让一个模型为另一个模型写提示,这招叫元提示(meta prompting)——作者引用的依据是:今天的大模型在写提示这件事上,水平已经和人相当31。书里的演示走完了全程:OneFit UltraStride 鞋的名字 → 一段产品描述 → 一段 DALL-E 提示 → 一张产品图32

为什么要费这个事?书里给的理由很实际:让人评价一张已有的图,比让他凭空想象一张图,认知负担小得多。 整条链的最终目的不是自动化本身,而是更快地产出「人可以拍板的东西」33

4. 作者的判断与证据

五原则的出处要说清,因为这本书的可信度一半押在它上面。 作者声明:五条原则是他们 2022 年 7 月首发在一篇博客里的,而不是跟风口抄来的;一年后 OpenAI 发布官方提示工程指南,与这五条高度重合34。我们的核对:这套说法自洽——2022 年 7 月早于 ChatGPT 发布(2022 年 11 月),早于市面上绝大多数提示工程材料。书里没有给出第三方对「我先提的」的独立佐证,这点如实说明。

哪些是证据、哪些是经验,书里基本分清了:

  • 有研究支撑的:少样本提升(GPT-3 论文)、预热(Liu et al., 2021)、「方向可能优于例子」(Hsieh et al., 2023)、元提示(Zhou, 2022)——都标了出处;
  • 纯经验陈述:「一到三个例子几乎总是划算」「方向冲突时留最重要的」「跑不到 10 次就会暴露偏差」——这些是作者 2020 年起在客户项目里攒的手感,书里以建议口吻给出,没有数据;
  • 图像侧的那条「社区反馈把模型偏向了幻想美学」(用户点放大按钮的选择被拿去训练,而早期用户多是数字艺术圈),作者自己加了「据报道」的限定35

判断(我们的,不是书里的): 五原则真正的价值不在内容,而在它是从「上线的毛病」反推出来的——每条都对着一个具体的生产事故类型(格式漂移、无法评测……)。这解释了为什么它经得起模型换代:模型再强,「格式不稳」「没有反馈环」这类工程问题不会自己消失。 如果错,会错在: 如果未来的模型把结构化和自评做成内置功能(比如强制输出合法 JSON、自带置信度),「定格式」「评质量」两条会退化成模型自带的能力,而不再是提示技巧。书里 2024 年之后的模型确实在往这个方向走,但「给方向」「给例子」「分工」三条目前看不到被替代的迹象。

5. 边界与局限

这本书写于 2024 年上半年,示例模型是 GPT-4、Midjourney v6、Stable Diffusion XL;书里自己声明:几个月后这些模型可能就不再是最强,但五原则的设计目标是扛住换代36。今天读它,请把每个具体模型名当「当时的最强」来读。

具体的局限:

  • 提示不能跨模型搬运。 书里明说:提示模板换到新模型,效果很少能直接可比;但五原则带来的改善在任何模型上都稳定存在37。所以不要把「这个提示在 GPT-4 上调好了」当成资产,要当成待重测的假设;
  • 提示工程有天花板。 书里给了一张关键的关系图:当例子能攒到几千个时,微调(拿这些例子继续训练模型本身)开始胜过提示工程。提示是启动期工具,不是终局38;
  • 图像侧的合规风险。 用别人的照片当底图、模仿在世艺术家的风格,都在法律灰区里,书里有明确警告,第 12 章展开39

6. 可带走的

  1. 提示写完先过五问:方向说清了吗?格式钉死了吗?有例子吗?怎么评测?该不该拆?
  2. 格式不稳是生产事故的头号来源——要求返回 JSON 并留半个骨架让它补完,解析失败就是免费的重试信号;
  3. 指名风格(乔布斯 vs 马斯克)比形容风格有效得多;
  4. 例子是方向盘:例子里有什么,输出里就只剩什么——动物名字的实验值得记住;
  5. 一到三个例子几乎稳赚;更多例子要试验着调;
  6. 先试「把方向说清楚」,再堆例子;
  7. 盲提示不是评测:两个变体各跑 5 次、打乱盲评,不到 10 次就能抓住偏差;
  8. 它写得出烂名字,也看得出烂名字——生成难、评判易,自评有效就靠这条;
  9. 「让我们一步步想」是零成本的性能改进,还附带审计轨迹;
  10. 提示的终点是链:名字 → 文案 → 图像提示 → 图,每一环都是给人拍板的机会。

7. 原文地图

主题原书章原文位置
提示与提示工程的定义Ch.1 五原则text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:5(搜「discovering prompts」) · text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:7(搜「set of instructions」)
朴素提示与五个毛病Ch.1 五原则text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:14(搜「fit any foot size」) · text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:33(搜「Vague direction」)
按量计费与随机性Ch.1 五原则text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:53(搜「three-fourths of a word」) · text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:57(搜「Average prompts」)
五原则清单与出处Ch.1 五原则text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:92(搜「Give Direction」) · text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:112(搜「July 2022」)
乔布斯 / 马斯克对照Ch.1 五原则text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:184(搜「ShoeX」)
预热与外部规则Ch.1 五原则text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:186(搜「prewarming」) · text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:254(搜「Brandwatch」)
方向冲突要取舍Ch.1 五原则text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:309(搜「conflicting combination」)
万能翻译器与 JSONCh.1 五原则text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:315(搜「universal translators」) · text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:353(搜「parsing error」)
方向与格式的分野Ch.1 五原则text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:372(搜「overlap between the first and second」)
零样本与少样本Ch.1 五原则text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:376(搜「zero-shot」)
动物名实验、例子数与创造力Ch.1 五原则text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:382(搜「three to five examples」) · text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:407(搜「PandaPaws」)
方向可能优于例子Ch.1 五原则text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:409(搜「direction works better」)
盲提示与拇指评测Ch.1 五原则text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:432(搜「blind prompting」) · text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:680(搜「0.2」)
排列组合提示Ch.1 五原则text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:773(搜「permutation prompting」)
自评打分与机制解释Ch.1 五原则text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:850(搜「struggle to know what the overall response」)
一步步想、思维链Ch.1 五原则text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:854(搜「step by step」)
元提示与起名→文案→配图链Ch.1 五原则text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:894(搜「meta prompting」) · text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:963(搜「blank page」)
提示的天花板与微调Ch.1 五原则text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:767(搜「fine-tuning」)

Footnotes

  1. 出处:「Ch.1 五原则」第 14 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:14,搜「fit any foot size」)与第 29 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:29,搜「feels like magic」)。原文的起名例子借自 OpenAI 的官方示例。

  2. 出处:「Ch.1 五原则」第 7 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:7,搜「set of instructions」)。

  3. 出处:「Ch.1 五原则」第 5 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:5,搜「discovering prompts」)。原文定义:提示工程是「发现能可靠地产出有用或想要的结果的提示」的过程。

  4. 出处:「Ch.1 五原则」第 92 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:92,搜「Give Direction」)。

  5. 出处:「Ch.1 五原则」第 7 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:7,搜「diffusion models like Midjourney」)。扩散模型的原理在第 11 章展开,这里只要知道它是「按文字描述生成图片」的那一类。

  6. 出处:「Ch.1 五原则」第 29 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:29,搜「throwaway interactions」)。

  7. 出处:「Ch.1 五原则」第 53 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:53,搜「temperature parameter」)。原文:模型不断预测下一个标记(约四分之三个词),每个新标记按其出现的可能性选出,并带有温度参数控制的随机成分。标记与温度两个词第 02 章还会再讲透。 2

  8. 出处:「Ch.1 五原则」第 39 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:39,搜「numbered list」)。

  9. 出处:「Ch.1 五原则」第 43 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:43,搜「average of its training data」)。

  10. 出处:「Ch.1 五原则」第 154 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:154,搜「branding agencies」)。

  11. 出处:「Ch.1 五原则」第 184 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:184,搜「ShoeX」)。三个例子也被换成了马斯克风格(Teslacool、WatchX),即原则和原则三是要一起换的——例子必须与方向同风格。

  12. 出处:「Ch.1 五原则」第 186 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:186,搜「prewarming」)。书里标注引自 Liu et al., 2021,并称这招也叫内部检索(internal retrieval):先让模型把相关知识「取」出来,再用在同一对话里。

  13. 出处:「Ch.1 五原则」第 254 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:254,搜「Brandwatch」)。

  14. 出处:「Ch.1 五原则」第 309 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:309,搜「conflicting combination」)。

  15. 出处:「Ch.1 五原则」第 315 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:315,搜「universal translators」)。

  16. 出处:「Ch.1 五原则」第 353 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:353,搜「parsing error」)。原文:「broken JSON will result in a parsing error, which can act as a trigger to retry the prompt」。

  17. 出处:「Ch.1 五原则」第 359 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:359,搜「in Minecraft」)。

  18. 出处:「Ch.1 五原则」第 372 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:372,搜「overlap between the first and second」)。

  19. 出处:「Ch.1 五原则」第 376 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:376,搜「zero-shot」)。10% 到近 50% 是书里对 GPT-3 论文图 1-8 的转述,按任务不同提升幅度不同。

  20. 出处:「Ch.1 五原则」第 407 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:407,搜「PandaPaws」)。

  21. 出处:「Ch.1 五原则」第 382 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:382,搜「three to five examples」)。

  22. 出处:「Ch.1 五原则」第 409 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:409,搜「direction works better」)。原文注明依据 Hsieh et al., 2023,并补充「好例子通常不好收集」。

  23. 出处:「Ch.1 五原则」第 411 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:411,搜「img2img」)。

  24. 出处:「Ch.1 五原则」第 432 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:432,搜「blind prompting」)。

  25. 出处:「Ch.1 五原则」第 680 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:680,搜「0.2」)。0.2 与 0.6 是书里一次真实运行的输出;每次跑分会变,关键是对照结构:打乱、盲评、按变体聚合。

  26. 出处:「Ch.1 五原则」第 717 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:717,搜「less than 10 test runs」)。

  27. 出处:「Ch.1 五原则」第 773 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:773,搜「permutation prompting」)与第 803 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:803,搜「surprisingly bad at math」)。书里顺带指出:模型连「图里有几个人」都数不准——生成式模型在做算术这件事上差得出名。

  28. 出处:「Ch.1 五原则」第 850 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:850,搜「OneSize Glovewalkers」)。

  29. 出处:「Ch.1 五原则」第 850 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:850,搜「struggle to know what the overall response」)。

  30. 出处:「Ch.1 五原则」第 854 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:854,搜「step by step」)与第 894 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:894,搜「giving the model time to think」)。

  31. 出处:「Ch.1 五原则」第 894 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:894,搜「meta prompting」),书里引 Zhou, 2022,称大模型已是「人类水平的提示工程师」。这个说法偏乐观,但「模型写的提示能直接用」在书里的演示中成立。

  32. 出处:「Ch.1 五原则」第 946 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:946,搜「Convert this description」)。

  33. 出处:「Ch.1 五原则」第 963 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:963,搜「blank page」)。

  34. 出处:「Ch.1 五原则」第 112 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:112,搜「July 2022」)。博客题为《Prompt Engineering: From Words to Art and Copy》。

  35. 出处:「Ch.1 五原则」第 144 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:144,搜「fantasy aesthetic」)。原文措辞是 reportedly,作者并未给出直接证据。

  36. 出处:「Ch.1 五原则」第 148 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:148,搜「GPT-5」)。

  37. 出处:「Ch.1 五原则」第 975 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:975,搜「rarely comparable」)。

  38. 出处:「Ch.1 五原则」第 767 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:767,搜「fine-tuning」)。微调——拿标注好的例子继续训练模型、调整它内部的参数——在第 02 章会讲。书里这张图(How many data points is a prompt worth?)只给了趋势结论,没给精确拐点。

  39. 出处:「Ch.1 五原则」第 426 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:426,搜「legal trouble」)。