它只是在续写 — 模仿者、幻觉与提示工程的诞生
这一章讲三件事: 你打交道的这台机器到底在做什么(答案比你想的朴素得多); 它是怎么一步步被逼成今天这个样子的;以及两个从娘胎里带来的毛病——幻觉与 「你说什么它信什么」。这是全书的第一章,后面十三章都建立在这一章的两个事实上。 不需要任何基础,遇到的生词都当场解释。
1. 这一章讲什么
原书前两章回答同一个问题:想用提示词驾驭 LLM,先得知道它是什么。
这一章把原书第 1 章(历史)和第 2 章前半(它的工作方式)合在一起讲, 因为它们其实是同一条因果链:它的过去解释了它的现在。
主走查是一个只有三行的例子——「昨天我的电视坏了」——我们会拿它从头走到尾: 先看机器面对这段话时在干什么,再看它给出的那个出人意料的答案是怎么来的。
2. 顶层全景:字进字出,仅此而已
剥到最外面一层,LLM 是一台字符串(一串字符,也就是一段纯文字)进、字符串出的机器: 你给它一段文字(叫提示词),它还你一段文字(叫补全)。
它没有「听到问题→思考→回答」这三个阶段。它只做一件事:
把「一份以提示词开头的文档,最可能怎么往下写」算出来,然后写出来。
所谓模型,就是让机器自己从例子里凑出规律的那套东西——不给它列规则, 给它看成山的例子,它把规律存进一堆可以调的数里。所谓训练, 就是让它读海量文字、不断把自己调到「续得像」的过程1。
「像」的参照物是上下文——模型开口前能看到的全部文字。上下文此刻只有你的提示词; 后面章节里,它会被我们精心装满各种东西。
你给的: 「One, Two,」
它还的: 「 Buckle My Shoe」
图说:整个交互就这么多。你觉得像儿歌接龙——没错,这就是它的全部工作,
整本书讲的是怎么把这件小事变成能用的产品。
3. 核心原理
3.1 它在模仿谁:从训练集里「随机抽一份文档」
机器读过的那一大堆文字,行话叫语料——书、网页、论坛帖子、代码,什么都有。 训练的目标不是让它背下语料,而是让它学出语料里的套路: 拿到一份语料里文档的前半截,能续出最可能的后半截2。
背下来反而是事故,行话叫过拟合——它没学到规律,而是把原文默写了一遍。 一个搜索引擎就能把训练集背得滚瓜烂熟:给它文档开头,它能 100% 找回原文后半截。 但那不是目标——目标是没见过的开头也能续得像样3。
主走查开始。 拿书里这个三行的开头:
Yesterday, my TV stopped working. Now, I can't turn it on at
下面三个续写,哪个最可能?① y2ior3w ② Thursday. ③ all.
三个都不是绝对不可能(猫踩键盘也能踩出①),但绝大多数模型会选③—— 因为在海量文字里,「can't turn it on at all」这个搭配出现的次数碾压另外两个4。
好,接受③,再往下走一步。现在文字变成:
Yesterday, my TV stopped working. Now, I can't turn it on at all.
书作者编了两个候选(a「于是我今晚安心看书」、b「要不要去你家看球?」), 然后拿真的模型(OpenAI 的 text-davinci-003)跑了一下。真模型给出的续写是:
(换两行)
First, try unplugging the TV from the wall and plugging it back in.
注意它干了什么:它从「诉苦」跳到了「客服给排查步骤」。 因为在它的语料里,「电器坏了」的抱怨后面,高频接着客服对话的排查建议—— 它不是在「帮你想办法」,它是在续写「最像训练集的文档」5。
书里给了一条整个行业的直觉口诀,值得原样记住:
假设你从训练集里随机抽了一份文档,你只知道它以你的提示词开头。 它统计上最可能的续写是什么?那就是你该预期的输出。
这条口诀解释了为什么「懂它的训练数据」比「懂它内部的构造」更能预测它的行为。 麻烦在于:商用模型的训练集配方是商业机密,你只能猜个大概6。