模型眼中的文字 — 标记、一次一个与温度
这一章讲三件事: 你打进去的字,在它眼里变成了什么;它往外吐字时遵守的 古怪纪律(一次一个,不许后悔);以及你为什么能用它「问两遍出两个答案」。 这一章是全书所有「算账」的基础——钱、速度、窗口大小,从这一章开始都要按 它的单位来算。
1. 这一章讲什么
上一章说了它是「续写机器」。这一章剥开第二层:它读的、写的都不是你以为的「文字」。
主走查是一句儿歌:「One, Two,」→「 Buckle My Shoe」。 我们会看着它被切成块、被一块块续出来、再看着同一个开头在另一种脾气下 续出完全不同的东西。中途再插入一次辅走查:「strange new worlds」这句话, 在大写转换任务里是怎么把模型难住的。
2. 顶层全景:先进切词器,才轮到模型
你发一段文字过去,在到达模型本体之前,先过一道切词器(tokenizer): 它把文字切成一串标记(token)——模型读写文字的最小单位,通常三四个字符一块, 可能是整个词,也可能是半个词。一个模型认识的所有标记,叫它的词表(vocabulary)1。
模型本体只跟标记打交道:吃进一串标记,吐出一串标记, 最后再由切词器把标记翻译回文字还给你1。
你打的: One, Two,
切成: [One] [,] [ Two] [,] 四个标记
模型干的: 这四个后面,第五个是什么? → [ Buck]
再切成: [One] [,] [ Two] [,] [ Buck] 五个标记
模型干的: 第六个是什么? → [le]
还给你: 「 Buckle」……继续
图说:本章主走查。注意 [ Two] 和 [ Buck] 前面都带空格——
空格被焊进了标记里,这一点到第 08 章组装提示词时会回来咬人。
后面每一节都回到这张图:第 3.1–3.3 节看「切」,第 3.4 节看「一块一块吐」, 第 3.5 节看「吐哪一块」。
3. 核心原理
3.1 切词器是台死板的机器——错别字在它眼里无处遁形
人读文字也按块读,不按字母读——所以你能毫不费力读懂打乱字母顺序的句子, 大脑自动帮你改了错别字。
模型的切词器是