基础站 — 清单背后的四条心智模型
这一章讲三件事: 原书那一页基础清单上,每份材料到底是干什么的; 这份清单背后藏着哪四条心智模型,每条怎么用一个具体输入走一遍; 以及原书放在训练部末尾的多模态(一个模型同时吃图和字)那一节,为什么本质上是基础站的延伸。 读完这一章的标准不是「知道这些名词」,而是后面七站每次撞回这些模型时,你都认得出。
1. 这一章讲什么
原书 Part I 的全部家当,是两页纸:一段导言,加三张清单(文章、视频、课程)1。 作者对它的定位只有一句:「理论加实 用的混合,为后续部分做准备」2。
清单是给别人列的,次序是作者排的。 本拆解的立场是:这一页的真正内容不是那些标题, 而是它们共同构成的四条心智模型。原书假定你学完就有,我们从零走一遍。
本章的主走查用一句话贯穿:拿上一章那个客服机器人任务的一条真实用户输入——
「退货政策是什么?」
看它从一串文字变成回答,在四条心智模型上各经过哪一步。
2. 顶层全景:一句话穿过整个基础站
「退货政策是什么?」
│
├─ ① 切块:整句被切成小块,每块换成一个编号 (第 3 节)
│ 「退货」「政策」「是」「什么」→ [8021, 3347, 271, 9816]
│
├─ ② 混合:每个小块去「看」其他小块,按相关度取信息 (第 4 节)
│ 处理「什么」时:「退货」的分数最高,它的信息被取得最多
│
├─ ③ 算账:几十亿个数一起动,吐出「下一个块」的候选清单(第 5 节)
│ 这份能力来自预训练:读完海量文本,反复猜「下一个词」
│
└─ ④ 挑选:按候选清单挑一个,接上去,再从头来一遍 (第 6 节)
温度旋钮决定挑第一名还是也敢挑冷门
图说:①②③④ 各对应一条心智模型,也各对应清单上的一类材料。
中间的编号与百分比都是为演示编的,不是真实数值。
3. 心智模型一:文字先被切成小块 — 分词器
清单对应: Karpathy 的视频《动手造 GPT 分词器》3,作者把它排在清单第一位。
解决什么问题: 模型内部只认数字,不认字。所以文字进模型前必须过一道转换: 先切成小块——每块行话叫一个 token(模型眼里的一个「字」),再查表把每块换成编号。 这个「切块 + 编号」的部件,叫分词器。
怎么做的: 最直觉的切法是按词切,但词有无限多个(新词、错拼、外语)。 业界通行的办法,是先把文本拆到最小单位——字节(电脑存信息的最小单位)——再统计哪两个小块总是一起出现、反复合并成一整块(这套工序行话叫字节对编码), 把它们合并成一块,写进合并表;重复这个过程几万次,就得到一张「常见组合表」。 编码时按合并表从头重演一遍。为什么有效: 高频组合被合并,生僻内容退回字节级, 任何新词都能兜住,不会出现「词典里没有这个词」的死局。
这一条我们不用泛泛而谈——书架上就有 Karpathy 那份教学分词器代码的完整拆解, 两个原子操作(统计相邻字节对、合并最高频对)十几行 Python 就能讲完4。
走查第 ① 步: 「退货政策是什么?」在分词器眼里可能不是六个字,而是四个块:
原文 退 货 政 策 是 什 么
切块 「退货」「政策」「是」「什么」
编号 [8021, 3347, 271, 9816]
图说:切块与编号都是为演示编的;真实切法取决于每个模型自己那份合并表,
「退货」这种高频商务词大概率会被合并成一块,「政策」未必。
这一步影响后面每一站:第 03 章微调时数据要先过同一张表;第 05 章 RAG 的文档要切块; 计费按 token 数算——全是这道工序的下游。
4. 心智模型二:每个位置挨个看周围,按分混合 — 注意力
清单对应: Jay Alammar 的《图解 Transformer》《图解 GPT-2》建立图像直觉, Lilian Weng 的长文《Attention? Attention!》补数学深度5,3Blue1Brown 的视频给动态演示6。
解决什么问题: 一句话里,每个字的意思取决于它周围的字——「什么」单独看没有指向, 放回「退货政策是什么」就指向了「政策」。模型需要一种机制,让每个位置 在算自己的表示时,能按需取用其他位置的信息。
怎么做的: 每个位置对其他所有位置打一个「相关度分」, 再按分数把别人的信息加权混进自己这份。为什么有效: 打分本身也是学出来的, 模型自己决定该看哪里,不用人写规则——这是 Transformer 架构(2017 年论文提出, 原书未注明出处,这里补上)7的核心部件,也是它能把长上下文里的关键信息捞出来的原因。
走查第 ② 步: 处理到「什么」这个块时,它给前面各块打分(分数为演示编的):
位置 退货 政策 是
「什么」给它打的分 0.62 0.31 0.07
按分取信息: 「退货」的信息取走约六成,「政策」约三成
→ 混合后,「什么」这一步的表示里,「退货+政策」占大头
→ 所以下一步算「下一个块」时,候选清单里「如何」「在哪」排前面
验收自检: 你能对任意一句自己说的话,指出「处理到哪个词时它该看哪个词」。 说不出,回清单去看图解——这四份材料分工就是「同一件事的四种讲法」,挑你看得进去的那种。
5. 心智模型三:它靠猜「下一个词」学会 — 预训练
清单对应: Karpathy 的《大语言模型导论》(总览整个流水线)8、 《nanoGPT》(几百行代码的真实现)9,课程清单里的《生成式 AI 与大语言模型》10。
解决什么问题: 上面两步说的是「怎么算」,还没说那些几十亿个用来打分的数 (术语叫参数)从哪来。答案:预训练——拿互联网级别的海量文本, 让模型反复做一件事:遮住下一个词,让它猜,猜错了把所有参数朝「猜对一点」的方向微调。 重复几万亿次。
为什么有效也为什么昂贵: 「猜下一个词」这个看似简单的目标,要猜得好, 就必须内化词怎么搭句子、事实、推理(从已知一步步推出未知)——语言里一切规律都被这个目标间接逼着学。 代价是同样的量级:原书在 notebook 章顺口给过一个数,Llama 2 的预训练读了 2 万亿个 token11——客服机器人微调用的指令数据通常只有几千到几万条, 两者差八个数量级,这就是为什么「从零训练」不是个人选项、微调才是(第 03 章)。
原书在这一步的清单哲学: 导言说要「理论加实用」2——视频课(导论)给地图, nanoGPT 给代码,课程给作业。三条路殊途同归:让你亲眼看见「预训练只是循环猜词」。