跳到主要内容

基础站 — 清单背后的四条心智模型

这一章讲三件事: 原书那一页基础清单上,每份材料到底是干什么的; 这份清单背后藏着哪四条心智模型,每条怎么用一个具体输入走一遍; 以及原书放在训练部末尾的多模态(一个模型同时吃图和字)那一节,为什么本质上是基础站的延伸。 读完这一章的标准不是「知道这些名词」,而是后面七站每次撞回这些模型时,你都认得出。

1. 这一章讲什么

原书 Part I 的全部家当,是两页纸:一段导言,加三张清单(文章、视频、课程)1。 作者对它的定位只有一句:「理论加实用的混合,为后续部分做准备」2

清单是给别人列的,次序是作者排的。 本拆解的立场是:这一页的真正内容不是那些标题, 而是它们共同构成的四条心智模型。原书假定你学完就有,我们从零走一遍。

本章的主走查用一句话贯穿:拿上一章那个客服机器人任务的一条真实用户输入——

「退货政策是什么?」

看它从一串文字变成回答,在四条心智模型上各经过哪一步。

2. 顶层全景:一句话穿过整个基础站

「退货政策是什么?」

├─ ① 切块:整句被切成小块,每块换成一个编号 (第 3 节)
│ 「退货」「政策」「是」「什么」→ [8021, 3347, 271, 9816]

├─ ② 混合:每个小块去「看」其他小块,按相关度取信息 (第 4 节)
│ 处理「什么」时:「退货」的分数最高,它的信息被取得最多

├─ ③ 算账:几十亿个数一起动,吐出「下一个块」的候选清单(第 5 节)
│ 这份能力来自预训练:读完海量文本,反复猜「下一个词」

└─ ④ 挑选:按候选清单挑一个,接上去,再从头来一遍 (第 6 节)
温度旋钮决定挑第一名还是也敢挑冷门

图说:①②③④ 各对应一条心智模型,也各对应清单上的一类材料。
中间的编号与百分比都是为演示编的,不是真实数值。

3. 心智模型一:文字先被切成小块 — 分词器

清单对应: Karpathy 的视频《动手造 GPT 分词器》3,作者把它排在清单第一位。

解决什么问题: 模型内部只认数字,不认字。所以文字进模型前必须过一道转换: 先切成小块——每块行话叫一个 token(模型眼里的一个「字」),再查表把每块换成编号。 这个「切块 + 编号」的部件,叫分词器

怎么做的: 最直觉的切法是按词切,但词有无限多个(新词、错拼、外语)。 业界通行的办法,是先把文本拆到最小单位——字节(电脑存信息的最小单位)——再统计哪两个小块总是一起出现、反复合并成一整块(这套工序行话叫字节对编码), 把它们合并成一块,写进合并表;重复这个过程几万次,就得到一张「常见组合表」。 编码时按合并表从头重演一遍。为什么有效: 高频组合被合并,生僻内容退回字节级, 任何新词都能兜住,不会出现「词典里没有这个词」的死局。

这一条我们不用泛泛而谈——书架上就有 Karpathy 那份教学分词器代码的完整拆解, 两个原子操作(统计相邻字节对、合并最高频对)十几行 Python 就能讲完4

走查第 ① 步: 「退货政策是什么?」在分词器眼里可能不是六个字,而是四个块:

原文 退 货 政 策 是 什 么
切块 「退货」「政策」「是」「什么」
编号 [8021, 3347, 271, 9816]

图说:切块与编号都是为演示编的;真实切法取决于每个模型自己那份合并表,
「退货」这种高频商务词大概率会被合并成一块,「政策」未必。

这一步影响后面每一站:第 03 章微调时数据要先过同一张表;第 05 章 RAG 的文档要切块; 计费按 token 数算——全是这道工序的下游

4. 心智模型二:每个位置挨个看周围,按分混合 — 注意力

清单对应: Jay Alammar 的《图解 Transformer》《图解 GPT-2》建立图像直觉, Lilian Weng 的长文《Attention? Attention!》补数学深度5,3Blue1Brown 的视频给动态演示6

解决什么问题: 一句话里,每个字的意思取决于它周围的字——「什么」单独看没有指向, 放回「退货政策是什么」就指向了「政策」。模型需要一种机制,让每个位置 在算自己的表示时,能按需取用其他位置的信息。

怎么做的: 每个位置对其他所有位置打一个「相关度分」, 再按分数把别人的信息加权混进自己这份。为什么有效: 打分本身也是学出来的, 模型自己决定该看哪里,不用人写规则——这是 Transformer 架构(2017 年论文提出, 原书未注明出处,这里补上)7的核心部件,也是它能把长上下文里的关键信息捞出来的原因。

走查第 ② 步: 处理到「什么」这个块时,它给前面各块打分(分数为演示编的):

位置 退货 政策 是
「什么」给它打的分 0.62 0.31 0.07

按分取信息: 「退货」的信息取走约六成,「政策」约三成
→ 混合后,「什么」这一步的表示里,「退货+政策」占大头
→ 所以下一步算「下一个块」时,候选清单里「如何」「在哪」排前面

验收自检: 你能对任意一句自己说的话,指出「处理到哪个词时它该看哪个词」。 说不出,回清单去看图解——这四份材料分工就是「同一件事的四种讲法」,挑你看得进去的那种。

5. 心智模型三:它靠猜「下一个词」学会 — 预训练

清单对应: Karpathy 的《大语言模型导论》(总览整个流水线)8、 《nanoGPT》(几百行代码的真实现)9,课程清单里的《生成式 AI 与大语言模型》10

解决什么问题: 上面两步说的是「怎么算」,还没说那些几十亿个用来打分的数 (术语叫参数)从哪来。答案:预训练——拿互联网级别的海量文本, 让模型反复做一件事:遮住下一个词,让它猜,猜错了把所有参数朝「猜对一点」的方向微调。 重复几万亿次。

为什么有效也为什么昂贵: 「猜下一个词」这个看似简单的目标,要猜得好, 就必须内化词怎么搭句子、事实、推理(从已知一步步推出未知)——语言里一切规律都被这个目标间接逼着学。 代价是同样的量级:原书在 notebook 章顺口给过一个数,Llama 2 的预训练读了 2 万亿个 token11——客服机器人微调用的指令数据通常只有几千到几万条, 两者差八个数量级,这就是为什么「从零训练」不是个人选项、微调才是(第 03 章)。

原书在这一步的清单哲学: 导言说要「理论加实用」2——视频课(导论)给地图, nanoGPT 给代码,课程给作业。三条路殊途同归:让你亲眼看见「预训练只是循环猜词」。

6. 心智模型四:怎么挑下一个词 —— 挑法的讲究

候选清单算出来之后「怎么挑」的讲究,行话叫解码策略

清单对应: Maxime Lebonne 的《LLM 中的解码策略》12——清单里唯一一份 专门讲「挑选环节」的材料。

解决什么问题: 第 5 节算出来的不是答案,是一张候选清单 (「如何」30%、「在哪」22%、「手续费」9%……)。挑哪个?永远挑第一名, 回答会死板、甚至复读;完全放开,又满嘴跑火车。

怎么做的(两个出门就会撞见的旋钮): 温度——把清单「调平」或「调尖」:温度低,高概率候选几乎包揽; 温度高,冷门候选也有机会。top-p——换个思路:从高到低排队, 累加到刚超过一条线(比如累计 0.9)就截断,只在这个小名单里挑13

走查第 ④ 步: 还是用「什么」后面的那张清单(百分比为演示编的):

清单:如何 30% / 在哪 22% / 手续费 9% / 什么时候 7% / ……长尾 32%

温度 0 永远挑「如何」 → 稳定,但十次提问答案一字不差
温度 0.7 大多挑「如何」,偶尔「在哪」 → 有点变化,不跑偏
top-p 0.9 累加到 0.9 截断 → 名单 = 如何+在哪+手续费+什么时候,长尾永远出不来

为什么这算「基础」: 第 06 章讲推理提速时,要回到这个挑选环节说话 (生成慢的结构性根源就在「一次只挑一个」)。验收自检: 能说清温度和 top-p 管的是 同一张清单的两种不同挑法,而不是两个互相独立的效果开关。

7. 延伸:视觉怎么进来 — 原书放错位置的一节

原书把「视觉语言模型」(Vision Language Model,让模型同时看图和文字)放在训练部末尾14, 但它的内容其实是基础站的延伸:多模态(multiple modality,一个模型同时吃多种输入, 比如文字加图片)讲解15、从零写一个 PaliGemma 模型的五小时视频16、 多模态 RAG 应用课17

用四条心智模型对照,多模态的「新东西」其实只有一处:图片也切成小块——行话叫图像块(图片版的 token)——当 token 用。

心智模型纯文本模型视觉语言模型
切块文字切成 token图片同样切块,块当 token 用
混合文字之间互相打分图像块与文字 token 打同一套分
学会猜下一个词先让配对的图和文互相靠近(行话叫对比学习),再进主模型
挑选照旧照旧

原书列的清单也印证这张表:那支五小时视频的主题清单里, Transformer 的一种省显存的注意力变体(grouped-query attention)、KV 缓存、top-p 采样(排队取前九成的可能)与温度——全是本章四条模型的直接复用, 新增的只有视觉侧编码与图文对齐两块18

8. 作者的判断与证据

原书基础站几乎没有作者自己的话,能拆出的判断有三条:

  1. 「图解优先」的判断。 清单把 Jay Alammar 的图解文章列第一、Karpathy 代码视频紧随5, 这是一个可检验的教学主张:先给视觉直觉,再给实现,比反过来学得快。 我们同意这个次序,但补一句书里没说的:图解只负责直觉,过不了「为什么有效」这一关, 数学 depth 要靠 Lilian Weng 那篇长文。
  2. 「一页清单够用」的判断。 基础站零正文,等于断言:入门材料市场已饱和, 路线图作者的增值在选材不在讲课。这个判断成立与否,取决于清单本身的质量 ——这四条模型对应的材料确实是各自品类里的公认最佳,我们认可。
  3. 多模态放在训练部末尾。 从内容看它属于基础站(见第 7 节的对照表), 排在那里更像「写完训练部顺手补的新题材」——原书各章成文时间不一,合订痕迹在此。

判断(我们的,不是书里的): 四条心智模型的次序(切块→混合→学会→挑选) 就是一条用户输入穿过系统的物理次序,原书清单的排列恰好也是这个次序 (分词器视频第一位、解码策略单列一份)。这不是巧合,是作者有结构感的证据。 如果错,会错在: 如果作者只是按材料知名度排序, 那这个次序的整齐就是巧合——但「解码策略」这份材料知名度并不高却被单列, 更像刻意为完整性补位,支持「有结构」的解释。

9. 边界与局限

  1. 原书零讲解。 本节的全部机制(分词器、注意力、预训练、解码)原书一个字没讲, 均为本拆解补充;出处只到「清单列了什么」,到不了「它是什么」。

  2. 清单止步 2024。 入门材料的世代更替很快,清单里的 Llama 2 系教程已不是当前版本; 但四条心智模型本身不随版本走。

  3. 没有「动手」环节。 基础站全部是看与听,直到训练部的 notebook 才第一次写代码—— 如果你 learn by doing,应该把 Karpathy 的 nanoGPT 当作本站的动手作业, 原书没这么点明。

  4. 数学被完全跳过。 注意力里那种大数字表——行话叫矩阵——的运算,清单里只有 Lilian Weng 一篇扛着;

  5. softmax(把一堆分数变成加和为一的占比)这类归一细节同样无人讲;需要系统数学的人,这个基础站不够。

10. 可带走的

  1. 基础站的目标是四条心智模型,不是清单本身:切块(token)→ 打分混合(注意力)→ 猜词学会(预训练)→ 挑选(解码策略);
  2. 分词器决定模型的世界观:高频组合合并、生僻退回字节,没有生词死局;
  3. 注意力是「每个位置按相关度取用其他位置的信息」,打分本身是学出来的;
  4. 预训练与微调的数据量差八个数量级,这是「个人只做微调」的硬理由;
  5. 温度与 top-p 是同一张候选清单的两种挑法,出门会撞见这两个名字;
  6. 多模态没有新的心智模型,只有「图片切块当 token 用」这一处替换;
  7. 选材判断:图解建立直觉 → 代码视频落实现 → 长文补数学,三份材料一个都不能少。

11. 原文地图

主题原书章原文位置
基础站导言与定位Part I: LLM Basics & Architecturetext/05-fm-part-i-llm-basics-architecture.txt:3(搜「foundational concepts」) · text/05-fm-part-i-llm-basics-architecture.txt:12(搜「blend of theoretical」)
图解类与长文清单Part I: LLM Basics & Architecturetext/05-fm-part-i-llm-basics-architecture.txt:16(搜「Illustrated Transformer」) · text/05-fm-part-i-llm-basics-architecture.txt:8(搜「Illustrated GPT-2」) · text/05-fm-part-i-llm-basics-architecture.txt:21(搜「Attention? Attention!」) · text/05-fm-part-i-llm-basics-architecture.txt:22(搜「Decoding Strategies in LLMs」)
视频清单Part I: LLM Basics & Architecturetext/05-fm-part-i-llm-basics-architecture.txt:24(搜「GPT Tokenizer」) · text/05-fm-part-i-llm-basics-architecture.txt:25(搜「nanoGPT」) · text/05-fm-part-i-llm-basics-architecture.txt:26(搜「Intro to Large Language Models」) · text/05-fm-part-i-llm-basics-architecture.txt:27(搜「Visual Intro to Transformers」)
课程清单Part I: LLM Basics & Architecturetext/05-fm-part-i-llm-basics-architecture.txt:30(搜「Generative AI with Large Language Models」) · text/05-fm-part-i-llm-basics-architecture.txt:34(搜「H2O.ai」)
多模态概念与代表作8. Best Resources to Build & Understand Vision Language Modelstext/13-ch08-8-best-resources-to-build-understand-vision-lang.txt:2(搜「intersection of computer vision」) · text/13-ch08-8-best-resources-to-build-understand-vision-lang.txt:25(搜「CLIP and Flamingo」) · text/13-ch08-8-best-resources-to-build-understand-vision-lang.txt:26(搜「contrastive learning」)
从零写 PaliGemma 的主题清单8. Best Resources to Build & Understand Vision Language Modelstext/13-ch08-8-best-resources-to-build-understand-vision-lang.txt:53(搜「PaliGemma」) · text/13-ch08-8-best-resources-to-build-understand-vision-lang.txt:65(搜「Rotary Positional Embedding」) · text/13-ch08-8-best-resources-to-build-understand-vision-lang.txt:73(搜「KV-Cache」)
多模态 RAG 收尾8. Best Resources to Build & Understand Vision Language Modelstext/13-ch08-8-best-resources-to-build-understand-vision-lang.txt:91(搜「multimodal」)

Footnotes

  1. 出处:「Part I: LLM Basics & Architecture」第 15–34 段(text/05-fm-part-i-llm-basics-architecture.txt:15,搜「Articles:」)。全部基础站内容:文章 4 篇、视频 4 支、课程 5 门,合计两页。

  2. 出处:「Part I: LLM Basics & Architecture」第 12 段(text/05-fm-part-i-llm-basics-architecture.txt:12,搜「blend of theoretical」)。原文:「This section provides a blend of theoretical and useful insights, preparing you for the next sections.」 2

  3. 出处:「Part I: LLM Basics & Architecture」第 24 段(text/05-fm-part-i-llm-basics-architecture.txt:24,搜「GPT Tokenizer」)。原文清单第一位:「Let's build the GPT Tokenizer by Andrej Karpathy」。

  4. 补充(不在书里,依据我们的 frontier 书架):字节对编码的两个原子操作与编码方式。依据: shelf=ai-frontier-reference/minbpe#01-bpe-core.md 事实=该拆解写明「训练 = 反复合并最高频的相邻字节对,编码 = 按合并表优先级贪心重演」,与正文描述一致。

  5. 出处:「Part I: LLM Basics & Architecture」第 16、17、21 段(text/05-fm-part-i-llm-basics-architecture.txt:16,搜「Illustrated Transformer」;:17 搜「Illustrated GPT-2」;:21 搜「Attention? Attention!」)。注意力机制的逐位置打分加权的完整走查,可对照我们自己的拆解: shelf=ai-book-reference/what-is-chatgpt-doing#04-inside-chatgpt.md 事实=该章把注意力讲成「每个词挨个去看句子里其他词、按相关度打分、按分数掺进自己的表示」。 2

  6. 出处:「Part I: LLM Basics & Architecture」第 27 段(text/05-fm-part-i-llm-basics-architecture.txt:27,搜「Visual Intro to Transformers」)。

  7. 补充(不在书里,来自通用知识):Transformer 架构出自 2017 年论文《Attention Is All You Need》(Vaswani 等,Google),原书清单只列解读文章、未提原始论文出处。

  8. 出处:「Part I: LLM Basics & Architecture」第 26 段(text/05-fm-part-i-llm-basics-architecture.txt:26,搜「Intro to Large Language Models」)。

  9. 出处:「Part I: LLM Basics & Architecture」第 25 段(text/05-fm-part-i-llm-basics-architecture.txt:25,搜「nanoGPT」)。

  10. 出处:「Part I: LLM Basics & Architecture」第 30 段(text/05-fm-part-i-llm-basics-architecture.txt:30,搜「Generative AI with Large Language Models」)。课程清单五门里的第一门。

  11. 出处:「3. 14 Free Large Language Models Fine-Tuning Notebooks」第 56 段(text/08-ch03-3-14-free-large-language-models-fine-tuning-note.txt:56,搜「pre-trained on an extensive dataset」)。原文介绍 Llama 2「pre-trained on an extensive dataset of 2 trillion tokens」。微调数据量级(几千到几万条)为通用知识补充,不在书里。

  12. 出处:「Part I: LLM Basics & Architecture」第 22 段(text/05-fm-part-i-llm-basics-architecture.txt:22,搜「Decoding Strategies in LLMs」)。原书作者名拼作「Maxime Lebonne」。

  13. 补充(不在书里,来自通用知识):温度重排概率分布、top-p 按累计概率截断的机制为业界通行做法,书里只在本地工具章的代码参数表里捎带出现过(「temperature」「top_p」两个参数名),未作解释。

  14. 出处:「8. Best Resources to Build & Understand Vision Language Models」第 2 段(text/13-ch08-8-best-resources-to-build-understand-vision-lang.txt:2,搜「Vision-Language Models」)。该章是训练部(Part II)的最后一章。

  15. 出处:「8. Best Resources to Build & Understand Vision Language Models」第 19 段(text/13-ch08-8-best-resources-to-build-understand-vision-lang.txt:19,搜「multimodal AI」)。原书对 Chip Huyen 那篇多模态综述的介绍,提到医疗影像配病历、机器人同时解读视觉与指令两个例子。

  16. 出处:「8. Best Resources to Build & Understand Vision Language Models」第 53 段(text/13-ch08-8-best-resources-to-build-understand-vision-lang.txt:53,搜「PaliGemma」)。原文:「In this 5-hour video, Umar Jamil will be coding the PaliGemma Vision Language Model from scratch」。

  17. 出处:「8. Best Resources to Build & Understand Vision Language Models」第 91 段(text/13-ch08-8-best-resources-to-build-understand-vision-lang.txt:91,搜「multimodal」)。多模态 RAG 应用课,覆盖多模态嵌入、视频处理、向量库检索等八节。

  18. 出处:「8. Best Resources to Build & Understand Vision Language Models」第 56–80 段(text/13-ch08-8-best-resources-to-build-understand-vision-lang.txt:56,搜「Transformer model」)。主题清单含 Transformer、视觉 Transformer、对比学习(CLIP、SigLip)、旋转位置嵌入、分组查询注意力、KV 缓存、top-p 采样与温度等项。