跳到主要内容

全景 — 大模型是什么,怎么造出来

这一章讲三件事: 「语言模型」这个词的严格含义;这类模型是怎么一步步演化到今天的;以及一个能对话的模型要经过哪四个阶段才造得出来。 这一章是全书 12 章的地图:后面每一章都在展开这四个阶段中的一个环节。 不需要任何基础,遇到的生词都在当场解释。

1. 先把「语言模型」说清楚

你每天用的对话产品,背后都是同一个东西在干活:一台机器,接一段文字,吐下一段文字。这件事在技术上的名字叫语言模型(Language Model)——它不是某家公司产品的名字,而是一类数学对象的通称。

你在每天用的对话产品背后看到的,就是这台机器:接一段文字,吐下一段文字——它在给每个候选的下文算概率(出现可能性的大小)。

它的定义出奇地朴素:语言模型要干的事,是给定一句话里的前几个词,算出每个词接下来出现的可能性各有多大(技术文献把这张「可能性总表」叫概率分布)1

这个定义马上撞上一个天文数字。词典里有约 7 万个词,句子长度按 20 个词算,如果要给「每一个可能的词序列(词的排列)」都存一个概率,参数量(那些可调数字的总数)达到 7.9792×10^96——一个 1 后面跟着 96 个 0。作为对照,宇宙中的原子总数大约是 10^80 个(这个对照数不在书里,是通用知识)。所以「把所有可能的句子都列成表」这条路,从一开始就被数字本身堵死了2

于是整本书的故事,就是「怎么绕开这张列不完的表」的故事。

主走查:这句话的概率怎么算

拿书里自己的例子走一遍:「把努力变成一种习惯」。

直接算整句的概率算不动,所以先做一次分解:整句概率 = 一连串「条件概率」的乘积——第一个词「把」出现的概率,乘上「见过把之后出现努力」的概率,乘上「见过把努力之后出现变成」的概率,以此类推3

P(把 努力 变成 一种 习惯)
= P(把)
× P(努力 | 把)
× P(变成 | 把 努力)
× P(一种 | 把 努力 变成)
× P(习惯 | 把 努力 变成 一种)

图说:每个箭头右边是一个词,左边是它前面见过的全部上文。
每一项都是一个 0 到 1 之间的数,连乘起来就是整句的概率。
这五项的具体数值书里没有给,也不需要——关键在分解这个动作本身。

这个分解解决了「怎么算」的问题,但没解决「每一项从哪来」的问题。后面两节讲的全部历史,都是在回答这后半句。

2. 三代技术:每一代都在补上一代的死角

第一代:n-gram,数频率

最容易想到的办法是数数:拿大量文本,统计「把」后面跟过哪些词、各多少次。为了避免要记住无穷长的上文,做一个简化假设:一个词出现的概率只跟它前面 n−1 个词有关。满足这个假设的模型叫 n-gram(n 元文法)模型,n 通常取 2 或 34

数频率有两个立刻撞上的死角。其一,再大的语料(供学习的文本材料)也数不全所有组合——没数到的不等于不会出现,所以要用「平滑」技术给没见过的组合留一个小的非零概率。

其二,也是更根本的:n 取大一点,组合数按指数(底数的幂次)爆炸;n 取小一点,又记不住隔了很多词的远处内容。书上总结了它的三个缺点:管不住远处的词、依赖人工设计的平滑规则、参数难以准确学习5

还有一个更隐蔽的损失:n-gram 把每个词当成孤立的编号,「猫」和「狗」在这套表示里毫无关系

第二代:神经网络,把词变成向量

针对最后一个死角,2000 年 Bengio 等人提出用前馈(一层层往前传、不绕圈的)神经网络来估计那些条件概率6

从此每个词不再是一个编号,而是一个词向量(一串有含义的实数),意思相近的词,这串数也相近。

神经网络语言模型解决了「词与词之间没有关系」的问题,但训练它需要海量打好标签的数据——而语言模型有个独特的优势:训练目标可以直接从原文的下一个词构造(遮住下一个词,让模型猜,答案就在文本里)。这使它成为典型的自监督学习任务:不需要任何人打标签,互联网上的文本就是教材7。这种「自己给自己出题」的做法,背后是机器学习(让机器自己从数据里找规律的技术)的大思路。

训练时还会配合 dropout(随机掐断一部分信号)这类防死记硬背的小技巧。

第三代:预训练 + Transformer,规模起飞

2017 年 Google 提出 Transformer 架构(第 02 章专讲),它在机器翻译上取得突破。

2018 年,GPT(生成文字的那种)问世。

它走的是生成式(自己产出文字)路线,是这条路线的开山作。

紧接着 BERT(理解式模型的标志)把「先在海量文本上预训练、再在具体任务上微调」变成标准做法8

自然语言处理(让计算机懂人话的学科)从此全面进入预训练加微调的时代。

2020 年 GPT-3 把参数量推到 1750 亿,并发现一件意外的事:模型大到一定程度,不用改参数也能干活——在输入里给几个例子,它就能照着做(这叫语境学习)。微调不再必要,提示词、指令微调这些新玩法接踵而至9

同年,Kaplan 等人提出缩放法则(Scaling Laws):模型的效果随参数量、数据量、计算量三者的增加而可预测地平稳提升10。这句话的分量在于它把「继续做大」从赌博变成了工程:投入翻倍,产出按规律增长。整个行业此后几年的军备竞赛,都是这条定律的执行。

3. 五年时间线:从百亿到推理模型

书里把不到五年的发展(截至 2025 年 2 月,国内外发布了超过百种大语言模型)粗分为三个阶段11:

阶段时间在解决什么代表动作
基础模型2018–2021把模型做大、验证预训练范式BERT(1.1 亿参数)→ GPT-2(15 亿)→ GPT-3(1750 亿)
能力探索2019–2022大模型不微调怎么用GPT-2 的零样本(不给示例直接考)尝试、GPT-3 语境学习、指令微调、InstructGPT
突破发展2022.11 起对话、看图、推理ChatGPT、GPT-4o、GPT-o1、DeepSeek-R1

两个值得记住的坐标。其一,GPT-4 在多种基准考试上的得分高于 88% 的应试者,包括美国律师资格考试——「通过考试」从此不再是人类的专属护城河12

其二,2024 年 12 月到 2025 年 1 月,DeepSeek V3 和 R1 相继开源(公开全部可调数字供人下载),在训练效率和推理能力上取得突破;R1 展示了一种新模型类型:推理模型——回答之前先生成一段长长的内部思考13

书里据此把模型分成三类,后面章节会反复用到这个分类:基础模型(只做过预训练,会续写但不会对话)、对话模型(在基础模型上做过有监督微调(SFT,上一站的产物)和强化学习,能听指令)、推理模型(专注于逻辑推理增强)。

4. 四阶段流水线:一个对话模型是怎么造出来的

这是全书的主干结构,原书第 2 到第 12 章都是在对这四段流水线做展开。流水线来自 OpenAI 联合创始人 Andrej Karpathy 在微软 Build 2023 大会上公开的信息,包含四个阶段:预训练、有监督微调、奖励建模和强化学习14

主走查:「复旦大学有几个校区」在这条流水线上的旅程

这个问题是书里自己用的例子,我们让它走完全程。

第 1 站·预训练。 数万亿词的互联网文本,喂给一屋子互连机器组成的集群(里头插着数千块加速卡),训练数十天,得到基础模型。这个阶段的代价有具体数字:GPT-3 一次训练的计算量,相当于上千块顶级芯片连跑近一个月;后来把效率抠到极致的 DeepSeek-V3,也要 266.4 万块加速卡各跑一小时——即便不计电费,一次训练的账单也是数百万元级15。此时你问它「复旦大学有几个校区」,它大概率只会接着你的话往下写别的文字,而不是回答——它见过答案,但没人教过它「问题要配答案」这个格式。

第 2 站·有监督微调(SFT)。 用少量高质量数据教格式:每条数据就是「提示词 + 理想输出」16。我们的例题正好是书里给的标准数据格式:

提示词:复旦大学有几个校区?
理想输出:复旦大学现有 4 个校区,分别是邯郸校区、新江湾校区、
枫林校区和张江校区。其中邯郸校区是复旦大学的主校区……

这个阶段只需要数十块加速卡、数天时间;Alpaca、MOSS、ChatGLM-6B 等很多模型走到这一步就发布,效果在一些评测中能达到 ChatGPT 的九成。研究重点也随之改变:预训练拼算力,这一阶段拼数据质量——少量精选数据比海量粗糙数据更有效17

第 3 站·奖励建模。 让人对同一个问题的多个回答排优劣,训练出一个「质量对比模型」。它的产出不是给用户用的产品,而是给下一站用的裁判。这个裁判训练起来意外地贵:需要百万量级的人工对比,而且「什么样的回答更好」很难定标准,参与排序的人之间口径是否一致本身就是难题18

第 4 站·强化学习。 拿几十万条提示词,让 SFT 模型生成回答,奖励模型打分,再用强化学习这套调参方法调整模型参数,使回答能拿到更高分。这一步出来的才是最终交付的对话模型19

海量文本 ──预训练──▶ 基础模型(会续写,不会对话)
│ 少量「指令-回答」对

SFT 模型(会对话,但不知人类偏好)
│ 人类对多个回答的优劣排序

奖励模型(一个自动裁判)
│ 用裁判的分数调参数

对话模型(最终交付)
图说:四站的算力递减(数千卡数天 → 数十卡数天 → 数十卡数天),
数据形态各不相同:文本 → 指令对 → 偏好排序 → 提示词。

这条流水线还有一个诚实的空白:为什么强化学习这一步能带来比有监督微调好得多的效果,截至 2025 年 2 月还没有完整或得到普遍共识的解释;目前相对得到认可的观点是它让模型泛化(举一反三)能力更好20

同时它也不是免费的:Karpathy 指出强化学习会降低基础模型的熵(输出的混乱程度)——让输出更多样性变少20。「我们不知道为什么有效,但它有效」——这句话全书后面还会出现很多次。

5. 作者的判断与证据

  • 有证据的: 各阶段的算力数字、模型参数量表、考试得分,书里都给了出处;四阶段流水线有 Karpathy 报告作为依据。
  • 作者的判断: 把五年发展切成三个阶段是本书作者(综合前人时间线扩展到 2025 年 2 月)做的归纳,阶段边界(比如能力探索阶段的起点定在 2019 年)是整理视角,不是业界共识。
  • 书里承认没搞懂的: 强化学习为什么优于有监督微调——书里原话是「还没有完整或得到普遍共识的解释」20

6. 边界与局限

  • 这一章是绪论,所有机制都只有名字没有原理——注意力机制、BPE、奖励模型怎么训练,分别要等到第 02、04、08 章才展开。
  • 发展时间线截至 2025 年 2 月,这不是一本会更新的书;表格里的参数量、型号会过时,但四阶段流水线的结构到写作时仍是主流。
  • 书里的参数量多处标注了「未得到官方证实」(比如 GPT-4 的 1.76 万亿参数来自第三方论文估算),引用时要注意这类数字的可靠性级别。

7. 可带走的

  1. 语言模型 = 给词序列算概率的函数;「大」指的是参数量,1750 亿个参数的 GPT-3 是这条路上的标志性节点;
  2. 整句概率可以分解成一串条件概率的连乘——生成下一个词,就是在解这个连乘的最后一项;
  3. 三代技术(n-gram → 神经网络 → 预训练)每一步都在补上一代的死角:数不全、词与词没关系、打标签太贵;
  4. 缩放法则让「做大」变成可预期的工程:参数、数据、算力按比例加,效果按规律涨;
  5. 模型分三类:基础模型会续写、对话模型会听指令、推理模型会先思考——买服务或选开源模型时先认清你要的是哪一类;
  6. 造一个对话模型要四站:预训练(拼算力)、SFT(拼数据质量)、奖励建模(拼人工排序)、强化学习(拼稳定性);
  7. 预训练是整条流水线里唯一贵到以百万美元计的环节,后面三站都是「数十块加速卡、数天」的量级——这解释了为什么业界愿意反复做后三站而极少重做第一站;
  8. 行业自己承认:强化学习为什么有效,还没有共识解释。遇到有人把它讲得头头是道,保持怀疑。

8. 原文地图

主题原书章原文位置
语言模型定义、概率分布1 绪论text/01-ch01.txt:20(搜「概率分布建模」)
天文数字参数量1 绪论text/01-ch01.txt:25(搜「现代汉语词典」)
链式分解、条件概率连乘1 绪论text/01-ch01.txt:40(搜「把 努力 变成 一种 习惯」)
n-gram 与三缺点1 绪论text/01-ch01.txt:56(搜「n 元文法」) · text/01-ch01.txt:67(搜「三个较为明显的缺点」)
神经语言模型、词向量1 绪论text/01-ch01.txt:78(搜「词向量」)
自监督1 绪论text/01-ch01.txt:84(搜「自监督学习」)
预训练范式、GPT-3 与语境学习1 绪论text/01-ch01.txt:94(搜「1750 亿个参数」) · text/01-ch01.txt:97(搜「语境学习」)
缩放法则1 绪论text/01-ch01.txt:105(搜「缩放法则」)
三阶段时间线1 绪论text/01-ch01.txt:117(搜「超过百种大语言模型」) · text/01-ch01.txt:121(搜「基础模型阶段」)
GPT-4 考试、推理模型分类1 绪论text/01-ch01.txt:160(搜「88% 的应试者」) · text/01-ch01.txt:174(搜「推理模型是指」)
四阶段流水线1 绪论text/01-ch01.txt:267(搜「奖励建模和强化」)
预训练算力账1 绪论text/01-ch01.txt:282(搜「3640」) · text/01-ch01.txt:290(搜「266.4 万」)
SFT 数据例(复旦校区)1 绪论text/01-ch01.txt:296(搜「复旦大学有几个校区」)
奖励建模标注量1 绪论text/01-ch01.txt:315(搜「百万量级」)
RL 未知解释、熵降低1 绪论text/01-ch01.txt:333(搜「普遍共识的解释」) · text/01-ch01.txt:335(搜「熵降低」)

Footnotes

  1. 出处:「1 绪论」第 20 段(text/01-ch01.txt:20,搜「概率分布建模」)。原文:「语言模型(Language Model,LM)的目标就是对自然语言的概率分布建模」。

  2. 出处:「1 绪论」第 25 段(text/01-ch01.txt:25,搜「现代汉语词典」)。原文以《现代汉语词典》(第 7 版)约 7 万词、句长 20 词为例,算出参数量 7.9792×10^96。原子数对照不在书里,来自通用知识。

  3. 出处:「1 绪论」第 40 段(text/01-ch01.txt:40,搜「把 努力 变成 一种 习惯」),即原书式 (1.2)。

  4. 出处:「1 绪论」第 56 段(text/01-ch01.txt:56,搜「n 元文法」)。原文假设「任意单词 wi 出现的概率只与过去 n−1 个词相关」。

  5. 出处:「1 绪论」第 67 段(text/01-ch01.txt:67,搜「三个较为明显的缺点」)。

  6. 出处:「1 绪论」第 78 段(text/01-ch01.txt:78,搜「词向量」)。原文介绍 Bengio 等人 2000 年的前馈网络语言模型,独热编码被映射为低维稠密实数向量。

  7. 出处:「1 绪论」第 84 段(text/01-ch01.txt:84,搜「自监督学习」)。

  8. 出处:「1 绪论」第 88 段(text/01-ch01.txt:88,搜「ELMo」)。

  9. 出处:「1 绪论」第 94-101 段(text/01-ch01.txt:94,搜「1750 亿个参数」;text/01-ch01.txt:97,搜「语境学习」)。

  10. 出处:「1 绪论」第 105 段(text/01-ch01.txt:105,搜「缩放法则」)。原文:模型效果随参数量、数据集大小和计算量的指数增加而平稳提升,损失值随规模指数增加而线性降低。

  11. 出处:「1 绪论」第 117 段(text/01-ch01.txt:117,搜「超过百种大语言模型」)与第 121 段(text/01-ch01.txt:121,搜「基础模型阶段」)。

  12. 出处:「1 绪论」第 160 段(text/01-ch01.txt:160,搜「88% 的应试者」)。

  13. 出处:「1 绪论」第 117 段(text/01-ch01.txt:117,搜「DeepSeek V3」)与第 174 段(text/01-ch01.txt:174,搜「推理模型是指」)。

  14. 出处:「1 绪论」第 267 段(text/01-ch01.txt:267,搜「奖励建模和强化」)。

  15. 出处:「1 绪论」第 282 段(text/01-ch01.txt:282,搜「3640」)与第 290 段(text/01-ch01.txt:290,搜「266.4 万」)。数百万元的说法见第 3 章对预训练成本的类似表述,此处为按 GPU 租赁市价的通用常识估算。

  16. 出处:「1 绪论」第 293 段(text/01-ch01.txt:293,搜「有监督微调」)。

  17. 出处:「1 绪论」第 305 段(text/01-ch01.txt:305,搜「数十块 GPU」)与第 308 段(text/01-ch01.txt:308,搜「90% 的效果」)。

  18. 出处:「1 绪论」第 315 段(text/01-ch01.txt:315,搜「百万量级」)与第 319 段(text/01-ch01.txt:319,搜「一致性」)。

  19. 出处:「1 绪论」第 325 段(text/01-ch01.txt:325,搜「奖励」)与第 305 段(text/01-ch01.txt:305,搜「数十块 GPU」)。

  20. 出处:「1 绪论」第 333 段(text/01-ch01.txt:333,搜「普遍共识的解释」)与第 335 段(text/01-ch01.txt:335,搜「熵降低」)。 2 3