跳到主要内容

一条流水线与一部 GPT 史 — 大模型是什么、怎么造

这一章讲三件事: 「大模型」这个词到底指什么(它是一路换引擎换出来的第四代); 造一个大模型的两阶段流水线长什么样(为什么先预训练、再后训练); 以及把这一切串起来的 GPT 系列演化史——从 1.1 亿参数走到今天的推理模型。 这一章是全书地图:后面 15 章讲的就是这条流水线的每一站怎么干。

1. 先看四代:每一代都在修上一代的死结

你平时说的「大模型」,在这个行业里有个正式位置:它是语言模型这个词族里的第四代。 语言模型就是「给前面的话,算后面该接什么」的模型——这个本职工作四代没变过, 变的是用什么引擎去算。原书把这条演化线讲成四代1,每一代都是被上一代的死角逼出来的:

先把表里要用的几个词说清。神经网络:一种模仿人脑的计算结构—— 大量简单计算零件互连,靠调整连接强度来学规律,后面每一章都会用到它。

互连的每个零件叫单元(最小的计算零件),零件之间的连接强度就叫权重,是「参数」的一种——学规律,学的就是调这些强度。

表达词的办法也换代了:用向量——一串有含义的数——来代表一个词。

词向量(word embedding)就是干这个的:让「猫」和「狗」这两串数彼此靠近——意思变成了距离,机器才有东西可算2

Transformer:2017 年谷歌提出的一种神经网络结构,核心是让句中任意两个词直接连线, 不再像旧网络那样一个传一个;它对硬件友好、训练时可以并行(把同一批活拆给多张卡同时干),后来成了所有大模型的地基3

时期引擎修好了什么留下什么死结
统计语言模型1990 年代数频率(n-gram:只看前面固定 n 个词)让「算下一词」第一次可行词的组合太多,概率表数不过来——维数灾难
神经语言模型2003 起小神经网络+词向量:把每个词变成一串有含义的数意思相近的词在数轴上靠得近,没见过的组合也能算网络太小,装不下世界知识
预训练语言模型2018 起Transformer(见第 05 章)+海量文本自学习先通读天下文章再干活(预训练+微调范式)模型还只有几亿参数,能力没放开
大语言模型2020 起同样的 Transformer,规模放大千倍一套权重直接解各种任务训练贵、会胡说、机制不明——后面各章的主题

1.1 两个时间点

两个时间点值得钉住。2018 年,OpenAI 出了 GPT-1(1.1 亿参数,和同时期谷歌的 BERT(BERT 是谷歌 2018 年出的预训练模型,Base 是它的标准尺寸版)差不多大)。

GPT-1 确立了「Transformer+解码器(只负责往外吐词的那半台机器)+预测下一个词」这条路4; 2020 年,GPT-3 把参数放大到 1750 亿——比 GPT-2 多了一百多倍5——并且展现了一种小模型没有的能力:只看几个例子就能做新任务, 不用重新训练,这叫上下文学习(in-context learning,后面第 12 章细讲)6。 正因为在 BERT、GPT-1 那一代身上看不到这种能力,研究者才专门造了「大语言模型」这个词, 指显著大于那一代的预训练模型7

判断(我们的,不是书里的): 四代表格里最值得记住的不是年份,是那个反复出现的模式—— 每一代的突破都不是发明了全新的任务,而是找到了一个更能扩规模的引擎。 任务始终是「算下一词」,变的是引擎的吞吐(单位时间能处理多少文本)。 如果错,会错在: 如果后来出现的能力(比如推理)被证明需要新的训练目标才能获得, 「任务不变、引擎变大」这条总结就只适用于前两代——第 14 章会看到,o1 的训练方式确实加了新东西(强化学习),但它优化的仍是「生成文本」这个动作。

2. 两阶段流水线:预训练打能力,后训练教做人

原书在背景章开篇就给出全书最重要的框架:造一个大模型分两大阶段8

海量互联网文本 ──→ ① 预训练 ──→ 会续写的「基础模型」──→ ② 后训练 ──→ 会听话的「对话模型」
(自学习:预测下一个词) │ (指令微调+人类对齐)
│ │
学到:语言规律+世界知识 │ 学到:听指令、对齐人类偏好
(还不会「听话」) (可上线)
图说:两个阶段用的是同一个模型、同一套训练引擎(第 06 章),
差别只在数据和目标——这就是全书 4~8 章的行进路线。

为什么必须分两段? 因为预训练的目标太「窄」了:它只会接着你的话往下写, 不擅长「听懂你要它干什么」。原书打了个比方:预训练完的模型像刚毕业的学生—— 通识课都修过了,但没上过岗前培训,还得按岗位教一遍9

两个阶段各自的量级差得很远,这组对照值得背下来:

预训练后训练(指令微调)
喂什么万亿级 token 的原始文本几十万~百万条问答对;几千到几万条高质量数据就可能够用10
花什么百亿参数模型≈至少一百张 A100 显卡跑几个月11一台 8 卡 A100 服务器(装着 8 张显卡的专用机器),几天就能给百亿参数模型做完12
产出语言能力+世界知识(「压缩了世界信息」,OpenAI 前首席科学家 Ilya Sutskever 的说法13)会听指令、更符合人类偏好

「token」这个词后面每一章都会出现,这里一次说清:token 是模型读写文本的最小单位, 可能是一个词、半个词、或几个字母——第 04 章专讲它怎么切。

原书还有一句容易被忽略但很重的判断:预训练这件事「看起来直白,做起来全是门道」, 真正的差异在人的经验上——「人才是最重要的因素」14。 同一份开源配方,不同团队训出来的模型质量可以差很远,后面 06 章会让你看到这些「门道」具体长什么样。

3. GPT 系五次换挡:一部压缩的行业史

原书用一整节梳理 GPT 系列,并把它划成五个阶段15。这张表是理解全书的时间轴:

阶段模型与时间关键动作量化变化
早期探索GPT-1(2018)、GPT-2(2019)确立「解码器+下一词」结构;GPT-2 起试图不微调直接解题参数 1.1 亿 → 15 亿
规模扩张GPT-3(2020)参数放大百倍;正式提出上下文学习1750 亿参数16
能力增强Codex(2021)→ GPT-3.5拿代码数据再训练;启动人类对齐(2017 年起的技术积累)代码训练明显提升推理能力17
性能飞跃ChatGPT(2022-11)、GPT-4(2023-03)对话化;多模态;6 个月安全对齐迭代18通过大量人类考试,被拿来讨论 AGI(通用人工智能——像人一样什么都能学的 AI)还有多远
测试时扩展o1(2024-09)、o3(2024-12)响应前先生成内部长思维链,想久一点再答o3 在 ARC-AGI 拿 87.5%19

三次换挡各说一句。GPT-2 那次,OpenAI 在论文里给「不微调直接解题」给了个理由: 监督任务的无监督版本如果学到位,两者的最优解就是同一个——所以把全世界的文本补全学好了, 具体任务自然就会了20Codex 那次说明喂什么数据决定了会长出什么能力: 在 GitHub 代码上再训练后,模型的推理能力整体变强,不止会写代码21o1 那次换了挡位:以前的模型比拼「答得又快又准」,o1 的输出变成两截—— 先给一段内部长思维链的摘要,再给正式答案;练法是放大强化学习训练, 让模型学会反思、回溯这些动作(第 14 章细讲)22

判断(我们的,不是书里的): 五次换挡里有两次不是「把模型变大」, 而是「换数据(代码)」和「换训练方式(强化学习)」。这说明「规模扩张」只是主旋律之一, 数据工程(第 04 章)和后训练(第 07、08 章)是与它交替发力的另外两只手如果错,会错在: 如果 o1 之后的能力增长又被证明主要靠参数规模, 那「三只手」的说法就高估了后训练的作用——目前公开证据(o1、DeepSeek-R1)都指向训练方式换挡,而非单纯变大。

4. 主走查:同一句话,四代模型各自怎么答

原书解释「预测下一个词为什么是万能任务」时给了三个例子23,我们拿它们当走查的输入。 走查的问题:「预测下一个词」这一件事,凭什么练出了各种解题能力?

输入前缀:「This movie is really good.」(这部电影真好)
预测下一词要答对 → 得先判断这是好评还是差评
⟹ 这一题在偷偷练「情感分类」

输入前缀:「3+4=」
预测下一词是「7」→ 得会算加法
⟹ 这一题在偷偷练「数值计算」

输入前缀:「The capital of China is」
预测下一词是「Beijing」→ 得存着这条世界知识
⟹ 这一题在偷偷练「知识问答」

答案就在这三次预测里:互联网文本里本来就埋着亿万个这样的「微型任务」, 模型为了把下一个词预测准,被迫把分类、计算、记忆(把知识存进权重里、生成时现取现用的本事)全学了一遍—— 所以原书说下一词预测可以看成一种多任务学习23。 训练没换过目标,是数据自己把任务带进来了。这也解释了两阶段流水线的分工: 预训练阶段,这三个微型任务都在「偷偷练」;后训练阶段,再把它们「叫醒」成听指令的能力(第 07 章)。

顺着这条线再看四代模型答同一句「The capital of China is」的差别: 统计模型要看前面恰好出现过这个搭配多少次——大概率查不到;神经模型能把「首都」「中国」 的词向量算一算,但小网络存不下几百万条这种事实;预训练模型在维基百科上读过一万遍, 答得出;大模型不但答得出,还能听懂「用一句话介绍」这种指令并照做。 同一道题,四代引擎的差距就是「见过多少、存得下多少、听得懂多少」—— 这里的「存」不是说模型有本翻得开的笔记,而是知识被压缩在那几千亿个权重数字里, 生成时现取现用,并没有一处可以点开的记忆。

5. 作者的判断与证据

  • 证据充分的: 四代演化的技术事实(每代代表模型、能力差异)有对应论文支撑; GPT 系各模型的时间线来自 OpenAI 论文、博客与 API 文档,原书明确说明了史料来源24
  • 作者的转述: 「预训练=压缩世界信息」「预测下一词越准、对文本的理解越深」是 Sutskever 在访谈里的观点,原书以访谈摘录的形式引用,不是可复现的实验结论13
  • 作者的坦白: GPT-3 之后 OpenAI 对技术细节守口如瓶,公开报告只剩评测结果25—— 所以原书写 GPT 系演化时大量依赖「官方只言片语+合理推断」,演化图里实线=有官方依据, 虚线=推测26。读这部分要记得:这是行业考古,不是技术档案。

6. 边界与局限

  • 本章(及原书对应章节)写于 2025 年 1 月27,没有覆盖其后的事: 闭源(只给在线接口用、权重不公开)模型在数学/代码上逼近开源、长上下文价格骤降、 多模态成为标配——这些只能读作「本书之后的进展」。
  • 「大模型」没有精确定义门槛:原书明说,通常指百亿~万亿参数,但也有工作把「数十亿参数+ 海量数据」的模型算进来;本书口径是「大规模参数或大规模数据」28。 顺带说清一对常一起出现的词:开源指模型权重公开、谁都能下载自己跑; 闭源指只给在线接口用、内部不公开——GPT-4 是后者,LLaMA 是前者。
  • 四代表格是能力视角的简化:同一时期不同实验室的模型可能跨代并存, 「代」是事后归纳,不是当年研究者的自觉。

7. 可带走的

  1. 大模型=第四代语言模型,任务没变过(算下一词),变的是引擎与规模;
  2. 两阶段流水线:预训练给能力,后训练给行为,前者烧卡,后者便宜得多;
  3. 预训练模型像「刚毕业的学生」——不是不会,是没上过岗前培训;
  4. GPT 系五阶段:探索→变大→喂代码+人对齐→对话化多模态→想久一点(o 系);
  5. 下一词预测=多任务学习:数据里埋着分类、算术、知识问答的微型任务;
  6. 「大模型」没有硬性参数门槛,只有「显著大于上一代」的相对说法;
  7. GPT-3 之后 OpenAI 技术细节保密,行业史=考古,读到「演化关系」要分清实线虚线;
  8. 训练大模型的胜负手在人的经验,同一配方不同团队能训出不同水平。

8. 原文地图

主题原书章原文位置
四代演化与各代死结1.1 The Development History of Language Modelstext/06-ch01-1-introduction.txt:51(搜「curse of dimensionality」) · text/06-ch01-1-introduction.txt:55(搜「paradigm」) · text/06-ch01-1-introduction.txt:57(搜「emergent abilities」)
词向量与 Transformer 的来历1.1 同上text/06-ch01-1-introduction.txt:53(搜「word embeddings」) · text/06-ch01-1-introduction.txt:55(搜「attention mechanism」)
GPT-1 与 BERT 的对比2.4.1 Early Explorationtext/07-ch02-2-background.txt:181(搜「110M」)
两阶段流水线与毕业生比方2.1 Construction Process of LLMstext/07-ch02-2-background.txt:73(搜「recent graduate」) · text/07-ch02-2-background.txt:75(搜「hundreds of thousands to millions」)
预训练算力门槛与「人才最重要」2.1.1 Pre-trainingtext/07-ch02-2-background.txt:67(搜「hundred GPUs」) · text/07-ch02-2-background.txt:69(搜「talent is the most important」)
GPT-2「无监督=监督」论证2.4.1 Early Explorationtext/07-ch02-2-background.txt:183(搜「global minimum」)
GPT-3 放大百倍与 ICL2.4.2 Scale Expansiontext/07-ch02-2-background.txt:189(搜「more than 100 times」)
Codex 与 GPT-3.52.4.3 Capability Enhancementtext/07-ch02-2-background.txt:195(搜「code-davinci-002」)
ChatGPT/GPT-4/o 系2.4.4-2.4.5text/07-ch02-2-background.txt:205(搜「similar training techniques」) · text/07-ch02-2-background.txt:217(搜「87.5%」)
下一词=多任务学习三例1.2 Capability Characteristicstext/06-ch01-1-introduction.txt:73(搜「multi-task learning」)
压缩世界信息(访谈观点)2.1.1 Pre-trainingtext/07-ch02-2-background.txt:63(搜「compresses world information」)
演化图实线/虚线的口径2.4 Technical Evolutiontext/07-ch02-2-background.txt:173(搜「solid lines」)

Footnotes

  1. 出处:「1.1 The Development History of Language Models」第 51-57 段(text/06-ch01-1-introduction.txt:51,搜「Statistical language model」;text/06-ch01-1-introduction.txt:57,搜「Large language model」)。四代的划分与各代代表模型均出自原书。

  2. 出处:「1.1 The Development History of Language Models」第 53 段(text/06-ch01-1-introduction.txt:53,搜「word embeddings」)。词向量源自 Bengio 等 2003 年的神经语言模型,Word2Vec(2013)是代表实现。

  3. 出处:「1.1 The Development History of Language Models」第 55 段(text/06-ch01-1-introduction.txt:55,搜「attention mechanism」)。原文:Transformer 只用注意力机制构建,可直接建模序列中任意两个 token 的两两关系,并且适合 GPU/TPU 并行。

  4. 出处:「2.4.1 Early Exploration」第 181 段(text/07-ch02-2-background.txt:181,搜「110M」)。GPT=generative pre-training;参数约 1.1 亿,与 BERT-Base 相当,当时未引起轰动。

  5. 出处:「2.4.2 Scale Expansion」第 189 段(text/07-ch02-2-background.txt:189,搜「more than 100 times」)。

  6. 出处:「1.1 The Development History of Language Models」第 57 段(text/06-ch01-1-introduction.txt:57,搜「not present in GPT-2」)。ICL 正式概念在 GPT-3 论文提出。

  7. 出处:「1.1 The Development History of Language Models」第 57 段(text/06-ch01-1-introduction.txt:57,搜「significantly larger」)。

  8. 出处:「2.1 Construction Process of LLMs」第 57 段(text/07-ch02-2-background.txt:57,搜「two main stages」)。

  9. 出处:「2.1.2 Post-training」第 73 段(text/07-ch02-2-background.txt:73,搜「recent graduate」)。

  10. 出处:「2.1.2 Post-training」第 75 段(text/07-ch02-2-background.txt:75,搜「hundreds of thousands to millions」)。原文还指出对话任务数千到数万条高质量样本即可有满意结果。

  11. 出处:「2.1.1 Pre-training」第 67 段(text/07-ch02-2-background.txt:67,搜「hundred GPUs」)。原文:百亿参数级模型通常至少需要一百张 A100 级显卡并行训练数月;千亿参数级需要数千甚至上万张。

  12. 出处:「2.1.2 Post-training」第 75 段(text/07-ch02-2-background.txt:75,搜「eight-GPU」)。

  13. 出处:「2.1.1 Pre-training」第 63 段(text/07-ch02-2-background.txt:63,搜「compresses world information」)。这是原书转述 Sutskever 访谈:大规模预训练把世界信息压缩进模型,使用时再「解压」出来解题。 2

  14. 出处:「2.1.1 Pre-training」第 69 段(text/07-ch02-2-background.txt:69,搜「talent is the most important」)。

  15. 出处:「2.4 Technical Evolution of the GPT Series Models」第 173 段(text/07-ch02-2-background.txt:173,搜「early exploration stage」)。

  16. 出处:「2.4.2 Scale Expansion」第 189 段(text/07-ch02-2-background.txt:189,搜「175B」)。参照物:GPT-2 为 1.5B,百倍放大。

  17. 出处:「2.4.3 Capability Enhancement」第 195 段(text/07-ch02-2-background.txt:195,搜「code-davinci-002」)。原书:官方 API 信息表明,由代码微调版发展来的 GPT-3.5 表明代码训练能大幅提升综合推理能力。

  18. 出处:「2.4.4 Performance Leap」第 207 段(text/07-ch02-2-background.txt:207,搜「6 months」)。GPT-4 上线前做了 6 个月迭代对齐,并把安全奖励信号纳入 RLHF。

  19. 出处:「2.4.5 Test-Time Scaling」第 217 段(text/07-ch02-2-background.txt:217,搜「87.5%」)。参照物:ARC-AGI 是公认的高难度推理基准,此前模型远达不到这个水平。

  20. 出处:「2.4.1 Early Exploration」第 183 段(text/07-ch02-2-background.txt:183,搜「global minimum」)。原文引用 GPT-2 论文:监督目标只是无监督目标在一个子序列上的取值,因此无监督目标的全局最小也是监督目标的全局最小。

  21. 出处:「2.4.3 Capability Enhancement」第 195 段(text/07-ch02-2-background.txt:195,搜「Codex」)。

  22. 出处:「2.4.5 Test-Time Scaling」第 217 段(text/07-ch02-2-background.txt:217,搜「long chain of thought」)。

  23. 出处:「1.2 Capability Characteristics of Large Language Models」第 73 段(text/06-ch01-1-introduction.txt:73,搜「multi-task learning」)。三个例子(情感/算术/知识)均为原文所举。 2

  24. 出处:「2.4 Technical Evolution of the GPT Series Models」第 173 段(text/07-ch02-2-background.txt:173,搜「OpenAI's research papers」)。

  25. 出处:前言第 7 段(text/03-fm-preface.txt:7,搜「tight-lipped」)。

  26. 出处:「2.4 Technical Evolution of the GPT Series Models」第 173 段(text/07-ch02-2-background.txt:173,搜「solid lines」)。

  27. 出处:前言落款(text/03-fm-preface.txt:37,搜「January 2025」)。

  28. 出处:「2.1 Construction Process of LLMs」第 53 段(text/07-ch02-2-background.txt:53,搜「no precise reference standard」)。