一条流水线与一部 GPT 史 — 大模型是什么、怎么造
这一章讲三件事: 「大模型」这个词到底指什么(它是一 路换引擎换出来的第四代); 造一个大模型的两阶段流水线长什么样(为什么先预训练、再后训练); 以及把这一切串起来的 GPT 系列演化史——从 1.1 亿参数走到今天的推理模型。 这一章是全书地图:后面 15 章讲的就是这条流水线的每一站怎么干。
1. 先看四代:每一代都在修上一代的死结
你平时说的「大模型」,在这个行业里有个正式位置:它是语言模型这个词族里的第四代。 语言模型就是「给前面的话,算后面该接什么」的模型——这个本职工作四代没变过, 变的是用什么引擎去算。原书把这条演化线讲成四代1,每一代都是被上一代的死角逼出来的:
先把表里要用的几个词说清。神经网络:一种模仿人脑的计算结构—— 大量简单计算零件互连,靠调整连接强度来学规律,后面每一章都会用到它。
互连的每个零件叫单元(最小的计算零件),零件之间的连接强度就叫权重,是「参数」的一种——学规律,学的就是调这些强度。
表达词的办法也换代了:用向量——一串有含义的数——来代表一个词。
词向量(word embedding)就是干这个的:让「猫」和「狗」这两串数彼此靠近——意思变成了距离,机器才有东西可算2。
Transformer:2017 年谷歌提出的一种神经网络结构,核心是让句中任意两个词直接连线, 不再像旧网络那样一个传一个;它对硬件友好、训练时可以并行(把同一批活拆给多张卡同时干),后来成了所有大模型的地基3。
| 代 | 时期 | 引擎 | 修好了什么 | 留下什么死结 |
|---|---|---|---|---|
| 统计语言模型 | 1990 年代 | 数频率(n-gram:只看前面固定 n 个词) | 让「算下一词」第一次可行 | 词的组合太多,概率表数不过来——维数灾难 |
| 神经语言模型 | 2003 起 | 小神经网络+词向量:把每个词变成一串有含义的数 | 意思相近的词在数轴上靠得近,没见过的组合也能算 | 网络太小,装不下世界知识 |
| 预训练语言模型 | 2018 起 | Transformer(见第 05 章)+海量文本自学习 | 先通读天下文章再干活(预训练+微调范式) | 模型还只有几亿参数,能力没放开 |
| 大语言模型 | 2020 起 | 同样的 Transformer,规模放大千倍 | 一套权重直接解各种任务 | 训练贵、会胡说、机制不明——后面各章的主题 |
1.1 两个时间点
两个时间点值得钉住。2018 年,OpenAI 出了 GPT-1(1.1 亿参数,和同时期谷歌的 BERT(BERT 是谷歌 2018 年出的预训练模型,Base 是它的标准尺寸版)差不多大)。
GPT-1 确立了「Transformer+解码器(只负责往外吐词的那半台机器)+预测下一个词」这条路4; 2020 年,GPT-3 把参数放大到 1750 亿——比 GPT-2 多了一百多倍5——并且展现了一种小模型没有的能力:只看几个例子就能做新任务, 不用重新训练,这叫上下文学习(in-context learning,后面第 12 章细讲)6。 正因为在 BERT、GPT-1 那一代身上看不到这种能力,研究者才专门造了「大语言模型」这个词, 指显著大于那一代的预训练模型7。
判断(我们的,不是书里的): 四代表格里最值得记住的不是年份,是那个反复出现的模式—— 每一代的突破都不是发明了全新的任务,而是找到了一个更能扩规模的引擎。 任务始终是「算下一词」,变的是引擎的吞吐(单位时间能处理多少文本)。 如果错,会错在: 如果后来出现的能力(比如推理)被证明需要新的训练目标才能获得, 「任务不变、引擎变大」这条总结就只适用于前两代——第 14 章会看到,o1 的训练方式确实加了新东西(强化学习),但它优化的仍 是「生成文本」这个动作。
2. 两阶段流水线:预训练打能力,后训练教做人
原书在背景章开篇就给出全书最重要的框架:造一个大模型分两大阶段8。
海量互联网文本 ──→ ① 预训练 ──→ 会续写的「基础模型」──→ ② 后训练 ──→ 会听话的「对话模型」
(自学习:预测下一个词) │ (指令微调+人类对齐)
│ │
学到:语言规律+世界知识 │ 学到:听指令、对齐人类偏好
(还不会「听话 」) (可上线)
图说:两个阶段用的是同一个模型、同一套训练引擎(第 06 章),
差别只在数据和目标——这就是全书 4~8 章的行进路线。
为什么必须分两段? 因为预训练的目标太「窄」了:它只会接着你的话往下写, 不擅长「听懂你要它干什么」。原书打了个比方:预训练完的模型像刚毕业的学生—— 通识课都修过了,但没上过岗前培训,还得按岗位教一遍9。
两个阶段各自的量级差得很远,这组对照值得背下来:
| 预训练 | 后训练(指令微调) | |
|---|---|---|
| 喂什么 | 万亿级 token 的原始文本 | 几十万~百万条问答对;几千到几万条高质量数据就可能够用10 |
| 花什么 | 百亿参数模型≈至少一百张 A100 显卡跑几个月11 | 一台 8 卡 A100 服务器(装着 8 张显卡的专用机器),几天就能给百亿参数模型做完12 |
| 产出 | 语言能力+世界知识(「压缩了世界信息」,OpenAI 前首席科学家 Ilya Sutskever 的说法13) | 会听指令、更符合人类偏好 |
「token」这个词后面每一章都会出现,这里一次说清:token 是模型读写文本的最小单位, 可能是一个词、半个词、或几个字母——第 04 章专讲它怎么切。
原书还有一句容易被忽略但很重的判断:预训练这件事「看起来直白,做起来全是门道」, 真正的差异在人的经验上——「人才是最重要的因素」14。 同一份开源配方,不同团队训出来的模型质量可以差很远,后面 06 章会让你看到这些「门道」具体长什么样。
3. GPT 系五次换挡:一部压缩的行业史
原书用一整节梳理 GPT 系列,并把它划成五个阶段15。这张表是理解全书的时间轴:
| 阶段 | 模型与时间 | 关键动作 | 量化变化 |
|---|---|---|---|
| 早期探索 | GPT-1(2018)、GPT-2(2019) | 确立「解码器+下一词」结构;GPT-2 起试图不微调直接解题 | 参数 1.1 亿 → 15 亿 |
| 规模扩张 | GPT-3(2020) | 参数放大百倍;正式提出上下文学习 | 1750 亿参数16 |
| 能力增强 | Codex(2021)→ GPT-3.5 | 拿代码数据再训练;启动人类对齐(2017 年起的技术积累) | 代码训练明显提升推理能力17 |
| 性能飞跃 | ChatGPT(2022-11)、GPT-4(2023-03) | 对话化;多模态;6 个月安全对齐迭代18 | 通过大量人类考试,被拿来讨论 AGI(通用人工智能——像人一样什么都能学的 AI)还有多远 |
| 测试时扩展 | o1(2024-09)、o3(2024-12) | 响应前先生成内部长思维链,想久一点再答 | o3 在 ARC-AGI 拿 87.5%19 |
三次换挡各说一句。GPT-2 那次,OpenAI 在论文里给「不微调直接解题」给了个理由: 监督任务的无监督版本如果学到位,两者的最优解就是同一个——所以把全世界的文本补全学好了, 具体任务自然就会了20。Codex 那次说明喂什么数据决定了会长出什么能力: 在 GitHub 代码上再训练后,模型的推理能力整体变强,不止会写代码21。 o1 那次换了挡位:以前的模型比拼「答得又快又准」,o1 的输出变成两截—— 先给一段内部长思维链的摘要,再给正式答案;练法是放大强化学习训练, 让模型学会反思、回溯这些动作(第 14 章细讲)22。
判断(我们的,不是书里的): 五次换挡里有两次不是「把模型变大」, 而是「换数据(代码)」和「换训练方式(强化学习)」。这说明「规模扩张」只是主旋律之一, 数据工程(第 04 章)和后训练(第 07、08 章)是与它交替发力的另外两只手。 如果错,会错在: 如果 o1 之后的能力增长又被证明主要靠参数规模, 那「三只手」的说法就高估了后训练的作用——目前公开证据(o1、DeepSeek-R1)都指向训练方式换挡,而非单纯变大。
4. 主走查:同一句话,四代模型各自怎么答
原书解释「预测下一个词为什么是万能任务」时给了三个例子23,我们拿它们当走查的输入。 走查的问题:「预测下一个词」这一件事,凭什么练出了各种解题能力?
输入前缀:「This movie is really good.」(这部电影真好)
预测下一词要答对 → 得先判断这是好评还是差评
⟹ 这一题在偷偷练「情感分类」
输入前缀:「3+4=」
预测下一词是「7」→ 得会算加法
⟹ 这一题在偷偷练「数值计算」
输入前缀:「The capital of China is」
预测下一词是「Beijing」→ 得存着这条世界知识
⟹ 这一题在偷偷练「知识问答」
答案就在这三次预测里:互联网文本里本来就埋着亿万个这样的 「微型任务」, 模型为了把下一个词预测准,被迫把分类、计算、记忆(把知识存进权重里、生成时现取现用的本事)全学了一遍—— 所以原书说下一词预测可以看成一种多任务学习23。 训练没换过目标,是数据自己把任务带进来了。这也解释了两阶段流水线的分工: 预训练阶段,这三个微型任务都在「偷偷练」;后训练阶段,再把它们「叫醒」成听指令的能力(第 07 章)。
顺着这条线再看四代模型答同一句「The capital of China is」的差别: 统计模型要看前面恰好出现过这个搭配多少次——大概率查不到;神经模型能把「首都」「中国」 的词向量算一算,但小网络存不下几百万条这种事实;预训练模型在维基百科上读过一万遍, 答得出;大模型不但答得出,还能听懂「用一句话介绍」这种指令并照做。 同一道题,四代引擎的差距就是「见过多少、存得下多少、听得懂多少」—— 这里的「存」不是说模型有本翻得开的笔记,而是知识被压缩在那几千亿个权重数字里, 生成时现取现用,并没有一处可以点开的记忆。
5. 作者的判断与证据
- 证据充分的: 四代演化的技术事实(每代代表模型、能力差异)有对应论文支撑; GPT 系各模型的时间线来自 OpenAI 论文、博客与 API 文档,原书明确说明了史料来源24。
- 作者的转述: 「预训练=压缩世界信息」「预测下一词越准、对文本的理解越深」是 Sutskever 在访谈里的观点,原书以访谈摘录的形式引用,不是可复现的实验结论13。
- 作者的坦白: GPT-3 之后 OpenAI 对技术细节守口如瓶,公开报告只剩评测结果25—— 所以原书写 GPT 系演化时大量依赖「官方只言片语+合理推断」,演化图里实线=有官方依据, 虚线=推测26。读这部分要记得:这是行业考古,不是技术档案。
6. 边界与局限
- 本章(及原书对应章节)写于 2025 年 1 月27,没有覆盖其后的事: 闭源(只给在线接口用、权重不公开)模型在数学/代码上逼近开源、长上下文价格骤降、 多模态成为标配——这些只能读作「本书之后的进展」。
- 「大模型」没有精确定义门槛:原书明说,通常指百亿~万亿参数,但也 有工作把「数十亿参数+ 海量数据」的模型算进来;本书口径是「大规模参数或大规模数据」28。 顺带说清一对常一起出现的词:开源指模型权重公开、谁都能下载自己跑; 闭源指只给在线接口用、内部不公开——GPT-4 是后者,LLaMA 是前者。
- 四代表格是能力视角的简化:同一时期不同实验室的模型可能跨代并存, 「代」是事后归纳,不是当年研究者的自觉。
7. 可带走的
- 大模型=第四代语言模型,任务没变过(算下一词),变的是引擎与规模;
- 两阶段流水线:预训练给能力,后训练给行为,前者烧卡,后者便宜得多;
- 预训练模型像「刚毕业的学生」——不是不会,是没上过岗前培训;
- GPT 系五阶段:探索→变大→喂代码+人对齐→对话化多模态→想久一点(o 系);
- 下一词预测=多任务学习:数据里埋着分类、算术、知识问答的微型任务;
- 「大模型」没有硬性参数门槛,只有「显著大于上一代」的相对说法;
- GPT-3 之后 OpenAI 技术细节保密,行业史=考古,读到「演化关系」要分清实线虚线;
- 训练大模型的胜负手在人的经验,同一配方不同团队能训出不同水平。
8. 原文地图
| 主题 | 原书章 | 原文位置 |
|---|---|---|
| 四代演化与各代死结 | 1.1 The Development History of Language Models | text/06-ch01-1-introduction.txt:51(搜「curse of dimensionality」) · text/06-ch01-1-introduction.txt:55(搜「paradigm」) · text/06-ch01-1-introduction.txt:57(搜「emergent abilities」) |
| 词向量与 Transformer 的来历 | 1.1 同上 | text/06-ch01-1-introduction.txt:53(搜「word embeddings」) · text/06-ch01-1-introduction.txt:55(搜「attention mechanism」) |
| GPT-1 与 BERT 的对比 | 2.4.1 Early Exploration | text/07-ch02-2-background.txt:181(搜「110M」) |
| 两阶段流水线与毕业生比方 | 2.1 Construction Process of LLMs | text/07-ch02-2-background.txt:73(搜「recent graduate」) · text/07-ch02-2-background.txt:75(搜「hundreds of thousands to millions」) |
| 预训练算力门槛与「人才最重要」 | 2.1.1 Pre-training | text/07-ch02-2-background.txt:67(搜「hundred GPUs」) · text/07-ch02-2-background.txt:69(搜「talent is the most important」) |
| GPT-2「无监督=监督」论证 | 2.4.1 Early Exploration | text/07-ch02-2-background.txt:183(搜「global minimum」) |
| GPT-3 放大百倍与 ICL | 2.4.2 Scale Expansion | text/07-ch02-2-background.txt:189(搜「more than 100 times」) |
| Codex 与 GPT-3.5 | 2.4.3 Capability Enhancement | text/07-ch02-2-background.txt:195(搜「code-davinci-002」) |
| ChatGPT/GPT-4/o 系 | 2.4.4-2.4.5 | text/07-ch02-2-background.txt:205(搜「similar training techniques」) · text/07-ch02-2-background.txt:217(搜「87.5%」) |
| 下一词=多任务学习三例 | 1.2 Capability Characteristics | text/06-ch01-1-introduction.txt:73(搜「multi-task learning」) |
| 压缩世界信息(访谈观点) | 2.1.1 Pre-training | text/07-ch02-2-background.txt:63(搜「compresses world information」) |
| 演化图实线/虚线的口径 | 2.4 Technical Evolution | text/07-ch02-2-background.txt:173(搜「solid lines」) |