跳到主要内容

大语言模型 — 规模定律与三大家族

这一章讲四件事: 「把模型做大」怎么从口号变成一笔可算的账(规模定律); 三个模型家族各按什么路数做事、各自赢在哪;赢下比赛的 decoder-only 一支 是靠哪三个「放大器」一路放大的;以及至今仍在冲击它的架构挑战者。 原书这一章收 41 篇——今天你听过的几乎每个模型名,都在这节里。

1. 这一章讲什么

第 01 章交代了方法的换代:注意力架构赢了,因为它不用压缩历史。 这一章接着回答两个自然追问:赢了之后,力气往哪使?同样的架构,为什么各家做出来差这么多?

先记住一个名字:2017 年那台注意力机器,行话叫 Transformer(变换器;下文说到它,指的就是这台机器)。

列表把这章分成六小节:规模定律(3 篇)、架构总览(1 篇)、三个家族(各一组)、 非 Transformer 挑战者(5 篇)。三台代表机,先混个脸熟: BERT(2018 年,做完形填空的只读模型)。

T5(2019 年,进文本出文本的先读后写模型)。

GPT(2018 年起、只管接下去的那一族,今天所有对话模型的祖先)。

读它的诀窍是先抓住「三大家族」这个分类本身—— 差别只在「读入一个词时,允许它看哪些位置」:

家族每个词允许看什么擅长代表
Encoder-only(只读)前后都看理解:分类、检索BERT
Encoder-Decoder(先读后写)读入时前后看,生成时只看已生成部分翻译、摘要这类「进文本出文本」T5
Decoder-only(只写)只看它左边的词接着写,什么任务都能装成「续写」GPT

这张表是全章的地图。下面先讲定方向的规模定律,再逐个家族走。

2. 顶层全景:一笔账,一场赛马,三个放大器

规模定律(2020–2023) 「力气往哪使」变成三篇论文可算的账


2017 年一篇架构论文 ──开枝──> Encoder-only(BERT 家族)── 定格在「理解」
│ └───> Encoder-Decoder(T5 家族)── 先行试验了「指令」


Decoder-only(GPT 家族)连拿三个放大器:
① 规模(GPT-3) ② 指令+人类反馈(InstructGPT→ChatGPT→GPT-4) ③ 开放复刻(LLaMA 系)


挑战者(状态空间/RWKV)—— 冲的正是注意力「两两都看、成本平方涨」的账单

图说:这是原书这章的小节顺序,也是因果顺序:账先算清,架构才敢放大;
赢家定型后,挑战者才有明确的靶子。

本章主走查占两步: §3 走那笔账(一笔固定计算量怎么分), §6 走 decoder-only 主线(同一台机器怎么被三个放大器逐级放大)。

3. 核心原理(上):规模定律——把「做大」变成一笔可算的账

3.1 Kaplan 2020:第一次把账摆上台面

列表把三篇论文排成一条线,第一篇是 2020 年的规模定律1。 它做的事说穿了很朴素:造一组大小不同的模型,逐个测性能,把「模型多大、数据多少、 算力(能用的计算量)多少」和「最后错多少」的关系拟成曲线。

结果三条曲线都呈幂律 (把「大多少倍」压成「多走几格」的刻度后,关系是一条直线——量级每上一格,效果按固定比例提升)。

这条曲线的实用价值是能外推:造不起 100 倍大的模型,也能算出它大概有多好。 「大力出奇迹」从此有了预算表。

3.2 Chinchilla 2022:发现账一直记错了

走查主步来了。假设你有一笔固定的算力预算(演示口径:100 份),要换成「多大的模型 + 多少的训练数据」。两篇论文给的分法完全不同:

Kaplan(2020)的记法: 模型 90 份 / 数据 10 份 —— 优先把模型做大
Chinchilla(2022)的记法: 模型 50 份 / 数据 50 份 —— 两边平分才划算

图说:两个百分比为演示编的,用来说明分法差异;两篇论文给出的是连续曲线,不是整数配比。

2022 年那篇2用同一套方法重测,结论是:当时的巨型模型普遍「字喂得不够」—— 同样预算下,缩小模型、多喂数据,性能反而更好。它按新配比造的那个 70 亿参数模型 (补充(不在书里,来自通用知识):对照当时的旗舰 GPT-3 是 1750 亿参数, Chinchilla 参数只有它的二十五分之一,性能反超),成了后来各家训练新模型的默认配方。

这一步在走查里的位置: 它解释了为什么 2023 年之后新发布的模型,参数个数普遍收敛 (不再一味加大)、训练数据量普遍暴涨——不是行业谦虚了,是账重算过了。

3.3 PaLM 2:照新配方办事的样板

第三篇3是 2023 年的技术报告,列表把它收进这一节的意思是:它公开了按 「算力换数据」新思路配平后的实际效果,是这一节「理论 → 落地」的收口。

4. 核心原理(中):一篇开山之作与两个「完形填空」家族

4.1 架构总览:只有一篇,但有讲究

「架构概览」一节只收 2017 年那篇《注意力就是你所需要的一切》4——全列表唯一 「一个主题一篇」的小节。

第 01 章说过,注意力让每个词直接给全体前文打分取用信息;这篇论文的贡献是把 「打分、取用、多层堆叠」组装成一台能成规模、反复复制生产的机器。

我们书架里有它最简实现(GPT-2 复刻)的源码拆解,可对照看机器内部实际是哪几个 零件(补充(不在书里,依据我们的 frontier 书架):依据: shelf=ai-frontier-reference/nanogpt#01-model.md 事实=该拆解逐块讲了一个 GPT-2 复刻的 注意力、前馈、残差与归一化的实现)。

4.2 Encoder-only:做完形填空的一族

第一个家族的代表是 2018 年的 BERT5——名字展开是「双向编码器(Encoder: 负责把输入读成内部表示的那半台机器)表示」。 它的训练法是完形填空:遮住句子里 15% 的词(演示比例,下同), 让模型看着左右两头猜中间。

因为每个词两头都能看,它天生适合「理解」类任务——判断情感、挑出相关段落。

后面三篇全是修训练配方

^6
证明「喂更多、遮更狠」就能再涨; ALBERT6 用参数共享把体积砍小;ELECTRA7 干脆换掉完形填空——改成「找出句子里 被偷换过的词」,学得更快更省。

判断(我们的,不是书里的): BERT 家族今天仍活在所有检索系统的第一线—— 搜索、RAG(第 06 章专讲的开卷考式做法)里给段落算意思向量(把一段话的意思变成一串数,意思近的段落、数也近)的,多半是它或它的后代。 如果错,会错在: 如果新造的专用模型全面替代了 BERT 系, 这条判断就只剩历史价值——但替换品用的仍是同一「两头看」的读法。

4.3 Encoder-Decoder:进文本、出文本的一族

第二个家族的代表是 T58,它的贡献不在结构而在口径:把所有任务统一成 「进一段文本、出一段文本」——翻译是「译成英文:……」,分类是「情感:……」。 同一节里的 BART9 反着来,靠「把文本弄脏再复原」训练,专攻生成。

这一族还先行试验了一件大事:T010 和 FLAN11 把几十上百个任务各写成一句指令, 混在一起训练,发现模型能零样本(没见过这个任务的例子)听懂新指令。

——这套指令微调(用写明任务的例子继续训练模型)的手法, 最先是在这一族上验证的。它埋的伏笔在第 6 步兑现:GPT-3 用别的方式撞到了同一扇门。

5. 核心原理(下):decoder-only 一族——三个放大器

5.1 放大器一:规模(GPT-1 → GPT-2 → GPT-3)

这一族从 2018 年的 GPT-112 起步,训练目标只有一个:接下去。 GPT-213 把规模抬了一个量级,发现不用专门训练就能做好一些任务;

GPT-314 再抬两个量级(1750 亿参数;对照:上一代 GPT-2 是 15 亿, 两年涨了一百多倍——补充(不在书里,来自通用知识)),并且撞出了那条大新闻: 只需在输入里给几个例子,它就能模仿着做新任务。 这就是第 03 章的主角——上下文学习(给几个例子、现场学新任务)。

5.2 放大器二:指令与人类反馈(InstructGPT → ChatGPT → GPT-4)

GPT-3 会续写,不听话。2022 年的 InstructGPT15 补上这一课,分三步。

第一步,示范:拿人写好的「指令 + 示范回答」继续训它——这步叫监督微调(拿示范对接着训练)。

第二步,打分:让人对模型的多个回答排好坏,训出一个奖励模型(给回答自动打分的模仿者)。

第三步,调向:用它打的分继续调大模型,让回答往人喜欢的那头挪。这套流程的缩写是 RLHF(拿人类反馈当训练信号)。

族谱:RLHF 属于强化学习(拿奖励信号反复试错来调参的门类);书架里那个极简复刻,就是把这个门类删到最简的样子。(第 04 章那条「学得少忘得少」的冷水是监督微调对比研究,不属这个门类,别混。)

后面两篇是放大结果

^17
是同一条流程做成产品;GPT-416 是规模与这套流程 叠满后的技术报告。走查至此:「接下去」这台机器,被指令和人类反馈改造成了「听指令的助手」 ——你今天用的所有对话产品的原型都在这三条里。

我们书架里有这套训后流程的源码级拆解可对照:一个从零复刻项目把它跑通(补充(不在书里, 依据我们的 frontier 书架):依据: shelf=ai-frontier-reference/nanochat#03-post-training.md 事实=该章的 SFT 用任务混合与 对话排版教 base 模型聊天,RL 是删掉信任域的一步极简策略梯度,作者自称读起来就是 REINFORCE)。

偏好这条线后来还有简化:DPO(不训奖励模型,直接拿「人更爱哪个回答」这样的答案对来调), 书架也有拆解(依据: shelf=ai-frontier-reference/trl#03-dpo.md 事实=TRL 的 DPO 用 两个打分的比值当隐式奖励,把整条线缩成一次监督式训练)。

5.3 放大器三:开放复刻(LLaMA → Alpaca/Vicuna → 生态)

2023 年 2 月,Meta 开源(公开权重——就是训练得到的那几十亿个参数——与代码, 允许自用与再发布)LLaMA17: 体积小一个量级、性能逼近旗舰。随后两个月内:

  • Alpaca18:拿 GPT-3.5 自造 5.2 万条指令数据(自造演示数;实数见原论文), 用 600 美元算力(演示量级,示意「便宜」)复刻出「听指令」能力;
  • Vicuna19:改用真实对话微调,宣称达到 GPT-4 九成的对话质量;
  • Llama 220、Llama 321:官方续作,把「开放模型」抬到旗舰水平。

先记一个后面要反复出现的名字:LoRA(给模型配一个可插拔的小补丁,只训补丁、 不训本体——第 04 章的主角)。这一节收的 QLoRA——把压短数字的存放格式配上 LoRA——让消费级显卡也能微调 650 亿参数的模型22;另有 Code Llama23 (代码分叉)。 这一步的走查意义:三个放大器至此齐了——普通实验室也能按公开配方造自己的模型。

再往后是一批「小团队套壳」条目:法律助手 LawGPT24、算术特训 Goat25, 以及两个多模态(能同时处理图像与文字)分叉 LLaVA26、MiniGPT-427—— 它们共同演示了「基座 + 少量微调 = 垂直产品」这个配方的普及。

5.4 走查收口:同一台机器的三级放大

GPT-3:「接下去」的机器,给例子能模仿 ← 规模
│ + 指令与人类反馈

InstructGPT/ChatGPT:听指令、合口味的助手 ← 对齐
│ + 开放权重与复刻配方

LLaMA/Alpaca 系:每家都能拥有的助手 ← 复刻

图说:三个放大器是串联的,缺任何一级都没有今天的行业格局。

6. 核心原理(补):非 Transformer 挑战者

列表最后收了五篇「架构挑战者」。它们冲的是同一笔账:注意力要求每个词和所有前文 两两打分,序列(排队处理的一串词)长度翻倍、计算量翻四倍(平方复杂度:长度 n 个词 要算 n×n 次配对,n 翻倍则次数翻四倍——演示口径)。两条主要解法:

  • 状态空间(拿着一份固定更新规则的记忆,一个词一个词往前滚)一线

    ^30
    用它处理序列,后继 Mamba28 让这份记忆规则随内容变化——该记的记、该忘的忘(和第 01 章 LSTM 的门控思想遥相呼应)。

    它处理长序列的成本只随长度按比例涨(线性——不是平方)——这也是所有挑战者共同的卖点。

  • RWKV 一线29:把注意力的好处嫁接回循环网络的形状,作答时只带一份滚动状态;

  • TTT30 则更激进:把「隐状态」本身做成一个小模型,作答时现场学习。

判断(我们的,不是书里的): 截至 2024 年中,挑战者尚未撼动主流—— 主流生态(工具链、配套芯片、人才)都在注意力这一侧,新架构要先证明「不只是省计算, 还能做注意力做不到的事」才可能换道。 如果错,会错在: 如果超长输入的需求(百万词级)成为主流应用形态, 平方账单变成硬约束,换道可能比判断的更快。

7. 编者的判断与证据

  • 规模定律独立成节、放在全章最前:方向先于架构——这是排布上的明确判断;
  • encoder-decoder 一节收了 FLAN 而三个家族里只有它收「指令」主题:说明编者把 「指令微调的起源」记在这一族名下;
  • decoder-only 一节收了 21 条,占本章过半:版面即结论;
  • 挑战者一节收至 2024 年的 TTT:说明这一线在当时仍被当作「进行时」而非「故纸堆」。

8. 边界与局限

局限说明
条目重复与误标GPT-4o 的博客链接挂了两条「GPT-4 technical report」名下(text/01-full.txt:227(搜「Gpt-4 technical report」)、:230(搜「gpt-4o」));Llama 2 那节简介里的条目作者串行(挂成了别论文的作者,见第 05 章边界一节的同类问题)
没收训练工程数据怎么洗、多机多卡怎么排、硬件账怎么省——这些「怎么真的训出来」的论文一概不收,列表只管模型与范式
挑战者只收到 2024 年中之后 Mamba 系的后续改版、混合架构不在列表里
三家族的「胜负」没写列表不评论 decoder-only 为何胜出;我们补的三个放大器是来自书外通识的整理,不是编者原话

9. 可带走的

  1. 「大力出奇迹」有预算表:规模定律把「多大模型、多少数据」和最终性能拟成幂律曲线,可外推;
  2. 2022 年的账目修正(模型与数据平分算力)解释了此后新模型「参数收敛、数据暴涨」的集体转向;
  3. 三大家族的差别只有一句话:读入时允许看哪里——两头看(理解)、先读后写(翻译摘要)、只看左边(续写);
  4. BERT 家族是今天检索系统的劳模:给段落算「意思向量」的多数是它的后代;
  5. 「指令微调」最先在 T5 一族验证,GPT-3 一族用规模撞到同一扇门,两条线在 InstructGPT 汇合;
  6. RLHF 三步:人写示范 → 人排好坏训奖励模型 → 用奖励模型继续调;
  7. 开源复刻(Alpaca 用几万美元级成本复刻「听指令」)把行业从「只有巨头能玩」变成「人人可造」;
  8. 挑战者架构冲的是注意力的平方账单,长上下文是它们的入场券。

10. 原文地图

主题原书节原文位置
规模定律三篇大数据+大模型→新智能text/01-full.txt:142(搜「Scaling laws」) · text/01-full.txt:145(搜「Compute-Optimal」) · text/01-full.txt:148(搜「PaLM 2」)
开山之作大语言模型架构概览text/01-full.txt:155(搜「Attention is all you need」)
Encoder-only 五篇基于 Encoder-only 架构的大语言模型text/01-full.txt:165(搜「Pre-training of Deep Bidirectional」) · text/01-full.txt:168(搜「Robustly Optimized」) · text/01-full.txt:171(搜「A Lite BERT」) · text/01-full.txt:174(搜「Discriminators Rather Than Generators」)
Encoder-Decoder 六篇基于 Encoder-Decoder 架构的大语言模型text/01-full.txt:181(搜「Unified Text-to-Text」) · text/01-full.txt:184(搜「Multitask Prompted Training」) · text/01-full.txt:193(搜「Denoising sequence-to-sequence」) · text/01-full.txt:190(搜「Scaling Instruction-Finetuned」)
Decoder-only 主线基于 Decoder-only 架构的大语言模型text/01-full.txt:203(搜「generative pre-training」) · text/01-full.txt:206(搜「unsupervised multitask」) · text/01-full.txt:209(搜「few-shot learners」) · text/01-full.txt:218(搜「follow instructions with human feedback」) · text/01-full.txt:221(搜「Introducing chatgpt」) · text/01-full.txt:225(搜「gpt-4-research」)
开放复刻基于 Decoder-only 架构的大语言模型text/01-full.txt:233(搜「LLaMA: Open and Efficient」) · text/01-full.txt:242(搜「Alpaca」) · text/01-full.txt:245(搜「Vicuna」) · text/01-full.txt:236(搜「Open Foundation and Fine-Tuned」) · text/01-full.txt:248(搜「QLoRA」)
挑战者非 Transformer 架构text/01-full.txt:270(搜「structured state spaces」) · text/01-full.txt:279(搜「Selective State Spaces」) · text/01-full.txt:276(搜「Reinventing RNNs」) · text/01-full.txt:282(搜「Learn at Test Time」)

Footnotes

  1. 出处:「大数据+大模型→新智能」第 142 段(text/01-full.txt:142,搜「Scaling laws」)。Kaplan 等人,OpenAI,2020。

  2. 出处:「大数据+大模型→新智能」第 145 段(text/01-full.txt:145,搜「Compute-Optimal」)。即 Chinchilla 论文,Hoffmann 等人,DeepMind,2022。「70 亿参数」这个数:补充(不在书里,来自通用知识)——Chinchilla 用 70B 参数对约 1.4 万亿词元训练,对照对象 Gopher 是 280B。

  3. 出处:「大数据+大模型→新智能」第 148 段(text/01-full.txt:148,搜「PaLM 2」)。

  4. 出处:「大语言模型架构概览」第 155 段(text/01-full.txt:155,搜「Attention is all you need」)。Vaswani 等人,NeurIPS 2017。

  5. 出处:「基于 Encoder-only 架构的大语言模型」第 165 段(text/01-full.txt:165,搜「Pre-training of Deep Bidirectional」)。BERT 的「15% 遮盖比例」:补充(不在书里,来自通用知识),出自原论文的遮盖语言建模设定。

  6. 出处:「基于 Encoder-only 架构的大语言模型」第 171 段(text/01-full.txt:171,搜「A Lite BERT」)。

  7. 出处:「基于 Encoder-only 架构的大语言模型」第 174 段(text/01-full.txt:174,搜「Discriminators Rather Than Generators」)。

  8. 出处:「基于 Encoder-Decoder 架构的大语言模型」第 181 段(text/01-full.txt:181,搜「Unified Text-to-Text」)。

  9. 出处:「基于 Encoder-Decoder 架构的大语言模型」第 193 段(text/01-full.txt:193,搜「Denoising sequence-to-sequence」)。

  10. 出处:「基于 Encoder-Decoder 架构的大语言模型」第 184 段(text/01-full.txt:184,搜「Multitask Prompted Training」)。即 T0。

  11. 出处:「基于 Encoder-Decoder 架构的大语言模型」第 190 段(text/01-full.txt:190,搜「Scaling Instruction-Finetuned」)。即 FLAN 系列(原始 FLAN 论文另收在参数高效微调一节,text/01-full.txt:514,搜「zero-shot learners」)。

  12. 出处:「基于 Decoder-only 架构的大语言模型」第 203 段(text/01-full.txt:203,搜「generative pre-training」)。GPT-1,2018。

  13. 出处:「基于 Decoder-only 架构的大语言模型」第 206 段(text/01-full.txt:206,搜「unsupervised multitask」)。GPT-2,2019。

  14. 出处:「基于 Decoder-only 架构的大语言模型」第 209 段(text/01-full.txt:209,搜「few-shot learners」)。GPT-3,2020;参数量对照为通用知识。

  15. 出处:「基于 Decoder-only 架构的大语言模型」第 218 段(text/01-full.txt:218,搜「follow instructions with human feedback」)。InstructGPT,2022。

  16. 出处:「基于 Decoder-only 架构的大语言模型」第 225 段(text/01-full.txt:225,搜「gpt-4-research」)。

  17. 出处:「基于 Decoder-only 架构的大语言模型」第 233 段(text/01-full.txt:233,搜「LLaMA: Open and Efficient」)。2023 年 2 月。

  18. 出处:「基于 Decoder-only 架构的大语言模型」第 242 段(text/01-full.txt:242,搜「Alpaca」)。斯坦福,2023 年 3 月。

  19. 出处:「基于 Decoder-only 架构的大语言模型」第 245 段(text/01-full.txt:245,搜「Vicuna」)。LMSYS,2023 年 3 月;「九成质量」是原博客标题里的宣称,且带着星号脚注,非严格评测结论。

  20. 出处:「基于 Decoder-only 架构的大语言模型」第 236 段(text/01-full.txt:236,搜「Open Foundation and Fine-Tuned」)。

  21. 出处:「基于 Decoder-only 架构的大语言模型」第 239 段(text/01-full.txt:239,搜「most capable openly available」)。Llama 3,2024。

  22. 出处:「基于 Decoder-only 架构的大语言模型」第 248 段(text/01-full.txt:248,搜「QLoRA」)。详见我们第 04 章的低秩一族。

  23. 出处:「基于 Decoder-only 架构的大语言模型」第 251 段(text/01-full.txt:251,搜「Code Llama」)。

  24. 出处:「基于 Decoder-only 架构的大语言模型」第 254 段(text/01-full.txt:254,搜「LawGPT」)。

  25. 出处:「基于 Decoder-only 架构的大语言模型」第 257 段(text/01-full.txt:257,搜「Goat」)。

  26. 出处:「基于 Decoder-only 架构的大语言模型」第 260 段(text/01-full.txt:260,搜「Visual instruction tuning」)。即 LLaVA。

  27. 出处:「基于 Decoder-only 架构的大语言模型」第 263 段(text/01-full.txt:263,搜「MiniGPT-4」)。

  28. 出处:「非 Transformer 架构」第 279 段(text/01-full.txt:279,搜「Selective State Spaces」)。Mamba,2023。

  29. 出处:「非 Transformer 架构」第 276 段(text/01-full.txt:276,搜「Reinventing RNNs」)。

  30. 出处:「非 Transformer 架构」第 282 段(text/01-full.txt:282,搜「Learn at Test Time」)。