跳到主要内容

缩放法则与涌现 — 「做大」怎么从赌博变成工程

这一章讲三件事: 两套缩放法则各说了什么、谁对(GPT-3 当年到底喂没喂够); 缩放法则能预言什么、不能预言什么(它能算损失——模型预测离正确答案差多远的那把尺,越小越好—— 算不出任务成绩); 以及站在公式对面的「涌现能力」——小模型没有、大模型突然会了的三样本事,和围绕它的争议。 主走查: 把书里的配比公式代进 GPT-3 的真实数字,亲手算出「它当年喂差了多少」。

1. KM 缩放法则:把「越大越好」写成公式

先说清这个词。缩放法则(scaling law)是一组量化公式,回答:模型性能随三个量怎么变—— 参数量(参数(模型里那些数字)的个数,记作 N)、数据量(记作 D)、 算力(投入的计算资源,显卡越多越大,记作 C)。 2020 年 OpenAI 的 Kaplan 等人最先给出,原书用两位共同一作 姓氏首字母称之为 KM 缩放法则1。它长得像这样(按原书式 2.1,只看参数那一条):

L(N) = (Nc / N)^0.076

L = 交叉熵损失(模型预测文本的「惊讶程度」,越低越好,单位是 nat)
N = 模型参数量;Nc = 实验定出的常数
另有 L(D)、L(C) 两条同型的式子,指数分别约 0.095、0.050

图说:三个量各自独立地压低损失;哪条指数大,多投入那个量就更划算。

公式的用法是算倍率。指数就是「翻 10 倍时该乘 10 的几次方」: 参数翻 10 倍,损失乘 10 的 −0.076 次方 ≈ 0.84,即下降约 16%; 而数据那条指数更大(0.095),同样翻 10 倍数据损失降约 21%——这两个「约 16%/约 21%」 是按公式算的演示值,不是书里直接给的数,但算法就是上式。 原书强调这组公式来自很宽的实验区间(数据 2200 万230 亿 token,参数 7.68 亿15 亿), 并且发现换架构对这条曲线影响不大2——这让「做大」第一次有了与具体设计无关的普适规律。

KM 法则还有一个值得记住的分解:总损失=不可约损失(语言本身就有的随机性, 谁来都压不下去)+可约损失(模型还不够好导致的,这一部分才能靠加大规模压)3。 这句话是后文「接近极限后还要不要继续做大」争论的根。

2. Chinchilla:参数与数据要配平

2022 年 DeepMind 的 Hoffmann 等人用更宽的实验(参数 7000 万160 亿,数据 50 亿5000 亿 token)重新拟合,得到 Chinchilla 缩放法则4。它与 KM 的差别不在公式形状,在资源分配: 给定一笔算力预算 C(≈6ND,即训练量约等于参数数乘数据量再乘 6), 参数和数据各分多少?原书把两套法则统一写成 C 的指数分配(式 2.5)5:

法则参数指数 a数据指数 b偏好
KM≈0.73≈0.27算力主要拿去堆参数
Chinchilla≈0.46≈0.54两者大致均摊,数据略多

指数的读法:算力翻 10 倍,参数该乘 10 的 a 次方,数据乘 10 的 b 次方。 按 KM,10 倍算力≈参数 ×5.4、数据 ×1.9;按 Chinchilla,≈参数 ×2.9、数据 ×3.5。 同样的钱,KM 让模型「更大」,Chinchilla 让模型「读得更多」。

主走查:GPT-3 当年喂差了多少

书里给了三组真实数字,我们把账算出来(每一步都可验算):

已知(书中原数):
GPT-3:175B 参数,只喂了 300B token → 数据/参数比 ≈ 1.7 : 1
Chinchilla 模型:70B 参数,喂了 1.4T token → 数据/参数比 ≈ 20 : 1
LLaMA-3:8B 参数,喂了 15T token → 数据/参数比 ≈ 1875 : 1

第 ① 步:比比值。GPT-3 的 1.7:1 对 Chinchilla 建议的 20:1,
差了约 12 倍——原书的判语是「远低于该模型的学习容量」[6]。

第 ② 步:按 Chinchilla 配比,175B 参数该喂约 3.5T token(175×20),
实际只喂了 300B——约十二分之一。(这个 3.5T 是我们按 20:1 推的演示值,
书里只给了比值判据,没有直接给这个数。)

第 ③ 步:看后续。LLaMA-3 把 8B 参数喂到 15T token,比值 1875:1,
原书据此说:数据/参数比后来被大幅上修,
「数据超过缩放法则的早期估计」已是行业共识[6]。

走查的结论:GPT-3 不是参数太大,是书读得太少。 「数据喂够」这个今天看显然的道理, 是 2022 年才被 Chinchilla 论文正式写清的。

3. 缩放法则能预言什么、不能预言什么

原书用「可预测训练」一节讲法则的三个实际用途,和两个管不了的盲区6

能干的:

  • 省钱试错:先用小代理模型试数据配比,选中了再放大——GPT-4 报告说这能可靠预测最终性能7;
  • 监控训练:损失曲线偏离法则预期=出事了,能早期发现异常6;
  • 预期管理:法则的指数形式意味着收益递减,而且原书引 OpenAI 的发现—— 即使逼近不可约损失、通用指标不再动,内部表示质量仍在随规模变好8, 所以「损失降不动了」不等于「模型不会再变强」。

管不了的:

  • 法则度量的是下一词预测的损失,不是任务成绩。损失降,任务通常变好, 但不保证——甚至存在 inverse scaling(逆向缩放):参数越大某些任务反而越差9;
  • 原书引 GPT-4 报告的坦白:编码能力这类可以由法则预测,多数任务不行; 而上下文学习这种关键能力「只在特定规模突然出现,法则预测不了」9。 这句话正好接出下一节的主角。

4. 涌现能力:跳变的三张脸与一场争议

涌现能力(emergent abilities)的定义,原书引用原文:小模型没有、大模型出现的能力—— 到了某个规模,任务成绩突然大幅跳过随机水平,像物理学里的相变,而且没有理论解释10。 原书明确表态:本书把「涌现能力」当作大模型的代表性能力来讲,不纠结小模型到底有没有10

三个代表,每个都带规模证据:

能力是什么规模证据
上下文学习prompt 里给几个例子,不训练就会做新任务GPT-3 的 175B 有,GPT-1/GPT-2 没有;且挑任务:13B 会三位数加减,波斯语问答连 175B 都不行11
指令遵循只给指令不给例子也能执行FLAN-PaLM 系列里,62B 及以上才在 BBH(23 个复杂推理任务)上显出强零样本(一个例子都不给,直接做题)推理;小模型靠高质量数据也能会,但只够做摘要类简单任务12
逐步推理把中间步骤写出来再答(思维链)PaLM 62B/540B 用思维链提升明显,8B 无感;提升幅度按任务排序 GSM8K > MAWPS > SVAMP13

注意表里反复出现的模式:没有统一的「临界规模」。原书特别指出, 随着数据质量和数量提升,激发同样能力所需的最小参数量还在持续下降14—— 所以别把「62B 才会思维链」当成自然法则,它是「当时那些模型」的观测值。

争议:跳变是真的,还是尺子画出来的?

这是原书处理得最诚实的一节。有研究认为涌现可能是评测方式的假象15:

  • 常用指标不连续(代码要么过测试要么不过),而且规模采样点稀疏(比如只测 8B/62B/540B 三档);
  • 把指标换成连续的、或把规模点补密,「跳变」可能变平甚至消失。

原书把两边的道理都摆出来,然后给出一个很实用的立场: 争论归争论,用户感受到的性能本来就是「对/不对」式的不连续—— 全过测试的代码,就是比「错得少但没过」的代码有用15。所以涌现作为概念可以吵, 作为产品现象它就在那里。

原书还补了一句:这个现象与机器学习(让计算机从数据里学规律的学科总称, 大模型是其中一支)里的 grokking 有亲缘关系,机制都还没有理论解释16

grokking 说的是:模型训练中突然从死记硬背跳到泛化——没见过的题也会做。

判断(我们的,不是书里的): 「涌现」争议其实是第 15 章(评估)问题的一次预演: 换尺子会改变结论,而选哪把尺子没有中立标准。 读后续各章的实验数字时, 建议默认带上这一章的警惕:一个「跳变」结论,先问规模点够不够密、指标连不连续。 如果错,会错在: 如果后续研究真找到了涌现的理论机制(而不只是度量伪影), 那「先怀疑尺子」的策略会漏掉真实存在的临界现象——目前两边证据都有限。

5. 作者的判断与证据

  • 有数据支撑的: 两条法则的公式与系数、三个能力各自的规模证据(FLAN-PaLM、PaLM 思维链实验), 都有论文出处;GPT-3 喂 300B、Chinchilla 喂 1.4T、LLaMA-3 喂 15T 是可核对的技术报告数字17
  • 作者的转述与归纳: 「人才最重要」「压缩世界信息」这类说法来自访谈(见 01 章); 本章里「数据/参数比持续上修」「最小规模持续下降」是原书对多篇论文趋势的归纳,不是单一实验。
  • 一处原书没有解释的缝隙: 按 Chinchilla 公式的拟合值 α=0.34、β=0.28 算, a=α/(α+β)≈0.55、b≈0.45;而原书正文引用的资源分配指数是 a≈0.46、b≈0.54(引 Chinchilla 论文5)。 两个「Chinchilla」并不严格一致——这是 Chinchilla 论文里不同估计方法的差异,原书没有展开。 我们在主走查里用的是正文引用的 0.46/0.54 那组。

6. 边界与局限

  • 缩放法则都拟合自特定架构、特定数据分布(训练数据里各类文本各占多少的构成)上的实验; 原书说架构影响不大2, 但那是在 Transformer 家族内部比的,Mamba 系等新架构(第 05 章)是否落在同一条曲线上,书里没有数据。
  • Chinchilla 的「20:1」很快被行业越过(LLaMA-3 已到千倍级),它是一个历史节点的最优解,不是永久配方; 原书自己也说多数开源模型尚未到「数据饱和」17
  • 涌现三例全部来自 2022-2023 年的 PaLM/GPT-3 系实验;「小模型+好数据也能会」的修正 (原书 2.3.1 末)意味着这些临界值只降不升,读旧报告里的规模门槛要打折。

7. 可带走的

  1. 缩放法则=性能对参数/数据/算力的幂律(性能随规模按「几次方」的方式涨, 翻固定倍数、成绩涨固定比例);指数就是投资回报率,数据那条(0.095)比参数那条(0.076)更陡;
  2. 总损失=不可约(语言的随机性)+可约(模型的问题)——只有后者能靠变大来压;
  3. GPT-3 的教训:不是太大,是喂太少;Chinchilla 之后行业把数据/参数比从 1.7:1 推到千倍级;
  4. 算力翻 10 倍:KM 分法≈参数×5.4/数据×1.9,Chinchilla 分法≈参数×2.9/数据×3.5;
  5. 法则管损失,不管任务:inverse scaling 存在,ICL 这种关键能力法则预测不了;
  6. 用小代理模型选配比、用法则监控训练异常——这是「可预测训练」的两个立即能用的做法;
  7. 涌现三样:上下文学习、指令遵循、逐步推理;没有统一临界规模,且门槛随数据质量持续下降;
  8. 「涌现可能是评测假象」是有论文的严肃观点;但用户感知本来就不连续,争论不影响产品判断。

8. 原文地图

主题原书章原文位置
KM 公式与三个指数2.2.1 KM Scaling Lawstext/07-ch02-2-background.txt:43(搜「KM Scaling」)
实验区间与架构无关性2.2.1 同上text/07-ch02-2-background.txt:95(搜「22M to 23B」) · text/07-ch02-2-background.txt:97(搜「architecture design」)
不可约/可约损失分解2.2.1 同上text/07-ch02-2-background.txt:99(搜「irreducible」) · text/07-ch02-2-background.txt:103(搜「cannot be reduced」)
Chinchilla 公式与系数2.2.2 Chinchilla Scaling Lawtext/07-ch02-2-background.txt:107(搜「Hoffmann」) · text/07-ch02-2-background.txt:111(搜「406.4」)
KM vs Chinchilla 分配指数2.2.2 同上text/07-ch02-2-background.txt:119(搜「0.46」)
GPT-3 喂少/Chinchilla/LLaMA-32.2.2 同上text/07-ch02-2-background.txt:119(搜「300B tokens」) · text/07-ch02-2-background.txt:119(搜「15T tokens」)
可预测训练与代理模型2.2.3 Discussion on Scaling Lawstext/07-ch02-2-background.txt:127(搜「predictable scaling」) · text/07-ch02-2-background.txt:129(搜「proxy models」)
不可约损失附近表示仍变好2.2.3 同上text/07-ch02-2-background.txt:131(搜「diminishing」)
inverse scaling 与法则盲区2.2.3 同上text/07-ch02-2-background.txt:139(搜「inverse scaling」)
涌现定义与相变类比2.3 Emergent Abilitiestext/07-ch02-2-background.txt:143(搜「do not exist in small models」)
ICL 的规模与任务证据2.3.1 Representative Emergent Abilitiestext/07-ch02-2-background.txt:149(搜「Persian」)
指令遵循 62B 门槛2.3.1 同上text/07-ch02-2-background.txt:151(搜「BBH」)
思维链的规模证据2.3.1 同上text/07-ch02-2-background.txt:153(搜「GSM8K」)
无统一临界规模2.3.1 同上text/07-ch02-2-background.txt:155(搜「critical scale」)
平滑 vs 跳变的矛盾2.3.2 关系与争议text/07-ch02-2-background.txt:159(搜「smooth and predictable」)
mirage 假说与用户立场2.3.2 同上text/07-ch02-2-background.txt:161(搜「artifact」) · text/07-ch02-2-background.txt:161(搜「passing all test cases」)
grokking 关联2.3.2 同上text/07-ch02-2-background.txt:163(搜「grokking」)

Footnotes

  1. 出处:「2.2.1 KM Scaling Laws」第 43 段(text/07-ch02-2-background.txt:43,搜「KM Scaling」)。原论文未命名该法则,原书以两位共同一作(Kaplan、McCandlish)首字母称呼;「nat」是损失单位(原书脚注 1,text/07-ch02-2-background.txt:357,搜「nat」)。

  2. 出处:「2.2.1 KM Scaling Laws」第 95 段(text/07-ch02-2-background.txt:95,搜「22M to 23B」)与第 97 段(text/07-ch02-2-background.txt:97,搜「architecture design」)。 2

  3. 出处:「2.2.1 KM Scaling Laws」第 99-103 段(text/07-ch02-2-background.txt:99,搜「irreducible」)。

  4. 出处:「2.2.2 Chinchilla Scaling Law」第 107 段(text/07-ch02-2-background.txt:107,搜「Hoffmann」);系数 E=1.69、A=406.4、B=410.7、α=0.34、β=0.28 见第 111 段(text/07-ch02-2-background.txt:111,搜「406.4」)。

  5. 出处:「2.2.2 Chinchilla Scaling Law」第 119 段(text/07-ch02-2-background.txt:119,搜「0.46」)。KM 的 a≈0.73、b≈0.27 与 Chinchilla 的 a≈0.46、b≈0.54 均为原书引用的估计值。 2

  6. 出处:「2.2.3 Discussion on Scaling Laws」第 127 段(text/07-ch02-2-background.txt:127,搜「predictable scaling」)与第 131 段(text/07-ch02-2-background.txt:131,搜「diminishing」)。 2

  7. 出处:「2.2.3 Discussion on Scaling Laws」第 129 段(text/07-ch02-2-background.txt:129,搜「proxy models」);GPT-4 的可预测性声明见第 139 段(text/07-ch02-2-background.txt:139,搜「coding proficiency」)。

  8. 出处:「2.2.3 Discussion on Scaling Laws」第 131 段(text/07-ch02-2-background.txt:131,搜「irreducible model loss」)。

  9. 出处:「2.2.3 Discussion on Scaling Laws」第 139 段(text/07-ch02-2-background.txt:139,搜「inverse scaling」;同段搜「only emerge」)。 2

  10. 出处:「2.3 Emergent Abilities」第 143 段(text/07-ch02-2-background.txt:143,搜「do not exist in small models」)。 2

  11. 出处:「2.3.1 Representative Emergent Abilities」第 149 段(text/07-ch02-2-background.txt:149,搜「Persian」)。

  12. 出处:「2.3.1 Representative Emergent Abilities」第 151 段(text/07-ch02-2-background.txt:151,搜「BBH」)。

  13. 出处:「2.3.1 Representative Emergent Abilities」第 153 段(text/07-ch02-2-background.txt:153,搜「GSM8K」)。

  14. 出处:「2.3.1 Representative Emergent Abilities」第 155 段(text/07-ch02-2-background.txt:155,搜「critical scale」)。

  15. 出处:「2.3.2 Relationship Between Emergent Abilities and Scaling Laws」第 161 段(text/07-ch02-2-background.txt:161,搜「artifact」;同段搜「passing all test cases」)。 2

  16. 出处:「2.3.2 Relationship Between Emergent Abilities and Scaling Laws」第 163 段(text/07-ch02-2-background.txt:163,搜「grokking」)。

  17. 出处:「2.2.2 Chinchilla Scaling Law」第 119 段(text/07-ch02-2-background.txt:119,搜「300B tokens」;同段搜「15T tokens」)。「远低于学习容量」对应原文 far below the model's learning capacity;「数据饱和」同段末。 2