跳到主要内容

模型是怎么炼成的:数据、架构、规模

这一章讲三件事: 一个基础模型的能力边界是怎么被它的训练数据划定的; 今天所有主流模型共用的那种架构,凭什么赢了; 以及「这个模型多大」这句话背后的三笔账——参数量、数据量、算力。 它在全书的位置:第 01 章说了「模型是别人造好的」,这一章掀开盖子看它是怎么造出来的; 下一章接着讲造出来之后,它怎么被教成「会对话、又为什么会胡说」。

1. 顶层全景:三个决策定生死

作者开门见山:市面上基础模型看着眼花缭乱,它们之间的差异主要来自三组决策——训练数据怎么选、架构与规模怎么定、后训练(模型出厂后的进修课,教它对话和分寸)怎么做1。这一章管前两组,后训练留给第 03 章。

训练数据(第 2 节) → 决定模型「会什么、不会什么」
架构(第 3–7 节) → 决定它「怎么算」——今天几乎只剩 Transformer 一家
规模(第 8–10 节) → 决定它「算得多好、多贵」
│ 三个数:参数量、训练 token 数、FLOPs
│ 一条配比法则:Chinchilla

两个正在逼近的瓶颈:互联网数据、电力

图说:你买模型时看到的「聪明程度差异」,大部分是这三组决策的叠加结果。

顺带交代两个本章要用的词。模型出生时的第一遍训练叫预训练(从一堆随机数开始,把海量文字读一遍);出生后的进修叫后训练(教它对话和分寸,第 03 章细讲)。

烧钱的主力硬件叫 GPU(图形处理器——原本为游戏画面设计的芯片,因为擅长同时做大批同构的计算,成了 AI 的主力硬件)。

2. 训练数据:能力边界是喂出来的

先说一个朴素事实:模型只会它见过的东西。 训练数据里没有越南语,它就不会把英语译成越南语2

那现在的模型都见过什么?大头是 Common Crawl——一个非营利项目,不定期抓取全网网页,2022–2023 年间每月抓 20 亿到 30 亿个页面;谷歌清理过的一个子集叫 C43。问题在于,Common Crawl 里充斥着标题党、假消息和阴谋论——书里的原话是「通俗地说,Common Crawl 中包含了大量的假新闻」4。但因为它免费且量大,GPT-3、Gemini 都用了它的各种变体。

「用现有的数据,而不是理想的数据」带来两个直接后果,都跟你有关。

后果一:语言不平等。 英语在 Common Crawl 里占 45.88%,第二名俄语只有 5.97%5。于是模型在英语任务上明显更强:有人拿 6 道数学竞赛题测 GPT-4,英语做对的次数是亚美尼亚语或波斯语的 3 倍以上,缅甸语和阿姆哈拉语则全军覆没6。更实际的是钱:同一句话,英语只要中位 7 个 token 就能说完,印地语要 32 个,缅甸语要 72 个——如果按 token 计费,说缅甸语的用户说同样的话要付大约 10 倍的钱、等大约 10 倍的时间7

后果二:领域不平等。 药物发现要的蛋白质数据、癌症筛查要的医疗影像,根本不会出现在公开互联网上,通用模型在这些任务上天然不行——于是有了专门的领域模型,比如用约 10 万个已知蛋白质结构训练的 AlphaFold8

怎么衡量一个模型在某领域行不行?业界的做法是考它:基准测试(一张统一的考卷,大家拿同一套题比分数)就是干这个的。书里反复出现的一张考卷叫 MMLU——57 个学科、上万道选择题,后面各章还会多次见面9

既然数据这么重要,是不是把所有数据都喂给一个模型最好?作者给的反例:一个团队只用 70 亿个高质量代码 token,训出一个 13 亿参数的模型,在代码考试里赢了比它大的模型——论文标题就叫「Textbooks Are All You Need」(2023)10数据的质量和配比,第 12 章会展开成一整章。

3. 老架构 seq2seq:一半读、一半写

要理解今天的架构为什么长这样,先看它要治什么病。

2014 年,一个叫 seq2seq 的架构在机器翻译上大放异彩,2016 年谷歌把它装进 Google 翻译,号称「迄今为止机器翻译质量的最大提升」11。这个名字是「从序列(按先后顺序排列的一串 token)到序列」的缩写:读进一串,写出另一串。

它的结构分两半:读输入的那半叫编码器(把输入的话「读懂」)。

写输出的那半叫解码器(把读懂的意思「写出来」)。

4. RNN 的两个病

参数住在哪:神经网络

先补一个承重词。上一章说的「几千亿个参数」,在模型里不是散着放的:它们被排成一层一层的阵列,数据从一层流向下一层——这样的计算结构就叫神经网络(名字借自人脑,但它不是对人脑的复刻)。

seq2seq 的编码器和解码器,用的都是一种特定的神经网络:循环神经网络(RNN,recurrent neural network)——按顺序逐个处理 token,每处理完一个,就把一段压缩过的内容递交给下一步。

RNN:按顺序读的神经网络

RNN 有两个病。第一个病出在训练期。训练要靠一个信号告诉每个参数「该往哪调、调多少」,这个信号叫梯度;信号要穿过很多步,太小会一路衰减到零(等于没指挥),太大会一路放大到失控12

算这个梯度的机制另有名字,叫反向传播:一句话说,就是「这一次答错了多少」的责任,从输出端出发按贡献大小一路追回到各个参数头上。

反向传播追的那个量本身也有名字,叫误差:模型这次的输出和正确答案之间差了多大距离。这两个词第 10 章还会用到,这里记住分工即可。

第二个病更要命,书里用了个漂亮的比方:解码器只看输入最终汇总出的那一点内容来生成输出,相当于只根据一本书的摘要来回答关于这本书的问题。 而且 RNN 必须逐个处理,输入 200 个 token,就得等前一个处理完才能处理下一个——慢是结构性的13

5. 可以翻书的任意一页:Transformer 登场

2017 年,谷歌一篇「Attention Is All You Need」给出了新架构 Transformer:今天几乎所有大语言模型共用的那副骨架(名字当专名记即可)。它把上面两个病一起治了14

它的核心武器,行话叫注意力:允许模型在生成每个输出 token 时回头看所有输入 token,并按重要程度分配关注度——相当于回答问题时可以翻书的任意一页,而不是只有摘要。

这个想法其实 2014 年就被提出过,谷歌 2016 年也在旧架构里用过;Transformer 的功劳是证明了它可以完全甩开 RNN 单干,输入端从此可以并行(一批同时算,而不是排队挨个算)处理15

注意力具体怎么算?书里给了三个角色,都是向量(一串有顺序的数字,比如 [0.11, 0.02, 0.54]——这是机器表达「意思」的基本形式):

  • 查询向量(Q):当前这一步「我在找什么」——相当于那个正在翻书找资料的人;

  • 键向量(K):每个前序 token 的「页码」——告诉别人这一页大概讲什么;

  • 值向量(V):每个前序 token 的「正文」——这一页的实际内容16

拿「页码」和「我在找什么」逐一算点积(两个向量对应位置相乘再相加,得出一个分数——分数越高说明越相关),再按分数高低把各页的「正文」加权掺进当前这一步。分高的多掺,分低的少掺。

书里还给了一组真实尺寸作参照(这是本章的走查数字):Llama 2-7B 的「模型宽度」是 4096,也就是说每个 token 的查询、键、值向量都是 4096 个数;实际计算时会把它们拆成 32 组(每组 128 个数),让 32 个「注意力头」各自去看不同的侧面,最后再拼回来17

这套结构的直接代价:前序 token 每多一个,要存要算的键、值向量就多一份——这就是「长上下文又贵又难」的总根源,第 13 章会专门对付它18

6. 模块里有什么:另一种零件

完整的 Transformer 模型由一个个相同的模块堆起来,每个模块里有两样东西。

一样是上面说的注意力模块。

另一样叫前馈模块(信息只往前流、不回头的几层计算)。

前馈模块内部由两类小变换交替叠成。第一类叫线性:只按固定比例放大缩小,路线不拐弯。只有这一类的堆叠没有意义——几十层连着做,效果等价于一层。

所以必须配上第二类,叫非线性:允许计算拐弯走。前馈模块靠这两类交替,才能学得出复杂的规律19

第二类的具体实现是一个简单函数,行话叫激活函数,而且出人意料地朴素:最常用的一种叫 ReLU,干的活只是把负数变成 0。书里特意指出,研究界曾竞赛般发明复杂的激活函数,结果更复杂的并没有更好——简单、算得快的反而赢了20

7. 模型的身材:四个尺寸

模块堆多少层、每个模块多宽,决定模型多大。先交代一个量度的词:维度就是「向量里有多少个数」——[0.11, 0.02, 0.54] 是 3 维。

四个关键尺寸里最重要的是模型维度:每个 token 的向量有多少个数——Llama 2-7B 是 409621

另外三个尺寸是模块堆多少层、前馈层做多宽,以及词表大小(第 01 章认识的那本「字典」有多厚)。

模型的最前面是嵌入模块(把 token 变成向量,顺便记录它在第几个位置),最后面是输出层——把算完的向量翻译成「词表里每个 token 的可能性」,交给第 03 章讲的采样(按可能性清单挑一个的过程)去挑下一个词22

6. 规模三个数:参数、数据、算力

新闻里「70 亿参数」「1750 亿参数」只是规模的第一个数。这一节把三个数凑齐,这是本章的主走查。

第一个数:参数量——模型的学习能力。 同名后缀就是它:Llama-13B 就是 Llama 家族的 130 亿参数版。参数量还能粗算内存:每个参数用 2 字节(8 个比特;存一个英文字符大约要 1 字节,一个汉字要 2–3 字节)存,70 亿参数就要 14 GB——这是「跑得动吗」的第一道筛子23

但参数量会撒谎,如果模型是稀疏(大部分参数值为零、每次只用一小部分)的。

近年流行的一种稀疏模型叫混合专家(MoE——把参数分成若干组「专家」,每个 token 来了只叫醒其中几个专家干活):Mixtral 8x7B 名义上是 8 个 70 亿参数的专家,去掉共享部分实际 467 亿参数,但每个 token 只激活 2 个专家、约 129 亿参数——所以它的账单和速度都按 129 亿算,能力却沾 467 亿的光24

第二个数:训练 token 数——模型学到的知识量。 参照物:一本书约 6.7 万个 token。Llama 三代分别吃了 1.4 万亿、2 万亿、15 万亿个 token;公开数据集 RedPajama-v2 有 30 万亿个 token,约等于 4.5 亿本书、5400 个维基百科25。注意训练 token 数 ≠ 数据集 token 数:1 万亿 token 的数据完整过两遍,训练 token 数就是 2 万亿——大模型如今通常只完整过一遍26

第三个数:FLOPs——训练成本。 浮点运算就是带小数点的加减乘除。

它的次数缩写叫 FLOPs。GPT-3-175B 训练用了 3.14×10²³ 次——这个数没参照物就没感觉,书里把它翻成了钱27:

任务总量: 3.14×10²³ 次浮点运算
机器: 256 块 H100(目前的主力 AI 芯片)
每块峰值 60×10¹² 次/秒
理想满负荷: 约 7.8 个月
现实: 机器不可能一直满负荷——实际能用上 50% 算不错,
70% 算非常优秀
按 70% 利用率、每块卡每小时 2 美元租金:
训练一次 GPT-3 的账单 ≈ 400 万美元以上

图说:这就是为什么「再训一版」是一个公司级的决策。
(利用率与租金是书里给的 2024 年数字,今天的租金已经更低。)

把三个数放一起记:参数量 = 学习能力,训练 token 数 = 知识量,FLOPs = 成本。 以后看到任何模型发布,先找这三个数28

7. 预算怎么花才值:三个数的配比

三个数之间怎么配比最划算?2022 年 DeepMind 训了 400 个大小不一的模型来找答案,结论叫 Chinchilla 规模法则(在固定算力预算下,模型和数据各该多大):训练 token 数 ≈ 参数量 × 20——30 亿参数的模型配 600 亿个 token;模型翻一倍,数据也要翻一倍29

有意思的是,Llama 的作者们故意没按最优配比来:他们选了比「理论最优」更小的模型——小模型部署便宜、推理省钱,换来的是被更多人用。理论最优和生意最优不是一回事。

另一个省钱的学问是怎么调超参数(由人设定、不由训练学到的旋钮,比如层数、每一批喂进去多少条样本)。

小模型可以反复试,大模型训一次就是 400 万美元,只有一次机会——于是有了「超参数迁移」:在小模型上试好,再搬给大模型。微软和 OpenAI 证明过,从 4000 万参数的模型搬到 67 亿参数是可行的30

超参数里最重要的一个叫学习率(每一步调整参数时迈多大步),它的讲究第 11 章细说。

迁移难做的另一个原因是涌现:有些能力只有模型大到某个门槛才突然出现,小模型上根本观察不到——小模型的试验田未必预告得了大模型的收成31

8. 规模的尽头:数据与电力

模型还能再大几个数量级?书里给了两个正在逼近的天花板。

天花板一:互联网快被读完了。 训练数据集的增长速度远快于人类产生新数据的速度,照这个趋势,公开文本几年内就会被用光。连锁反应已经在发生:Reddit、Stack Overflow 修改条款禁止抓取;到 2024 年,C4 里 45% 的内容已经设限32。于是专有数据(版权书籍、合同、病历)成了新的竞争优势——OpenAI 排队和出版商签数据协议就是这个原因。还有个哭笑不得的插曲:xAI 的模型 Grok 拒绝请求时冒出一句「这违反 OpenAI 的使用政策」——因为网上已经到处是 ChatGPT 的输出,抓网页训出来的新模型,多少都「吃」过前辈的剩饭33

天花板二:电力。 数据中心目前消耗全球 1%–2% 的电,2030 年可能升到 4%–20%;书里算过,照现在的路子,数据中心最多只能再扩 50 倍——不到两个数量级34

9. 作者的判断与证据

  • 数据决定边界是全书反复敲打的主题,本章的证据(语言占比、小语种 token 成本、领域模型)是公开数据,可信度高。
  • 架构替代论:作者认为 Transformer 的地位短期难撼动——它已被深度优化,挑战者必须在「用户在意的规模和硬件」上全面胜出。她引了 OpenAI 联合创始人 Ilya Sutskever 的一个有趣论证:神经网络擅长模拟各种计算机程序,训练就是在可模拟的程序里搜索——新架构想赢,必须能模拟旧架构模拟不了的程序35。Mamba、Jamba 等挑战者(计算量随序列线性增长,而非 Transformer 的平方增长)已有实质进展,作者对此如实记录但没有下注36
  • 逆向规模:并非越大越好。Anthropic 发现:让模型行为符合人类偏好的训练(行话叫对齐)做得过多,反而让模型更「有主见」地输出政治宗教观点;2023 年「逆向规模奖」征集「越大越差」的任务,99 个投稿里 11 个拿了三等奖,但无一在真实任务上复现37

判断(我们的,不是书里的): 「20:1 配比」是 2022 年对「数据便宜、算力贵」这一前提的解。当专有数据开始按授权费计价、推理成本占比越来越大时(第 13 章会说推理已占部署成本的大头),配比会系统性偏向「小模型、多数据」——Llama 的选择正是这个方向的先声。 如果错,会错在: 如果数据合成(第 12 章)让高质量数据重新变得近乎免费,前提恢复,20:1 就仍然是好锚点。

10. 边界与局限

  • 本章只给了「看懂模型」所需的最小解剖课,刻意略过了训练的数学细节(第 10 章会补一部分);想从零造模型,这本书本来就不是教程。
  • 规模数字都是 2024 年快照:租金、利用率、「千亿才算大」的口径都在快速变化,引用前先核对当下价格。
  • 训练数据的不透明在加剧:书里引的构成分析大都来自 GPT-3/C4 时代;新一代模型几乎不公布配方,作者自己也只能「怀疑」而非「知道」38

11. 可带走的

  1. 模型只会它见过的东西——数据里没有的语言和领域,就是它的能力边界;

  2. 小语种用户更贵更慢:同一句话,缅甸语的 token 数是英语的约 10 倍;

  3. Transformer 赢在两件事:能翻书的任意一页(注意力),输入可以并行;

  4. 注意力的三个角色:查询(我在找什么)、键(页码)、值(正文),点积算相关;

  5. 规模三数:参数量(能力)、训练 token 数(知识)、FLOPs(成本)——GPT-3 一次训练约 400 万美元;

  6. 稀疏模型按激活参数算钱:Mixtral 名义 467 亿,账单按 129 亿;

  7. Chinchilla 配比:训练 token ≈ 参数 × 20;但生意上常故意选更小的模型;

  8. 两个天花板:公开互联网数据几年内见底;数据中心最多再扩约 50 倍。

12. 原文地图

主题原书章原文位置
三个设计决策第2章text/09-ch02.txt:30(搜「训练数据、模型架构和规模」)
Common Crawl 与 C4、假新闻第2章text/09-ch02.txt:62(搜「20亿到30亿个网页」) · text/09-ch02.txt:65(搜「假新闻」)
英语占比、小语种表现与 token 成本第2章text/09-ch02.txt:91(搜「45.88%」) · text/09-ch02.txt:132(搜「3倍以上」) · text/09-ch02.txt:156(搜「缅甸语则高达72」)
领域特定模型、AlphaFold第2章text/09-ch02.txt:204(搜「10万个已知蛋白质」)
高质量数据胜过大模型第2章text/09-ch02.txt:80(搜「Textbooks Are All You Need」)
seq2seq 与 RNN 的两个毛病第2章text/09-ch02.txt:243(搜「最大提升」) · text/09-ch02.txt:249(搜「梯度消失」) · text/09-ch02.txt:254(搜「一本书的摘要」)
注意力机制、Q/K/V第2章text/09-ch02.txt:257(搜「任意页面」) · text/09-ch02.txt:298(搜「查询向量」) · text/09-ch02.txt:307(搜「点积」)
多头注意力、Llama 2-7B 尺寸第2章text/09-ch02.txt:333(搜「32个维度为128」)
前馈层、激活函数 ReLU第2章text/09-ch02.txt:354(搜「前馈层」) · text/09-ch02.txt:363(搜「负值变为0」)
模型维度的四个决定量第2章text/09-ch02.txt:387(搜「模型维度」)
参数量与内存、稀疏与 MoE第2章text/09-ch02.txt:501(搜「140亿字节」) · text/09-ch02.txt:513(搜「129亿」)
训练 token 规模、训练轮次第2章text/09-ch02.txt:537(搜「15万亿个token」) · text/09-ch02.txt:554(搜「2万亿个」)
FLOPs、利用率、400 万美元第2章text/09-ch02.txt:587(搜「60 TeraFLOP/s」) · text/09-ch02.txt:601(搜「7.8个月」) · text/09-ch02.txt:613(搜「400万美元」)
Chinchilla 规模法则第2章text/09-ch02.txt:661(搜「400个语言模型」)
超参数迁移、涌现第2章text/09-ch02.txt:712(搜「µTransfer」) · text/09-ch02.txt:718(搜「涌现能力」)
数据瓶颈与电力瓶颈第2章text/09-ch02.txt:764(搜「45%」) · text/09-ch02.txt:767(搜「50倍」)
逆向规模第2章text/09-ch02.txt:634(搜「逆向规模奖」)
Sutskever 的架构替代论证第2章text/09-ch02.txt:426(搜「模拟许多计算机程序」)

Footnotes

  1. 出处:「第2章」第 30 段(text/09-ch02.txt:30,搜「训练数据、模型架构和规模」)。

  2. 出处:「第2章」第 56 段(text/09-ch02.txt:56,搜「越南语」)。

  3. 出处:「第2章」第 62 段(text/09-ch02.txt:62,搜「20亿到30亿个网页」)。C4 即 Colossal Clean Crawled Corpus,出自 Raffel 等 2019。

  4. 出处:「第2章」第 65 段(text/09-ch02.txt:65,搜「假新闻」)。《华盛顿邮报》2023 年的调查显示,数据集中最常见的 1000 个网站里,部分媒体在 NewsGuard 可信度评分中排名垫底。

  5. 出处:「第2章」第 91 段(text/09-ch02.txt:91,搜「45.88%」)。数据来自 Lai 等 2023 对 Common Crawl 的分析。

  6. 出处:「第2章」第 132–133 段(text/09-ch02.txt:132,搜「3倍以上」)。Yennie Jun 用 Project Euler 的 6 道数学题做的测试。

  7. 出处:「第2章」第 156 段(text/09-ch02.txt:156,搜「缅甸语则高达72」)与第 159 段(text/09-ch02.txt:159,搜「10倍」)。测试集是 MASSIVE,100 万条短文本译成 52 种语言。

  8. 出处:「第2章」第 201–204 段(text/09-ch02.txt:204,搜「10万个已知蛋白质」)。

  9. 出处:「第2章」第 118 段(text/09-ch02.txt:118,搜「MMLU基准测试」)。MMLU 全称 Massive Multitask Language Understanding,2020 年提出。

  10. 出处:「第2章」第 80 段(text/09-ch02.txt:80,搜「Textbooks Are All You Need」)。Gunasekar 等,2023。

  11. 出处:「第2章」第 243 段(text/09-ch02.txt:243,搜「最大提升」)。seq2seq 出自 Sutskever 等 2014。

  12. 出处:「第2章」第 249 段(text/09-ch02.txt:249,搜「梯度消失」)。

  13. 出处:「第2章」第 254 段(text/09-ch02.txt:254,搜「一本书的摘要」)。

  14. 出处:「第2章」第 237 段(text/09-ch02.txt:237,搜「Attention Is All You Need」)。Vaswani 等,2017。

  15. 出处:「第2章」第 266–274 段(text/09-ch02.txt:271,搜「早在Transformer论文发表前3年」;text/09-ch02.txt:274,搜「并行处理」)。

  16. 出处:「第2章」第 295–307 段(text/09-ch02.txt:298,搜「查询向量」;text/09-ch02.txt:307,搜「点积」)。

  17. 出处:「第2章」第 330–333 段(text/09-ch02.txt:333,搜「32个维度为128」)。Llama 2-7B 隐藏维度 4096,32 个头,4096/32=128。

  18. 出处:「第2章」第 316 段(text/09-ch02.txt:316,搜「上下文长度如此困难」)。

  19. 出处:「第2章」第 342–354 段(text/09-ch02.txt:354,搜「前馈层」)。

  20. 出处:「第2章」第 357–363 段(text/09-ch02.txt:363,搜「负值变为0」)。GPT-2 用 ReLU,GPT-3 用 GELU。

  21. 出处:「第2章」第 384–408 段(text/09-ch02.txt:387,搜「模型维度」)。

  22. 出处:「第2章」第 372–381 段(text/09-ch02.txt:381,搜「解嵌入层」)。

  23. 出处:「第2章」第 487 段(text/09-ch02.txt:487,搜「Llama-13B」)与第 501 段(text/09-ch02.txt:501,搜「140亿字节」)。

  24. 出处:「第2章」第 507–513 段(text/09-ch02.txt:513,搜「129亿」)。

  25. 出处:「第2章」第 531–546 段(text/09-ch02.txt:537,搜「15万亿个token」;text/09-ch02.txt:546,搜「5400倍」)。一本书 ≈ 5 万词 ≈ 6.7 万 token,见第 540 段。

  26. 出处:「第2章」第 554 段(text/09-ch02.txt:554,搜「2万亿个」)。

  27. 出处:「第2章」第 578–587 段(text/09-ch02.txt:587,搜「60 TeraFLOP/s」)。

  28. 出处:「第2章」第 616–625 段(text/09-ch02.txt:619,搜「参数量」)。

  29. 出处:「第2章」第 660–661 段(text/09-ch02.txt:661,搜「400个语言模型」)。DeepMind「Training Compute-Optimal Large Language Models」,2022。

  30. 出处:「第2章」第 697–712 段(text/09-ch02.txt:712,搜「µTransfer」)。

  31. 出处:「第2章」第 718 段(text/09-ch02.txt:718,搜「涌现能力」)。Wei 等,「Emergent Abilities of Large Language Models」,2022。

  32. 出处:「第2章」第 761 段(text/09-ch02.txt:761,搜「耗尽」)与第 764 段(text/09-ch02.txt:764,搜「45%」)。Longpre 等,「Consent in Crisis」,2024。

  33. 出处:「第2章」第 755 段(text/09-ch02.txt:755,搜「ChatGPT的输出内容」)。

  34. 出处:「第2章」第 767 段(text/09-ch02.txt:767,搜「50倍」)。

  35. 出处:「第2章」第 426 段(text/09-ch02.txt:426,搜「模拟许多计算机程序」)。Sutskever 2023 年在伯克利 Simons 研究所的演讲。

  36. 出处:「第2章」第 455 段(text/09-ch02.txt:455,搜「线性增长」)与第 463 段(text/09-ch02.txt:463,搜「520亿」)。Mamba(Gu 和 Dao,2023);Jamba(Lieber 等,2024),总参 520 亿、激活 120 亿,单块 80 GB GPU 可跑。

  37. 出处:「第2章」第 631–634 段(text/09-ch02.txt:634,搜「逆向规模奖」)。

  38. 出处:「第2章」第 68 段(text/09-ch02.txt:68,搜「我怀疑」)。