跳到主要内容

账本 — 一个大模型到底要多少张显卡、多少电、多少数据

这一章讲三件事: 一个大模型的开销怎么从最基本的运算推算出来; 算出来之后会碰到哪四堵墙;以及另一头的数据账为什么更紧张。 这是全书最值得读的一章,也是唯一一段你能拿计算器自己验一遍的内容。 前三章讲「东西是怎么造出来的」,这一章讲「造它要花多少钱」—— 第 07 章讲这门生意怎么分钱,分的就是这一章算出来的那笔。

1. 先看现象:「算力」在多数文章里是个形容词

你在新闻里见到的算力,通常长这样:「算力惊人」「算力需求爆发」「一万张卡的机房」。

这些句子读完,你还是不知道一个模型到底要多少张卡。

这本书难得地做了一件别人不做的事:它把这笔账从头算了一遍,而且步骤全部公开。 这一节先把结论摆出来,后面几节讲它是怎么来的:

一个 1750 亿参数的模型,训练一次要六千多张顶级显卡跑满一天; 而它上线之后,如果每天有一亿人、每人问答十次,每天要一万三千多张显卡不停地转。1

注意后一个数比前一个大一倍。这就是这一章最重要的一句话。

2. 顶层全景:这笔账是怎么一层层推出来的

机器学习到底在做哪几种运算?
└─ 数一数 → 两条极简算式:训练每字 6×参数量,回答每字 2×参数量
└─ 代入一个具体产品 → 要多少次运算 → 要多少张显卡
└─ 一张不够 → 上千张一起干 → 它们之间传数据反而成了新瓶颈
└─ 这么多机器得有地方放 → 机房 → 风扇吹不动 → 泡液体里降温
└─ 最后卡在电费上

图说:每一层都是被上一层逼出来的。全书的产业判断,底座就是这条链。

书自己给这一章起的副标题是「成本高昂的『暴力美学』」—— 「暴力」两个字用得很准:这条路上没有任何巧劲,全是硬堆。

3. 先把「算力」这个词变成一个数

这一节回答:算力到底怎么量。

书给的定义很干脆:算力就是设备在单位时间内完成计算任务的能力,单位是 FLOPS—— 它是 floating point operations per second 的缩写,意思是「每秒能做多少次运算」2

这里的「运算」准确说叫浮点运算——相当于计算机做一次基本的四则运算(加、减、乘、除)。 书就是这么解释的,不必想复杂。

于是「算力」就有了一个可以比较的数。书还按硬件把它分成三类2:

叫法谁提供干什么用
通用算力CPU(电脑里那颗主处理器)什么都能干,但不擅长「同一件事做上万遍」
智能算力GPU 等专门的 AI 芯片正是大模型要的那种:同时做海量简单运算
超级算力超级计算机科学计算

记住这条对应关系:大模型烧的是第二类。 后面所有的机房、电费、采购,说的都是它。

4. 两条算式:全书最值钱的一段

这一节回答:那两条算式是怎么来的。看懂它,你以后估任何模型的成本都不必求人。

训练在做哪三件事

书从神经网络的训练过程讲起,拆成三步3下面这三步都用大白话重讲一遍:

① 前向传播:把题目从头灌进去,一层一层往前算,最后吐出一个答案
② 反向传播:看答案离标准答案差多远,再从最后一层倒着往回推,
算出每一个数「该往哪个方向挪」
③ 梯度下降:照着上一步算出来的方向,把每一个数挪一丁点

图说:一道题走完这三步,叫训练了一步。要重复几万亿次。

这几个名字第 02 章末尾提过一次,这里一个一个再钉一遍。 先钉最要紧的那个:「该往哪挪」那个方向叫梯度。 它对每一个可调的数各给一个答复——该调大还是调小、大概挪多少。 (「差多远」那个差距叫损失,第 02 章已经讲过。)

倒着往回、把每一个数的梯度都算出来,这个过程叫反向传播。 为什么非得倒着来:最后一层差多远是直接量出来的, 再往前每一层该负多少责任,都得靠它后面那一层推回来。

照着算出来的梯度,把每一个数各挪一丁点,这个动作叫梯度下降。 一步只挪一丁点,所以同一道题要走成千上万遍。

数一数每一步要做多少次运算

书的推导很朴素,核心是一句话:每一个可调的数,都要被乘一次、加一次。

步骤每个参数要做几次运算书的说法
① 往前算2 次(一次乘、一次加)有 N 个参数时要做 N 次乘法、N−1 次加法,N 一大就约等于 2N4
② 倒着推2 次同样是「收到的方向 × 自己这条连线上的数,再求和」,也是 2N5
③ 挪一下2 次每更新一个数要做 2 次运算6

加起来正好 6 次。 于是:

训练:每处理一个字,需要 6 × 参数量 次运算。 上线之后回答问题:每吐一个字,需要 2 × 参数量 次运算。7

为什么回答问题只要 2 次: 因为那时候参数已经定死了,不用再调—— 只走第①步,不走②③。 这是这两条算式之间唯一的差别,也是全部的道理所在。

顺手把两个单位说清楚

  • 参数量的单位: 书里的「175B」就是 1750 亿,B 是 Billion(十亿)8;
  • 字数的单位: 书里一律说「Token」。 它是模型切分文字的最小单位——可能是一个词,也可能只是词的一小截; 中文里大致可以按「一个字」来估。第 07 章讲计费时会再碰到它。

5. 拿它算一道题:书里的那道应用题

这一节把上一节的算式用一遍。你可以拿计算器跟着按。

书设了这样一道题9:

题设数值
模型多大1750 亿参数
训练材料多少3000 亿个 Token
上线后每天多少人用1 亿
每人每天问答几次10 次
每次问答一共多少字2000 个 Token(约 1500 个英文单词)

代进去:

训练一共要做: 6 × 1750 亿 × 3000 亿 ≈ 3.15 × 10²³ 次运算
上线后每天要做: 2 × 1750 亿 × (1 亿 × 10 × 2000) ≈ 7 × 10²³ 次运算

图说:后一个数是前一个的两倍多。而且训练只做一次,回答问题是天天做。

这个数太大了,所以有了「算力当量」

10²³ 这种数看不出感觉,所以书引入了一个更顺手的单位:算力当量10

1 个算力当量(PD)= 一台每秒能做一千万亿次运算的计算机,整整跑一天。

顺便记下这个换算: 一天是 86400 秒,所以 1 PD 就是 86400 × 一千万亿 ≈ 8.64 × 10¹⁹ 次运算。 按这个算,上面那次训练大约相当于 3600 多个算力当量

判断(我们的,不是书里的): 书这里的写法是「1 PD = 86400 PFLOPS」10, 这个等式两边的单位对不上——左边是「一共做了多少次运算」, 右边是「每秒能做多少次」,差着一个「时间」。 正确的写法是 1 PD = 1 PFLOPS × 86400 秒。 这不影响书里的任何结论(它后面的数算得都对),但照抄这行等式会算错。 如果错,会错在: 如果原书表格里其实带了时间单位、只是转成纯文字后丢了, 那这是排版损耗不是作者笔误——但读者拿到的就是这一行,照抄一样会错。

换算成显卡:要买多少张

书接着做了第二道题11:用英伟达 H200 显卡,按 FP16 精度算, 并且假设有效算力比为 0.3

「有效算力比」当场解释,这是全章最实用的一个概念: 厂家标的峰值是实验室里的理想值;真跑起来,数据搬运、等待、同步都会浪费时间, 实际只能发挥出标称值的一小部分。0.3 就是「只发挥三成」。

「FP16 精度」当场解释: 精度指的是每个数用多少位来存。位数越少,存得越粗, 但算得越快、也越省地方。FP16 就是用 16 位来存一个小数,是训练大模型时的常用挡位。

数值
H200 的标称峰值1979 TFLOPS(T 是万亿,即每秒 1979 万亿次)12
打三折之后约每秒 594 万亿次
一张卡跑一天约 5.1 × 10¹⁹ 次运算
训练需要6141 张卡跑一天
上线后每天需要13646 张卡不停地转1

这两个数你现在可以自己验: 拿上一节算出的 3.15 × 10²³ 除以 5.1 × 10¹⁹, 就是 6141;拿 7 × 10²³ 除以同一个数,就是 13646。

补充(不在书里): H200 的这几个数字今天仍可在英伟达官网核对。

FP16 峰值 1979 TFLOPS(英伟达给这一项冠了个词叫「张量」——就是多维的数字表格—— 标成「张量核心」性能);

显存 141 GB——上一代 H100 是 80 GB,涨了三分之二;

每秒能从显存里搬 4.8 TB 数据(这一项行话叫带宽,就是「一秒能搬多少东西」)—— 上一代是 3.35 TB/s,涨了四成;

最大功耗可配置到 700 W——一台家用空调外机大约 1000 W,一张卡就吃掉大半台空调, 而上面那道题要一万三千多张。

来源:NVIDIA H200 产品页 https://www.nvidia.com/en-us/data-center/h200/(查阅于 2026-08-25)

这道题真正的结论

书自己没有把它点破,但它是全书最重要的一条推论:

训练是一次性的,回答问题是天天的。产品越成功,后者越贵。

这条结论直接决定了后面所有的生意判断: 第 05 章说「AI 搜索的成本比传统搜索贵一个数量级」, 第 07 章说「收入会往芯片和机房那一层倾斜」,根子都在这里。

书还引了刘慈欣的一句话来收这一节,措辞很有画面感(迭代就是「一代一代往上做」): 「我们能提供的算力不足以支持人工智能的进一步迭代……我们人类的无能最终成为我们的最后一个障碍。」13

6. 第一堵墙:一张卡不够,而卡与卡之间会互相拖累

这一节回答:为什么「买够卡」不等于「算得动」。

先看现象

一台服务器通常装 8 张显卡14。上面那道题要六千多张,那就是近八百台机器。

于是必须把一个训练任务拆开,分给成百上千台机器一起干—— 这叫分布式并行计算,这一堆机器合起来叫集群; 因为它提供的是给 AI 用的那类算力,所以叫智算集群。

书举了两个真实规模:OpenAI 在微软提供的一万张 V100 显卡的集群上训练 ChatGPT; Meta 用了两个加起来超过 4.9 万张 H100 显卡的集群训练 Llama-314

新问题:它们要不停地互相说话

这是这一节的关键: 机器一多,它们之间来回传数据的时间,反而可能超过计算时间。

书说得很准:除了单张卡的性能,卡与卡之间、机器与机器之间的通信, 决定了集群的性能能不能随着卡数增长而线性提升15

「线性提升」的意思是:卡翻一倍,速度也翻一倍。 做不到线性,加卡就是浪费。

所以互联技术和算力同等重要

先说两个词:带宽就是「一秒能搬多少东西」,延迟就是「搬一趟要等多久」。 训练卡在延迟上的时候更多——因为所有机器必须互相等着对齐。

书在这里报了一串线路的名字。它们之间的差别只有两点:连的是哪一层、快多少。 一条一条来,每条只认一个名字。

  • 一台机器内部的通用插槽总线叫 PCIe,显卡、网卡、硬盘都插在它上面。 正因为通用,它在「显卡之间互传」这件事上偏慢——2024 年的第 5 代是 128 GB/s。

  • 同一台机器里显卡与显卡之间还有一条专用线,英伟达自家的 NVLink。 只干这一件事,所以快得多:2024 年的第五代 1.8 TB/s,是同期 PCIe 5.0 的 14 倍; 再配一颗叫 NVSwitch 的转接芯片,可以把最多 576 张卡连成一片16

  • 机器与机器之间的那套专用网络叫 InfiniBand,要配它专门的网卡和交换机。 延迟极低,是训练集群的默认选择;代价是整套网络设备都得换成它。 英伟达 2019 年花 69 亿美元买下 Mellanox 就是为了拿到它, 2024 年推出带宽 800 Gbit/s 的交换机17

  • 同样连机器与机器,还有一条便宜路子叫 RoCEv2,比 InfiniBand 慢一点, 胜在客户原来的网不必整套拆掉重建17

    它便宜在哪:它跑在一种叫以太网的网上——就是办公楼和机房里最常见的那种网线加交换机, 几乎所有已经建好的网络都是它,不必为了训练模型重铺一遍。

一句话记住上面这四条:线越专用越快,越通用越省钱。 「卡多了不等于快」差的就是这几条线——买了一屋子显卡却配了错的线,它们大半时间在互相等。

云厂商还有第三条路:自己造

亚马逊自研了传输协议 SRD 和网卡 EFA, 把上万台服务器连成超大集群;2023 年的 Trn2 实例可扩展到 10 万张自研训练芯片, 合计 65 EFLOPS(E 是「百亿亿」,见下表)18

这里冒出了第三个数量级前缀,顺手把三个排一排——后面几节要拿它们互相比:

前缀每秒多少次运算拿它量什么
T(万亿)1 万亿一张显卡的量级:H200 标称 1979 T,打三折约 594 T
P(千万亿)1000 万亿,是 T 的一千倍一间机房的量级:书里普查到的智算中心多在 100–300 P
E(百亿亿)100 亿亿,是 P 的一千倍超大集群的量级:上面那 65 E,约等于十一万张打完折的 H200 一起开工

7. 第二堵墙:芯片自己也被卡住了,卡在「取数」上

这一节回答:为什么新一代显卡的算力没涨,却仍然算是升级。

书在这里塞进了一段很有价值的内容,而且是全书为数不多的硬知识19

先看现象

英伟达的 H200 相比上一代 H100,算力峰值一点没变(还是 1979 TFLOPS), 涨的全在「存」这一侧——第 5 节末尾那组对照(显存 80 → 141 GB、带宽 3.35 → 4.8 TB/s) 就是这一节要解释的东西。

为什么厂商愿意只升级「存」这一侧?

原因:计算和存储是分开的

书从一种叫冯·诺依曼的架构讲起——它指的是「算的地方」和「存的地方」分开的那种计算机设计, 今天市面上几乎所有芯片都是这么造的。

分开就意味着:每算一次,都得先把数据从存的地方搬到算的地方。

而这里有一组极其重要的数字: 处理器的性能每年涨约 55%,内存的性能每年只涨约 10%19

处理器越跑越快 ┐
├─→ 差距逐年拉大 ─→ 「算得动但喂不饱」
内存越跑越慢 ──┘

图说:这道差距行话叫「存储墙」。大模型训练要在两边频繁搬数据,所以撞得特别狠。

所以大内存和高带宽成了 AI 芯片的升级重点——这就是 H200 的答案。

一条更激进的路:存算一体

存算一体就是干脆不搬了:让存数据的地方自己会算。

书给的收益很惊人:和冯·诺依曼架构相比,能效比可以提高 2 到 3 个数量级 (也就是一百倍到一千倍),因为搬运数据本身就是耗电大户20

书列了三条实现路线,并给了一条产业进度。那条进度里有两样东西要先立住,一段一样。

先说 HBM——专门配给 AI 芯片用的高速内存(全称 high bandwidth memory,直译「高带宽存储器」)。 普通内存是插在主板上、离处理器有一段距离的一条条; HBM 是贴着处理器封在同一块基板上的一摞,图的就是把上面说的那段搬运路程缩到最短。 H200 那 141 GB 显存用的正是它,HBM4 则是它的新一代规格。

再说 3D 堆叠——把存储芯片一层层竖着叠起来,再整摞直接叠到处理器上面, 而不是像过去那样在平面上摊开、再用线绕过去。 叠的好处只有一条:路更短,同样面积里搬得更多。

于是那条产业进度是:韩国的 SK 海力士(SK hynix,目前 HBM 产量最大的存储厂商之一) 计划把 HBM4 用 3D 堆叠直接叠到处理器上,预计 2026 年量产20

判断(我们的,不是书里的): 这一节是全书技术含量最高的一段, 而它出现在一本产业书里并不奇怪——因为「存储墙」是运营商和机房建设方每天都要面对的现实。 回到第 01 章那条观察:这本书强在它一手接触的领域,弱在它二手转述的领域。 这一节就是「一手」的那一侧。 如果错,会错在: 如果存算一体在若干年后仍然停留在实验室, 那这一节就属于「产业界的一厢情愿」而不是「产业界的一手观察」—— 判据是:有没有量产芯片真的用上了它。

8. 第三堵墙:机器要有地方放,而地方要能散热

这一节回答:为什么大模型逼着机房从吹风改成泡液体。

机房的分类

一堆机器要放进机房,机房里是一排排机架,机架上插着服务器、硬盘、交换机。 按里面主要装什么芯片,机房分成通算中心、智算中心、超算中心三类—— 大模型用的是智算中心21

书给了一份 2023 年 7 月的普查:全国在建和已投运的智算中心共 53 个, 其中京津冀、长三角、粤港澳三地占了 31 个(60%); 34 个由政府主导、19 个由企业主导;七成以上是 100–300 PFLOPS 的小型中心22

一个容易被忽略的约束:训练必须在一个机房里做完

书点出了一件很实在的事:当时机房与机房之间的网络性能,还达不到训练所需—— 所以一次训练必须在单个智算中心内部完成23

这句话解释了「为什么大家都在建超大机房」: 不是为了气派,是因为训练拆不开。 于是算力规模在 1 EFLOPS 以上、行话叫**「E 级」**的中心成了建设重点 (阿里张北 12 EFLOPS,中国电信中部与京津冀各 5 EFLOPS)。 对照第 6 节那张前缀表:1 E 就是一千个 P,而书里普查到的中心七成还停在 100–300 P ——「E 级」是比它们大三到十倍的东西,阿里张北那个 12 E 更在四十倍以上。

而回答问题这一侧正好相反:它可以离用户近一点,所以边缘智算中心的需求在涨。 书给的经验值很好用:光纤每多 100 公里,就多约 1 毫秒的延迟23

然后就撞上了电

这是全章最有冲击力的一组数字24:

说法数值来源
GPT-3 训练一次的耗电吉瓦时级(1 吉瓦时 = 100 万度电)书按 V100 显卡的估算
训练 AI 的能耗 vs 常规云计算3 倍Digital Information World 的报告
ChatGPT 的日耗电可能超过 50 万度,相当于美国家庭平均用电量的 1.7 万倍《纽约客》报道
马斯克 2023 年的预测两年内会从「缺硅」变成「缺电」转述

注意第三行不是作者算的,是媒体报道;第四行是转述的个人预测。 这一章里唯一由作者自己推导出来的数字,是第 5 节那道应用题。

散热为什么必须换方案

书这里的推导很扎实,值得完整记住25:

一台 AI 服务器(以 DGX A100 为例)功率 6.5 kW,是普通服务器的 6~8 倍
└─ 一个机架放 7 台 → 单机架 45.5 kW
└─ 而风冷系统能处理的机架功率上限约 30 kW
└─ 所以:液冷不是选择题,是必答题

图说:这是一条纯粹由物理逼出来的结论,和技术路线偏好无关。

液冷——不用风扇吹,而是让液体流过发热部件(甚至把整块板子泡进特制液体里)把热带走。 液体带走热量的本事比空气强得多。

PUE——机房行业最常用的一个指标——是「整个机房总耗电」除以「其中真正用在计算设备上的电」。 PUE 越接近 1 越好——等于 1 就意味着一度电都没浪费在制冷和照明上。 书给的对照是:风冷通常超过 1.5,液冷可以做到不高于 1.225

剩下两条省电的路

  • 让芯片本身更省:书举的例子是 H100 PCIe 的算力是上一代的 2.5 倍,而功耗都是 300 W26;
  • 用绿电:难点在于风、光发电看天吃饭。书给的解法叫绿电响应—— 不是让电迁就算力,而是让算力迁就电:哪儿有电、什么时候有电,就把计算任务调过去27

最后这条引出了一个更大的构想:算力网络—— 把分散在各地的机房用高速网络连起来统一调度, 让一堆小机房在逻辑上合成一个大机房27

判断(我们的,不是书里的): 「算力网络」这个构想要成立,前提是第 6 节那道坎被跨过去—— 也就是机房之间的网络要好到能承载训练。 而书自己在第 8 节亲口说了当时做不到。 所以这个构想在书里是自相矛盾的:同一章里,前面说训练拆不开,后面说可以逻辑上合成一个大机房。 合理的读法是:算力网络先能用于「回答问题」这一侧,训练那一侧要等网络再进一步。 如果错,会错在: 如果书说的「合成一个大机房」本来就只指回答问题那一侧、 只是没写清楚,那这是表述问题不是矛盾。但书里确实没有区分。

9. 顺带两笔:一体机与量子

这两节在书里各占一小段,这里同样只给一小段。

  • 大模型一体机:把模型、算力、存储、网络打包成一台机器,直接放进客户自己的机房。 解决的不是技术问题,是信任问题——政务、金融这类客户最担心数据外流28第 06 章和第 07 章都会再碰到它:它是「卖软件」之外的另一条卖法。

  • 量子数据中心:书把它列为「后摩尔时代」的出路。 摩尔定律——一条经验规律:芯片上的晶体管数量每 18–24 个月翻一番。 书指出这条规律已经跟不上了,实际约三年才翻一番, 而 AI 的算力需求每年涨 10 倍29

    量子比特——普通的一个比特只能是 0 或 1,它却可以同时处于多种状态, 所以理论上能一次处理多得多的信息30书自己也划了界: 量子计算机的信息极为脆弱,要在零下 272.78 摄氏度运行, 这限制了它大规模商用的可能31

10. 另一头的账:数据

这一节回答:钱够了,数据够不够。

书对这件事的定性是对的:在训练阶段,数据的规模、质量、多样性、代表性, 决定了模型「出厂」时的水平32

数据这一侧有四道工序,而这四道工序里有三道正在往「用模型解决模型的问题」上退:

工序卡在哪书给的解法
① 采集公开的中文语料又少又杂做开源中文数据集
② 标注人工标注又贵又慢改用大模型来标
③ 合成高质量真实数据快用完了让机器造假数据来训机器
④ 临时喂资料模型不知道新知识和专业知识把资料转成一串串数存起来,提问时搜出来拼进提示词

① 采集:中文语料是真的少

书举了一个让人印象深刻的例子:谷歌 2023 年底推出的 Gemini, 用英文问「你是谁」它答「我是谷歌训练的大语言模型」, 用中文问「你是谁」它却答「我是百度文心大模型」33

这不是段子,是证据: 它说明当时能拿到的中文训练材料里, 掺进了大量由别的中文模型生成的文字。

书列的解法是几个开源中文数据集33:

  • 书生·万卷 1.0(上海人工智能实验室):超过 2 TB,含文本、图像、视频三类;
  • MTP(智源研究院):3 亿对中英文;
  • Skypile(昆仑万维):600 GB。

② 标注:这一步已经被模型自己接管了

这是这一节最值得带走的一条。

书给的证据很扎实34:

  • 苏黎世大学把 ChatGPT 和亚马逊众包平台上的人类标注员对比, 五项标注任务里,ChatGPT 有四项的准确率更高;
  • 成本方面,ChatGPT 每条约 0.003 美元,是人工的五分之一;
  • 卡内基梅隆、耶鲁、加州伯克利的团队发现 GPT-4 在所有标注任务上都优于普通标注员, 某些任务上与顶级专家相当;
  • 创业公司 refuel 的工具号称把标注效率提高最多 100 倍,成本降到人工的七分之一。

这里要留意一个词:零样本——就是不给它任何例子、直接让它干。 上面那些对比用的正是零样本下的准确率,这个前提让结果更有分量—— 模型是在完全没被针对性训练的情况下赢的。

判断(我们的,不是书里的): 这一步有一个书没点破的隐患。 用模型来标数据,再用这些数据训下一个模型,等于让模型的偏见自我复制。 回到第 01 章那条「同质化」:基座的缺陷会被下游全部继承—— 而这里,基座的缺陷会被下一代基座继承。 如果错,会错在: 如果标注环节有足够强的人工抽检兜底, 这个自我复制的链条就会被打断——判据是抽检比例和抽检标准,而这两样书里都没有。

③ 合成:因为真数据真的快用完了

书引了一份预测:高质量的语言数据存量预计 2026 年耗尽, 低质量的语言数据和图像数据分别在 2030–2050 年和 2030–2060 年枯竭35

「合成数据」在这里的定义: 由计算机模拟或算法生成的数据, 它不来自真实世界的事件,但在统计上足够像真数据36

书给的两条好处都站得住:生成的同时就带着标注(省掉第②步), 以及绕开了真实数据的隐私问题

补充(不在书里): 书引的那份预测出自 Epoch AI 团队的 《Will we run out of data? Limits of LLM scaling based on human-generated data》, 第一作者 Pablo Villalobos,2022 年 10 月 26 日首次提交。

作者本人在 2024 年 6 月修订了这个结论—— 新版的说法是「模型将在 2026 到 2032 年之间训练到与公开人类文本存量相当的规模」, 比原来那个「2026 年耗尽」宽松得多。

书引用的是老版本,而修订版和本书出版几乎同时。

来源:https://arxiv.org/abs/2211.04325(查阅于 2026-08-25)

④ 临时喂资料:这套做法有个名字,书没给

书把步骤描述得很准确,分四步37:

① 把行业资料、聊天记录之类先存进向量数据库
② 用户提问 → 把问题也变成一串数
③ 在数据库里搜出「意思最接近」的前 N 条
④ 把这 N 条连同原问题一起,当成提示词喂给模型

图说:模型本身一个字没改,改的是每次喂给它的东西。

向量数据库——把每段文字变成一串数、再按「意思接近」来找的那种数据库。 普通数据库只能按字面找(你搜「猫」只能找到含「猫」的条目), 它搜「猫」却能找到讲「猫科动物」的段落。

补充(不在书里):这套做法的正式名字叫检索增强生成,英文缩写 RAG—— retrieval-augmented generation 的首字母。

论文标题里还带着一个缩写:NLP 指的是「让计算机读写人类语言」这门技术。 原始论文题为《Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks》, 第一作者 Patrick Lewis,2020 年 5 月 22 日提交,比这本书早四年

书里把步骤讲对了,但没给名字——读者因此搜不到这四年间的全部后续研究,这是实实在在的损失。

来源:https://arxiv.org/abs/2005.11401(查阅于 2026-08-25)

11. 作者的判断与证据:哪些有依据,哪些是转述

档次这一章里的例子
作者自己推导、可复算6 与 2 那两条算式;那道应用题的两个结果(6141 张、13646 张);风冷 30 kW 撞上机架 45.5 kW 那条推理
有明确依据的事实H200 的标称参数、NVLink 与 PCIe 的带宽对比、英伟达收购 Mellanox 的金额、2023 年 7 月全国 53 个智算中心的普查
转述第三方《纽约客》的日耗电数字、Digital Information World 的 3 倍、Epoch AI 的数据枯竭预测、IDC 与波士顿咨询对量子计算市场的预测、马斯克与刘慈欣的话
作者的判断「算力需求甚至可能成为制约大模型发展的终极因素」13;「液冷系统成为智算中心的必然选择」25

第一档是这本书真正的贡献。 全书 15 万字里,能被读者独立验算的只有这一段。

12. 边界与局限

两处数字硬伤,而且是书自己拆穿自己的

书里的说法为什么站不住
「OpenAI 训练 GPT-3 时使用的数据集规模达到千万级 Token」38同一本书的第 5 节那道应用题,题设写的是「训练数据规模为 3000 亿个 Token」——差了四个数量级。两处不可能同时对
「昆仑万维开源了包含 1500 万个 Token 的 600 GB 高质量数据集 Skypile/Chinese-Web-Text-150B」33数据集名字里的 150B 就是一千五百亿,而句子里写的是「1500 万」;而且 1500 万个 Token 也装不满 600 GB。名字和数字在同一句里打架

判断(我们的,不是书里的): 这两处都属于**「万」和「亿」在中文转述里错位**, 是同一种毛病。它们不影响这一章的推理链条(那条链用的是应用题里的数), 但它提醒你一件事:这本书的数字要分两类看—— 作者自己算出来的那些可以信,转述来的那些必须重核。 如果错,会错在: 如果是排版或转码环节丢了字(比如「千亿」被排成「千万」), 那作者没写错,是出版环节的问题——但读者拿到的就是这个版本。

这一章没覆盖的东西

  • 算式漏掉了随长度增长的那部分开销。 那两条算式只覆盖了「每个参数乘一次加一次」这类运算, 没有覆盖「句子越长、词与词之间要比对的次数涨得越猛」那一块。 句子短的时候影响不大,长文档、长对话时实际成本会明显高于估算——估出来的是下限;
  • 只讲了模型多大,没讲数据要配多少。 这是全书最大的技术缺口,见下;
  • 没有一处失败记录。 没有「某个集群建好了但利用率上不去」这类内容, 而这恰恰是这一行最常见的坑;
  • 没讲怎么省钱。 全章都在讲要花多少,没有一节讲「同样的效果怎么少花」

一处必须补上的缺口:模型和数据要一起放大

这是全书最要紧的一处遗漏,而且当时早就有答案。

书全篇的口径都是「参数越多越强」。但决定成本的是参数量和训练字数的乘积—— 这一点从第 4 节那条算式里就能直接看出来:6 × 参数量 × 字数

补充(不在书里): 2022 年 3 月 29 日,《Training Compute-Optimal Large Language Models》 (第一作者 Jordan Hoffmann)指出:在给定的算力预算下,模型每翻一倍,训练用的字数也该翻一倍。 论文用一个 700 亿参数、但训练材料是原来 4 倍的模型(Chinchilla), 在同样的算力下全面胜过 2800 亿参数的 Gopher

换句话说:当时的大模型普遍「个头太大、读书太少」。 这篇论文比本书早两年,而本书没有一处提到它。

来源:https://arxiv.org/abs/2203.15556(查阅于 2026-08-25)

判断(我们的,不是书里的): 把这条补上之后,第 5 节那道应用题的意义就变了: 它算的不是「一个 1750 亿参数模型该花多少钱」,而是「一个 1750 亿参数、只读了 3000 亿字的模型该花多少钱」。 而按上面那篇论文的口径,1750 亿参数的模型应该读 3.5 万亿字左右——十倍以上。 所以书里那道题的训练成本,是被严重低估的。 如果错,会错在: 如果那道题的题设本来就是照 GPT-3 的真实配置设的 (GPT-3 确实只读了约 3000 亿字),那它作为「复现历史」是准确的, 只是不该被当成「今天该怎么配」的参考。这两种读法书里没有区分。

13. 可带走的

  1. 算力有单位,不是形容词:FLOPS = 每秒能做多少次浮点运算,一次浮点运算约等于一次四则运算;
  2. 两条算式记住就够用:训练每字 6 × 参数量次运算,回答问题每字 2 × 参数量次;
  3. 差别只在于「参数还调不调」——回答问题时参数定死了,所以省掉了倒推和更新那两步;
  4. 上线之后的开销比训练大,而且产品越成功越大——这是全书所有生意判断的底座;
  5. 有效算力比是最实用的一个数:标称峰值只能发挥出一小部分,书里按三成算;
  6. 卡多了不等于快,能不能随卡数线性提速,取决于卡与卡、机器与机器之间的通信;
  7. 芯片的瓶颈已经从「算得慢」变成「喂不饱」:处理器每年涨 55%、内存只涨 10%;
  8. 液冷是被物理逼出来的:单机架 45.5 kW,而风冷上限约 30 kW,没得选;
  9. PUE 越接近 1 越好,风冷通常 >1.5,液冷可到 ≤1.2;
  10. 训练必须在一个机房里做完(当时的网络不够),所以大家都在建超大机房;
  11. 数据的四道工序里有三道在退向「用模型解决模型的问题」——标注用模型标、数据不够用模型造;
  12. 「用模型标数据」意味着偏见会自我复制,书没点破这一点;
  13. 「临时喂资料」这套做法叫检索增强生成(RAG),论文比本书早四年,书没给名字;
  14. 书里有两处「万/亿」错位(GPT-3 的数据量、Skypile 的规模),都是被书自己拆穿的;
  15. 全书最大的缺口:模型个头和训练字数必须一起放大,书通篇只强调个头。

14. 原文地图

主题原书章原文位置
算力的定义与三分类3.1 算力基础设施text/14-ch03-01-3-1.txt:16(搜「单位时间内完成计算任务的能力」)
训练三步:往前算3.1.1 智算集群text/14-ch03-01-3-1.txt:42(搜「前向传播」)
训练三步:倒着推3.1.1text/14-ch03-01-3-1.txt:51(搜「反向传播是将梯度」)
训练三步:挪一下3.1.1text/14-ch03-01-3-1.txt:60(搜「梯度下降」)
两条算式3.1.1text/14-ch03-01-3-1.txt:69(搜「训练阶段算力需求」) · text/14-ch03-01-3-1.txt:72(搜「推理阶段算力需求」)
参数量单位与上下文长度3.1.1text/14-ch03-01-3-1.txt:75(搜「175B」) · text/14-ch03-01-3-1.txt:78(搜「10万个Token」)
那道应用题的题设3.1.1text/14-ch03-01-3-1.txt:84(搜「日活用户为1亿」)
算力当量的定义3.1.1text/14-ch03-01-3-1.txt:90(搜「PFLOPS-Day」)
刘慈欣那句话3.1.1text/14-ch03-01-3-1.txt:98(搜「我们人类的计算能力是有限的」)
显卡换算题与有效算力比3.1.1text/14-ch03-01-3-1.txt:107(搜「有效算力比」) · text/14-ch03-01-3-1.txt:110(搜「1979 TFLOPS」) · text/14-ch03-01-3-1.txt:119(搜「6141张H200 GPU」)
集群、并行、真实规模3.1.1text/14-ch03-01-3-1.txt:122(搜「分布式并行计算」)
通信为什么关键3.1.1text/14-ch03-01-3-1.txt:125(搜「线性扩展」)
NVLink 与 NVSwitch3.1.1text/14-ch03-01-3-1.txt:128(搜「NVLink」)
Mellanox 收购与 RoCE3.1.1text/14-ch03-01-3-1.txt:131(搜「Mellanox」)
亚马逊的 SRD 与 EFA3.1.1text/14-ch03-01-3-1.txt:134(搜「SRD」)
冯·诺依曼架构与存储墙3.1.1text/14-ch03-01-3-1.txt:137(搜「冯·诺依曼架构」)
存算一体3.1.1text/14-ch03-01-3-1.txt:140(搜「存算一体」)
机房的三种分类3.1.2 智算中心text/14-ch03-01-3-1.txt:151(搜「通算中心」)
2023 年智算中心普查3.1.2text/14-ch03-01-3-1.txt:154(搜「在建和已投运的智算中心」)
训练拆不开、边缘与延迟3.1.2text/14-ch03-01-3-1.txt:157(搜「张北超级智算中心」)
能耗那组数字3.1.2text/14-ch03-01-3-1.txt:160(搜「50万千瓦时」) · text/14-ch03-01-3-1.txt:160(搜「缺硅」)
PUE、液冷、机架功率3.1.2text/14-ch03-01-3-1.txt:166(搜「PUE」) · text/14-ch03-01-3-1.txt:168(搜「液冷系统成为智算中心的必然选择」)
芯片能效与绿电响应3.1.2text/14-ch03-01-3-1.txt:171(搜「H100 PCIe」) · text/14-ch03-01-3-1.txt:174(搜「绿电响应」)
大模型一体机3.1.3 大模型一体机text/14-ch03-01-3-1.txt:185(搜「大模型一体机」)
摩尔定律跟不上了3.1.4 量子数据中心text/14-ch03-01-3-1.txt:196(搜「摩尔定律」)
量子比特与九章三号3.1.4text/14-ch03-01-3-1.txt:199(搜「九章三号」)
量子数据中心的进展与限制3.1.4text/14-ch03-01-3-1.txt:202(搜「太湖量子智算中心」)
数据决定上限3.2 数据基础设施text/15-ch03-02-3-2.txt:16(搜「预测每一个词语后续最有可能出现的词语」)
GPT-3/GPT-4 的数据规模3.2.1 数据采集text/15-ch03-02-3-2.txt:27(搜「千万级Token」)
中文语料稀缺与开源数据集3.2.1text/15-ch03-02-3-2.txt:30(搜「书生·万卷」) · text/15-ch03-02-3-2.txt:30(搜「1500万个Token」)
标注被模型接管3.2.2 数据标注text/15-ch03-02-3-2.txt:41(搜「Amazon Mechanical Turk」) · text/15-ch03-02-3-2.txt:41(搜「0.003美元」)
数据枯竭预测3.2.3 数据合成text/15-ch03-02-3-2.txt:52(搜「高质量的语言数据存量预计将在2026年耗尽」)
合成数据的定义与优势3.2.3text/15-ch03-02-3-2.txt:55(搜「合成数据是基于计算机模拟技术」)
巨头在合成数据上的布局3.2.3text/15-ch03-02-3-2.txt:58(搜「AI.Reverie」)
向量数据库四步法3.2.4 向量数据库构建text/15-ch03-02-3-2.txt:72(搜「利用向量数据库增强大模型知识储备大致分4步」)
各家厂商的向量数据库3.2.4text/15-ch03-02-3-2.txt:87(搜「Zilliz」)

Footnotes

  1. 出处:「3.1.1 智算集群」第 119 段(text/14-ch03-01-3-1.txt:119,搜「6141张H200 GPU」)。原文的完整表述是「在训练阶段,我们需要 6141 张 H200 GPU 连续工作 1 天,而在推理阶段,每天则需 13646 张 H200 GPU 连续运行」,并特别注明「这些数字仅是理论值,实际需求往往只会增加不会减少」。 2

  2. 出处:「3.1 算力基础设施」第 16 段(text/14-ch03-01-3-1.txt:16,搜「单位时间内完成计算任务的能力」)。原文对一次浮点运算的解释是「相当于计算机执行一次基本的四则运算(加、减、乘、除)」;三分类也在同一段。 2

  3. 出处:「3.1.1 智算集群」第 36 段(text/14-ch03-01-3-1.txt:36,搜「前向传播」)。注意:原文这三小节里夹着几行由公式下标转码而来的乱码(如「,l1,l-1」),不影响文字部分的可读性。

  4. 出处:「3.1.1」第 42 段(text/14-ch03-01-3-1.txt:42,搜「2N-1次运算」)。原文:「当权重 W 的数量为 N 时,Xi 在前向传播过程中需要完成 N 次乘法和 N-1 次加法,共计 2N-1 次运算。当 N 足够大时,这个运算次数可近似为 2N」。

  5. 出处:「3.1.1」第 51 段(text/14-ch03-01-3-1.txt:51,搜「反向传播是将梯度」)。原文同样给出 2N。

  6. 出处:「3.1.1」第 60 段(text/14-ch03-01-3-1.txt:60,搜「梯度下降过程中每更新一个权重」)。原文:「梯度下降过程中每更新一个权重需要进行 2 次运算」。

  7. 出处:「3.1.1」第 69 段(text/14-ch03-01-3-1.txt:69,搜「训练阶段算力需求」)与第 72 段(text/14-ch03-01-3-1.txt:72,搜「推理阶段算力需求」)。「推理时权重已固定,无须更新,仅涉及前向传播」这句解释见第 63 段(text/14-ch03-01-3-1.txt:63,搜「仅涉及前向传播过程」)。书里管这件事叫「推理阶段」,就是本文说的「上线之后回答问题」——注意它和第 01 章那个「推理」(一步步想出结论)不是一回事,本拆解正文一律用后者的意思,只在引原文时保留「推理阶段」四个字。

  8. 出处:「3.1.1」第 75 段(text/14-ch03-01-3-1.txt:75,搜「175B」)。

  9. 出处:「3.1.1」第 84 段(text/14-ch03-01-3-1.txt:84,搜「日活用户为1亿」)。

  10. 出处:「3.1.1」第 90 段(text/14-ch03-01-3-1.txt:90,搜「PFLOPS-Day」)。原文写作「1 PD=86400 PFLOPS」,这一行的单位不自洽,见正文判断块。 2

  11. 出处:「3.1.1」第 107 段(text/14-ch03-01-3-1.txt:107,搜「有效算力比」)。

  12. 出处:「3.1.1」第 110 段(text/14-ch03-01-3-1.txt:110,搜「1979 TFLOPS」)。

  13. 出处:「3.1.1」第 98 段(text/14-ch03-01-3-1.txt:98,搜「我们人类的计算能力是有限的」)。原文注明这段话摘自刘慈欣 2023 年 4 月在联合国中文日演讲后的问答;同一段里作者自己的判断是「算力需求……甚至可能成为制约大模型发展的终极因素」。 2

  14. 出处:「3.1.1」第 122 段(text/14-ch03-01-3-1.txt:122,搜「分布式并行计算」)。同段给出三种并行方式(数据并行、流水线并行、张量并行)与两个真实集群规模。 2

  15. 出处:「3.1.1」第 125 段(text/14-ch03-01-3-1.txt:125,搜「线性扩展」)。

  16. 出处:「3.1.1」第 128 段(text/14-ch03-01-3-1.txt:128,搜「NVLink」)。

  17. 出处:「3.1.1」第 131 段(text/14-ch03-01-3-1.txt:131,搜「Mellanox」)。原文写明英伟达以 69 亿美元击败出价 60 亿的英特尔和 55 亿的微软。 2

  18. 出处:「3.1.1」第 134 段(text/14-ch03-01-3-1.txt:134,搜「SRD」)。

  19. 出处:「3.1.1」第 137 段(text/14-ch03-01-3-1.txt:137,搜「冯·诺依曼架构」)。原文:「处理器性能每年以约 55% 的速度增长,而内存性能的增长速度仅为 10%」;H200 与 H100 的内存对比也在同一段。 2

  20. 出处:「3.1.1」第 140 段(text/14-ch03-01-3-1.txt:140,搜「存算一体」)。原文列的三堵墙是「存储墙」「带宽墙」「功耗墙」,并给出能效比提高 2~3 个数量级的说法;HBM4 那句在同一段(搜「HBM产业领导者SK」)。补充(不在书里,来自通用知识):书里写的「SK」是简称,完整名字是 SK 海力士(SK hynix),韩国存储芯片厂商;HBM 的全称是 high bandwidth memory。 2

  21. 出处:「3.1.2 智算中心」第 151 段(text/14-ch03-01-3-1.txt:151,搜「通算中心」)。

  22. 出处:「3.1.2」第 154 段(text/14-ch03-01-3-1.txt:154,搜「在建和已投运的智算中心」)。

  23. 出处:「3.1.2」第 157 段(text/14-ch03-01-3-1.txt:157,搜「张北超级智算中心」)。原文:「大模型的训练需在单个智算中心内完成」;光纤延迟那条经验值也在同段(搜「每增加100千米」)。 2

  24. 出处:「3.1.2」第 160 段(text/14-ch03-01-3-1.txt:160,搜「50万千瓦时」)与同段(搜「缺硅」)。GWh 级的估算与 Digital Information World 的 3 倍也在这一段。

  25. 出处:「3.1.2」第 166 段(text/14-ch03-01-3-1.txt:166,搜「PUE」)与第 168 段(text/14-ch03-01-3-1.txt:168,搜「液冷系统成为智算中心的必然选择」)。PUE 的定义原文放在页边注里:「电能利用效率,是数据中心总能耗与 IT 设备能耗的比值」。 2 3

  26. 出处:「3.1.2」第 171 段(text/14-ch03-01-3-1.txt:171,搜「H100 PCIe」)。

  27. 出处:「3.1.2」第 174 段(text/14-ch03-01-3-1.txt:174,搜「绿电响应」)。算力网络与「多个小型智算中心在逻辑上组成一个大型智算中心」的说法也在同段。 2

  28. 出处:「3.1.3 大模型一体机」第 185 段(text/14-ch03-01-3-1.txt:185,搜「大模型一体机」)。书举的例子是科大讯飞与华为的星火一体机,以及中国电信的天翼云慧聚平台——后者是作者所在企业的产品

  29. 出处:「3.1.4 量子数据中心」第 196 段(text/14-ch03-01-3-1.txt:196,搜「摩尔定律」)。

  30. 出处:「3.1.4」第 199 段(text/14-ch03-01-3-1.txt:199,搜「九章三号」)。同段给出 IDC 与波士顿咨询对量子计算市场的多组预测——都是咨询机构的预测,不是已发生的事实

  31. 出处:「3.1.4」第 202 段(text/14-ch03-01-3-1.txt:202,搜「太湖量子智算中心」)。零下 272.78 摄氏度这个限制条件在同段末尾。

  32. 出处:「3.2 数据基础设施」第 16 段(text/15-ch03-02-3-2.txt:16,搜「预测每一个词语后续最有可能出现的词语」)。

  33. 出处:「3.2.1 数据采集」第 30 段(text/15-ch03-02-3-2.txt:30,搜「书生·万卷」)。Gemini 那个例子与 Skypile 数据集的描述也都在这一段(搜「1500万个Token」)。 2 3

  34. 出处:「3.2.2 数据标注」第 41 段(text/15-ch03-02-3-2.txt:41,搜「Amazon Mechanical Turk」)与同段(搜「0.003美元」)。OpenAI 在肯尼亚聘用低成本标注劳动力这一条也在同段开头。

  35. 出处:「3.2.3 数据合成」第 52 段(text/15-ch03-02-3-2.txt:52,搜「高质量的语言数据存量预计将在2026年耗尽」)。

  36. 出处:「3.2.3」第 55 段(text/15-ch03-02-3-2.txt:55,搜「合成数据是基于计算机模拟技术」)。同段还给出 Forrester、Cognilytica、Gartner 三家机构的预测——同样是预测,不是事实。

  37. 出处:「3.2.4 向量数据库构建」第 72 段(text/15-ch03-02-3-2.txt:72,搜「利用向量数据库增强大模型知识储备大致分4步」)。

  38. 出处:「3.2.1」第 27 段(text/15-ch03-02-3-2.txt:27,搜「千万级Token」)。同一段还写 GPT-4 的数据集「达到十万亿级 Token」。与之矛盾的那道应用题题设见「3.1.1」第 84 段(text/14-ch03-01-3-1.txt:84,搜「训练数据规模为3000亿个Token」)。