跳到主要内容

钢与硅,以及训练系统

这一章讲三件事: 一颗 GPU(显卡——做并行数值计算的芯片)到底是什么——为什么它是「一小块极快的存储 + 一大块较慢的存储」贴在一起; 一个上千张卡的训练任务是怎么被切开来铺上去的,以及为什么切法由通信带宽决定; 还有三条越过了纯技术的约束——机器每天都会坏、数据中心的第一个变量是电、芯片已经开始跟着地缘政治走。

它在全书链条里的位置:第 05 章末尾那笔「预训练要花多少算力」的账,在这一章变成真实的机器和时间; 第 03、04 章那些架构改造,也要在这里接受「扩得动吗」的检验。下一章转到模型的下半场——把它伺候给用户用的推断系统。

顶层全景:一条从芯片到国家的放大链

§1 一颗 H100:两级存储(小而快的片上 SRAM + 大而慢的显存 HBM)
│ §2 芯片江湖:六七个流派押不同的注

§3 四级组装:节点(8 卡) → 机柜 → 机房 → 数据中心
│ §4 两种「说话」:节点内 900 GB/s vs 节点间 50 GB/s —— 约 20 倍差距

§5 三种切法:数据并行 / 张量并行 / 流水线并行 —— 切法听带宽的

┌────┴─────────┬──────────────┐
§6 不改数学 §7 显存怎么省 §8 故障是常态
FlashAttention 重算·分片·融合 每 3 小时中断一次(Llama 3 实测)
└────┬─────────┴──────────────┘

§9 训练平台:配方、调度、数据通路 —— 组织的是研究节奏

§10–§12 越出技术的三道墙:电与水(物理)、能源合约(资本)、出口管制(政治)

§13 同样的卡榨出不一样的算力:DeepSeek 的答案

§14 账本挪向推断 + 摩尔定律减速后的六条突围路

图说: 这一章的名词又多又碎,但骨架是一条放大链——芯片、节点、机柜、机房、数据中心、国家棋局, 每一级都有自己新的瓶颈冒出来。压轴的 §13 是全书那条主线的系统版:算法与工程叠在一起,能换算力。

1. 一颗 H100 是什么

具体看一颗芯片,前面章节的抽象数字才会落地。H100 是 NVIDIA 在 2022 年推出的旗舰 AI 芯片, 下面以最常见的 SXM5 80GB 形态为准1。把它翻过来看一圈,关键的数就这几个:

部件数字参照物
制程4 纳米一根头发丝直径约 8 万纳米,晶体管小到肉眼根本看不见2
晶体管约 800 亿个相当于地球人口 10 倍的微型开关,塞在几平方厘米的裸片里3
运算单元约 1.7 万个 CUDA 核 + 500 多个 Tensor 核Tensor 核是专门为矩阵乘法设计的电路——而大模型主要就是在算矩阵乘法4
显存(芯片上的高速存储)80GB 的 HBM(High Bandwidth Memory,即「高带宽存储」——多层芯片堆出来的高速显存)三代产品,带宽 3.35TB/s既装得多,也喂得快:每秒能把一座中等图书馆的藏书倒进运算单元嘴里5
功耗700 瓦满载时相当于一台小型电烤箱或电暖器一档的功率6
价格分析师估计落在数万美元区间NVIDIA 不公布官方单价;这个数是采购规模浮动很大的估计值7

这里要立起本章最重要的一个观念:这块芯片内部有两级存储。 一级是大而慢的显存(上面那张表里的 80GB HBM3,HBM 的意思是「高带宽存储」, 做法是把好几层记忆芯片垂直堆在一起换带宽)8; 另一级是小而快、紧挨着运算单元的片上存储(寄存器和 SRAM),容量只有几十 MB 上下, 但离得近、跑得飞快。第 02 章说过程序卡脖子的两种病:算不动,和搬不过来。 对 GPU 来说,搬不过来往往更要命——计算单元再快,数据躺在显存里送不到手上,电门开着也只能干等9。 后面 §6 的那个著名优化,完全就是在这两级存储之间做文章。

顺带看清这一代的走向。H100 之后,2024 年的 B200 把两颗芯片裸片用芯粒(chiplet, 把一颗大芯片拆成几颗小的分别制造、再封装在一起)拼成一颗逻辑 GPU, 显存从 80GB 跳到约 180GB;再往后是 GB200 NVL72——一个液冷(用冷却液带走热量,比风冷高效)机柜塞下 72 颗 GPU 和 36 颗 CPU, 机柜功耗到了百千瓦级、重量以吨计,普通机房已经放不下10。 书里由此给出一个结构性判断:下一代 AI 算力的采购和部署单位,正在从一颗 GPU 扩展到一座液冷机柜11

2. 芯片江湖的几大派别

以为芯片故事只有一个主角,是因为只看了 leaderboard。书里按目标分成三大类至少六派, 各自押不同的注12:

派别代表押的是什么软肋
通用旗舰NVIDIA H100/B200生态:研究者的 PyTorch 代码几乎不改就能跑贵,且供不应求
同代第二选择AMD MI300X(192GB 显存,同代领先)显存容量、价格敏感客户ROCm 软件生态追了十几年仍不及 CUDA 成熟
自研Google TPU(已迭代到第七代)、亚马逊 Trainium、Meta MTIA供应链自主,服务自家搜索/Gemini 等业务一般不单独卖,别人用不上
国产华为昇腾、寒武纪、海光等2022 年出口管制之后被迫加速的一条线前沿性能、互联、HBM 供应仍有差距
推断新势力Groq LPU、Cerebras 晶圆级巨芯(单芯片数万亿晶体管)赌未来推断需求远超训练,谁做得又快又便宜谁赢适用范围窄
端侧Apple M4、高通骁龙 X Elite让手机笔记本本地跑得动 7B–13B 的模型只做小模型

六派之后还有一批更激进的 ASIC(为单一工作负载量身定做的专用电路)创业公司, 比如专为 Transformer(第 03 章那个统一底座的正式名字)推断而生的 Etched Sohu、走开源路线的 Tenstorrent。 书里把它们这场赌局说得很直白:这是一场押注架构稳定性的对赌—— Transformer 范式延续多久,专用硬件就有多少红利;期间架构一旦剧变,投资就可能打水漂, 而专用芯片从设计到流片要数年,这两个时间尺度天然打架13

一张书里给的对照锚点:H100 的低精度格式算力约 1979 万亿次/秒(计稀疏口径),这和衡量答案质量的评测分数毫无关系, MI300X 约 1300 TFLOPS(TFLOPS 即每秒千万亿次浮点运算),TPU v5p 约 459 TFLOPS——但书里紧接着警告: 单看 TFLOPS 下结论很容易踩坑,2024–2026 年真正改变部署可行性的,往往是显存那一栏的跃迁 (80GB→180GB、3.35TB/s→8TB/s),因为它直接决定单卡能装多大的 KV 缓存和模型分片14。 这句话请带走,第 10 章讲并发时会看到它的后果。

3. 从一块卡到一座工厂

一颗 H100 再强,也只是单兵。训练今天的前沿模型,要把上万张卡组织成有纪律的部队。 书里给的四级分层是这样的15:

层级里头有什么参照物
节点一台主机(装在同一个机箱里的多卡机器),NVIDIA 标配 8 颗 H100 用 NVLink 高速互联整机数十万美元量级,AI 任务算力接近过去许多小型超算
机柜几台到十几台节点,共享供电散热网络高约 2 米、几百公斤;装满 GPU 加液冷的整柜级系统可达数百万美元
机房上百到几千个机柜,机房专用高速网络或通用局域网的高端款互联机房内 GPU 间通信延迟必须小到微秒级,否则就是干等
数据中心多机房 + 电力 + 冷却 + 网络出口占地几公顷,大型的一座部署几万甚至更多高端 GPU

从第三级开始,事情的性质变了:显卡的供应商对比变成了基础设施的设计题。 到第四级,书里的话是——集群(成千上万张卡连成的整体)已经长成一座专业工厂16

4. 两种「说话」:一道 20 倍的带宽鸿沟

到了上万张卡的规模,决定训练速度的常常不是单卡算力,而是卡之间的通信效率—— 每一步训练都要把刚算出的梯度同步给所有相关 GPU,同步得慢,全体一起等17。 书里打了个足够准的比方:节点内的几颗 GPU 像「同一栋楼里走楼梯」,微秒级到达; 节点间的主机互相传话,则要走楼与楼之间的通道,慢得多18

具体数字摆在一把尺子上,差距一目了然19:

  • 节点内:NVLink 4,每颗 H100 双向 900 GB/s——约为通用 PCIe——主板与插卡之间走数据的标准通道——第 5 代的 128 GB/s 的近 7 倍;
  • 节点间:机房专用高速网络(NDR 档)单口 400 Gb/s ≈ 50 GB/s(靠 RDMA——让网卡不打扰 CPU 直接读写显存的技术);
  • 差多少:书里的结论是节点内对节点的带宽差通常在约 20 倍量级, 外层网络老旧时差距还会拉大到近 40 倍20

这 20 倍不是冷知识,它直接写死了后面所有切法的排布。 配套的技术暗战也值得知道名字:NVIDIA 2020 年收购了 InfiniBand(即上面说的机房专用高速网络)的主要供应商 Mellanox, 把芯片、网络、软件一起握进手里;业界则反过来用通用局域网技术组建 AI 集群(名为 Ultra Ethernet 的联盟在推) 试图降低对这个生态的依赖21。最新的战场甚至挪到了光:把光电转换直接封装进交换芯片(CPO), 缩短光与计算芯片的距离——瓶颈又一次从计算挪向了搬运22

5. 三种切法:把模型铺上千张卡

现在正面回答那个问题:一个模型怎么放进一千张各 80GB 显存的卡? 书里给的答案是三种切开方式组合使用,并且特意强调它们不是互斥选项23:

数据并行——每张卡放一份完整模型,喂不同的数据,各自算梯度,最后把梯度取平均同步一遍。 最简单常用,横向扩吞吐,但前提是单卡还装得下整个模型24

按矩阵切分的并行(行话叫张量并行:张量就是矩阵——模型里那层数值排成的大表)——单卡装不下时,把同一层里的大矩阵拆到几张卡上共同算。 Transformer 里每层的注意力投影和前馈都是巨大的矩阵乘法,按行或按列劈开就行; 这是 Megatron-LM 的代表性思路25。代价:每层算完都得通信汇总,频率极高。

流水线并行——把不同层分给不同的卡,数据像流水线一样一段段传过去。 麻烦在于起步和收尾时有「气泡」:第一段算完了,下一段的数据还在路上,一部分卡空转; 缓解办法是把每批数据切成很多小块连续填进去26

MoE(把一层拆成多个「专家」小网络、每次只用几个)之后还有第四种:专家并行,不同专家分布在不同设备上,路由结果决定词元送去哪算。 于是训练不再是「多卡干同样的活」,而是一种多层次分工:有的按数据分、有的按矩阵分、有的按层分、有的按专家分27

为什么切法必须听 §4 那道鸿沟的? 书里给了一张训练工程师反复用的通信成本速查表, 列在这里(记不住没关系,记结论):数据并行只在每步结束时同步一次,最容易跨节点; 张量并行每层内部要通信两次,单层结果巨大,频率极高;流水线并行传的是层间激活,中等频率但要防气泡; 分片式的 ZeRO/FSDP 则要在每层计算前后临时汇集和归还参数28。 所以工程铁律是——通信最重的张量并行只能留在节点内 900 GB/s 的 NVLink 上; 流水线和数据并行通信稀疏一些,才有资格跨节点走 50 GB/s 的 InfiniBand29

一张书的原文配置可以直接背下来:一个 1750 亿参数的模型用 1024 张 A100 训练, 典型切法是张量并行 = 8、流水线并行 = 16、数据并行 = 8,也就是「8 × 16 × 8」: 张量并行通信最重,放在同机;流水线其次,跨节点;数据并行只在每步末尾碰头,放最外层30。 本章末尾的主走查就用这套配置。

切片分的最后一层是省显存本身:普通数据并行最大的浪费是每张卡都存一份完整的参数、梯度和优化器状态 (就是第 05 章算过的那笔 16 字节 × 参数量的账)。微软 DeepSpeed 的 ZeRO 把这些状态在数据并行维度上逐级切碎: 一级只切优化器状态,二级连梯度一起切,三级连参数也切——用的时候临时取过来、用完释放, 换来显存大降、通信显著上涨;PyTorch 后来内置的 FSDP 就是三级思路的官方实现,已是开源界的事实标准之一31

6. 不改数学,只改计算顺序

这是第 04 章欠下的债,现在有了两级存储的概念,可以还得干净利落。

问题回忆一下:标准注意力要先算一张 N × N 的分数表(第 03 章那米字格), softmax(把分数压成一组加起来为 1 的权重)完再做加权。问题不在算,而在那张中间矩阵必须完整写到显存里再读回来—— 序列越长它越大,显存峰值高、来回搬运慢,两头吃亏。

FlashAttention 的做法朴素得惊人:把「算分数、归一化、加权混合」这三步融成一个整体执行, 中间结果不写回显存,直接留在离运算单元最近的片上存储里用完即弃32。 效果:中间结果的显存占用从 O(N²) 掉到 O(N),速度反而更快——因为省掉的正是最贵的「搬运」33

注意它的边界,也是书里特别值得学的地方:它在数学上一个字都没改, 输出的仍是标准注意力的精确结果,只是换了数据的摆放和搬运顺序。 这印证了第 04 章预告的那句话——效率有时不来自更聪明的算法,而来自更懂硬件的实现。 §7 还有一整族这种「抠出来」的优化,道理相同。

7. 显存怎么省

模型真占地方的不光是参数:前向留下的激活值、中间缓存、梯度、优化器状态都在抢显存, 而且训练期的压力往往比使用期更大,因为反向传播要回头用中间结果34。 除了 §5 的切片和分片,书里点名了几样标准武器,各自的账目如下:

手段怎么省代价
混合精度训练大多数计算用低精度格式完成,敏感的状态保持高精度需要在数值稳定性上小心看护;原理第 05 章 §10 已讲透
梯度检查点(激活重计算)只保留少数「关键」层的激活(比如每 4 层存一份),反向传播要用时重新算一遍典型省 50% 以上显存,多付约 33% 计算——典型的「时间换空间」,显存紧、算力够时几乎一定要开35
状态分片即 §5 末尾的 ZeRO/FSDP,把三大件切散到多张卡通信变多
融合算子把大量「计算量小、读写显存多」的小操作(归一化、弯折函数、加法)合并成一个核函数,中间结果不出片上工程量大;单项看着琐碎,合起来是几十个百分点的吞吐差别36

这一节还有一个容易被漏掉的工程判断,书里说得很好:不是所有省显存的招都值得开到最大—— 重计算费算力、分片费通信、极致压缩还会让调试和恢复变难; 好的训练系统按模型规模、网络条件和实验目标组合着来, 把每项优化都开到最大,反而未必划算37。优化的目标服从整体的效率和稳定性,不是单项刻度的军备竞赛。

8. 故障是常态

以为训练就是「跑起来等着收敛」的人,该看看这本书给出的实测统计。 Meta 公开的 Llama 3 405B 训练日志:最多动用了约 1.6 万张 H100, 在一个 54 天的训练期里发生了 466 次中断,其中 419 次是非计划的—— 按非计划中断折算,平均约每 3 小时一次。 最常见的原因包括 GPU 本身故障、显存问题、软件 bug、交换机和线缆、主机维护38。 这个故障率并不意外:一万张卡、一万根线缆、几万个风扇, 任何一个零件每天有万分之一的概率坏,加起来就是每天都有几次39。 另外 Meta 的 OPT-175B 日志里也记下了几十次主动回滚——发现数据有问题就退回去重来一段40

所以现代训练的核心工程问题是:怎么让训练在故障中不被打断。 答案是检查点,但它比「定时存盘」严格得多——要保证参数、优化器状态、随机数状态、 数据读到哪了这四样能够完全一致地恢复41。 恢复能力强的系统,失败损失几个小时;弱的,损失一整轮(一整遍)实验窗口。 书里由此提出一个冷峻的观察:成本高到一定程度之后,能不能优雅失败本身就会影响研究节奏和团队产出42—— 这就是第 05 章许诺过的那句「实验室 8 张卡跑通」和「工业级反复跑通」之间的真实距离: 差的不是算法,是这一整套扛故障的本事。本书在第 09 章 §8 兑现这句许诺,特此记账。

9. 训练平台:组织的不只是算力,是研究节奏

上一节解决「一次能跑通」,这一节是「团队怎么能反复、稳定、可复现地训」——前者考验账本,后者考验平台43

配方( recipe):学习率怎么定、预热多长、批次怎么涨、几股数据按什么比例混、什么时候切换阶段—— 单看每个都是超参数,组合起来决定成败。规模一大,局部选择会被放大: 一个小模型上无伤大雅的学习率,大规模训练可能带来长期震荡44。 成熟团队会把配方当成可记录、可复用、可比较的系统配置,而不是某个工程师脑子里的手感。

实验分层:训练太贵,不可能每次改动都全量跑。 哪些问题在小规模短步数上就能验趋势,哪些必须放大才能看出真实效果,要有纪律地分开; 否则团队很容易在一次昂贵实验里同时改太多变量,花了算力也不知道哪个起了作用45

集群调度:同样一套集群,为什么有时永远不够用、有时明明空着却凑不出一组拓扑合适的大作业? 书里点破:大作业要求固定数量且互联位置讲究的卡,粗粒度的「有空卡就分」会把高性能互联切成碎片, 大作业长期排队、小作业频繁打断,表面利用率不低,适合关键训练的有效容量却不断下降46。 所以成熟平台要懂拓扑感知调度、优先级和抢占策略。

数据通路:数据真正进卡之前要经历读取、解压、清洗、分片、打乱、切词元、打包、分发一整条链, 任何一环跟不上,卡就在等数据。长短不一的文本胡乱组批会产生大量填充浪费, 所以样本打包本身就是系统设计的一部分:长度分桶、拼接、动态批、按比例混采47

回到那个代表案例 Megatron-LM:它的重要性不只是某种并行做得快, 而是回答了「多种并行能不能组合着做、还做得稳定高效」。书里的总结句值得抄下来: 今天人们提到 Megatron,指的往往不是一个代码仓库,而是一种大模型训练的工业组织方式48。 最后是那句反直觉的收束:高效训练从来不等于「把卡喂满」, 它意味着固定预算下让更多有效实验发生、让结果可复现、让团队更快从想法走到验证49 ——系统能力甚至会反过来塑造研究范式:平台适合什么样的实验节奏,研究者就往哪个方向组织试错50

10. 数据中心的物理学

集群大了以后,卡脖子的是物理:电、水、土地、政策四个变量,算法反而退居其次, 选址本质上是把这四个变量同时优化51

电是第一变量。 一座十万卡级别的数据中心功率常被估计在百兆瓦量级——相当于一座中等城市的用电; 披露中的星际之门计划总规模说到最高 10 吉瓦级别,得分阶段建,和电网扩容、土地审批一起推进。 「再买一批 GPU 就够了」在这个量级上不再成立52

水是第二变量,因为算力等于热量:一颗 H100 发 700 瓦热,十万颗就是 70 兆瓦, 需要相应规模的冷却系统,于是风冷让位给液冷甚至浸没式冷却。 微软做过一个极端实验:把整个数据中心舱体沉进苏格兰附近海底,靠海水自然冷却, 结果故障率比陆地还低53

土地和政策是第三、第四变量。 美国的 AI 数据中心扎堆在得克萨斯、爱荷华、北卡罗来纳、弗吉尼亚 ——电价低、地便宜、税收优惠多。中国的对策是一个叫「东数西算」的国家工程: 把东部产生的算力需求,用专网送到内蒙古、贵州、宁夏、甘肃这些清洁能源充足的西部枢纽去算—— 逻辑很直白,把电费贵的地方算力需求,搬到电费便宜的地方做54

11. 能源账本与核能回潮

先给直觉尺度(以下均为书里给出的估算口径,闭源前沿模型的训练账本并未公开): 训练一次前沿模型约几千万度电——按 5000 万度作数量级参照,约等于五千户美国家庭一整年的用电, 或一架波音 747 跨美国大陆往返三四十次的油耗当量;电费就要几百万美元,还不含硬件折旧55。 单次对话只有瓦时级,听着不多,但乘上亿级请求后,推断端的总能耗就成了不容忽视的大数56

再看能效的杠杆在哪。还是第 05 章碰过的算术强度那一族逻辑:同一台 GPU 主机, 训练时利用率能做到 50% 以上,推断的解码阶段可能只有 20%–40%,能耗效率差出近一倍—— 硬件在等数据搬运的时候,电表并不会暂停57。 所以给推断提速的系统优化(第 10 章的主角)本质上也是能源优化:利用率从 20% 提到 40%, 等于同等电费下有效产出翻倍。

钱烧到这里,故事自然会撞上核能。书里给的场景像小说:2024 年 9 月, 微软与美国 Constellation Energy 签下二十年的购电合约(长期按约买电的合同),计划重启宾夕法尼亚州三里岛核电站 1 号机组 (规划装机约 835 兆瓦,争取 2027 年前后并网)——那是 1979 年美国民用核电史上最严重部分熔毁事故的发生地, 那场事故曾让美国核电冷藏了三十年58。亚马逊买下了另一座核电站旁的数据中心; 谷歌签下小型模块化反应堆的采购合约,目标 2035 年前部署约 500 兆瓦59。 书里的总结句很锋利:算力叙事正在从「今年买多少卡」,演化成「未来十年锁多少瓦」—— 这正是 AI 进入工业基础设施层级的标志60

12. 出口管制与算力主权

技术故事讲完,该上政治经济学了。从 2022 年 10 月开始,美国围绕先进计算多次更新出口管制, 限制面向中国市场的高端 AI 芯片;英伟达推出过 H800、H20 这类合规降配型号,又随规则变化反复调整61。 书里把中国的应对分成三层看,层层递进: 第一层,能不能买到同代硬件;第二层,国产芯片和软件栈能不能接住训练任务; 第三层,能不能用更高的训练效率把差距补回来(这正是下一节的 DeepSeek 故事)62。 第二层的标志性动作:华为 2025 年发布的 Atlas 900 A3 SuperPoD,用 16 个机柜级联塞下 384 颗昇腾 910C, 总算力约 300 PFLOPS——国产硬件开始在「超节点」形态上对标英伟达的整柜系统; 不过书里也如实提醒,产能良率(出厂合格比例)和有效规模受供应链影响,不宜写成稳定数字63

这一层之上,书里立了一个新词:算力主权——谁掌握算力,谁就更容易定义模型能力的边界; 一个国家长期拿不到同代芯片,它在模型规模、训练周期和迭代速度上的上限就被外部条件锁住64。 应对归纳为三条彼此补位的路线:加速国产替代、提升训练效率、推广开源与开放权重。 但第三条有明确的边界——模型开放替代不了芯片、显存、互联、供电、数据中心和基础软件栈65

对照的一面在美国自己身上:GPU 租赁商 CoreWeave 于 2025 年 3 月上市,招股书披露了规模可观的算力, 却也坦白写出风险——收入高度集中在少数几个大客户,硬件支出又高度集中在英伟达一家。 书里的判语:算力供给和需求都被压缩到很少的几个名字上,买卖双方任何一边出问题,整条供应链都会抖动66

13. 算力效率工程:DeepSeek 做对了什么

2024 年 12 月,杭州公司 DeepSeek 发布 V3 时披露:最终成功的预训练一轮用了 2048 块受管制的 H800, 按 GPU 小时和租赁价格折算的成本约 558 万美元,并在多项公开基准上逼近当时的闭源前沿67。 这个数字马上被全世界误读,书里专门校准了口径:它只是最终那一轮正式训练的租价估算, 不含前期探索实验、后训练、推断服务、人员和数据中心成本——用来比较「两家谁的训练更省钱」是可以的, 当成「做一个前沿模型的总花费」是错的68

那它到底示范了什么?同样的卡,不同的用法。架构层面的三件事 (细粒度加共享专家的混合专家组合、把 KV 缓存压进低维隐空间的 MLA、FP8 低精度的规模化使用) 在第 04 章都已经讲过;这里补架构图之外的两件事

第一件是工程的「硬抠」,四处代表性动作69: 自研训练框架 HAI-LLM(HAI 即「高效 AI 基础设施」),绕开英伟达开源工具,从受限硬件反向设计流程; DualPipe 让前向和反向的气泡互相填补,流水线近乎无缝运转; 关键算子不用常规的 CUDA C 编程、直接用更底层的 PTX 汇编写—— 书里的类比是别人写 C++,他们直接写汇编,代价是工程量陡增,回报是把利用率推到极限; 再加上算子级的细碎重写,单项只省几个百分点,叠起来就是几十个百分点的有效算力70。 这些本事不像架构创新有漂亮论文可写,散落在无数个内核、调度和检查点策略的细节里, 是千次实验调出来的工艺71

判断(我们的,不是书里的): DeepSeek 的真正护城河不是「用更少的钱训出了好模型」这件事本身, 而是把「工艺know-how」沉淀成了框架和组织方法——HAI-LLM、DualPipe、PTX 层面的规则一旦写成代码, 就从个人手艺变成了组织的可复用资产。这与第 08 章 Megatron 一节说的「框架化是把稀缺工程经验规模化的方式」 完全同构,只是方向相反:一个是把经验固化成公共设施,一个是把稀缺榨成私有优势。 如果错,会错在: 这套工艺高度绑定特定硬件(H800 的带宽特征),换了硬件环境可能需要大部分重调, 使其价值局限于「管制窗口期内」而非长期方法论。书里对这一点未置可否。

第二件来自 R1:其中激进的 R1-Zero 版本干脆不做监督微调暖启动,直接从基座模型开始大规模强化学习, 结果显示思维链行为本身就可能被强化学习「逼」出来72。 这条路对推理模型的意义,第 07 章 §8 已经展开;从算力账本的角度,它意味着另一种分配: 少砸数据和监督微调,把 GPU 更多挪给强化学习的采样和探索73。 后续的方向书里也列了:更低精度(FP4)、替换沿用十年的 AdamW、压缩注意力让百万词元上下文进入产品—— 单看都是技术细节,合起来是一句话:算力不足时,算法和工程会被迫一起进化74

14. 推断时代的新瓶颈

过去十年,算力故事的主角一直是训练——怎么把模型从零训到能用。转折发生在用户规模上: 2023 年起 ChatGPT 的活跃用户进入亿级,Claude、Gemini、文心、豆包、通义、Kimi 的调用量继续快速增长, 每一个请求都要在 GPU 上跑一次推断。书里的一句话分界:训练决定模型能不能诞生, 推断决定模型能不能被大规模使用75

两边对硬件的要求几乎相反,书里的比喻准确:训练像修大坝,重在万千台机器一起把模型推起来; 推断像城市自来水,重在每次打开龙头都快、稳、便宜76。 于是留出了两类新市场:一是推断专用的 ASIC 新势力(Groq 的 LPU 在特定配置下单用户输出可达数百词元每秒, Cerebras 干脆把整片晶圆做成一颗芯片消掉跨卡通信); 二是端侧——Apple Intelligence 走的端云路线,手机本地跑小模型,复杂任务才上云, 用户端买到三样东西:隐私、低延迟、离线可用77。未来的图景大概率是端云协作,而不是谁吃掉谁78

在本章结束前,还得回答那个终极问题:算力的尽头在哪? 摩尔定律(集成电路上晶体管数每 18–24 个月翻倍的经验规律)从 1970 年代撑到 2010 年代, 2015 年后明显放缓——晶体管已小到几个原子大小,量子隧穿、漏电、热密度让继续微缩越来越难: 从 7 纳米到 5 纳米花了三年,5 到 3 纳米又是三年,成本指数上升79。 但「摩尔定律死了」也是夸张,台积电创始人张忠谋的说法是「慢了,但还没死」,2 纳米之后还有 1.4 纳米和埃米级80。 业界同时在六条非传统路径上找增长81:

路径一句话思路现状
3D 堆叠(把多层电路垂直叠起来)盖楼式制造;HBM 显存就是这个思路的成功产物已量产
芯粒大芯片拆成小芯片分别制造再封装AMD/英伟达/苹果均在用
光子芯片用光代替电传输信号,更快更省电工程化早期
专用 ASIC为一类负载定制电路,效率可高出一个数量级Groq/Cerebras 属极端版本
神经形态计算模仿生物突触的脉冲计算极省电但未打通通用训练
量子计算特定问题上指数加速离实用尚远,长期赌注

算力增长的节奏大概会从「每两年翻倍」滑向「每三四年翻倍」。书里的结语克制而有分量: 算力终将变得像水电煤一样看不见但无处不在——但在通往那个成熟态的路上, 集中与分散、硬件与算法、能源与气候、算力与权力这四条张力会一直撕扯82。 第 17 章讨论风险治理时会回到其中的脆弱面;下一章,我们先解决眼前的账本: 把这颗昂贵的芯片,用在每一次真实回答上。

主走查:一笔 1750 亿参数、2 万亿词元的训练账

这条走查贯穿本章。 输入是一个假设的任务:训一个 1750 亿参数的稠密模型,看 2 万亿词元, 用 1024 张 A100(每卡理论 3.12×10¹⁴ 次浮点运算/秒,这里按书里 3×10¹⁴ 的口径取整)。 走查里凡由我推演的数,当场标明是演示计算。

① 先问装不装得下。(§5 §7) 用第 05 章的速算公式:混合精度训练下每张卡最少要装约 16 字节 × 参数量 = 16 × 1.75×10¹¹ ≈ 2.8 TB 的模型状态(参数+梯度+优化器状态)—— 是单卡显存 80GB 的 35 倍(演示计算)。没有任何单卡装得下,分布式不是选择,是被逼的。

② 再问要算多少。(主走查承重步:6ND) 按书里给的近似公式 FLOPs ≈ 6ND:6 × 1.75×10¹¹ × 2×10¹² = 2.1×10²⁴ 次浮点运算(演示计算,公式是书里的)。 书上那个对照组:Llama 2 7B 用 2 万亿词元,8.4×10²² 次,同样 1024 卡配置下大约一周83。 参数大 25 倍,运算量和时间也就大约放大 25 倍——这就是第 05 章说「要重复这件事两万亿次」落到机器上的样子。

③ 折成时间和钱。 可用算力 = 1024 卡 × 3×10¹⁴ × 50% 利用率 = 1.536×10¹⁷ 次/秒 (50% 这个分子取书里给的常见区间中枢,公开报告常见 30%–55%)。 2.1×10²⁴ ÷ 1.536×10¹⁷ ≈ 1.37×10⁷ 秒 ≈ 158 天,五个月出头(演示计算)。 同一个任务,利用率若只有 30%(公开区间的低端),时间膨胀到约 264 天——「利用率」三个字值半年工期, 这就是第 05 章埋下的那句「利用率估完才算数」在这里的兑现。

④ 切法:8 × 16 × 8。(§5) 照书里的典型配置:张量并行 = 8,流水线并行 = 16,数据并行 = 8,三者相乘正好 1024 张84。 排布逻辑读一遍就记住了:张量并行(8 张一小组)通信最重,全部留在同一台节点的 NVLink 内; 16 个流水线段跨节点走 InfiniBand;最外层 8 份数据副本只在每步结束时碰一次头。 对照 §4 的 20 倍带宽差,这不是偏好,是被物理逼出来的排法。

⑤ 显存账怎么抹平。(§5 §7) 第二步的 2.8 TB 分摊到 1024 张卡,理想情况每卡约 2.7 GB(演示计算)——靠的就是三级切片: ZeRO/FSDP 把优化器状态、梯度、参数逐步切开;张量并行再把每一层的大矩阵劈成 8 份; 还不够的位置交给梯度检查点,拿约 33% 的额外计算换回一半以上的激活显存85。 每一样武器的代价都在别的科目上记着账。

⑥ 第 40 天,凌晨三点,机器坏了。(§8,中断时刻为演示设定) 某节点的 HBM 显存报错,训练停止。恢复动作:全员回到最近一个检查点—— 不只是参数,还包括优化器状态、随机数状态和数据读到的位置,四样缺一不可86; 丢掉的是自上个检查点以来几个小时的进度。照 Llama 3 的实测,这样的场景在这五个月里会发生上百次, 平均三小时一次87能不能优雅失败,在这一行里不是美德,是工期。

⑦ 收尾。 158 天后训完,155 万美元级别的电费刚交出去,真正的难关才刚开始: 怎样让它以每次几分钱的成本接住上亿人的提问——那是第 10 章的两本账里的另一本。

作者的判断与证据

书里给出了实测或公开来源的硬证据:

  • Llama 3 405B 的 54 天、466 次中断、每 3 小时一次,出自 Meta 公开的技术报告38;
  • OPT-175B 的几十次回滚,出自公开训练日志40;
  • DeepSeek V3 的 2048 块 H800 与 558 万美元,出自其官方技术报告的口径; 书里同时如实转述:母公司算力储备的具体构成「多来自行业报告与匿名消息」88;
  • H100 的制程、晶体管数、带宽、功耗,均来自厂商公开规格;书里明说价格是分析师估计7;
  • 训练能耗「数千万度」被明确标注为外界估算,闭源模型并无公开账本55

书里明确标成判断或趋势的地方:

  • 「显存容量和带宽的代际跃迁往往比 TFLOPS 翻倍更能改变部署可行性」——作者的行业判断,给了理由(KV 缓存和模型分片大小),但没有量化论证14;
  • 「采购单位正从一颗 GPU 扩展到一座液冷机柜」——趋势判断11;
  • 国产芯片产能「不宜写成稳定的单一数字」——作者主动坦白不确定性的地方63;
  • 开源权重路线的边界(替代不了芯片与供电)——作者的判断,且有清晰的理由陈述65

判断(我们的,不是书里的): 这一章的全部型号、公司名、带宽数字都会过时, 但它的骨架不会:每一代硬件都要重新回答同样的四个问题——算得动吗(算力), 喂得动吗(存储带宽),传得动吗(互联),供得起吗(电水地政)。 读这章的正确姿势不是记住 H100 的参数,而是拿着这四问去审下一代硬件; 第 9 章末尾那六条突围路径,本质上也全是这四问的变体。 如果错,会错在: 出现把「算-存-传」合并成一体的新计算基底(成熟的存算一体——在存储原地做计算——或晶圆级光互连), 让「芯片-节点-机柜」的分层本身松动——那时四问要重写。书里 9.9 节的六条路径正是冲着这个去的, 只是截至成书没有一条动摇主流格局。

边界与局限

  • 本组拆解的结构: 原书第 6 章被拆成两半——训练侧(并行、显存、容错、平台)并进本章,推断侧(预填充、缓存、调度、服务治理)单独成第 10 章;原书第 9 章全文对应本章骨架。
  • 所有价格与能耗都是估计口径。 英伟达不公布单价,闭源模型不公布能耗,书里反复标注这一点,我们也一并继承。
  • 没展开的: xAI Colossus 集群的工程细节只留了一句;光模块供应链竞争、核能合作合同的监管审批风险、习题册都略过;Groq/Cerebras 的内部架构差异(内存排序 vs 晶圆)书里也未深挖。
  • 时效性: 2024–2026 年的型号对标(B200、Atlas 900 A3、GB200 NVL72)很快会变旧闻;书里自己也说了「具体型号和参数会很快变成旧闻」——骨架不变,数字请查当时资料。
  • 有两处我们做了取舍: 原书习题册里那段「装箱问题」类比(显存/通信/气泡之间换钱)很有教学价值但与我们主走查重叠,收敛为主走查里的第 ③⑤ 步;Chapter 6 的训练稳定性三板斧(裁剪/衰减/回滚)正文保留主干、细节并入 §8。

可带走的

  1. GPU 是两级存储的婚姻: 片上存储小而快,显存大而慢;一切优化(含 FlashAttention)都是在缩短这两者之间的搬运。
  2. 参数不值钱,搬动才值钱: 决定万卡训练速度的常常不是单卡算力,是通信效率;节点内与节点间的带宽差约 20 倍,切法背诵版「8 × 16 × 8」由此而来。
  3. 故障是常数,不是意外: 每 3 小时一次中断(Llama 3 实测),检查点的一致性(参数+优化器状态+随机数+数据位置)就是工期的保障。
  4. 高效训练 ≠ 把卡喂满: 它指的是固定预算下更多有效实验、可复现的结果、更快的想法-验证循环;平台能力反过来塑造研究方向。
  5. 数据中心的四大变量按序是电、水、地、政策,十万卡≈百兆瓦≈一座中等城市的用电。
  6. 算力叙事已从「买多少卡」换成「锁多少年的瓦」: 微软签下 20 年核电长约,是为了数据的可持续供电。
  7. 出口管制之下有三层应对: 买得到硬件吗、国产栈接得住吗、效率补得回来吗——DeepSeek 是第三层的样板。
  8. 同样卡 × 不同工程 = 不同有效算力,这是本章的全部副标题;第 04 章的架构创新在此处兑现为吞吐。
  9. 推断时代到来: 用户规模过亿后,调用量取代了训练成本成为算力扩张的主要增量;第 10 章专章讲这本账。
  10. 摩尔定律慢了没死,后继的非传统路径(堆叠/芯粒/光子/ASIC/神经形态/量子)要么更省电、要么更专用。

原文地图

主题原书节原文位置
H100 规格9.1text/10-ch09-9-gpu.txt:22(搜「2022 年推出的旗舰」) · text/10-ch09-9-gpu.txt:26(搜「头发丝直径约 8 万纳米」) · text/10-ch09-9-gpu.txt:31(搜「地球人口 10 倍的微型开关」) · text/10-ch09-9-gpu.txt:35(搜「3.35TB/s 带宽」)
尺度反差9.1text/10-ch09-9-gpu.txt:38(搜「小型电烤箱」) · text/10-ch09-9-gpu.txt:44(搜「巧克力的大小」) · text/10-ch09-9-gpu.txt:46(搜「中等图书馆的所有藏书」)
两级存储6.1.2.1text/07-ch06.txt:159(搜「寄存器或 SRAM」)
B200 与整柜9.1text/10-ch09-9-gpu.txt:67(搜「封装成一颗逻辑 GPU」) · text/10-ch09-9-gpu.txt:71(搜「72 颗 Blackwell GPU 和 36 颗」) · text/10-ch09-9-gpu.txt:76(搜「百千瓦级、重量到吨级」)
采购单位变大9.1text/10-ch09-9-gpu.txt:83(搜「从一颗 GPU 扩展到一座液冷机柜」)
六大派别9.2text/10-ch09-9-gpu.txt:96(搜「训练旗舰追求通用生态」) · text/10-ch09-9-gpu.txt:101(搜「几乎不改就能跑」) · text/10-ch09-9-gpu.txt:103(搜「ROCm 追了十几年」) · text/10-ch09-9-gpu.txt:125(搜「7B 到 13B」)
ASIC 对赌9.2text/10-ch09-9-gpu.txt:163(搜「押注架构稳定性」) · text/10-ch09-9-gpu.txt:167(搜「设计到流片再到部署往往要数年」)
显存栏更重要9.2text/10-ch09-9-gpu.txt:153(搜「更能改变大模型部署的实际可行性」)
集群四级9.3text/10-ch09-9-gpu.txt:171(搜「单兵作战的士兵」) · text/10-ch09-9-gpu.txt:177(搜「数十万美元量级」) · text/10-ch09-9-gpu.txt:179(搜「整柜级 AI 系统」) · text/10-ch09-9-gpu.txt:188(搜「长成一座专业工厂」)
通信决定训练9.3.1text/10-ch09-9-gpu.txt:192(搜「常常不是单卡的算力」) · text/10-ch09-9-gpu.txt:199(搜「同一台服务器里几颗 GPU 之间」)
NVLink vs InfiniBand9.3.1text/10-ch09-9-gpu.txt:204(搜「双向带宽达 900」) · text/10-ch09-9-gpu.txt:212(搜「远程直接内存访问」)
20 倍差距与铁律9.3.1text/10-ch09-9-gpu.txt:235(搜「约 20 倍量级」) · text/10-ch09-9-gpu.txt:233(搜「张量并行的通信量最重、频率」)
以太网替代9.3.1text/10-ch09-9-gpu.txt:216(搜「反向尝试用以太网构建」)
光互联9.3.1text/10-ch09-9-gpu.txt:238(搜「把光更靠近 GPU」) · text/10-ch09-9-gpu.txt:240(搜「共封装光学」)
三种并行定义9.3.2 与 6.1.1text/10-ch09-9-gpu.txt:253(搜「吃不同的数据」) · text/10-ch09-9-gpu.txt:260(搜「按列或按行」) · text/10-ch09-9-gpu.txt:267(搜「“气泡”」) · text/07-ch06.txt:66(搜「互斥选项」)
通信成本速查表6.1.1text/07-ch06.txt:80(搜「AllReduce,通信量」) · text/07-ch06.txt:82(搜「2 次 AllReduce」) · text/07-ch06.txt:86(搜「pipeline bubble」)
3D 并行典型配置6.1.1.1text/07-ch06.txt:101(搜「175B 模型用 1024 张 A100」) · text/07-ch06.txt:103(搜「8 × 16 × 8」) · text/07-ch06.txt:104(搜「同机 NVLink 上」)
ZeRO 与 FSDP6.1.1.2text/07-ch06.txt:111(搜「Zero Redundancy Optimizer」) · text/07-ch06.txt:118(搜「连参数本身也切片」) · text/07-ch06.txt:121(搜「Fully Sharded Data Parallel」)
FlashAttention6.1.2.1text/07-ch06.txt:158(搜「融合算子(Fused Kernels)」) · text/07-ch06.txt:160(搜「最有名的产物」) · text/07-ch06.txt:161(搜「降到 𝑂(𝑁 )」)
显存优化全家桶6.1.2text/07-ch06.txt:137(搜「以时间换空间」) · text/07-ch06.txt:150(搜「每 4 层」) · text/07-ch06.txt:154(搜「增加约 33%」) · text/07-ch06.txt:144(搜「未必划算」)
稳定优化三板斧6.1.2.1text/07-ch06.txt:167(搜「全局范数限制在某个阈值」) · text/07-ch06.txt:174(搜「rollback / replay」) · text/07-ch06.txt:176(搜「几十次这样的回滚」)
利用率差6.1.2.1text/07-ch06.txt:182(搜「40% 还是 60%」)
故障统计9.3.3text/10-ch09-9-gpu.txt:299(搜「约 1.6 万张 H100」) · text/10-ch09-9-gpu.txt:300(搜「466 次训练中断」) · text/10-ch09-9-gpu.txt:304(搜「万分之一的故障概率」)
检查点一致性6.2.1text/07-ch06.txt:214(搜「还必须“扛得住”」) · text/07-ch06.txt:221(搜「牵涉到参数、优化器状态、随机」) · text/07-ch06.txt:224(搜「优雅失败本身就会影响研究节奏」)
平台四件事6.2text/07-ch06.txt:207(搜「考验账本,后者考验平台」) · text/07-ch06.txt:237(搜「recipe」) · text/07-ch06.txt:244(搜「哪些改动只能打包验证」) · text/07-ch06.txt:257(搜「对资源形状非常敏感」)
数据通路6.2.5text/07-ch06.txt:296(搜「tokenize、样本拼接」) · text/07-ch06.txt:301(搜「padding 浪费」)
Megatron 的意义6.2.4text/07-ch06.txt:287(搜「不是一个代码仓库」) · text/07-ch06.txt:329(搜「让模型更稳定地收敛」)
数据中心物理学9.4text/10-ch09-9-gpu.txt:315(搜「电、水、土地、政策」) · text/10-ch09-9-gpu.txt:317(搜「百兆瓦量级」) · text/10-ch09-9-gpu.txt:322(搜「70 兆瓦的热量」) · text/10-ch09-9-gpu.txt:331(搜「把电费贵的地方算力需求」)
核能回潮9.4.1text/10-ch09-9-gpu.txt:335(搜「20 年购电协议」) · text/10-ch09-9-gpu.txt:339(搜「部分熔毁事故」) · text/10-ch09-9-gpu.txt:350(搜「未来十几年的电力合约」)
能耗参照9.5text/10-ch09-9-gpu.txt:376(搜「数千万度电量级」) · text/10-ch09-9-gpu.txt:377(搜「5000 户美国普通家庭」) · text/10-ch09-9-gpu.txt:380(搜「瓦时级」)
能效账本9.5text/10-ch09-9-gpu.txt:395(搜「20–40%」) · text/10-ch09-9-gpu.txt:391(搜「电表并不会暂停」)
出口管制9.6text/10-ch09-9-gpu.txt:431(搜「2022 年 10 月开始」) · text/10-ch09-9-gpu.txt:436(搜「第一层是能不能买到」)
昇腾对标9.6text/10-ch09-9-gpu.txt:444(搜「300 PFLOPS」) · text/10-ch09-9-gpu.txt:450(搜「不宜写成稳定的单一数字」)
算力主权9.6.1text/10-ch09-9-gpu.txt:457(搜「谁掌握算力,谁就更容易定义」) · text/10-ch09-9-gpu.txt:466(搜「供电、数据中心和基础软件栈」)
CoreWeave 对照9.6text/10-ch09-9-gpu.txt:470(搜「GPU 租赁经济的崛起」) · text/10-ch09-9-gpu.txt:476(搜「整条供应链都会抖动」)
DeepSeek 成本口径9.7text/10-ch09-9-gpu.txt:482(搜「2048 块 H800」) · text/10-ch09-9-gpu.txt:483(搜「558 万美元」) · text/10-ch09-9-gpu.txt:487(搜「不含前期探索性实验」)
工程硬抠9.7.1text/10-ch09-9-gpu.txt:503(搜「HAI-LLM 框架」) · text/10-ch09-9-gpu.txt:511(搜「写 C++,他们直接写汇编」) · text/10-ch09-9-gpu.txt:515(搜「几十个百分点的有效算力」) · text/10-ch09-9-gpu.txt:518(搜「千次实验调出来的工艺」)
R1-Zero9.7.2text/10-ch09-9-gpu.txt:523(搜「不经传统监督微调暖启动」) · text/10-ch09-9-gpu.txt:527(搜「“逼”出来」)
推断时代到来9.8text/10-ch09-9-gpu.txt:553(搜「活跃用户规模进入亿级」) · text/10-ch09-9-gpu.txt:559(搜「训练像修一座大坝」) · text/10-ch09-9-gpu.txt:564(搜「数百词元/秒」)
端侧推断9.8.2text/10-ch09-9-gpu.txt:573(搜「Apple Intelligence」) · text/10-ch09-9-gpu.txt:580(搜「端云协作」)
摩尔定律9.9text/10-ch09-9-gpu.txt:605(搜「明显放缓」) · text/10-ch09-9-gpu.txt:612(搜「但还没死」)
突围六路9.9.2text/10-ch09-9-gpu.txt:617(搜「盖楼」) · text/10-ch09-9-gpu.txt:620(搜「拆成几颗小芯片」) · text/10-ch09-9-gpu.txt:628(搜「脉冲计算模式」)
结语与张力9.10text/10-ch09-9-gpu.txt:646(搜「水电煤」) · text/10-ch09-9-gpu.txt:650(搜「四条张力」)

Footnotes

  1. 出处:「9.1 一颗 H100 是什么」第 22 段(text/10-ch09-9-gpu.txt:22,搜「2022 年推出的旗舰」)与第 24 段(text/10-ch09-9-gpu.txt:24,搜「SXM5 80GB」)。

  2. 出处:同节第 26 段(text/10-ch09-9-gpu.txt:26,搜「头发丝直径约 8 万纳米」)。

  3. 出处:同节第 31 段(text/10-ch09-9-gpu.txt:31,搜「地球人口 10 倍的微型开关」)。

  4. 出处:同节第 32 段(text/10-ch09-9-gpu.txt:32,搜「500 多个张量核心」)。

  5. 出处:同节第 35 段(text/10-ch09-9-gpu.txt:35,搜「3.35TB/s 带宽」)与第 46 段(text/10-ch09-9-gpu.txt:46,搜「中等图书馆的所有藏书」)。

  6. 出处:同节第 38 段(text/10-ch09-9-gpu.txt:38,搜「小型电烤箱」)。

  7. 出处:同节第 40 段(text/10-ch09-9-gpu.txt:40,搜「通常不公开」)与第 41 段(text/10-ch09-9-gpu.txt:41,搜「数万美元区间」)。 2

  8. HBM 的解释来自书内原文:「高带宽存储,High Bandwidth Memory」(text/10-ch09-9-gpu.txt:35,搜「High Bandwidth Memory」);「多层 DRAM 裸片堆在一起」在同章第 618 段(text/10-ch09-9-gpu.txt:618,搜「多层 DRAM 裸片堆在一起」)。

  9. 「GPU 大部分时间在等数据搬运」的直接表述见 text/07-ch06.txt:394(搜「大部分时间在等数据搬运」)与本页 text/10-ch09-9-gpu.txt:88(搜「浪费在“等」)。

  10. 出处:「9.1」第 67 段(text/10-ch09-9-gpu.txt:67,搜「封装成一颗逻辑 GPU」)、第 71 段(text/10-ch09-9-gpu.txt:71,搜「72 颗 Blackwell GPU 和 36 颗」)、第 76 段(text/10-ch09-9-gpu.txt:76,搜「百千瓦级、重量到吨级」)。

  11. 出处:同节第 83 段(text/10-ch09-9-gpu.txt:83,搜「从一颗 GPU 扩展到一座液冷机柜」)。 2

  12. 出处:「9.2 芯片的几大派别」第 96 段(text/10-ch09-9-gpu.txt:96,搜「训练旗舰追求通用生态」)、第 101 段(text/10-ch09-9-gpu.txt:101,搜「几乎不改就能跑」)、第 103 段(text/10-ch09-9-gpu.txt:103,搜「ROCm 追了十几年」)、第 106 段(text/10-ch09-9-gpu.txt:106,搜「迭代到第七代」)、第 110 段(text/10-ch09-9-gpu.txt:110,搜「被迫加速的一支力量」)、第 117 段(text/10-ch09-9-gpu.txt:117,搜「把全部硅都压在加速」)、第 120 段(text/10-ch09-9-gpu.txt:120,搜「Wafer-Scale Engine」)、第 125 段(text/10-ch09-9-gpu.txt:125,搜「7B 到 13B」)。

  13. 出处:同节第 163 段(text/10-ch09-9-gpu.txt:163,搜「押注架构稳定性」)与第 167 段(text/10-ch09-9-gpu.txt:167,搜「设计到流片再到部署往往要数年」)。

  14. 出处:同节第 136 至 147 段的速查表(text/10-ch09-9-gpu.txt:136,搜「1979 TFLOPS」;text/10-ch09-9-gpu.txt:141,搜「192 GB」;text/10-ch09-9-gpu.txt:144,搜「459 TFLOPS」)与第 153 段(text/10-ch09-9-gpu.txt:153,搜「更能改变大模型部署的实际可行性」)。 2

  15. 出处:「9.3 万卡集群」第 171 段(text/10-ch09-9-gpu.txt:171,搜「单兵作战的士兵」)、第 177 段(text/10-ch09-9-gpu.txt:177,搜「数十万美元量级」)、第 179 段(text/10-ch09-9-gpu.txt:179,搜「整柜级 AI 系统」)、第 182 段(text/10-ch09-9-gpu.txt:182,搜「scale-out 网络」)、第 186 段(text/10-ch09-9-gpu.txt:186,搜「占地几公顷」)。

  16. 出处:第 188 段(text/10-ch09-9-gpu.txt:188,搜「长成一座专业工厂」)。

  17. 出处:「9.3.1」第 192 段(text/10-ch09-9-gpu.txt:192,搜「常常不是单卡的算力」)。

  18. 出处:同节第 199 段(text/10-ch09-9-gpu.txt:199,搜「同一台服务器里几颗 GPU 之间」)。

  19. 出处:第 204 段(text/10-ch09-9-gpu.txt:204,搜「双向带宽达 900」)、第 212 段(text/10-ch09-9-gpu.txt:212,搜「远程直接内存访问」)、第 228 段(text/10-ch09-9-gpu.txt:228,搜「200 / 400 / 800 Gb/s」)。

  20. 出处:第 235 段(text/10-ch09-9-gpu.txt:235,搜「约 20 倍量级」);「接近 40 倍」在相邻文字中,第 236 段(text/10-ch09-9-gpu.txt:236,搜「TP 总是先填满节点」)。

  21. 出处:第 216 段(text/10-ch09-9-gpu.txt:216,搜「反向尝试用以太网构建」)与第 217 段(text/10-ch09-9-gpu.txt:217,搜「Ultra Ethernet Consortium」)。

  22. 出处:第 238 段(text/10-ch09-9-gpu.txt:238,搜「把光更靠近 GPU」)与第 240 段(text/10-ch09-9-gpu.txt:240,搜「共封装光学」)。

  23. 出处:「6.1.1」第 66 段(text/07-ch06.txt:66,搜「互斥选项」)与「9.3.2」第 236 段(text/10-ch09-9-gpu.txt:236,搜「3D 并行」)。

  24. 出处:text/10-ch09-9-gpu.txt:253(搜「吃不同的数据」)与 text/07-ch06.txt:58(搜「喂不同的数据分片」)。

  25. 出处:text/10-ch09-9-gpu.txt:259(搜「张量并行(Tensor Parallelism)」)与第 260 段(搜「按列或按行」)、第 261 段(text/10-ch09-9-gpu.txt:261,搜「Megatron-LM」)。

  26. 出处:text/10-ch09-9-gpu.txt:265(搜「流水线并行(Pipeline Parallelism)」)、第 266 段(搜「气泡」)、第 268 段(text/10-ch09-9-gpu.txt:268,搜「GPipe」)。

  27. 出处:text/07-ch06.txt:62(搜「专家并行」)与 text/07-ch06.txt:64(搜「演化成一种多层次分工」)。

  28. 出处:「6.1.1」第 80 至 93 段(text/07-ch06.txt:80,搜「AllReduce,通信量」;text/07-ch06.txt:82,搜「2 次 AllReduce」;text/07-ch06.txt:89,搜「AllGather」)。

  29. 出处:text/07-ch06.txt:95(搜「放在带宽高的链路」)与 text/10-ch09-9-gpu.txt:233(搜「张量并行的通信量最重、频率」)。

  30. 出处:「6.1.1.1」第 101 段(text/07-ch06.txt:101,搜「175B 模型用 1024 张 A100」)、第 103 段(text/07-ch06.txt:103,搜「8 × 16 × 8」)、第 104 段(text/07-ch06.txt:104,搜「同机 NVLink 上」)。

  31. 出处:「6.1.1.2」第 111 段(text/07-ch06.txt:111,搜「Zero Redundancy Optimizer」)、第 115 段(搜「ZeRO-1」)、第 118 段(搜「连参数本身也切片」)、第 121 段(text/07-ch06.txt:121,搜「Fully Sharded Data Parallel」)与第 123 段(搜「事实标准」)。

  32. 出处:「6.1.2.1」第 158 段(text/07-ch06.txt:158,搜「融合算子(Fused Kernels)」)与第 159 段(text/07-ch06.txt:159,搜「不写回显存」)。

  33. 出处:第 160 段(text/07-ch06.txt:160,搜「最有名的产物」)与第 161 段(text/07-ch06.txt:161,搜「降到 𝑂(𝑁 )」)。速度更快因省掉了搬运的机制表述见同节及其习题(text/07-ch06.txt:889,搜「不再来回搬运中间矩阵」)。

  34. 出处:「6.1.2」第 128 段(text/07-ch06.txt:128,搜「激活、中间缓存、梯度」)与第 129 段(搜「内存压力往往比推断阶段更严峻」)。

  35. 出处:「6.1.2.1」第 148 段(text/07-ch06.txt:148,搜「直接拿来计算梯」)、第 150 段(搜「每 4 层」)、第 154 段(text/07-ch06.txt:154,搜「省 50% 以上」)、第 156 段(搜「一定要开」)。

  36. 出处:第 162 段(text/07-ch06.txt:162,搜「fused dropout-residual-add」)与第 163 段(text/07-ch06.txt:163,搜「几十个百分点的差别」)。

  37. 出处:「6.1.2」第 142 段(text/07-ch06.txt:142,搜「让调试和恢复变得更困难」)与第 144 段(text/07-ch06.txt:144,搜「未必划算」)。

  38. 出处:「9.3.3 故障是常态」第 299 段(text/10-ch09-9-gpu.txt:299,搜「约 1.6 万张 H100」)、第 300 段(text/10-ch09-9-gpu.txt:300,搜「466 次训练中断」)与第 301 段(text/10-ch09-9-gpu.txt:301,搜「每 3 小时一次」)。 2

  39. 出处:第 304 段(text/10-ch09-9-gpu.txt:304,搜「万分之一的故障概率」)。

  40. 出处:「6.1.2.1」第 175 段(text/07-ch06.txt:175,搜「checkpoint,然后跳过有问题的数据」)与第 176 段(text/07-ch06.txt:176,搜「几十次这样的回滚」)。 2

  41. 出处:「6.2.1」第 221 段(text/07-ch06.txt:221,搜「牵涉到参数、优化器状态、随机」)。

  42. 出处:同节第 224 段(text/07-ch06.txt:224,搜「优雅失败本身就会影响研究节奏」)。

  43. 出处:「6.2」引言第 207 段(text/07-ch06.txt:207,搜「考验账本,后者考验平台」)。

  44. 出处:「6.2.2」第 237 段(text/07-ch06.txt:237,搜「recipe」)与第 239 段(text/07-ch06.txt:239,搜「长期震荡」)。

  45. 出处:第 244 段(text/07-ch06.txt:244,搜「哪些改动只能打包验证」)。

  46. 出处:「6.2.3」第 255 段(text/07-ch06.txt:255,搜「拼不出一组适合大作业的拓扑」)、第 261 段(text/07-ch06.txt:261,搜「有效容量却不断下降」)。

  47. 出处:「6.2.5」第 296 段(text/07-ch06.txt:296,搜「tokenize、样本拼接」)、第 301 段(text/07-ch06.txt:301,搜「padding 浪费」)、第 302 段(text/07-ch06.txt:302,搜「长度分桶」)。

  48. 出处:「6.2.4」第 287 段(text/07-ch06.txt:287,搜「不是一个代码仓库」)。

  49. 出处:「6.2.6」第 329 段(text/07-ch06.txt:329,搜「让模型更稳定地收敛」)。

  50. 出处:第 333 段(text/07-ch06.txt:333,搜「训练系统越成熟」)。

  51. 出处:「9.4 数据中心的物理学」第 315 段(text/10-ch09-9-gpu.txt:315,搜「电、水、土地、政策」)。

  52. 出处:第 317 段(text/10-ch09-9-gpu.txt:317,搜「百兆瓦量级」)与第 320 段(text/10-ch09-9-gpu.txt:320,搜「10 吉瓦级别」)。

  53. 出处:第 322 段(text/10-ch09-9-gpu.txt:322,搜「70 兆瓦的热量」)与第 325 段(text/10-ch09-9-gpu.txt:325,搜「Project Natick」)、第 326 段(text/10-ch09-9-gpu.txt:326,搜「故障率比陆地还低」)。

  54. 出处:第 328 段(text/10-ch09-9-gpu.txt:328,搜「东数西算国家工程」)与第 331 段(text/10-ch09-9-gpu.txt:331,搜「把电费贵的地方算力需求」)。

  55. 出处:「9.5 AI 的能源账本」第 376 段(text/10-ch09-9-gpu.txt:376,搜「数千万度电量级」)、第 377 段(text/10-ch09-9-gpu.txt:377,搜「5000 户美国普通家庭」)、第 377 段(text/10-ch09-9-gpu.txt:377,搜「波音 747 飞越美国大陆」)。 2

  56. 出处:第 380 段(text/10-ch09-9-gpu.txt:380,搜「瓦时级」)与第 382 段(text/10-ch09-9-gpu.txt:382,搜「总能耗就会变成一个不容忽视」)。

  57. 出处:「从 Roofline 看 AI 的能效账本」段(text/10-ch09-9-gpu.txt:395,搜「20–40%」)与第 391 段(text/10-ch09-9-gpu.txt:391,搜「电表并不会暂停」)。

  58. 出处:「9.4.1 核能的回潮」第 335 段(text/10-ch09-9-gpu.txt:335,搜「20 年购电协议」)、第 336 段(text/10-ch09-9-gpu.txt:336,搜「835 兆瓦」)、第 339 段(text/10-ch09-9-gpu.txt:339,搜「部分熔毁事故」)。

  59. 出处:第 343 段(text/10-ch09-9-gpu.txt:343,搜「Kairos Power」)与第 344 段(text/10-ch09-9-gpu.txt:344,搜「500 兆瓦 SMR 容量」)。

  60. 出处:第 351 段(text/10-ch09-9-gpu.txt:351,搜「今年买多少卡」)。

  61. 出处:「9.6 中国的算力局」第 431 段(text/10-ch09-9-gpu.txt:431,搜「2022 年 10 月开始」)与第 433 段(text/10-ch09-9-gpu.txt:433,搜「H800、H20」)。

  62. 出处:第 436 段(text/10-ch09-9-gpu.txt:436,搜「第一层是能不能买到」)。

  63. 出处:第 444 段(text/10-ch09-9-gpu.txt:444,搜「300 PFLOPS」)与第 450 段(text/10-ch09-9-gpu.txt:450,搜「不宜写成稳定的单一数字」)。 2

  64. 出处:「9.6.1」第 457 段(text/10-ch09-9-gpu.txt:457,搜「谁掌握算力,谁就更容易定义」)。

  65. 出处:第 465 段(text/10-ch09-9-gpu.txt:465,搜「三是推广开源与开放权重」)与第 466 段(text/10-ch09-9-gpu.txt:466,搜「供电、数据中心和基础软件栈」)。 2

  66. 出处:「对照看一眼」第 470 段(text/10-ch09-9-gpu.txt:470,搜「GPU 租赁经济的崛起」)与第 476 段(text/10-ch09-9-gpu.txt:476,搜「整条供应链都会抖动」)。

  67. 出处:「9.7」第 482 段(text/10-ch09-9-gpu.txt:482,搜「2048 块 H800」)与第 483 段(text/10-ch09-9-gpu.txt:483,搜「558 万美元」)。

  68. 出处:第 487 段(text/10-ch09-9-gpu.txt:487,搜「不含前期探索性实验」)。

  69. 出处:「9.7.1」第 503 段(text/10-ch09-9-gpu.txt:503,搜「HAI-LLM 框架」)、第 506 段(text/10-ch09-9-gpu.txt:506,搜「DualPipe」)、第 511 段(text/10-ch09-9-gpu.txt:511,搜「写 C++,他们直接写汇编」)。

  70. 出处:第 515 段(text/10-ch09-9-gpu.txt:515,搜「几十个百分点的有效算力」)。

  71. 出处:第 518 段(text/10-ch09-9-gpu.txt:518,搜「千次实验调出来的工艺」)。

  72. 出处:「9.7.2」第 523 段(text/10-ch09-9-gpu.txt:523,搜「不经传统监督微调暖启动」)与第 527 段(text/10-ch09-9-gpu.txt:527,搜「“逼”出来」)。

  73. 出处:第 529 段(text/10-ch09-9-gpu.txt:529,搜「rollout 和探索上」)。

  74. 出处:「9.7.3」第 544 段(text/10-ch09-9-gpu.txt:544,搜「算法和工程会被」)。

  75. 出处:「9.8」第 553 段(text/10-ch09-9-gpu.txt:553,搜「活跃用户规模进入亿级」)与第 556 段(text/10-ch09-9-gpu.txt:556,搜「推断决定模型能不能被大规模使用」)。

  76. 出处:「9.8.1」第 559 段(text/10-ch09-9-gpu.txt:559,搜「训练像修一座大坝」)。

  77. 出处:第 564 段(text/10-ch09-9-gpu.txt:564,搜「数百词元/秒」)、第 573 段(text/10-ch09-9-gpu.txt:573,搜「Apple Intelligence」)、第 576 段(text/10-ch09-9-gpu.txt:576,搜「隐私(能本地完成的任务不必上传云端)」)。

  78. 出处:「9.8.2」第 580 段(text/10-ch09-9-gpu.txt:580,搜「端云协作」)。

  79. 出处:「9.9.1」第 605 段(text/10-ch09-9-gpu.txt:605,搜「明显放缓」)与第 606 段(text/10-ch09-9-gpu.txt:606,搜「从 7 纳米到 5 纳米」)。

  80. 出处:第 612 段(text/10-ch09-9-gpu.txt:612,搜「但还没死」)。

  81. 出处:「9.9.2」第 617 段(text/10-ch09-9-gpu.txt:617,搜「盖楼」)、第 620 段(text/10-ch09-9-gpu.txt:620,搜「拆成几颗小芯片」)、第 623 段(搜「光子芯片」)、第 628 段(text/10-ch09-9-gpu.txt:628,搜「脉冲计算模式」)、第 631 段(搜「量子计算」)。

  82. 出处:「9.10 结语」第 646 段(text/10-ch09-9-gpu.txt:646,搜「水电煤」)与第 650 段(text/10-ch09-9-gpu.txt:650,搜「四条张力」)。

  83. 出处:「4.4」第 507 段(text/05-ch04.txt:507,搜「8.4 × 10」)与第 508 段(text/05-ch04.txt:508,搜「大约需要一周」)。

  84. 出处:「6.1.1.1」第 103 段(text/07-ch06.txt:103,搜「8 × 16 × 8」)。

  85. 出处:「6.1.2.1」第 154 段(text/07-ch06.txt:154,搜「增加约 33%」)。

  86. 出处:「6.2.1」第 221 段(text/07-ch06.txt:221,搜「牵涉到参数、优化器状态、随机」)。

  87. 出处:「9.3.3」第 301 段(text/10-ch09-9-gpu.txt:301,搜「每 3 小时一次」)。

  88. 出处:「9.7」第 489 段(text/10-ch09-9-gpu.txt:489,搜「匿名消息」)。