跳到主要内容

从卧室里两块游戏显卡到万卡集群 — 三种切法与 466 次中断

这一章讲三件事: AI 的故事有前一半和后一半——前面十几章讲的是软件的思考, 这一章走进钢与硅的另一半; 一颗卡是怎么长成一座工厂的,以及长到这个尺寸之后,每天必然坏掉的是什么; 电、水、地缘政治怎样接手了原本属于算法的问题。

它在全书链条里的位置: 第 15 章说过「千卡量级、连续跑几十天」,那一章欠的账在这还: 怎么组织、坏了怎么办。推断(模型训好之后被人用的阶段)在这里也换了一次主角位置。

1. 卧室里那台台式机

改变历史的那台机器,不在超算中心。2012 年 AlexNet 夺冠的那份成绩, 是在作者父亲卧室里的一台普通台式机上练出来的——里面塞了两块 GeForce GTX 580 游戏显卡, 每块只有 3GB 显存1

显存放不下整个模型怎么办?研究生当时的解法土得很:把网络从中间「劈开」, 一半参数放一块卡,中间靠数据通信连起来。这个被迫的工程妥协, 后来成了「多卡并行」的雏形——今天万卡集群的全部章法,起点就是这台卧室机器1

对照一下这十年的陡度2:GPT-3 的训练已是千卡级;GPT-4 外界估在万卡到数万卡; 2025 年前后,数万卡成了入场门槛。本章的主走查就沿这条楼梯往上走: 两块卡 → 一个八卡节点 → 一个机柜 → 一片万卡集群,每一级都给具体的数。

2. 显卡为什么正好合用

第一步要说清一件经常被误读的事:GPU 是为渲染游戏画面造的,AI 只是恰好住进了别人的房子3

游戏画面每帧包含几百万个三角形顶点,每个顶点都要做坐标变换和光照计算—— 这些都是彼此独立的小任务,可以同时开算。「一大堆简单的事一起做」, 正是它与生俱来的胃口3

神经网络的核心运算是矩阵乘法,结构上惊人地相似:两个 1024 × 1024 的矩阵相乘, 要做约十亿次乘加,而大多数乘加互不依赖,可以一口气并行做掉4。 对照着记就够了:CPU 擅长一件事按顺序做完,GPU 擅长一万件简单事同时做—— 神经网络恰好是后者的形状4

3. CUDA:一场十年没人看好的下注

房子盖好了,还缺门。2006 年英伟达做了一个当时被广泛视为多余的决定: 推出 CUDA(统一计算设备架构——一套让程序员能把 GPU 当通用处理器来写程序的开发环境), 让科研人员可以用接近 C 语言的方式在显卡上跑仿真和计算5

接下来十年它是华尔街眼中的包袱:分析员反复质疑为什么要养一个游戏卡之外的奇怪生态5。 直到 2012 年 AlexNet 用它家的两块游戏卡一战成名,这笔押注才第一次看到回报5

书里把它最硬的部分说得直白:CUDA 真正的护城河不是硬件,而是近二十年攒出来的软件生态 ——一整套加速库让主流框架在其卡上又快又稳;竞争对手的硬件参数并不落下风, 但开发者、库和存量代码的惯性深得多6。评判一笔早期投入值不值, 十年往往是最低的计价单位。

4. Transformer 和显卡是天作之合

房子有了,还差对口的住户。假如今天的主流模型仍是循环网络,再多卡也帮不上痛快: 第 100 个词必须等第 99 个词的隐状态算完,序列计算像一条只能单人通行的窄楼梯, 后面排着一万张卡也只能等着7

Transformer 与 GPU 是天作之合(书本原文的措辞):它把几乎全部计算都改写成 显卡最爱吃的大块矩阵乘法——注意力里的投影是矩阵乘法,前馈层也是, 而且训练时整个序列可以一次性排开并行处理8。 再叠上两个优点:基本块结构高度均匀,堆上百层每层长得一样, 框架知道从哪下刀去切9;配合那条可预估的能力曲线, 投资人听懂了这不是买一堆发热的卡,是带着曲线图烧钱10

书里有一句值得原样收下的史评:这场匹配在 2017 年那篇初衷只为改进机器翻译的论文发表时 完全看不出来,这是 AI 历史上算法与硬件最幸运的一次相遇11

5. 一颗旗舰芯片是什么

抽象说完了,把楼梯的第零级具象化:一颗 H100 长什么样12?

项目数值参照物
制程4 纳米,台积电代工一根头发丝直径约 8 万纳米
晶体管数约 800 亿个开关相当于地球人口的 10 倍
计算单元约 1.7 万个通用核心 + 500 多个张量(多维数组)核心(专为矩阵乘法设计的电路)张量核心是矩阵乘法的专用车道
显存80GB 高速显存,每秒能搬 3.35TB 数据把一座中等图书馆藏书每秒「倒进嘴里」的速度
功耗700 瓦相当于一台小型电烤箱
单价数万美元区间(市场估计,官方从不标价)供需紧张时更高

书的总结同样适合背下来:尺度极小、密度极高、价格极贵、能耗极大—— 握在手里是一块巧克力的体积,散出的热量让你十秒就想松手13。 它也在换代:继任者用「芯粒」(把两片裸芯片封装成一颗逻辑 GPU)把单卡显存抬到约 180GB; 更新的整柜方案则把 72 颗 GPU 绑成一个机柜级计算单元,总带宽(每秒能搬走的数据量)130TB/s—— 训练框架看到的不再是一堆松散的卡,而是一台接近「超大 GPU」的机器14

6. 走查:从一块卡到一座工厂

现在沿楼梯往上爬,每一级都有明码标价15:

第 1 级 · 节点 一台服务器,通常装 8 颗 GPU,整机数十万美元量级
——一台这样的机器已接近过去许多小型超算的峰值
第 2 级 · 机柜 几台到十几台节点共享供电散热;满配整柜可达数百万美元,
约两米高、几百公斤起
第 3 级 · 机房 上百到几千个机柜;卡间通信延迟必须压到微秒级,
否则算力全在空等
第 4 级 · 数据中心 多机房 + 电力 + 冷却,占地几公顷,几万卡起步
——到这里已经不是「一堆电脑」,是一座工厂

这张梯子的隐含主线是通信。上万卡的规模里,决定速度的常常不是单卡算力, 而是卡与卡之间「说话」有多快——每一步训练都要在所有相关卡之间同步一次, 同步越快下一步开始越早16。两级各用各的路:节点内靠专用高速通道, 让一台服务器里的几张卡像一张大卡(NVLink 一类的通道把带宽做到了通用接口的近 7 倍); 节点间靠数据中心网络,让上千台服务器尽量少互相等待17。 连收购也是围绕这条路打的:英伟达买下主流高端网络的供应商,把「芯片 + 互联 + 软件」攥成一整套, 逼得对手们转头用以太网(通用的组网技术)另立山头18

7. 三种把模型切开的办法

把第 6 节的问题问到底:一个万亿参数级模型的权重,光是半精度存储就要数 TB, 任何单卡都装不下,必须切到几百上千颗卡上。怎么切?一共三个方向19:

切法思路代价
数据并行每卡一份完整模型,各吃各的数据,每步结束后全体同步取平均最简单常用,但同步开销吃网络
张量并行把单层内部的大矩阵竖着切开,几卡合力算同一层层内通信极频繁,依赖超高速通道
流水线并行按层分段接力,第 1 卡管 1–12 层、第 2 卡管 13–24 层,数据像流水线流过衔接处有空转「气泡」,要用小批次连续喂饱

实战里三者混用,行业黑话叫「3D 并行」:一部分卡分数据、一部分卡分层内矩阵、一部分卡分层号, 同时平衡显存、通信拓扑和流水线饱满度20。 好消息是这个难度天花板已经被开源框架封好——顶尖的训练框架让普通工程师只用几十行配置 就能调度几万张卡协同工作,把过去只有超算专家才能驾驭的复杂工程平民化了21

这就是第 15 章那句「千卡量级怎么组织」的答案的骨架。

8. 故障是常态,不是例外

组织起来了,然后它天天坏。书里引了一份难得公开的工业记录:Meta 训练 Llama 3 405B 时, 最多动用约 1.6 万张 H100;在一个 54 天的训练快照期内发生 466 次中断, 其中 47 次是计划维护,419 次是非计划的——折算下来大约每 3 小时中断一次22

碰见两个数字就能明白为什么不用大惊小怪23:假设一万个零件每个每天的故障概率只有万分之一, 合计起来整体每天就会有几次故障。毁掉整个行业的从来不是坏消息本身, 是不知道坏消息一定会来。

于是工程问题的重心变成「怎么让训练在故障里不断气」:定期保存检查点 (把模型和优化器的关键状态存进存储),事故后从最近的存档恢复,少丢已完成的工作24。 另一个极端样本xAI 在田纳西州改造旧厂房建的集群,约十万张卡, 书里的评价是把一座大型机场的调度、供电、消防和通信压缩进了一栋楼25

9. 电、水、地、政策

台阶爬顶,瓶颈换了主人:不再是算法也不全是芯片,而是物理。选址就是同时对四个变量求最优26

电是第一变量。 十万卡的数据中心功率按百兆瓦量级估——相当于一座中等城市的用电26; 头部公司们的「星际之门」计划更是要四年投五千亿美元、最高做到十吉瓦级别, 等于在美国境内为 AI 专建一套大型供电体系27。 水紧随其后,因为七百瓦的卡乘以十万就是七十兆瓦的热, 冷却是绕不开的账,液冷(冷却液直接流过芯片降温)甚至海底实验(把整个舱体沉进海水自然冷却)都被试过了28。 土地和政策托底:美国的项目扎堆在电价低土地便宜的几个州; 中国的对应解法是国家工程「东数西算」——把电贵的地方的算力需求,搬到电便宜且绿电多的西部去做29

最戏剧性的段落属于核电:微软签下二十年购电协议(一份长期买电的合同),重启三里岛核电站的一号机组专门给自己供电—— 那是 1979 年美国核电史上最严重事故的发生地,沉睡几十年后被 AI 叫醒;亚马逊和谷歌也各自下手买电站、投新型反应堆30

把抽象的耗电换成生活尺度的账本31:公开估算认为训练一次 GPT-4 要约 5000 万度电, 约合五千户美国家庭一年的用电,或一架大型客机横跨美国往返三四十次; 而且电要的是稳定——数据中心宕机一分钟的损失可能高达几十万美元, 所以电网宁愿选核电这类能日夜打底的电源,而不是看天吃饭的风光31

10. 算力效率工程:同样的卡榨出不同的力

硬件的天花板之下还有一层自由度,书里用 DeepSeek 当解剖标本32: 先用一句话交代它引发的争议——那个「约 558 万美元」的训练成本,准确的口径只是最终一次成功预训练的租卡费, 不含前期实验与人员;母公司实际囤了多少硬件也有多种说法。书里的裁决很干脆: 争议不重要,重要的是它示范了同样的卡,不同的用法可以差出一个量级32

它做对了什么?两条线各挑两样33:

  • 工程线:自研训练框架,不从现成工具起步而是从受限硬件反推优化; 敢用 8 位浮点(FP8,数字表达从 16 位砍到 8 位,省内存提吞吐)在超大模型上做成完整训练; 自创的双向流水线让前一节的「气泡」互相填补;关键算子直接跳过常规编程语言、用底层汇编压榨硬件。
  • 架构线:细粒度的混合专家——总参数 671B,但每个词元只激活 37B,比例约 5.5%; 以及对注意力缓存做低维压缩,同样的显存服务更多用户34

这套打法的普适结论,书里写在标题之外:算力不足时,算法和工程会被迫一起进化; 在硬件不占优的国家和团队面前,这条路只会越走越宽35

11. 从训练时代到推断时代

本章开头楼梯的主人是训练;结尾的主人正在换人。 转折的原因朴素:用户多了。亿级活跃用户每人每次提问都要真金白银地烧一次推断算力, 粗略地说,训练决定模型能不能诞生,推断决定模型能不能被大规模使用36

两种负载的脾气完全不同,书里的比方一对就对上了37:

训练推断
修一座大坝——重在许多机器一起把它推起来城市的自来水——重在每一次打开龙头都快、稳、便宜
吃什么聚合算力:一万张卡同时算延迟和单流速度:你问完下一秒就要看到答案

于是芯片江湖裂出新物种:有的公司干脆放弃通用性,把全部硅面积拿去加速「一个词一个词往外吐」, 特定场景做到单用户数百词元每秒;有的把一整块十二英寸晶圆直接做成一颗巨型芯片来砍跨卡通信38。 另一条平行赛道是把模型塞进手机和笔记本——目标是让终端设备本地跑得动几十亿到百余亿参数的小模型, 卖点三条:隐私(数据不出门)、延迟(少一来一回)、离线(飞机地下室也能用)39。 两张曲线的交叉点,书里的示意大约落在 2024 年前后:推断需求开始追平甚至反超训练40 ——这也回收了第 15 章那句「推断才是长期账单」。

12. 算力主权

把这些线拧成一股,是一个新词:算力主权——谁掌握算力,谁就更容易定义模型能力的边界; 一个国家长期拿不到同代芯片,它的模型规模上限就被外部条件锁死41。 书里把它与能源主权、粮食主权归为一类:「关键基础设施不受制于人」的国家级战略42

背景是 2022 年 10 月起逐年收紧的出口管制,以及随之而来的合规特供型号反复调整43。 这件事书里给的三层拆法很干净44:第一层,能不能买到同代硬件(管制决定); 第二层,国产芯片和配套软件栈能不能接住训练任务; 第三层,能不能用更高的训练效率弥补硬件差距——上一节 DeepSeek 的故事,正是第三层的答卷。

完整的版图远不止两家:旗舰阵营、追赶阵营、大厂自研芯片、受管制催生的国产阵容、 专注推断的新势力、塞进手机的端侧力量——六七个流派同台,而任何一个真实的产品栈都是异构混搭: 训练在这一家、云端推断在那一家、你的手机又是第三家45。 至于哪家通吃,书里的回答保持了学者的诚实:目前没人说得准45

13. 摩尔定律慢下来之后

最后的老问题:涨势还能持续多久?半个世纪的默认答案是摩尔定律——1965 年提出的经验观察: 集成电路上可容纳的晶体管数每隔 18 到 24 个月翻一倍46。 2015 年以后明显放缓:晶体管已经小到几个原子的尺度, 量子隧穿和漏电让继续缩小越来越难,每一代节点的研发和建厂成本指数上升47。 但「死了」是夸张说法——业内元老的评语是「慢了,但还没死」,2 纳米之后还有 1.4 纳米和埃米级48

替补队员们已经列队49,各带各自的短板——先认识一个反复出现的词:良率(造出来能用的比例):

路径核心想法现状
3D 堆叠(把多层电路在竖直方向叠起来)高带宽显存就是此路先驱已量产
芯粒大芯片拆成小芯片分别造再封装互联,良率(造出来能用的比例)升、成本降已进入旗舰产品
光子芯片用光信号代替电信号传输工程化早期
专用 ASIC为单一负载定制电路,效率高出一个数量级已商用(Groq 等)
神经形态计算模仿大脑突触的脉冲式计算,极省电研究与小众应用
量子计算对部分问题指数加速离实用尚远

综合的预期也因此务实了很多:指数曲线大概率还能走下去,只是节奏从 「每两年翻倍」滑向「每三年、每四年翻倍」50——留出来的时间差, 正好是算法和工程(上一节)表演的舞台。

14. 作者的判断与证据

有证据的部分。 卧室机器的细节、Llama 3 的 466 次中断统计、H100 的参数表、 GPT-4 五千万度电的公开估算、三里岛购电协议,均有公开出处或报告来源; DeepSeek 各项技术的口径也都注明「据其公开材料」。

要分开看的四处:

  1. 成本与硬件储备的传闻偏多。 558 万美元的口径问题书里专门澄清过32; 关于其母公司囤卡数量的「据传」,可靠性更低,只当背景。
  2. 能耗数字全部来自外部估算。 五千万度电这类数字的定义域是「量级感」, 不是审计后的电表读数。
  3. 各家的路线名与技术名词更新极快。 本章的具体型号(H100/B200 等)保鲜期以年计; 楼梯层级、切法三分、故障统计思路这些结构知识耐用得多。
  4. 「推断追平训练」是示意而非实测。 书里的那张图自己注明了「不对应实测数值」40, 定性的方向可靠,别引用其中任何坐标。

判断(我们的,不是书里的):「天作之合」听起来像运气,其实是双向筛选的结果。 硬件一方筛选标准明确——矩阵乘法、无序贯依赖、结构均匀; 之后所有赢下的算法恰好都长这样。所谓幸运的相遇, 更像是拿着筛子等来了第一个合格的候选人。 如果错,会错在: 如果后续出现同样满足三条性质、却在别的维度更优的架构 (比如线性注意力和状态空间模型这一支)并被生态大规模接纳, 那么「天作之合」就要改写成「一段婚姻只维持了一个技术代际」。

判断(我们的,不是书里的):万分之一乘以一万零件的那个算术,是全章最重要的一行。 它说明故障率不是管理水平问题,是规模本身的属性—— 同一个乘法会在第 20 章换个身份重新出场:单步九成五的正确率, 连乘二十步只剩三成六。大系统的可靠性数学,从来不做加法,只做乘法。 如果错,会错在: 现实工程里有冗余和容错设计,实际故障间隔常常优于朴素算术的预测; 但「随规模劣化」的方向从未被推翻过。

15. 边界与局限

  • 书里不教你怎么搭集群。 具体到采购、组网、调参的内容一概没有,这一版刻意保持通识海拔。
  • 国家与厂商的具体产能数字多为报道口径。 出口管制的时间线可靠,产能与代差比较书里明确反对写成单卡固定百分比44
  • 尚未覆盖运维监控的实操栈。 检查点之外的容错手段(冗余备份、自动换卡)只顺带一提24
  • 量子与神经形态两节只有地图没有路线图。 两者何时实用,书里只给了「尚远」的定性。
  • 本章与第 15 章成本数字有意重叠一处。 DeepSeek 成本的口径声明两边都有, 因为那是全书唯一一次真实价格进入讨论,重复强调是有意的。

16. 可带走的

  1. 起点是一台卧室台式机:两块 3GB 游戏卡,模型被劈开各装一半。 并行是被逼出来的。
  2. GPU 合用是因为「一万件简单事同时做」恰好对上了矩阵乘法的胃口;CPU 是顺序做事的形状。
  3. CUDA 的护城河是生态不是硬件。 一项被视为多余的投资守了十年才等到主权时刻。
  4. 算法也被硬件反向选择:注意力赢有一部分原因是它长了显卡爱吃的样子。
  5. 一级楼梯记四个价:节点数十万美元、满配机柜数百万美元、机房要求微秒级延迟、数据中心按公顷算。
  6. 万卡时代的瓶颈常是通信不是算力:节点内拼带宽,节点间拼稳定。
  7. 切模型只有三个方向:切数据、切层内、切层间;实战三者混搭。
  8. 每 3 小时断一次电是正常日子:1.6 万卡 54 天 466 次中断,419 次非计划。
  9. 故障率是乘法题:万分之一乘以一万个零件,每天都有几次——规模自带坏消息。
  10. 选址第一问是电,十万卡≈一座中等城市的用电;训练一次 GPT-4≈五千户家庭一年。
  11. 算力效率是可以主动挣的:同样的卡,8 位精度、混合专家、底层优化的组合能差出量级。
  12. 推断曲线追平训练曲线(约 2024 年前后,示意):注意力从此分给「快、稳、便宜」。
  13. 算力主权=基础设施不受制于人,三层防线:买得到、接得住、跑得更省。
  14. 摩尔定律慢而未死,翻倍周期从两年滑向三四年。 效率工程的窗口因此敞开着。

17. 原文地图

主题原书章原文位置
卧室台式机与劈开第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:13(搜「卧室」)· :15(搜「劈开」)
千卡到万卡的陡度第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:18(搜「千卡级」)· :19(搜「数万卡」)
软件故事与物理故事第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:26(搜「物理的故事」)
渲染的本职第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:32(搜「渲染 3D」)· :36(搜「大规模并行」)
矩阵乘法同构第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:38(搜「1024」)· :39(搜「一万件简单事情」)
CUDA 决定第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:44(搜「2006 年」)· :45(搜「Compute Unified」)
生不逢时的十年第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:49(搜「生不逢时」)
生态护城河第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:55(搜「护城河不是硬件」)· :58(搜「认了」)
RNN 窄楼梯第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:64(搜「不够痛快」)· :65(搜「单人通行的窄楼梯」)
全是大矩阵第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:67(搜「大块矩阵」)· :71(搜「暗号」)
结构均匀易切第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:78(搜「高度均匀」)· :81(搜「奇怪大楼」)
带着曲线图烧钱第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:86(搜「曲线图烧钱」)
最幸运的相遇第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:90(搜「改进机器翻译」)· :92(搜「最幸运」)
H100 参数第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:106(搜「H100」)· :110(搜「头发丝」)· :117(搜「3.35」)· :119(搜「700 瓦」)
四个极值总结第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:126(搜「松手」)· :127(搜「倒进它的嘴里」)· :129(搜「尺度极小」)
B200 与整柜第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:148(搜「B200」)· :152(搜「72 颗」)· :154(搜「超大」)
集群四级第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:205(搜「节点」)· :210(搜「机柜」)· :213(搜「机房」)· :217(搜「数据中心」)
通信是隐形瓶颈第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:223(搜「决定训练速度」)· :225(搜「严重低估」)
两级通道与倍数第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:229(搜「记住分层」)· :230(搜「楼梯」)· :235(搜「900」)
收购与以太网反击第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:248(搜「Mellanox」)· :250(搜「Ultra Ethernet」)
必须切几百上千卡第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:256(搜「数 TB」)· :257(搜「80GB」)
三种切法第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:260(搜「数据并行」)· :265(搜「张量并行」)· :269(搜「流水线并行」)
气泡与小批次第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:293(搜「气泡」)· :272(搜「连续填入」)
3D 并行与框架第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:293(搜「3D 并行」)· :299(搜「脚手架」)· :300(搜「平民化」)
466 次中断第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:303(搜「Llama 3」)· :305(搜「419 次」)· :306(搜「每 3 小时」)
故障率的算术第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:308(搜「不可避免」)· :309(搜「万分之一」)
检查点恢复第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:310(搜「不被打断」)· :311(搜「checkpoint」)
十万卡厂房第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:313(搜「Colossus」)· :316(搜「一栋楼」)
选址四变量第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:320(搜「电、水、土地、政策」)· :322(搜「百兆瓦」)
星际之门第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:325(搜「星际之门」)· :325(搜「5000 亿」)
冷却与海底实验第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:328(搜「液冷」)· :330(搜「Natick」)
东数西算第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:333(搜「东数西算」)· :336(搜「搬到电费便宜」)
三里岛重启第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:339(搜「三里岛」)· :346(搜「讽刺」)
能耗生活账本第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:371(搜「5000 万度」)· :372(搜「波音 747」)· :390(搜「宕机」)· :391(搜「基荷电源」)
DeepSeek 口径澄清第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:447(搜「2048 块 H800」)· :451(搜「幻方量化」)· :454(搜「有效算力」)
FP8 与底层优化第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:466(搜「FP8」)· :472(搜「DualPipe」)· :476(搜「PTX」)
细粒度混合专家第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:481(搜「671B」)· :487(搜「低维隐空间」)
效率工程的演化第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:505(搜「被迫一起进化」)· :511(搜「越走越宽」)
训练决定诞生,推断决定使用第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:516(搜「亿级」)· :519(搜「能不能被大规模使用」)
大坝与自来水第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:522(搜「大坝」)· :523(搜「聚合算力」)
推断新势力第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:527(搜「数百词元」)· :529(搜「12 英寸晶圆」)
端侧三卖点第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:535(搜「不上云」的位置改为搜「量化后的小型」)· :539(搜「隐私」)
交叉点示意第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:544(搜「端云协作」)· :546(搜「追平甚至反超」)· :558(搜「实测数值」)
摩尔定律定义与放缓第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:565(搜「18 到 24 个月」)· :567(搜「物理极限」)· :570(搜「数百亿美元」)
慢而未死第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:572(搜「夸张说法」)· :573(搜「还没死」)
六条突围路第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:579(搜「3D 堆叠」)· :582(搜「芯粒」)· :588(搜「ASIC」)· :590(搜「神经形态」)· :593(搜「量子计算」)
翻倍周期变慢第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:597(搜「每三年翻倍」)
水电煤成熟态第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:601(搜「蒸汽和铁路」)· :604(搜「水电煤」)· :608(搜「集中与分散」)
不思考但没有它们不存在第9章 钢与硅:AI 的物理底座text/10-ch09-9-ai.txt:622(搜「不像」)· :623(搜「默默运转」)

Footnotes

  1. 出处:「第9章 钢与硅:AI 的物理底座」第 13 至 16 段 (text/10-ch09-9-ai.txt:13,搜「卧室」;:15,搜「劈开」)。 2

  2. 出处:「第9章 钢与硅:AI 的物理底座」第 18 至 19 段 (text/10-ch09-9-ai.txt:18,搜「千卡级」;:19,搜「数万卡」)。

  3. 出处:「第9章 钢与硅:AI 的物理底座」第 32 至 36 段 (text/10-ch09-9-ai.txt:32,搜「渲染 3D」;:36,搜「大规模并行」)。 2

  4. 出处:「第9章 钢与硅:AI 的物理底座」第 38 至 39 段 (text/10-ch09-9-ai.txt:38,搜「1024」;:39,搜「一万件简单事情」)。 2

  5. 出处:「第9章 钢与硅:AI 的物理底座」第 44 至 51 段 (text/10-ch09-9-ai.txt:44,搜「2006 年」;:49,搜「生不逢时」)。 2 3

  6. 出处:「第9章 钢与硅:AI 的物理底座」第 55 至 58 段 (text/10-ch09-9-ai.txt:55,搜「护城河不是硬件」;:58,搜「认了」)。

  7. 出处:「第9章 钢与硅:AI 的物理底座」第 63 至 66 段 (text/10-ch09-9-ai.txt:64,搜「不够痛快」;:65,搜「单人通行的窄楼梯」)。

  8. 出处:「第9章 钢与硅:AI 的物理底座」第 67 至 71 段 (text/10-ch09-9-ai.txt:67,搜「大块矩阵」;:71,搜「暗号」)。

  9. 出处:「第9章 钢与硅:AI 的物理底座」第 78 至 82 段 (text/10-ch09-9-ai.txt:79,搜「上百层」;:81,搜「奇怪大楼」)。

  10. 出处:「第9章 钢与硅:AI 的物理底座」第 86 至 87 段 (text/10-ch09-9-ai.txt:86,搜「曲线图烧钱」)。

  11. 出处:「第9章 钢与硅:AI 的物理底座」第 89 至 93 段 (text/10-ch09-9-ai.txt:90,搜「改进机器翻译」;:92,搜「最幸运」)。 「天作之合」的书内原话在第 62 段(text/10-ch09-9-ai.txt:62,搜「天作之合」)。

  12. 出处:「第9章 钢与硅:AI 的物理底座」第 105 至 123 段 (text/10-ch09-9-ai.txt:108,搜「SXM5」;:110,搜「头发丝」;:113,搜「地球人口」;:117,搜「3.35」;:119,搜「700 瓦」;:121,搜「数万美元」)。

  13. 出处:「第9章 钢与硅:AI 的物理底座」第 125 至 129 段 (text/10-ch09-9-ai.txt:127,搜「倒进它的嘴里」;:129,搜「尺度极小」)。

  14. 出处:「第9章 钢与硅:AI 的物理底座」第 148 至 155 段 (text/10-ch09-9-ai.txt:148,搜「B200」;:149,搜「180」;:154,搜「超大 GPU」)。

  15. 出处:「第9章 钢与硅:AI 的物理底座」第 204 至 220 段 (text/10-ch09-9-ai.txt:205,搜「通常装 8 颗」;:206,搜「数十万美元」;:211,搜「数百万美元」;:216,搜「空等」;:218,搜「几公顷」)。

  16. 出处:「第9章 钢与硅:AI 的物理底座」第 222 至 225 段 (text/10-ch09-9-ai.txt:223,搜「决定训练速度」;:225,搜「严重低估」)。

  17. 出处:「第9章 钢与硅:AI 的物理底座」第 227 至 236 段 (text/10-ch09-9-ai.txt:229,搜「记住分层」;:233,搜「超巨型」;:236,搜「900」)。

  18. 出处:「第9章 钢与硅:AI 的物理底座」第 248 至 252 段 (text/10-ch09-9-ai.txt:248,搜「Mellanox」;:251,搜「性能相当」)。

  19. 出处:「第9章 钢与硅:AI 的物理底座」第 255 至 273 段 (text/10-ch09-9-ai.txt:256,搜「数 TB」;:260,搜「数据并行」;:266,搜「张量并行」;:270,搜「流水线并行」)。 表格中的「代价」一列是对原文相应段落的浓缩。

  20. 出处:「第9章 钢与硅:AI 的物理底座」第 292 至 293 段 (text/10-ch09-9-ai.txt:293,搜「组合起来形成」)。

  21. 出处:「第9章 钢与硅:AI 的物理底座」第 294 至 300 段 (text/10-ch09-9-ai.txt:299,搜「脚手架」;:300,搜「平民化」)。

  22. 出处:「第9章 钢与硅:AI 的物理底座」第 303 至 307 段 (text/10-ch09-9-ai.txt:304,搜「466 次」;:305,搜「419 次」;:306,搜「每 3 小时」)。

  23. 出处:「第9章 钢与硅:AI 的物理底座」第 308 至 309 段 (text/10-ch09-9-ai.txt:309,搜「万分之一」)。

  24. 出处:「第9章 钢与硅:AI 的物理底座」第 310 至 312 段 (text/10-ch09-9-ai.txt:311,搜「checkpoint」)。 2

  25. 出处:「第9章 钢与硅:AI 的物理底座」第 313 至 316 段 (text/10-ch09-9-ai.txt:314,搜「10 万张」;:316,搜「一栋楼」)。

  26. 出处:「第9章 钢与硅:AI 的物理底座」第 320 至 323 段 (text/10-ch09-9-ai.txt:322,搜「百兆瓦」)。 2

  27. 出处:「第9章 钢与硅:AI 的物理底座」第 324 至 326 段 (text/10-ch09-9-ai.txt:325,搜「5000 亿」)。

  28. 出处:「第9章 钢与硅:AI 的物理底座」第 327 至 331 段 (text/10-ch09-9-ai.txt:327,搜「70 兆瓦」;:330,搜「Natick」;:331,搜「故障率比陆地还低」)。

  29. 出处:「第9章 钢与硅:AI 的物理底座」第 332 至 336 段 (text/10-ch09-9-ai.txt:334,搜「内蒙古」;:336,搜「搬到电费便宜」)。

  30. 出处:「第9章 钢与硅:AI 的物理底座」第 339 至 345 段 (text/10-ch09-9-ai.txt:339,搜「三里岛」;:344,搜「Cumulus」;:344,搜「Kairos」)。

  31. 出处:「第9章 钢与硅:AI 的物理底座」第 371 至 374、390 至 391 段 (text/10-ch09-9-ai.txt:372,搜「5000 户」;:372,搜「波音 747」;:390,搜「宕机」;:391,搜「基荷电源」)。 2

  32. 出处:「第9章 钢与硅:AI 的物理底座」第 450 至 455 段 (text/10-ch09-9-ai.txt:451,搜「幻方量化」;:454,搜「有效算力」)。 2 3

  33. 出处:「第9章 钢与硅:AI 的物理底座」第 461 至 478 段 (text/10-ch09-9-ai.txt:462,搜「HAI-LLM」;:466,搜「FP8」;:472,搜「DualPipe」;:476,搜「PTX」)。

  34. 出处:「第9章 钢与硅:AI 的物理底座」第 480 至 489 段 (text/10-ch09-9-ai.txt:481,搜「671B」;:488,搜「隐空间」)。

  35. 出处:「第9章 钢与硅:AI 的物理底座」第 504 与 510 至 511 段 (text/10-ch09-9-ai.txt:505,搜「被迫一起进化」;:511,搜「越走越宽」)。

  36. 出处:「第9章 钢与硅:AI 的物理底座」第 516 至 519 段 (text/10-ch09-9-ai.txt:376,搜「亿级」;:519,搜「大规模使用」)。

  37. 出处:「第9章 钢与硅:AI 的物理底座」第 522 至 524 段 (text/10-ch09-9-ai.txt:522,搜「大坝」;:523,搜「聚合算力」;:523,搜「打开水龙头」)。

  38. 出处:「第9章 钢与硅:AI 的物理底座」第 525 至 530 段 (text/10-ch09-9-ai.txt:527,搜「数百词元」;:529,搜「12 英寸晶圆」)。

  39. 出处:「第9章 钢与硅:AI 的物理底座」第 534 至 539 段 (text/10-ch09-9-ai.txt:536,搜「NPU」;:539,搜「隐私」)。

  40. 出处:「第9章 钢与硅:AI 的物理底座」第 546 与 558 段 (text/10-ch09-9-ai.txt:546,搜「追平甚至反超」;:558,搜「实测数值」)。 2

  41. 出处:「第9章 钢与硅:AI 的物理底座」第 432 至 436 段 (text/10-ch09-9-ai.txt:433,搜「算力主权」;:434,搜「边界」)。

  42. 出处:「第9章 钢与硅:AI 的物理底座」第 437 至 438 段 (text/10-ch09-9-ai.txt:437,搜「能源主权」)。

  43. 出处:「第9章 钢与硅:AI 的物理底座」第 410 至 414 段 (text/10-ch09-9-ai.txt:410,搜「2022 年 10 月」;:412,搜「H20」)。

  44. 出处:「第9章 钢与硅:AI 的物理底座」第 415 至 417 与 424 段 (text/10-ch09-9-ai.txt:415,搜「三层」;:424,搜「固定百分比」)。 2

  45. 出处:「第9章 钢与硅:AI 的物理底座」第 164 与 197 至 199 段 (text/10-ch09-9-ai.txt:166,搜「三大类」;:198,搜「异构混合」;:199,搜「说得准」)。 2

  46. 出处:「第9章 钢与硅:AI 的物理底座」第 564 至 566 段 (text/10-ch09-9-ai.txt:565,搜「18 到 24 个月」)。

  47. 出处:「第9章 钢与硅:AI 的物理底座」第 567 至 571 段 (text/10-ch09-9-ai.txt:567,搜「物理极限」;:570,搜「指数上升」)。

  48. 出处:「第9章 钢与硅:AI 的物理底座」第 572 至 574 段 (text/10-ch09-9-ai.txt:572,搜「夸张」;:574,搜「埃米级」)。

  49. 出处:「第9章 钢与硅:AI 的物理底座」第 577 至 595 段 (text/10-ch09-9-ai.txt:579,搜「3D 堆叠」;:583,搜「芯粒」;:588,搜「ASIC」;:590,搜「神经形态」;:593,搜「量子计算」)。

  50. 出处:「第9章 钢与硅:AI 的物理底座」第 596 至 598 段 (text/10-ch09-9-ai.txt:597,搜「每三年翻倍」)。