跳到主要内容

从一次千亿市值的翻车,进产业篇

这一章讲三件事: 为什么产业篇要从一次翻车讲起; 这个产业分成哪四层;以及最底下两层各自在卖什么。

它在全书链条里的位置: 第 05 章说它会编、而且越准越危险。 这一章把那句判断换算成钱。 第 17、18 章接着往上讲第三层和第四层。

1. 同样是编错一次,创业公司没事,搜索巨头是千亿

这一节是产业篇真正的开头,它比任何一张产业地图都更能说明问题。

时间线只有两个月,请按顺序看:

时间发生了什么
2022 年 12 月上旬谷歌一次全员沟通会上,有员工问:ChatGPT 上线未满一周就收获百万用户,这是否证明谷歌错失了一次重大机会?1
同一场会那位技术负责人的回答是:这类东西仍然存在一些问题,谷歌有能力提供同样的产品,但如果在产品尚不成熟时就公之于众,产品可能在提供信息时出错,就会招致更大的「声誉风险」——所以谷歌需要**「比小型初创公司更保守」**2
同一场会首席执行官的表态是:在这个新领域需要兼顾勇气和责任,必须维持好平衡3
仅仅十余天后首席执行官在公司内部发出了「红色代码」警报,推动多个团队快速集结;他甚至把两位创始人拉进这些会议中,而这两人自 2019 年后就已淡出公司运营4
2023 年 2 月初谷歌在发布会上展示了同类产品 Bard;Bard 在短短的演示中暴露了一个事实错误——它误认为世界上首张太阳系外行星照片是由詹姆斯·韦伯太空望远镜拍摄到的5
错误被公众发现后股价暴跌 9%,市值损失千亿美元5
同期微软发布集成了这类能力的搜索引擎,一个月内下载量增长了 8 倍之多6

书里对这件事的解读是两句话,两句都要记住:

第一句是对那位技术负责人的:「接下来发生的事情证明,谷歌是对的。」 Bard 那次翻车完美印证了他的判断——这类东西目前都存在问题7

第二句是本章的核心:虽然 ChatGPT 也会犯错, 但谷歌作为全球最大的搜索引擎公司,其产品一旦出错,就被公众舆论放大, 其承担的风险将远大于创业公司7

把第 05 章那条判断换算一下:

创业公司编错一次搜索巨头编错一次
技术上一样一样
后果用户抱怨一句9% 股价,千亿美元市值
原因没人指望它准所有人都指望它准

这就是「越准越危险」在产业上的价钱: 你越被信任,你犯的每一个错就越贵。

书里还给这件事贴了一个标签:创新者窘境—— 成功的公司往往会被自己现有的市场和客户束缚,而忽视新兴的技术和市场的需求, 从而导致被更具创新力和灵活性的新进入者所颠覆8具体到这里:这类应用是搜索引擎的潜在替代品,而它的商业模式尚不明晰; 一旦替代发生,新的收入能不能弥补搜索收入的损失,这是那位首席执行官要考虑的9。 (这笔账在第 18 章会被算得更细。)

2. 四层地图:钱是怎么流的

这一节给出产业篇的骨架,后面三章各占一层或两层。

书里的分法是四层10:

┌─────────────────────────────────────────┐
│ 应用层 直接面对用户 ── 第 18 章 │
├─────────────────────────────────────────┤
│ 模型即服务层 把模型包成按次收费的服务 │
│ ── 第 17 章 │
├─────────────────────────────────────────┤
│ 软件基础设施层 三块 ──── 本章第 7–9 节 │
├─────────────────────────────────────────┤
│ 硬件基础设施层 显卡和云 ── 本章第 3–6 节│
└─────────────────────────────────────────┘

这张地图和代序里那张是同一张(第 07 章第 8 节核对过)。

本章讲最底下两层。 先说结论:这两层是这一轮里商业模式最清晰、 也最先赚到钱的两层。

3. 硬件那一层:为什么非显卡不可

这一节先说清楚这一层在卖什么力气。

先立一个词:这一行数算力,数的是「每秒能做多少次带小数点的加减乘除」, 这种运算叫浮点运算。

书里引了一句投资公司的话当题记,这句话说得很直白: 一切数据处理都要经过基础设施厂商之手,他们收割了产业回报; 算力的每秒浮点运算次数成了生成式 AI 的命脉11

为什么用显卡而不是普通处理器? 书里的理由只有一句: 它擅长并行——就是「同时干很多份一模一样的活」; 而这一行要算的正是那种活12

书里管那种活叫矩阵运算——矩阵就是一张排成方阵的数表, 成千上万个数排成行和列,一次算一大片。

4. 四个要求,每一个都有数

这一节把那四个要求逐条对上具体的数。

先把三个词讲清楚,不然下面那张表读不懂。

显存:就是那张卡自己身上的存放空间——参数和中间结果都得先搬进去,它才算得动。

带宽:就是「每秒能搬多少数据」,像水管的粗细。

字节:就是数据量的基本单位,一个英文字母大约占一个字节,一个汉字通常占三个。

大模型对这张卡提了四个要求13:

要求为什么对应的数(以书里点名的那张卡为例)
更高的计算能力规模一大,计算量翻着跟头涨每秒 1979 万亿次 16 位浮点计算14
更大的显存容量装得下整个模型,就不用频繁去别处取80 GB14
更快的显存带宽数据要在存放的地方和计算的地方之间快速来回每秒 3.35 万亿字节14
更高效的多卡通信一张卡装不下,就要拆到多张卡上,卡之间要同步最多可连接 256 张,跨卡通信每秒 9000 亿字节14

这张卡有名字,而且你在任何一份机房报价单或显卡规格页上都会撞见它: 书里点名的这一张叫 H100,它的上一代专业卡叫 A10014

那 1979 万亿次是什么概念? 书里自己给了两个参照物,这是全书最好的一处对照: 索尼那台游戏机的显卡是 10.28 万亿次,A100 是 312 万亿次14也就是说:它是那台游戏机的约 190 倍,是上一代专业卡的约 6 倍。

表里最后一行那两个数也要放在一起读:卡之间每秒 9000 亿字节, 而同一张卡内部的显存带宽是每秒 3.35 万亿字节—— 也就是说,卡跟卡说话的速度只有卡跟自己说话的四分之一左右。 这个四分之一就是下一节那个瓶颈的来处。

换成业务上的效果: 以 1750 亿参数那一代(也就是第 02 章那个 GPT-3)为例, 训练速度最高提升 12 倍(与 A100 相比); 在 5300 亿参数那个模型上,每张卡每秒能处理的量比 A100 高 30 倍; 而「你按下去到它开口」之间的那段等待,可控制在 1 秒之内15—— 1 秒大约是你正常说话说出两三个字的工夫(这个参照是我们补的常识,不在书里)。

5. 一台机器装不下,于是网络成了瓶颈

这一节讲一个外行最容易忽略、但决定成败的东西。

书里说得很清楚:一台机器(书里叫计算节点,就是一台装了 8 张卡的机器) 往往装不下,需要连接多台机器一起训—— 这种做法叫分布式训练;这就要求数据中心具备更高的核心网带宽16

当时的量级:云服务厂商可以提供每秒数百吉比特的核心网带宽, 未来可以达到每秒万亿比特的级别17

5.1 先说被比下去的那一方:办公室里那根网线

这一小节只讲一件事:平常机器之间是怎么说话的。

办公室、机房里那根网线用的是一套通行了几十年的收发规矩,这套规矩叫以太网

在它上面还叠着另一套规矩,管的是「这段数据发给谁、走哪条路、丢了怎么重发」。 这套规矩你在任何一份网络设置页面上都会撞见,它的名字叫 TCP/IP

这两套规矩为什么在这里不够用? 因为它们把数据交出去之前, 要先请机器上那套管收发的系统程序过一道手,还要占用处理器去打包拆包。 平时上网这点开销可以忽略,可训练时几百台机器要不停地互相核对中间结果,这道手就成了瓶颈。

5.2 那种关键技术:让两台机器的内存直接对话

这一小节讲书里点名的那种做法,以及它凭什么快。

书里点名的做法是:把数据直接从一台机器的内存快速搬到另一台机器的内存里, 绕开双方那套管收发的系统程序,也不劳烦处理器18这种做法的名字叫 RDMA(远程直接内存访问)18—— 你在任何一份机房网络方案里都会撞见这四个字母。

绕开中间环节换来什么? 书里给了两样。 第一样叫吞吐——就是「单位时间里能过多少量」——很高,占用也低18

第二样叫时延——就是「从发出到收到隔了多久」——很低18这两样正好对应第 4 节末尾那个四分之一:卡之间的话说得越快、等得越短, 那一堆卡才越像一台机器。

这条路上有两种方案,先把两个名字挂在这儿。 一种自己拉专线,名字叫 InfiniBand(书里译成「无限宽带技术」,缩写 IB); 另一种把同样的报文塞进以太网的包里收发,名字叫 RoCE19

两者的取舍书里写得很实用19:

方案好处代价
专线那种(IB)带宽利用率更高,能支撑更大规模的训练集群(集群就是「一堆机器当一台使」)无法兼容现有以太网,要换网卡和交换机,部署运维成本不菲
架在以太网上那种(RoCE)被认为是低成本解决方案性能上有一些损失

这一节的意义在于:它解释了为什么「买卡」不等于「有算力」。 卡之间连不好,买再多也跑不满。

6. 主走查:训一个 130 亿参数的模型要多少钱

这是本章的主走查。四步,每一步都有可核的数。

书里这笔账出现在第 15 章那场对话里,由几个角色一句一句算出来。 我们把它整理成一条走查,每个数都标了出处

第几步算什么
1官方论文给的训练消耗13.5 万卡时(用 80 GB 显存的那种专业卡)20
2假设你有 1000 张卡13.5 万 ÷ 1000 = 135 小时
3换算成天135 ÷ 24 ≈ 5 天半20
4光买这 1000 张卡要多少钱差不多 1 个亿人民币20

第 4 步那个数是这条走查的落点:1 亿元只是卡钱,不含机房、电、人。 书里另一处把完整的门槛给出来了:大模型预训练的资金门槛在几个亿到几十个亿之间 (对应百亿级到千亿级参数的模型)21

顺带记住一个对照: 这一代 130 亿参数的模型, 推理只用上一代的单卡就能完成20—— 训练要 1000 张卡跑五天半,而用起来只要一张老卡。 这个不对称是整个产业的经济学基础(第 18 章会把它变成一条横线)。

这一层为什么最先赚到钱? 书里的理由很硬: 提供商预训练和微调时要用它;行业客户拿私域数据微调时要用它; 最终用户使用应用时,还要用它来推理—— 每一个环节都能创造面向企业的收入22

7. 软件那一层,第一块:让多机多卡一起干活

从这一节开始讲第四层。这一层有三块,书里逐块讲了。

第一块是框架。 书里先给了一个好懂的定位: 有人将深度学习框架比作深度学习的操作系统—— 它提供预定义的组件(抽象层)、管理计算资源、适配不同硬件23这一层的几个名字你在任何一份招聘启事上都会撞见:书里点的是 谷歌大脑做的 TensorFlow、Meta 做的 PyTorch、百度做的飞桨(PaddlePaddle)23

为什么大模型需要它的「分布式」版本? 书里列了四件事24: 大规模计算、数据与模型与流水线三种并行、高效的资源利用、容错和恢复最后一条最容易被忽略:训练时间很长,中途某台机器坏了, 有容错和恢复机制就不必从头再来。

书里把实现方式分成两类,这个分法很清楚25:

类型做法书里点名的例子
叠加式在已有框架之上再提供分布式能力,两者分工:一个管任务调度、资源管理和容错,另一个管模型怎么搭、怎么训、怎么调得更好ChatGPT 项目里用的那一套组合叫 Ray on PyTorch:调度和容错归 Ray,搭模型和训模型归 PyTorch26
全栈式专为大模型解决横向扩展、原生支持分布式的框架,不需要定制化开发,兼容多种底层硬件国内一个把源码公开出来的框架,名字叫 OneFlow27

这一块的商业模式,书里说得很实在:除了常见的高级功能年费、技术咨询费、 定制开发费之外,还有一条新路—— 把框架技术投入某一家模型提供商、提供定制的技术能力,从对方的商业收入中分成; 书里那句总结很直白:如果做框架本身不好挣钱,但客户能挣钱,那么就加入你的客户28

8. 软件那一层,第二块:数据这门生意

这一节讲的东西第 02 章提过一句(「数据要大,更要精」),这里是它的产业形态。

先分清哪一步要人。 标注:就是「给一条数据写上正确答案或打上分类」。 书里说,预训练阶段需要的数据量极大,但不需要人来标注, 可以通过购买、合作、抓取获得;而后面两个阶段(监督微调和强化学习)都需要人标过的样本29

标注样本有四种来源30:

来源具体做法关键细节
1 专业人员标注分两类人:培训后即可上岗的标注人员,和对学历与行业经验要求高的垂直行业人员训练阶段曾有几十位博士参与标注,编写对话答案或给答案评分31
2 收集用户反馈用户重新生成回答之后,系统问「新老两个回答哪个更好」这是数据数量最大、性价比最高的一种32
3 公域或三方数据公开的互联网数据,或其他产品的数据必须符合法律规定;书里举了一个浏览器插件的例子,用户在上面分享自己的对话记录33
4 企业私域数据企业客户自己的数据归到模型服务层去讲

第 1 种的成本压力,书里写得很坦白。 那家专业标注公司降成本的两个办法是: 尽量把任务分解、在某些环节降低对人员学历和专业素质的要求, 把更多人力工作外包给东南亚、非洲、南美等地; 以及在积累到一定数据量之后,先用机器标注、再由人工审核34

第 2 种最值得讲,因为它会自己转起来。 书里把这个循环叫数据飞轮—— 早于竞争对手发布产品 → 提前拿到更多数据 → 加入训练、体验变好 → 吸引更多用户 → 收集到更多数据35这是一个自我强化的循环,而且它在第 17、19 章还会各出现一次。

9. 软件那一层,第三块:那个托管着十万个模型的地方

这一节讲第三块,它是这一层里最不像「软件」的一块。

书里的类比很好懂:在软件行业,最大的代码托管和协作社区叫 GitHub—— 开发者在上面做版本管理、协作开发、分享和复用别人的东西; 而在模型这一侧,有一个对应的地方,它的名字叫 Hugging Face36这两个名字都得记住:你以后但凡去下载一个模型或一段代码,九成会落在这两个地方之一。

这个地方的用户分两类37:

在这里干什么
模型托管者(通常是研发方)托管并共享预训练模型和数据集
模型使用者挑合适的模型、在社区里协作和评价、把选定的模型投入生产;训练和推理都能在平台上完成

顺带把一个词讲清楚:把源码和那一堆训练好的数公开出来、 别人可以下载、可以改、还可以再放出去,这种做法叫开源。

规模有多大? 书里给的数: 从 2019 年一个模型的分享起步,上万家公司都在使用他们的服务; 接受该社区托管的模型超过 10 万个,其中半数以上是开源的38这两个数放在一起才有量感:上万家公司对十万个模型, 平均每家公司背后大约躺着十个模型——它不是一个小众的资料站,是这一行的默认货架。

它的价值在哪? 书里用了一个经济学的说法: 它是一个双边平台,为模型研发者(科学界)和模型使用者(产业界)搭建桥梁, 弥补了科学与生产之间的鸿沟39国内类似的模型库社区,书里点名了阿里的那一个39

商业模式? 书里说得很清楚:完全是面向企业的—— 与其他开源项目的商业化相似,主要通过高级功能付费、定制服务项目费赢利, 也可以扩展到云计算代理领域40

这一块为什么容易被漏掉? 因为它既不生产模型,也不生产算力。 但第 17 章那个用 8 张卡一天做出来的模型,它的底座就是从这里下载的—— 没有这一块,那一章的故事讲不成。

10. 作者的判断与证据

说法性质
那次全员会、红色代码、Bard 翻车、9%、千亿新闻事实,可核
「谷歌是对的」作者的判断,而且这个判断有事实支撑
显卡四个要求与那些数厂商公开规格
训练一个 130 亿参数模型的账书里角色对话中的估算,基于论文里的卡时数
「几个亿到几十个亿」的门槛估算,书里没有给测算过程
框架的两类实现技术事实
标注外包的成本控制方式事实,而且书里没有回避它不好看
数据飞轮商业分析,不是可测量的模型

必须点破的一处:这一章讲硬件时用的全是某一家的产品参数。 书里对国产替代只给了一段(书里点名了一家国内芯片厂商的产品41), 而且没有做同口径对比。 读的时候要知道:这一章的数字有强烈的单一厂商色彩。

11. 边界与局限

  • 书里没有讲显卡的供给约束会持续多久。 它在这一章末尾把这个问题列成了「思考题」, 自己没有回答。
  • 书里没有讲电。 代序里那笔电费账(第 07 章第 5 节)在这一章一次都没有被接上—— 产业篇讲了卡、讲了网、讲了框架,唯独没讲电。
  • 标注工人的处境书里只字未提。 外包到低成本地区这件事只当成本控制手段来写, 没有一句关于那些人的工作条件。
  • 模型库社区的合规风险没有讨论。 十万个模型里那些数是从哪来的、按什么许可放出来的、 被下载之后怎么用,一句没有。

12. 可带走的

  1. 产业篇的真正开头是一次翻车:同样是会编,创业公司没事,搜索巨头是 9% 股价、千亿市值。
  2. 四层:硬件 → 软件 → 模型即服务 → 应用。 钱从下往上流,先赚到钱的在最下面。
  3. 显卡的四个要求:算得快、装得下、搬得快、连得好。
  4. 1979 万亿次 ≈ 那台游戏机显卡的 190 倍——这是全书最好用的一个参照物。
  5. 训一个 130 亿参数的模型:13.5 万卡时 → 1000 张卡跑 5 天半 → 光卡钱约 1 亿元。 而推理只要一张老卡。
  6. 软件那一层有三块:分布式框架、数据、模型库社区。 少讲哪一块,地图就是残的。
  7. 数据飞轮:先发 → 更多数据 → 更好 → 更多用户 → 更多数据。 它会自己转起来。

13. 原文地图

主题原书章原文位置
全员会与「更保守」13 大模型应用的三重境界text/15-ch13.txt:114(搜「2022年12月上旬」) · text/15-ch13.txt:121(搜「比小型初创公司」)
红色代码13 大模型应用的三重境界text/15-ch13.txt:133(搜「仅仅十余天后」) · text/15-ch13.txt:137(搜「而二人自2019年后就已淡出」)
Bard 翻车与千亿13 大模型应用的三重境界text/15-ch13.txt:146(搜「误认为世界上首张太阳系外行星照片」) · text/15-ch13.txt:148(搜「市值损失千亿美元」)
创新者窘境13 大模型应用的三重境界text/15-ch13.txt:126(搜「谷歌正在遭遇创新者窘」)
四层结构14 大模型产业拆解text/16-ch14.txt:2(搜「我们将大模型产业划分为4层」)
显卡四要求14 大模型产业拆解text/16-ch14.txt:22(搜「更高的计算能力」) · text/16-ch14.txt:36(搜「更高效的集群通信能力」)
1979 万亿次与两个参照14 大模型产业拆解text/16-ch14.txt:52(搜「计算能力达到1979万亿次」) · text/16-ch14.txt:53(搜「索尼PlayStation5游戏机的GPU计算能力是」)
12 倍与 30 倍14 大模型产业拆解text/16-ch14.txt:62(搜「可将训练速度最高提升12倍」) · text/16-ch14.txt:64(搜「每GPU推理吞吐量比A100高30倍」)
核心网带宽与两种方案14 大模型产业拆解text/16-ch14.txt:77(搜「G比特每秒」) · text/16-ch14.txt:87(搜「无限宽带技术」)
RDMA 与它绕开的东西14 大模型产业拆解text/16-ch14.txt:80(搜「远程直接内存访问」) · text/16-ch14.txt:83(搜「绕开双方操作系统内核」)
硬件最先赚钱14 大模型产业拆解text/16-ch14.txt:103(搜「硬件基础设施To B」)
框架比作操作系统与三个名字14 大模型产业拆解text/16-ch14.txt:139(搜「有人将深度学习框架比作深度学习的操作系统」) · text/16-ch14.txt:136(搜「Meta开发的PyTorch」)
叠加式与全栈式14 大模型产业拆解text/16-ch14.txt:186(搜「叠加式」) · text/16-ch14.txt:210(搜「全栈式」)
标注四种来源14 大模型产业拆解text/16-ch14.txt:266(搜「通过专业人员进行数据标注」) · text/16-ch14.txt:321(搜「获取公域或三方数据」)
数据飞轮14 大模型产业拆解text/16-ch14.txt:313(搜「数据飞轮」)
模型库社区14 大模型产业拆解text/16-ch14.txt:350(搜「GitHub是最大的软件代码托管平台和社区」) · text/16-ch14.txt:364(搜「接受该社区托管的模型超过10万个」) · text/16-ch14.txt:370(搜「双边平台」)
训一个 130 亿参数的账15 关于大模型产业的对话:第1集text/17-ch15-15-1.txt:50(搜「跑13.5万GPU小」) · text/17-ch15-15-1.txt:52(搜「差不多1个亿人民币」)

Footnotes

  1. 出处:「13 大模型应用的三重境界」第 114 段(text/15-ch13.txt:114,搜「2022年12月上旬」)。这一段在原书里属于产业篇的开篇引子,排在第 13 章正文之后,所以转码文件把它归在了那一段里。

  2. 出处:「13 大模型应用的三重境界」第 121 段(text/15-ch13.txt:121,搜「比小型初创公司」)。

  3. 出处:「13 大模型应用的三重境界」第 124 段(text/15-ch13.txt:124,搜「兼顾勇气和责任」)。

  4. 出处:「13 大模型应用的三重境界」第 133 段(text/15-ch13.txt:133,搜「仅仅十余天后」)与第 137 段(text/15-ch13.txt:137,搜「而二人自2019年后就已淡出」)。

  5. 出处:「13 大模型应用的三重境界」第 146 段(text/15-ch13.txt:146,搜「误认为世界上首张太阳系外行星照片」)与第 148 段(text/15-ch13.txt:148,搜「市值损失千亿美元」)。 2

  6. 出处:「13 大模型应用的三重境界」第 155 段(text/15-ch13.txt:155,搜「应用下载量增长了8倍」)。

  7. 出处:「13 大模型应用的三重境界」第 143 段(text/15-ch13.txt:143,搜「接下来发生的事情证明」)与第 149 段(text/15-ch13.txt:149,搜「虽然ChatGPT也会犯错」)。 2

  8. 出处:「13 大模型应用的三重境界」第 126 段(text/15-ch13.txt:126,搜「谷歌正在遭遇创新者窘」)。这是全书唯一一次用到这个说法。

  9. 出处:「13 大模型应用的三重境界」第 129 段(text/15-ch13.txt:129,搜「大模型应用是谷歌搜索引擎的潜在替代产品」)。

  10. 出处:「14 大模型产业拆解」第 2 段(text/16-ch14.txt:2,搜「我们将大模型产业划分为4层」)。

  11. 出处:「14 大模型产业拆解」第 11 段(text/16-ch14.txt:11,搜「一切数据处理都要经过基础设施厂商之手」)。这是一家投资公司的说法,书里当章节题记引用。

  12. 出处:「14 大模型产业拆解」第 16 段(text/16-ch14.txt:16,搜「GPU具有」)。

  13. 出处:「14 大模型产业拆解」第 22 段(text/16-ch14.txt:22,搜「更高的计算能力」)、第 27 段(text/16-ch14.txt:27,搜「更大的显存容量」)、第 32 段(text/16-ch14.txt:32,搜「更快的显存带宽」)与第 36 段(text/16-ch14.txt:36,搜「更高效的集群通信能力」)。

  14. 出处:「14 大模型产业拆解」第 52 段(text/16-ch14.txt:52,搜「计算能力达到1979万亿次」)、第 53 段(text/16-ch14.txt:53,搜「索尼PlayStation5游戏机的GPU计算能力是」)、第 54 段(text/16-ch14.txt:54,搜「GPU显存大小为80GB」)与第 55 段(text/16-ch14.txt:55,搜「最多可连接256个」)。 2 3 4 5 6

  15. 出处:「14 大模型产业拆解」第 62 段(text/16-ch14.txt:62,搜「可将训练速度最高提升12倍」)与第 64 段(text/16-ch14.txt:64,搜「每GPU推理吞吐量比A100高30倍」)。

  16. 出处:「14 大模型产业拆解」第 73 段(text/16-ch14.txt:73,搜「单个计算节点」)。

  17. 出处:「14 大模型产业拆解」第 77 段(text/16-ch14.txt:77,搜「G比特每秒」)。

  18. 出处:「14 大模型产业拆解」第 82 段(text/16-ch14.txt:82,搜「技术将数据直接从一个GPU节点的内存快速转」)与第 83 段(text/16-ch14.txt:83,搜「绕开双方操作系统内核」)。名字在第 80 段(text/16-ch14.txt:80,搜「远程直接内存访问」):原文写的是「RDMA 远程直接内存访问(Remote Direct Memory Access)技术」;被它对比的两样是「传统以太网和 TCP/IP 协议」(text/16-ch14.txt:81,搜「跟 传 统 以 太 网 和」)。原文里的「操作系统内核和 CPU」,本组拆解统一写成「那套管收发的系统程序」和「处理器」。 2 3 4

  19. 出处:「14 大模型产业拆解」第 87 段(text/16-ch14.txt:87,搜「无限宽带技术」)。原文给的两个名字是「无限宽带技术(IB)」和「基于融合以太网的 RDMA(RoCE)」;两种方案的取舍在第 88–93 段(text/16-ch14.txt:91,搜「低成本解决方案」)。「无限宽带技术」是原书对 InfiniBand 的中译,今天的技术文档里通常直接写英文名。 2

  20. 出处:「15 关于大模型产业的对话:第1集」第 50 段(text/17-ch15-15-1.txt:50,搜「跑13.5万GPU小」)、第 51 段(text/17-ch15-15-1.txt:51,搜「相当于5天半左右」)与第 52 段(text/17-ch15-15-1.txt:52,搜「差不多1个亿人民币」)。推理只用上一代单卡见「14 大模型产业拆解」第 489 段(text/16-ch14.txt:489,搜「推理则用V100 GPU」)。 2 3 4

  21. 出处:「15 关于大模型产业的对话:第1集」第 58 段(text/17-ch15-15-1.txt:58,搜「大模型预训练的资金门槛」)。

  22. 出处:「14 大模型产业拆解」第 107 段(text/16-ch14.txt:107,搜「大模型提供商进行预训练和微调时」)。

  23. 出处:「14 大模型产业拆解」第 139 段(text/16-ch14.txt:139,搜「有人将深度学习框架比作深度学习的操作系统」)。定义见第 134 段(text/16-ch14.txt:134,搜「深度学习框架是一种用于设计」);三个名字在第 136 段(text/16-ch14.txt:136,搜「Meta开发的PyTorch」),原文还点了阿里的 PAI TensorFlow。 2

  24. 出处:「14 大模型产业拆解」第 161 段(text/16-ch14.txt:161,搜「大规模计算」)到第 179 段。

  25. 出处:「14 大模型产业拆解」第 184 段(text/16-ch14.txt:184,搜「分布式深度学习框架能力的实现方式有两种」)。

  26. 出处:「14 大模型产业拆解」第 186 段(text/16-ch14.txt:186,搜「叠加式」)。原文点名的组合是 OpenAI 在 ChatGPT 项目里用的 Ray on PyTorch,并写明分工:Ray 主要解决分布式计算、任务调度和资源管理,PyTorch 侧重模型的构建、训练和优化(text/16-ch14.txt:187,搜「Ray主要解决分」)。原文还提到同类做法的另外两个:英伟达的 Nemo Framework、微软的 DeepSpeed(text/16-ch14.txt:206,搜「Nemo」)。

  27. 出处:「14 大模型产业拆解」第 210 段(text/16-ch14.txt:210,搜「全栈式」)。原文点名的是国内的开源框架 OneFlow,并说它「以软硬协同设计为指导思想,从芯片设计领域借鉴了大量思路」(text/16-ch14.txt:213,搜「以软硬协同设计为指导思想」)。

  28. 出处:「14 大模型产业拆解」第 123 段(text/16-ch14.txt:123,搜「分布式AI框架」)与「15 关于大模型产业的对话:第1集」第 126 段(text/17-ch15-15-1.txt:126,搜「如果做框架本身不好挣」)。

  29. 出处:「14 大模型产业拆解」第 254 段(text/16-ch14.txt:254,搜「大模型的训练包括三个阶段」)与第 257 段(text/16-ch14.txt:257,搜「需要的数据量极大但无需人类标注」)。

  30. 出处:「14 大模型产业拆解」第 264 段(text/16-ch14.txt:264,搜「大模型标注样本数据的获取主要有以下4种手段」)。

  31. 出处:「14 大模型产业拆解」第 270 段(text/16-ch14.txt:270,搜「曾有几十位博士参与数据标注」)。

  32. 出处:「14 大模型产业拆解」第 310 段(text/16-ch14.txt:310,搜「收集用户反馈是数据数量最大」)。

  33. 出处:「14 大模型产业拆解」第 321 段(text/16-ch14.txt:321,搜「获取公域或三方数据」)与第 326 段(text/16-ch14.txt:326,搜「ShareGPT」)。

  34. 出处:「14 大模型产业拆解」第 284 段(text/16-ch14.txt:284,搜「降低人力成本」)与第 286 段(text/16-ch14.txt:286,搜「外包给东南亚」)。

  35. 出处:「14 大模型产业拆解」第 313 段(text/16-ch14.txt:313,搜「数据飞轮」)。

  36. 出处:「14 大模型产业拆解」第 350 段(text/16-ch14.txt:350,搜「GitHub是最大的软件代码托管平台和社区」)与第 355 段(text/16-ch14.txt:355,搜「Hugging Face则是最有影响力的在」)。两个名字都是原文点的,本组拆解只是把它们留在正文里。

  37. 出处:「14 大模型产业拆解」第 355 段(text/16-ch14.txt:355,搜「Hugging Face则是最有影响力的在」)。

  38. 出处:「14 大模型产业拆解」第 364 段(text/16-ch14.txt:364,搜「接受该社区托管的模型超过10万个」)。

  39. 出处:「14 大模型产业拆解」第 370 段(text/16-ch14.txt:370,搜「双边平台」)与第 373 段(text/16-ch14.txt:373,搜「阿里的ModelScope魔搭社区」)。 2

  40. 出处:「14 大模型产业拆解」第 375 段(text/16-ch14.txt:375,搜「模型库社区的商业模式完全是」)。

  41. 出处:「14 大模型产业拆解」第 96 段(text/16-ch14.txt:96,搜「R480」)。