跳到主要内容

十万亿词元、557.6 万美元、千卡跑几十天 — 造一个大模型要什么

这一章讲三件事: 造一个大模型的完整账单——素材从哪来、要多少算力、花多少钱; 全行业敢一次性投几亿美元的道理在哪(一条画出来的直线); 以及把规模缩小一百万倍之后,一个人在一台机器上能走到哪一步。

它在全书链条里的位置: 结构(09–10)、语言接口(14)、训练方法(12–13)你都见过了。 但语言丢掉的视觉、触觉、运动经验,正是后面几章要去补的另一半世界。> 这一章看资源——要投入的卡、数据与钱。第 16 章讲出厂之后的再加工, 第 18 章讲撑起这一切的钢与硅;「怎么组织几千张卡」这个问题,到时候才展开。

1. 目标简单到可笑:猜下一个词

先把这一章的主角钉住。前面已经见过这道训练题:给它前一段文字,让它猜下一个词1。 到了工业规模,它就是这个样子:用一个巨大的 Transformer(第 10 章那块反复堆的积木), 在海量词元上反复做这一件单调的事,然后神奇的事情就发生了——写作、翻译、编程、解数学题的能力,从这个单调目标里长了出来2

值得停一下的是这件事的反差:产品端它是「几乎所有能力都在一个对话框里」的万能感, 训练端却只是一个填空游戏。这一章讲的全部资源——万亿词元的语料、千卡的机房、几百万到上亿的美元—— 都是为了让这一个游戏玩得足够多、足够准。

2. 为什么是语言先突破

第一个问题:为什么是文字先做到,而不是图像、语音或者机器人?

书里的回答从一句话开始:语言不只是聊天工具,它是人类智能千百年来对世界的一次次压缩3。 几千年攒下来的书、报纸、法律条文、科学论文,每一篇都把作者脑子里的认识压成几百上千个字。 整个文字库因此像一台庞大「压缩机」的输出——表面是文字,底下垫着物理、化学、社会、历史的海量知识。

要在这样的语料上把「猜下一个词」做好,模型不得不反着走一遍: 该接「首都」就不能接「省城」,该接「摔碎」就不能接「融化」—— 为了猜对词,它被迫还原了人压缩进文字里的那一部分世界4

那图像为什么不灵?因为照片是世界的原始记录,没有经过认知过滤; 机器人数据又稀缺又贵。只有文字是几千年里人反复用来思考、记录、传递的中介物5。 所以这不是巧合:AI 撞上的是人类积累最厚的一座矿。

但这座矿有它的边界,书里说得直白:语言丢掉了细微的视觉、触觉、运动经验—— 这正是后面几章(多模态、具身)要去补的另一半世界6

3. 十万亿词元是什么概念

现代模型的胃口有多大?公开数据:GPT-3 用了约 3000 亿词元, Llama 三代分别用了约 1 万亿、2 万亿和 15 万亿词元;闭源——权重不公开——前沿的数字没公开,只能外估7

拿最大那个换算一遍(换算是书里给的): 英文一个词元约合 0.75 个单词(第 14 章讲过),15 万亿词元就是约 7.5 万亿英文单词; 按一本书平均 8 万单词算,相当于 9000 多万本书的文字量8。 一个人的阅读速度做参照物:每天读 1 万词,不吃不睡要读两百多万年; 换成两百多万人一起读,也要整整一年8。 书里那句总结值得原样带走:训练数据不是「多看几本书」,是把一座文字大陆铲进炉膛9

4. 数据从哪来,又要洗掉什么

大陆不会自己变干净。原始素材的长相:Common Crawl 这种公开网页抓取集有上百 TB 原始 HTML, 其中大部分是广告、导航栏、乱码和重复内容;此外还有维基百科、代码仓库、论文、书籍、论坛问答等来源10

所以进炉膛之前有一整套清洗工序11:

工序干什么不做会怎样
去 HTML 标签从网页里剥出正文广告和菜单条混进语料
去重找出反复出现的同一段文字模型把「 internet 上最常复述的话」背得更死
过滤有害与低质去仇恨暴力色情、去机器生成的垃圾语料教坏模型
语言识别区分中英法德混语料让每种语言都被稀释

还有一道不太出名但很致命的:去污染——不许评测考卷混进训练数据, 否则模型的「成绩」就是提前看过题的水分;这需要专门的比对检查12

最后一道更像做菜的:配比——各种来源按什么比例混合, 太多垃圾网页拉低水平,太多高质代码把文风带偏,靠大量实验调出来13。 书里给的这条行业经验分量很重:在很多阶段,把数据洗干净、配得好,比换一个花哨技巧更能改进模型14

5. 规模法则:那条改变了投资观念的直线

现在回答钱的问题的前提:凭什么是敢投,而不是赌一把?

2020 年,OpenAI 的 Jared Kaplan 等人在一篇标题平淡的论文里第一次把这件事画清楚: 横轴取参数量(或数据量、算力)的对数——即把数字换成它的量级刻度——纵轴取损失的对数, 连起来的点几乎落在一条下降直线上——这就是规模法则15。 书里给的经验式用文字说就是:损失大致等于一个常数,加上「随参数变大而衰减的一项」, 再加上「随数据变多而衰减的一项」;三项里只要参数 N 和数据 D 同步放大,总和就稳步往下走16

这条直线值钱的地方不是「大就好」,是效果可预测:花 10 倍算力,大致能得到多少改进,事先能估17。 书里点破了它的商业含义——如果「花十倍的钱」对应一个「可算的下降」, 训练一个亿级美元的模型就不再是赌博,而是一笔可以规划的工程; GPT、Claude、Gemini 一路堆上来的自信,大部分来自这张图18

它的局限也在同一句话里:收益递减——越往后每一点提升越贵, 而且会撞上高质量数据、硬件、电力和工程复杂度的墙19。 书里的比方是:规模是地心引力,不是许愿池20。 另外它只管训练那一段的总损失;模型到底好不好用,还被数据质量、后训练、工具使用和产品设计牵着21

6. 走查:参数和数据要配平

有了直线还有一道新问题:一份固定的算力预算,该堆给参数还是堆给数据? 后来有一个常被引用的研究结论(通常叫 Chinchilla,研究中那个配平了数据量的模型名): 固定预算下参数和词元要配平,常见经验大约每个参数配几十个训练词元22

这一章的主走查就从这里开始:用书里给出的两组真实数字,验一验「早期大模型欠训」这句话。

已知:GPT-3 有 1750 亿个参数23;它吃了约 3000 亿词元7。 每参数摊到的词元数,是我们自己除的(除法是我们的,两个数是书里的):

3000 亿词元 ÷ 1750 亿参数 ≈ 1.7 个词元 / 参数
Chinchilla 经验线 ≈ 20 个词元 / 参数
缺口 ≈ 十倍出头

也就是说,GPT-3 的块头和饭量之间差着一个数量级——书里说「很多早期大模型其实是欠训的」, 意思被这行算术具体化了:像一个健身房办了年卡、每次只去门口拍照的人, 块头看着大,训练没跟上22。 同一批参数预算,当年若砍一半块头、把省下的算力换成词元,模型反而更强—— 这就是后来几代模型「参数几乎没大多少、能力却明显涨」的重要原因之一。

这笔账还解释了一件事:为什么后来公开的模型越吃越多——Llama 3 把 150 亿量级的稠密模型喂到 15 万亿词元, 每参数配比冲过了百词元7单纯「更大」的时代结束了,「配平」的时代开始了。

7. 一台巨兽要多少张卡

练一个 GPT-3 这个级别的模型,需要上千张高端 GPU 连续工作很长时间; 更前沿的成本则到数千万甚至上亿美元级别(这些数字来自外部估算,不是财报,量级足够说明问题)24。 书里把这种门槛的跃迁说得很形象:过去做 AI 像开实验室,今天做前沿大模型有点像修机场25

千卡量级还要连续跑几十天——这么多的卡怎么组织成一台逻辑上的机器、坏了怎么办, 是另一个话题,第 18 章专门讲。这一节只需要记住门槛本身: 它直接决定了全世界有能力做这件事的公司一只手数得过来26

8. 训练成本的量级

OpenAI 从未公开过 GPT-3 的训练成本,业界普遍按几百万美元的算力费估; GPT-4 这一级外界估数千万到上亿美元——而且这些还不含人员、试错重训和数据基建的摊销27

好在有一个难得诚实的锚点,来自书里第四章转述的一份技术报告: DeepSeek-V3 的正式训练,按每小时 2 美元的 H800 租用价折算, 约需 278.8 万张 GPU 卡时(一张卡跑一小时记 1),约 557.6 万美元; 报告同时声明,这只算这一次正式训练,不含此前的架构、算法、数据和消融实验(为验证每个设计而做的对照小实验)的投入28。 参照物:两千七八百万小时的显卡时间,大约等于一千张卡连轴转三个多月。 这本书引起轰动的原因,书里说得准确:不是「便宜到人人可造」, 而是同样的强能力,架构、系统和工程效率确实能显著改写成本曲线28

9. 稳定性:这么大的训练每天都出事

钱之外还有一个不对称的事实:这种规模的训练,天天出事是常态。

典型的翻车方式29:损失突然变成 NaN(计算溢出后的「不是一个数」,意味着训练当场报废)、 梯度爆炸、某个节点报错拖住全局、训了好几天才发现效果反而变差。 对策是一整套流水线习惯:实时盯着损失曲线,自动保存检查点(定期存档的训练状态)并能回滚(退回之前保存的版本重来), 外加大量的小规模实验先行探路30

有多不放心?Meta 训练 OPT-175B 时罕见地公开了完整训练日志(逐条记录的运行台账),里面详细记录了上百次损失飙升、 硬件故障、通信中断、回滚重启——书里称之为「教科书级的失败展示」31; 在这种规模下,「一次跑通到底」近乎奢望,「出事 → 定位 → 回滚 → 继续」才是常态31。 配这套流水线的也不是几个科学家,而是几十人的团队,分工像大型科学工程 ——书里直接比作粒子对撞机项目32

10. 三类模型家族

排行榜(按分数给模型排名的榜单)月月在换,书里刻意不写赛马榜,给了一个更耐用的分类法33:

家族代表特点
闭源前沿GPT、Claude、Gemini当时最强,产品成熟;权重不给看,像大型航空公司,发动机内部一般不让你拆34
开放权重Llama、Mistral、Qwen、DeepSeek权重可下载(注意「开放」不等于严格意义的开源——训练数据和完整代码往往并不公开),可以本地部署、量化、微调35
端侧(部署在手机、汽车、内网里)小模型各家几十亿参数级在手机、汽车、内网低成本运行;写纪要、整理文档、受限客服,几十亿参数配合检索就够了36

开放权重阵营的意义,书里归纳得不只是省钱,而是把创新权从少数巨头手里分散出来: 一个研究生、一家小公司、一台服务器,也能从小模型起步参与生态37。 未来更可能的图景不是一家统治,而是三类各司其职——书里把这个格局类比成操作系统、数据库那种多家长期并存的生态38

11. 走查收尾:六道工序被装进了几个脚本

这一章讲的所有环节——分词、预训练、评估、指令微调(拿「指令-回答」对教它听话)、强化学习、上线对话——听着都得是巨头的活。 补充(不在书里,依据我们的 frontier 书架): 有一位以教学著称的工程师把这条流水线 原样缩到一个单机节点上,整套系统叫 nanochat,按阶段拆成一组脚本: 训分词器、训底座、评底座、做指令微调、做带奖励的强化学习、起对话界面,一路排下来39

最有量感的参照物在这份项目的自述里:训出一个达到 GPT-2 档能力的模型—— 2019 年 OpenAI 当年为此花了约 4.3 万美元——现在在一台八卡的节点上只要两个多小时、约 48 美元40七年间同样一件事的价格跌了近一千倍:这正是本章另一面的注脚, 规模法则是地心引力,而工程效率在偷偷搬动它的坐标轴。

这一节也是下一章的路标:nanochat 流水线里排在预训练之后的那两步, 恰恰是大模型出厂后最重要的再加工。

12. 推断成本才是长期账单

最后一个反转:最贵的可能不是训练。 书里的比方:训练成本像造一架飞机,推断成本像每一次飞行烧的油和维护41。 训练做一次;推断天天做——当一个产品每天处理数亿次请求时,单次看起来不贵, 累积起来就是天文数字41

于是推断优化成了很现实的学问,手段包括压缩、量化(把数值位数降下来)、蒸馏(让小模型照着大模型的行为学)、缓存、专用芯片等等42 ——其中「蒸馏」指让一个小模型照着大模型的行为学,用小模型的推断价钱近似大模型的答案。 书里给的判据冷冰冰也很诚实:用户不关心你的数学多漂亮,只关心快、准、便宜; 模型能力略逊但成本低十倍,往往比能力强一点但账单爆炸更有吸引力42

顺带把生意本身也标在地图上,主流路线五条:按用量收费的 API、面向个人按月订阅(付月费换用量)、 给大企业定制部署、开源权重带动周边服务、以及刚刚开始的广告模式43

13. 谁的工作先被改变

账单不止企业在付。书里引了一项后来发表于《科学》的研究: 研究者把美国一千多个职业拆成近两万个具体任务,问一个问题—— 用这类 AI,某项任务耗时能否缩短一半以上44

结论的两个数44:约 80% 的美国劳动者所在的职业,至少有一成任务受影响; 约 19% 的劳动者所在职业,至少一半任务受影响。 参照物要给足:「受影响」说的是任务暴露度,不等于任务一定被自动化,更不等于岗位消失44

真正耐读的是那条分界线,而不是排名45: 越是把信息读进去、写出来、转换成另一种符号的工作(翻译、调研、报税、会计), 暴露越高;越依赖身体、工具、现场环境的工作(厨师、瓦工、打桩机操作员), 短期越难被纯语言模型替代。 而且一个职业是一捆任务,不是一项任务:作家除了打字还要采访、判断、承担声誉—— AI 先改变的往往是工作流(一件活从接手到交付的工序),至于最后是增效、降薪还是岗位减少,取决于组织、法规和人46

14. 作者的判断与证据

有证据的部分。 词元规模(Llama 三代)、Chinchilla 配比结论、DeepSeek-V3 报告披露的成本、 OPT-175B 公开的失败日志、发表在《科学》上的职业暴露研究,都有明确出处。

要分开看的四处:

  1. 成本数字全是外部估算。 书里两次主动提醒:网上流传的训练成本只覆盖某一次运行的部分算力, 不等于公司全部研发投入,不能当精确账本47。557.6 万美元是唯一由技术报告亲自给出的数, 而且报告自己就注明「不含前期实验」。
  2. 第 6 节那行除法是我们的。「3000 ÷ 1750 ≈ 1.7」这个数字组合是书里的,除法和对比线是我们画的, 目的是把「欠训」从一个形容词变成一个可核对的数。
  3. 「修机场」「造飞机」是作者的修辞,不是计量。 它们传达门槛的性质,不要当成成本比例。
  4. 职业暴露是美国的口径。 千余职业、近两万任务的拆解基于美国劳工数据库,结论结构 (语言符号型高暴露、身体现场型低暴露)可迁移,具体百分比不可直接搬到其他国家。

判断(我们的,不是书里的):这一章真正的主角是一个词——「可预测」。 规模法则的价值从来不在「越大越好」,而在「投入多少、回来多少,事先算得出」。 是它把一个科研冒险变成了一种基建工程,深谋远虑的公司和鲁莽的公司在这里分出了组织能力。 如果错,会错在: 直线是历史区间的拟合,不是定律——高质量文本储量、电力供给 都可能是还没撞到的墙(第 27 章会回到这一点);一旦斜率变了,「可规划」的故事就要重写。

判断(我们的,不是书里的):「配平」比「更大」更接近这几年真实的胜负手。 Llama 3 相对早期模型的提升,相当一部分来自喂得更饱而不是长得更大; 只盯参数规模的新闻,大概率误读了能力增长的来源。 如果错,会错在: 更强的后训练和更长推理带来的增益可能盖过预训练侧的配比差异—— 那样的话「账要算在数据的头上」就成了过度归因。

15. 边界与局限

  • 千卡怎么组织,这一版完全没展开。 三种并行切法在第 15 章原文提了名字,本拆解整体挪给了第 18 章。
  • 清洗管线只给了清单,没有给配方。 各家去重阈值、过滤规则、配比秘方都不公开,书里也没有假装知道。
  • 榜单与价格保鲜期极短。 本章凡是涉及具体公司和排名的说法,半年内就会过时;机制部分不受影响。
  • 职业研究只覆盖美国。 其他经济体的任务结构与岗位分布不同,80% / 19% 不可外推44
  • 「六道工序」的中间两道这一章只报了名字。 指令微调和偏好对齐的具体做法,第 16 章整章展开。

16. 可带走的

  1. 一个「全能助手」背后是一道单调的填空题。 资源全部砸在把这一个游戏玩到万亿词元的尺度。
  2. 语言赢在密度:几千年的人类写作是一座压缩过的知识矿,别的模态没有这种认知过滤。
  3. 十万亿词元 = 9000 多万本书 = 一个人读两百多万年。 这是量感,不是修辞。
  4. 数据进门要洗五遍:去标签、去重、滤毒滤渣、辨语言、防考卷泄漏;配比靠大量实验。
  5. 洗数据经常比换技巧更涨分——这是书里给的、也被业内反复验证的经验。
  6. 规模法则是一条直线,价值在可预测:十倍算力的回报事先可估,赌博由此变成工程。
  7. 它同时是递减的:越往上每一点越贵,并且终将撞上数据、电力、工程的墙。
  8. 参数和数据要配平,经验线约每参数二十个词元。 按 3000 亿÷1750 亿算,GPT-3 欠训一个数量级。
  9. 门槛的单位变了:过去比论文,现在比能不能养得起上千张卡连转几十天;开实验室变成了修机场。
  10. 故障是日程表的一部分:百次回滚的公开日志说明,「出事→定位→回滚→继续」就是常态。
  11. 六道工序已经被装进几个脚本,同一门课的价格七年跌近千倍。 门槛高的是前沿,不是入门。
  12. 推断才是长期账单:训练造一次飞机,推断是每次飞行的油钱;快、准、便宜缺一样都白搭。

17. 原文地图

主题原书章原文位置
单调目标 + 合力第8章 语言的魔法:大语言模型text/09-ch08.txt:29(搜「合力」)· :29(搜「预测下一个词」)
语言是对世界的压缩第8章 语言的魔法:大语言模型text/09-ch08.txt:69(搜「一次次压缩」)· :71(搜「世界压缩机」)
被迫还原世界第8章 语言的魔法:大语言模型text/09-ch08.txt:76(搜「被迫还原」)
别的模态为什么不灵第8章 语言的魔法:大语言模型text/09-ch08.txt:78(搜「智能压缩」属性)· :81(搜「智能矿藏」)
语言丢失的另一半第8章 语言的魔法:大语言模型text/09-ch08.txt:82(搜「触觉」)
词元规模三代第8章 语言的魔法:大语言模型text/09-ch08.txt:161(搜「3000 亿词元」)· :162(搜「15 万亿」)
十万亿的换算第8章 语言的魔法:大语言模型text/09-ch08.txt:164(搜「7.5」)· :166(搜「两百多万年」)
文字大陆进炉膛第8章 语言的魔法:大语言模型text/09-ch08.txt:168(搜「文字大陆」)
数据来源第8章 语言的魔法:大语言模型text/09-ch08.txt:169(搜「Common Crawl」)
清洗四件套与经验第8章 语言的魔法:大语言模型text/09-ch08.txt:172(搜「去重」)· :175(搜「洗干净」)
上百 TB 原始 HTML第8章 语言的魔法:大语言模型text/09-ch08.txt:297(搜「上百 TB」)
去污染与配比第8章 语言的魔法:大语言模型text/09-ch08.txt:302(搜「去污染」)· :305(搜「数据配比」)
Kaplan 直线第8章 语言的魔法:大语言模型text/09-ch08.txt:214(搜「Kaplan」)· :216(搜「下降的直线」)
经验式与投资含义第8章 语言的魔法:大语言模型text/09-ch08.txt:216(搜「投资观念」)· :232(搜「10 倍的算力」)
递减与约束第8章 语言的魔法:大语言模型text/09-ch08.txt:260(搜「高质量数据」)· :262(搜「地心引力」)
Chinchilla 配平第8章 语言的魔法:大语言模型text/09-ch08.txt:236(搜「配平」)· :238(搜「健身房」)
GPT-3 参数与卡量第8章 语言的魔法:大语言模型text/09-ch08.txt:308(搜「上千张高端 GPU」)
修机场第8章 语言的魔法:大语言模型text/09-ch08.txt:318(搜「修机场」)
外部估算与总投入第8章 语言的魔法:大语言模型text/09-ch08.txt:733(搜「数百万美元」)· :734(搜「摊销」)
稳定性翻车清单第8章 语言的魔法:大语言模型text/09-ch08.txt:333(搜「NaN」)· :336(搜「回滚」)
几十人与对撞机第8章 语言的魔法:大语言模型text/09-ch08.txt:339(搜「粒子对撞机」)
三类家族第8章 语言的魔法:大语言模型text/09-ch08.txt:270(搜「闭源前沿」)· :282(搜「小而精」)
开放 ≠ 严格开源第8章 语言的魔法:大语言模型text/09-ch08.txt:276(搜「开放」并不都等于)
分散创新权第8章 语言的魔法:大语言模型text/09-ch08.txt:279(搜「创新权」)
DeepSeek-V3 成本第4章 把网络训好的艺术text/05-ch04.txt:621(搜「278.8 万」)
OPT-175B 失败日志第4章 把网络训好的艺术text/05-ch04.txt:626(搜「chronicles」)· :627(搜「教科书级失败展示」)
航空公司与发动机第8章 语言的魔法:大语言模型text/09-ch08.txt:273(搜「大型商业航空公司」)
职业暴露研究第8章 语言的魔法:大语言模型text/09-ch08.txt:759(搜「1000 多个职业」)· :762(搜「80%」)
高低暴露两端第8章 语言的魔法:大语言模型text/09-ch08.txt:769(搜「身体和现场任务」)· :777(搜「分界线」)
一捆任务第8章 语言的魔法:大语言模型text/09-ch08.txt:784(搜「一捆任务」)
训练像造飞机第8章 语言的魔法:大语言模型text/09-ch08.txt:748(搜「造飞机」)
快准便宜判据第8章 语言的魔法:大语言模型text/09-ch08.txt:750(搜「投机解码」)· :752(搜「账单爆炸」)
五条商业路线第8章 语言的魔法:大语言模型text/09-ch08.txt:792(搜「订阅」)· :804(搜「周边业务」)· :809(搜「广告」)
成本口径警告第8章 语言的魔法:大语言模型text/09-ch08.txt:822(搜「只覆盖」)

Footnotes

  1. 出处:「第6章 无师自通:从数据中自学」(text/07-ch06.txt,搜「下一词元预测」)与本拆解第 12 章 §10「下一词元预测」。这是原书 6.5 节的主题,此处不再重复展开。

  2. 出处:「第8章 语言的魔法:大语言模型」第 29 段(text/09-ch08.txt:29,搜「预测下一个词」) 与第 30 段(text/09-ch08.txt:30,搜「神奇的事情」)。

  3. 出处:「第8章 语言的魔法:大语言模型」第 69 段(text/09-ch08.txt:69,搜「一次次压缩」) 与第 71 段(text/09-ch08.txt:71,搜「世界压缩机」)。

  4. 出处:「第8章 语言的魔法:大语言模型」第 76 段(text/09-ch08.txt:76,搜「被迫还原」)。

  5. 出处:「第8章 语言的魔法:大语言模型」第 78 段(text/09-ch08.txt:78,搜「智能压缩」) 与第 81 段(text/09-ch08.txt:81,搜「智能矿藏」)。

  6. 出处:「第8章 语言的魔法:大语言模型」第 82 段(text/09-ch08.txt:82,搜「视觉、触觉」)。

  7. 出处:「第8章 语言的魔法:大语言模型」第 161 段(text/09-ch08.txt:161,搜「3000 亿词元」) 与第 162 段(text/09-ch08.txt:162,搜「15 万亿」)。 「Llama 3 是 150 亿量级的稠密模型」为公开配置常识,补充(不在书里,来自通用知识) 2 3

  8. 出处:「第8章 语言的魔法:大语言模型」第 164 段(text/09-ch08.txt:164,搜「7.5」) 与第 166 段(text/09-ch08.txt:166,搜「两百多万年」)。 2

  9. 出处:「第8章 语言的魔法:大语言模型」第 168 段(text/09-ch08.txt:168,搜「文字大陆」)。

  10. 出处:「第8章 语言的魔法:大语言模型」第 169 段(text/09-ch08.txt:169,搜「Common Crawl」) 与第 171 段(text/09-ch08.txt:171,搜「StackExchange」); 「上百 TB 原始 HTML」出自第 297 段(text/09-ch08.txt:297,搜「上百 TB」)。

  11. 出处:「第8章 语言的魔法:大语言模型」第 172 至 175 段 (text/09-ch08.txt:172,搜「去重」;:175,搜「洗干净」)。 表格里「不做会怎样」一列是我们补的后果注解。

  12. 出处:「第8章 语言的魔法:大语言模型」第 302 段(text/09-ch08.txt:302,搜「去污染」)。

  13. 出处:「第8章 语言的魔法:大语言模型」第 304 段(text/09-ch08.txt:304,搜「配比」) 与第 305 段(text/09-ch08.txt:305,搜「大量实验」)。

  14. 出处:「第8章 语言的魔法:大语言模型」第 175 段(text/09-ch08.txt:175,搜「洗干净」)。

  15. 出处:「第8章 语言的魔法:大语言模型」第 214 段(text/09-ch08.txt:214,搜「Kaplan」) 与第 216 段(text/09-ch08.txt:216,搜「下降的直线」)。

  16. 出处:「第8章 语言的魔法:大语言模型」第 229 段(text/09-ch08.txt:229,搜「经验指数」)。 原式为 ℒ ≈ A/N^α + B/D^β,这里的文字释义是我们按原意改写的。

  17. 出处:「第8章 语言的魔法:大语言模型」第 232 段(text/09-ch08.txt:232,搜「10 倍的算力」)。

  18. 出处:「第8章 语言的魔法:大语言模型」第 216 段(text/09-ch08.txt:216,搜「投资观念」) 与第 218 段(text/09-ch08.txt:218,搜「自信」)。

  19. 出处:「第8章 语言的魔法:大语言模型」第 260 段(text/09-ch08.txt:260,搜「高质量数据」)。

  20. 出处:「第8章 语言的魔法:大语言模型」第 262 段(text/09-ch08.txt:262,搜「地心引力」)。

  21. 出处:「第8章 语言的魔法:大语言模型」第 264 段(text/09-ch08.txt:264,搜「只有它也不够」)。

  22. 出处:「第8章 语言的魔法:大语言模型」第 236 段(text/09-ch08.txt:236,搜「配平」) 与第 238 段(text/09-ch08.txt:238,搜「健身房」)。「Chinchilla 是研究中那个配平了数据量的模型名」 为补充(不在书里,来自通用知识);书里只写了「后续研究(Chinchilla)」。 2

  23. 出处:「第8章 语言的魔法:大语言模型」第 308 段(text/09-ch08.txt:308,搜「1750 亿参数」)。

  24. 出处:「第8章 语言的魔法:大语言模型」第 308 至 310 段 (text/09-ch08.txt:308,搜「上千张高端 GPU」;:310,搜「外部估算」)。

  25. 出处:「第8章 语言的魔法:大语言模型」第 318 段(text/09-ch08.txt:318,搜「修机场」)。

  26. 出处:「第8章 语言的魔法:大语言模型」第 315 段(text/09-ch08.txt:315,搜「少数几家公司」)。

  27. 出处:「第8章 语言的魔法:大语言模型」第 732 至 734 段 (text/09-ch08.txt:733,搜「数百万美元」;:734,搜「摊销」)。

  28. 出处:「第4章 把网络训好的艺术」第 621 段(text/05-ch04.txt:621,搜「278.8 万」) 与第 622 段(text/05-ch04.txt:622,搜「不包括此前的」)。 原文注明这是「按每小时 2 美元的 H800 租用价计算」的正式训练费用。 「一千张卡连轴转三个多月」是按 278.8 万 ÷ 1000 ≈ 79 天换算的, 换算过程如前所列,读者可直接核对 2

  29. 出处:「第8章 语言的魔法:大语言模型」第 333 至 335 段 (text/09-ch08.txt:333,搜「NaN」;:334,搜「梯度爆炸」)。

  30. 出处:「第8章 语言的魔法:大语言模型」第 336 段(text/09-ch08.txt:336,搜「回滚」)。

  31. 出处:「第4章 把网络训好的艺术」第 626 段(text/05-ch04.txt:626,搜「chronicles」) 与第 627 段(text/05-ch04.txt:627,搜「教科书级失败展示」)。 2

  32. 出处:「第8章 语言的魔法:大语言模型」第 339 段(text/09-ch08.txt:339,搜「粒子对撞机」)。

  33. 出处:「第8章 语言的魔法:大语言模型」第 268 段(text/09-ch08.txt:268,搜「赛马榜」)。

  34. 出处:「第8章 语言的魔法:大语言模型」第 273 段(text/09-ch08.txt:273,搜「大型商业航空公司」)。

  35. 出处:「第8章 语言的魔法:大语言模型」第 276 段(text/09-ch08.txt:276,搜「并不都等于」) 与第 278 段(text/09-ch08.txt:278,搜「量化」)。

  36. 出处:「第8章 语言的魔法:大语言模型」第 282 段(text/09-ch08.txt:282,搜「小而精」) 与第 283 段(text/09-ch08.txt:283,搜「会议纪要」)。

  37. 出处:「第8章 语言的魔法:大语言模型」第 279 段(text/09-ch08.txt:279,搜「创新权」)。

  38. 出处:「第8章 语言的魔法:大语言模型」第 288 段(text/09-ch08.txt:288,搜「各司其职」) 与第 838 段(text/09-ch08.txt:838,搜「多家路线并存」)。

  39. 补充(不在书里,依据我们的 frontier 书架):nanochat 把整条流水线拆成按阶段排列的脚本, 分词、底座预训练、底座评估、指令微调、强化学习、对话界面各有入口。 依据: shelf=ai-frontier-reference/nanochat@src:scripts/base_train.py:1 @92d63d4e8bb4df75c3b71618f31ddde2378b2bcd 事实=scripts/ 目录下 tok_train / base_train / base_eval / chat_sft / chat_rl / chat_cli 等脚本按流水线阶段依次排列, base_train.py 文档串写明可用 torchrun 以 8 进程启动。

  40. 补充(不在书里,依据我们的 frontier 书架):该项目自述在单节点 8 张 H100 上, 两个多小时、约 48 美元即可训出 GPT-2 档能力的模型并与之对话; 而 2019 年 OpenAI 训练 GPT-2 的开销约为 43,000 美元。 依据: shelf=ai-frontier-reference/nanochat@src:README.md:5 @92d63d4e8bb4df75c3b71618f31ddde2378b2bcd 事实=README 写明 "~$43,000 to train in 2019 ... for only $48 (~2 hours of 8XH100 GPU node)"。 「跌幅近一千倍」按 43000 ÷ 48 ≈ 896 计算,可核对。

  41. 出处:「第8章 语言的魔法:大语言模型」第 748 段(text/09-ch08.txt:748,搜「造飞机」) 与第 749 段(text/09-ch08.txt:749,搜「数亿次请求」)。 2

  42. 出处:「第8章 语言的魔法:大语言模型」第 750 段(text/09-ch08.txt:750,搜「投机解码」) 与第 752 段(text/09-ch08.txt:752,搜「账单爆炸」)。 2

  43. 出处:「第8章 语言的魔法:大语言模型」第 792 段(text/09-ch08.txt:792,搜「订阅」)、 第 800 段(text/09-ch08.txt:800,搜「企业定制」)、第 805 段(text/09-ch08.txt:805,搜「周边业务」) 与第 809 段(text/09-ch08.txt:809,搜「广告」)。

  44. 出处:「第8章 语言的魔法:大语言模型」第 759 段(text/09-ch08.txt:759,搜「1000 多个职业」) 与第 762 段(text/09-ch08.txt:762,搜「80%」)、第 764 段(text/09-ch08.txt:764,搜「不等于」)。 研究者名单与技术细节见原文第 756 至 761 段。 2 3 4

  45. 出处:「第8章 语言的魔法:大语言模型」第 777 段(text/09-ch08.txt:777,搜「分界线」) 与表格两端示例第 769 段(text/09-ch08.txt:769,搜「身体和现场任务」)。

  46. 出处:「第8章 语言的魔法:大语言模型」第 784 段(text/09-ch08.txt:784,搜「一捆任务」) 与第 787 段(text/09-ch08.txt:787,搜「取决于」)。

  47. 出处:「第8章 语言的魔法:大语言模型」第 822 段(text/09-ch08.txt:822,搜「只覆盖」)。