跳到主要内容

从零构建大模型 — 全书拆解

30 秒导读: 这是一本 2025 年的中文教材(约 13.5 万字符正文),回答一个工程问题: 一个大模型是怎么从零件造到上线的。 它的路线图是:先用五种零件搭出一台能用的机器, 教会它写和读,再让它管看图;然后用一组技术把造它的成本压下来;最后两条压缩路和两章实战收尾。 我们这份拆解比原书略厚——补的是原书省略的解释和它没点破的坑,不是压缩原书。 十二章。读完不必看原书,但要看懂原书没讲的东西,请看每章的「边界与局限」。

1. 这是谁在什么时候写的

作者梁楠,清华大学出版社,2025 年 4 月出版(前言落款 2025 年 1 月)1
定位教材式的实践指南:每章「概念→代码→逐行讲解→运行结果→思考题」的固定结构,共 12 章
时代坐标写在开源(open source,源码公开、可自由取用)社区普遍转向「少动现成机器、只加小部件」技术路线的时期;书里的工具栈(PyTorch、Hugging Face transformers)是当时主流
要留意的①全书代码清单以图片排版,文本层没有代码本体;②演示均为教学级小实验,数字不能当成真实成绩引用;③引言与个别术语有硬伤(见 §6 判断)

利益相关:出版方教材,无产品推销;每章末的「思考题」是教学装置,拆解不逐题复述。

2. 全书一条主线(读完这一节,你就懂了这本书)

这本书是一条从头贯到尾的施工流水线,每一步都被上一步逼出来。

① 先有机器(01 章)

把文字变成数字、让词与词互相关照、给深网络修保险丝、补上顺序感——五种零件拼成一台机器,这套架构有个名字,叫 Transformer(2017 年问世,今天几乎所有大模型都拿它当骨架)。

零件不挑输入:喂文字,它分化成两个门派——管写的那一派,开山的是 GPT(02 章)。

管读的那一派,代表是 BERT(03 章);喂图块,它还能看图(04 章)。

五种零件里,把词变成一串数的那一步,行话叫嵌入。

让每个词去看别的词的那一步,行话叫注意力。

② 教它本事(02、03 章)

写作是「看前文、挑下一个词」的无限重复;阅读靠「遮住词让它猜」的自我出题。教法对了,看图也通用。

③ 省着教(05 章)

从头教一遍太贵,得少动原机。四条路里,有插小部件的,有拆低秩(把一个大改动拆成两个小数表的乘积)的。

还有只训一段提示(挂在输入前的一小组可调数)的。

这一整类「少动原机」的做法,行话叫微调(在练好的机器上稍作调教去干新活)。

④ 两道硬约束(06、07 章)

数据要洗、要造变体、要切好词(06 章)。

卡上另一头紧的是显存(显卡上装数据的内存)——不够就省着用。

算力(卡的计算能力)同理(07 章)。

⑤ 教法进化(08 章)

训练(反复喂题目,按梯度——往哪调、调多少的指引——把机器内部可调的数往好处挪)可以不给答案。

不给答案的教法:对比学习(让数据自己出题)。

也可以故意喂坏输入:对抗训练(喂坏输入,让机器挨打长记性)。

两招都不需要标注(人工贴的答案)。

⑥ 步子怎么迈(09 章)

每一步往哪挪、挪多大,由一批训练前定好的可调数管着——这批数行话叫超参数。

调的过程叫优化(往好处调)。

干这件事的部件,行话叫优化器。

其中「步子迈多大」这一个数,行话叫学习率——开局热身、中段大步、尾段细调。

⑦ 练好了,装得下才能上线(10 章)

两条压缩路。蒸馏(大的教小的):让小的连「犹豫的方式」都学。

剪枝(把不重要的连接直接去掉)。

备个词:精度——记数记到多细。

还有量化(把精度调粗来省空间)。

⑧ 两条实战流水线(11、12 章)

从零教一台,要会守护:监控、检查点(每隔一段进度存一次盘的存档)、断点续训。

拿现成的改造,要会施工:冻结(把一部分内部数锁死不让动)、调教、评估、量化收尾。

一句话:这本书的主张是「大模型工程没有魔法,只有一条可以逐站检修的流水线」。

3. 章节地图

读完你就能回答推荐顺序
01 五种零件这台机器拆开是哪五块?让词互相看、把词变数串的两步到底在算什么?必读,全书地基
02 生成它凭什么一段段往外写?两种挑词法差在哪?「写得好」怎么量?必读
03 理解它和写的那台差在哪个开关上?没有人工答案怎么学?必读
04 视觉不用老式看图算子怎么让机器看图?「它在看哪」怎么变成数字?关心多图混合的输入再读
05 省着教不动原机怎么教新活?四条路各动哪里?实操必读
06 数据喂之前数据要过哪几道工序?切词在解决什么?实操必读
07 省卡卡不够时先动哪个旋钮?切数据还是切机器怎么选?实操必读
08 皮实没答案怎么学?有人捣乱为什么防得住?进阶选读
09 节奏AdamW 的 W 是什么?开局热身在防什么?进阶选读
10 压缩大的教小的,教的是答案还是犹豫?剪枝剪的是零还是整块?部署必读
11 训练实战长跑式训练断了怎么接着跑?存档要存几样?落地必读
12 微调实战一次改造的五步各抄哪些数?上线前还要做哪两件事?落地必读

推荐顺序: 01→02→03 打地基;05/06/07 是实操三件套;10/11/12 走到部署;04/08/09 按需补。

4. 这本书覆盖什么、不覆盖什么

4.1 讲透了:机械与评估

Transformer 的五个组成部分各自解决什么问题,让词互相看的四步怎么走。

三把评估尺子:BLEU 管抄得像不像、ROUGE 管盖得全不全、困惑度(机器自己在多少个候选里犹豫)管内部适应度。

BERT 的遮词预训练(先海量泛读、再上岗干活的那一步)怎么做,-100 标签(「此处不计分」的记号)起什么作用。

图像怎么切块喂给机器——卷积(滑动窗式的传统看图算子)在这里降级成切刀;「它在看哪」怎么变成统计数字。

4.2 讲透了:省钱教法

四种省钱教法——Adapter(插小部件)、把大改动拆成两个小数表的乘积、只训一段提示——各动哪里。

数据四道工序:清洗、增强、分词(把句子切成机器能吃的小块)、变数。

外加怎么把「犹豫」当成训练目标这类评估指标(算分的口径)。

四种教法里最常用的是 LoRA(把大改动拆成两个小数表的乘积)。

4.3 讲透了:省卡与压缩

算力三招:混合精度——一部分计算用低精度(记数粗、省空间)、一部分用高精度(记数细、保稳定)。

并行(数据切开多机一起算,或机器切开接力)。

步幅曲线(行话叫学习率调度)怎么选。

GAN(造假者与验钞机对练)这场博弈怎么练。

蒸馏连「犹豫的方式」——软标签(教师在每个候选上的占比答卷)——一起教。

4.4 没覆盖:调教合意这一侧

没有对齐——把机器调得合人意。

备个词:强化学习(靠奖惩信号学行为的方法)。

RLHF(人类反馈强化学习——上一句那类方法用在人身上——靠人打分调教)整套缺席。

奖励模型(给回答打分的裁判)同样缺席。

DPO(不打分、直接比好坏的调法)也一样。

4.5 没覆盖:前沿关键词与其他

MoE(把一台机器拆成多个专家部件)、超长阅读窗口——缺席。

RAG(先查资料再回答)、部署侧运行框架——缺席。

QLoRA(更省的低秩变体)、GPTQ/AWQ 量化——缺席。

续写类任务的实战不在(12 章只做分类);书末没有文献表(84 号文件只是字体许可声明),引言外的出处无从追溯;全书代码清单以图片排版,文本层没有代码本体。

5. 我们的判断

判断(我们的,不是书里的): 这本书的定位是「大模型工程的第一张全景图」, 强在覆盖面与流程感——从零件到上线一条线走通,每站都有可跑的教学演示; 弱在深度与时效——每个机制都停在「能跑通的最小演示」,规模感、对照实验、 2024-2025 的新技术(QLoRA、量化新方法、RLHF)一律没有。拿它当入门骨架合适, 当案头手册不够深。 如果错,会错在: 如果把「教学演示的小数字」当性能证据、或把「覆盖 12 章」 当「覆盖该领域」,就会高估它;反过来说,若读者已有工程经验、只缺骨架, 这条判断也可能低估了它当备查地图的价值。

判断(我们的,不是书里的): 原书有几处硬伤,读的时候要带着修正: ①引言说 GPT-4 有 1750 亿参数——那是 GPT-3 的数字,GPT-4 实际多大并未公开; ②书把「每轮减固定量」的衰减误写成「即等比下降」——等比是乘、等差是加, 书里自己的数字(每轮约减 0.0045)证明是加法; ③书把 ViT 说成「本质也是读入+生成两半的结构」——原版只有读入的那半边,没有生成的那半边; ④「Casual Tokenizer」等分词术语与通行名不符。 四处都已在对应章节当场点破。 如果错,会错在: 若这些是出版社排版的错而非作者的错,「书的质量」评价要相应 宽容一点;但无论错在谁,读者照单全收都会被带偏,修正清单本身不受影响。

判断(我们的,不是书里的): 全书最值得带走的一个观察是原书自己重复讲了两遍 梯度累积(7.3 与 9.2)、三处改造演示的输出几乎一样(5.1/5.2/5.3)——这不只是疏忽, 也是「章节自足」的教材写法的代价。读教材时,遇到跨章重复的机制要主动合并笔记, 否则笔记里会凭空多出「几种」技术。 如果错,会错在: 如果这种重复其实是有意的螺旋式复习设计且对目标读者(学生)有效, 那该修正的是我们的阅读策略,而不是说它写法有问题。

6. 许诺兑现表

拆解里每一处「第 N 章讲」「放到了第 N 章」,在这里记一行、逐行核过。

许诺在哪许诺了什么应兑现在哪核过了吗
本页 §2 ①零件不挑输入,看图也通用04 全章(图像切块当词)
本页 §2 ③四条不动原机的路05 §3.1-3.3(四法机制)与 §3.4(选型表)
本页 §2 ④数据工序与省卡三招06 §3.1-3.4;07 §3.1-3.3
本页 §2 ⑤数据自己出题/挨打长记性08 §3.1-3.2、§3.4
本页 §2 ⑥步子怎么迈、怎么变09 §3.1-3.4
本页 §2 ⑦蒸馏与剪枝10 §3.1-3.2
本页 §2 ⑧训练守护与微调施工11 全章;12 §3.1-3.4
01 §1「教新本事(05 章)」——四法微调05 全章
01 §1「拧更快的转速(07-12 章)」——省卡到部署07-12 各章
02 §5 边界「第 11 章才会碰真实的预训练模型」11 §3.2、§3.5(真实分词器与 IMDB 案例)
03 §4AdamW 原理「放到 09 章」09 §3.1
05 §3.2 补充块LoRA 标准数学(ΔW=BA、α/r)05 §3.2 判断块内书架锚:peft#01-lora-math.md
06 §1「11 章讲大规模流水线里怎么做」11 §3.1(清洗去重切分标注的规模化版)
07 §3.4「三招全叠的成品看 11 章综合案例」11 §3.5
09 §5 边界「12.3 会补改造场景的实战配比」12 §3.3(2e-5+0.01)
10 §1「12 章的部署收尾会回到压缩」12 §3.4(量化+蒸馏收尾)
11 §1「12 章讲改造怎么落地」12 全章
12 §5 边界「05 与 12 是同一决策两端,选型表补上」05 §3.4 选型表
12 §3.4「三招压缩按需叠加」10 §3.2(剪枝)+12 §3.4(量化/蒸馏)

拆解写于 2026-08-27,依据 2025 年清华大学出版社版本。原始书籍文件不入库, 本组文档是我们自己的重写;每条引用都可用 node scripts/book-verify.mjs cong-ling-gou-jian-da-mo-xing 回核。

Footnotes

  1. 出处:「前言」第 56-58 段(text/02-fm.txt:58,搜「2025年1月」)。