跳到主要内容

01-outline — cong-ling-gou-jian-da-mo-xing 拆解大纲

全书 12 章原文约 13.5 万字符;拆解 12 章,按推理链切分(与原书章序基本对齐,引言并入第 1 章,原书 9.2 与 7.3 重复讲梯度累积——合并到算力章,原书 12.4 的量化/蒸馏归入微调实战与压缩章的呼应)。

自查记录:初稿曾把「评估指标」与「生成策略」拆成两章,「出去时知道」都落在「怎么判断它生成得好不好」→ 合并回第 2 章;原书 7.3 与 9.2 两处梯度累积,「出去时知道」同一件事 → 合并进第 7 章,第 9 章只讲优化器与调度。

#文件章节(一节一行:进来时以为 → 出去时知道)
0101-transformer-parts.md引言+第1章。进来时以为「大模型是一个黑箱」→ 出去时知道它由五种零件拼成:序列到序列的编码-解码骨架、把词变成向量的分词与嵌入、让每个词互看的自注意力/多头、让深网络训得动的残差与层归一化、给无序输入补顺序的位置编码
0202-gpt-generate.md第2章。进来时以为「它会写东西」→ 出去时知道它只是自回归地一步步挑下一个词(单向掩码保证只能看前文),挑法有 Greedy/Beam 之分,好坏用 BLEU/ROUGE/困惑度来量,困惑度又能反过来当训练目标
0303-bert-understanding.md第3章。进来时以为「BERT 是另一个聊天模型」→ 出去时知道它是双向的理解模型:靠随机遮词再猜词(Masked Language Model)自监督预训练,靠接一个线性分类层微调,小数据也能到高准确率;-100 标签决定「只对被遮的位置算损失」
0404-vit-vision.md第4章。进来时以为「图像得用卷积」→ 出去时知道把图切成小块当词用,ViT 就能把 Transformer 原封搬进视觉:卷积只当切刀,CLS token 汇总全局,注意力量化(均值/方差)让「模型在看哪」可测量
0505-peft.md第5章。进来时以为「微调要动整个模型」→ 出去时知道四条参数高效路线:Adapter 插小模块、LoRA 拆低秩小矩阵、Prompt Tuning 只训前缀提示、P-Tuning 参数化提示序列——共同点是冻结基座、只训少量新增参数
0606-data.md第6章。进来时以为「数据拿来就用」→ 出去时知道要过四道工序:清洗(正则去噪)、增强(同义替换/随机插入删除交换造变体)、BPE 分词(高频字对合并解决稀有词)、嵌入生成与降维——数据质量直接写进模型上限
0707-compute.md第7章(并入原书9.2)。进来时以为「训练慢只能换卡」→ 出去时知道三招榨硬件:混合精度(FP16 算+FP32 守+GradScaler 防下溢)、两种并行(数据并行切数据/模型并行切模型)、梯度累积(小批次攒出大批次的效果)
0808-robustness.md第8章。进来时以为「训练好=表现好」→ 出去时知道还有两条加粗底线:对比学习(无标签拉近正对、推远负对,SimCLR 增强造视角+NT-Xent)、对抗训练(在嵌入上加微扰造对抗样本一起训,模型才抗扰动);GAN 的生成器-判别器博弈也在这一章
0909-optimizer-schedule.md第9章。进来时以为「优化器随便选」→ 出去时知道 AdamW=带记忆的自适应步长+解耦权重衰减,LAMB=按每层参数模长控步速适配超大批次;学习率不是常数:线性衰减、余弦退火、Warmup、循环学习率与五种调度器各有适用阶段
1010-compression.md第10章。进来时以为「小模型只能训小的」→ 出去时知道两条压缩路:知识蒸馏(大教师软标签+温度 T+KL 散度教小学生,参数减半精度近全量)、剪枝(非结构化剪单权重/结构化剪整通道,BERT 还能剪注意力头和层)
1111-training-in-practice.md第11章。进来时以为「跑起来就行」→ 出去时知道长训练有一套守护流程:清洗去重切分标注、WordPiece/BPE 分词器、DDP 多卡多节点、TensorBoard 监控、检查点+断点续训,IMDB 全流程串一遍
1212-finetune-in-practice.md第12章。进来时以为「微调=全量再训」→ 出去时知道实战五步:数据(分层切分+增强)→ 层级冻结(只解冻顶部两层+分类头)→ 超参(学习率 2e-5/权重衰减 0.01)→ 四指标评估(准确率/精确率/召回率/F1)→ 量化+蒸馏优化推理

总纲主线(草稿)

一句话:把「从零件到上线」一条链走完——先用五种零件搭出 Transformer(01),让它学会生成(02)和理解(03),再搬进视觉(04);然后是让它省钱省卡的四组技术:少动参数(05)、喂好数据(06)、榨干硬件(07)、守住底线(08);最后是让它收敛得好(09)、变小变快(10),以及两条实战流水线(11、12)。

② 类出处候选(已核对存在)

  • shelf=ai-frontier-reference/peft#01-lora-math.md — LoRA 数学(ΔW=BA、α/r、B 零初始化)
  • shelf=ai-frontier-reference/pytorch#05-distributed-ddp.md — DDP 梯度桶/allreduce、跨卡平均
  • shelf=ai-frontier-reference/accelerate#04-mixed-precision-and-accumulation.md — GradScaler/下溢/loss 除累积步数
  • shelf=ai-frontier-reference/minbpe#01-bpe-core.md(及 02)— BPE 合并、预切分
  • shelf=ai-frontier-reference/deepspeed/index.md — fp16 动态 loss scale(备用)