跳到主要内容

01-outline — 拆解切分(8 章)

原书结构:Part I 导览(1 页清单)+ Part II 训练部(8 章)+ Part III 生产部(10 章)+ Part IV 作品集部(3 章),共 27 篇文章的合订本,约 20 万字符。 切分原则:一条推理链一章;书是路线图,我们的章按「路线的一段」组织,不按原书篇目一一对应;清单压缩,机制补足。 自查:每行「出去时知道」互相不同;总纲主线 = 01 的路线逻辑 + 02-08 各站承接。

01-what-this-roadmap-is — 这是一本什么书、路线怎么用(覆盖:书的三重身份、四段路线、每站验收标准、追前沿机制)

  • 进来时以为:这是一本从零教到精通的教科书 → 出去时知道:它是 27 篇博客文章的合订,骨架是一张学习路线图,价值在「顺序与验收」,知识要靠别的书补。
  • 进来时以为:路线就是章节顺序 → 出去时知道:四段路线(基础认知→构建训练→生产上线→作品集)每一段有明确的出口标准,卡在哪一站可以自查。
  • 进来时以为:基础站有很多要学 → 出去时知道:基础站原书只有一页清单,真正要建立的是四块心智模型(它怎么写字/怎么学/怎么记/怎么调),这些模型是后面每一站的判读工具。
  • 进来时以为:追前沿是订阅一堆账号 → 出去时知道:原书第 II-7 章给的是一套「分层信源」结构(研究者/机构/社区/期刊四层各干什么用),且作者把自己的通讯列了两次——信源清单本身要打折读。

02-foundations-map — 基础站:清单背后的知识地图(覆盖:Part I 全部 + tokenizer/attention/解码/Karpathy 三件套/VLM 导览)

  • 进来时以为:Illustrated Transformer 这类文章就是入门材料 → 出去时知道:基础站真正要带走的是四条心智模型,清单只是这四条模型的载体。
  • 进来时以为:tokenizer 是预处理小事 → 出去时知道:切词方式决定了模型的世界观,后面 RAG 的切块、成本按 token 计费、上下文窗口都以它为单位。
  • 进来时以为:注意力是「看全文找重点」 → 出去时知道:注意力是每个位置对其他位置打分再取加权混合,书单里 Lilian Weng 长文与 Karpathy 视频的分工是「图解直觉」对「代码实现」。
  • 进来时以为:VLM 是进阶选修 → 出去时知道:原书把多模态放训练部末尾当延伸,本质是给 02 的四条模型各加一条「视觉侧」的对应物。

03-data-and-finetuning — 训练站(上):数据与微调(覆盖:Part II ch1-3)

  • 进来时以为:训练先谈模型 → 出去时知道:原书把数据集排在第一章,因为同一底座模型的上限由数据决定,数据是训练站的第一杠杆。
  • 进来时以为:微调=重新训练 → 出去时知道:微调是在预训练底座上小步调参;书里「Google 研究 10%」无出处、「万亿参数」夸大,但 PEFT「只调一小部分参数」的动机是真的。
  • 进来时以为:LoRA 是又一个名词 → 出去时知道:LoRA 用「只训两块小矩阵、输出相加」把 7B 模型的微调显存从几十 GB 压到一张消费卡,QLoRA 再叠加 4-bit 底座(书里两处展开解释都写错了 LoRA 的全称)。
  • 进来时以为:14 个 notebook 要逐个看 → 出去时知道:它们是同一套流程(装环境→备数据→挂 LoRA→训→存)在 14 个模型上的变体,选 1 个走通即可,变量只有模型大小与量化位数。

04-eval-quantize-align — 训练站(下):评测、压缩、对齐(覆盖:Part II ch4-6)

  • 进来时以为:评测就是跑个分数 → 出去时知道:先分三问(评什么/在哪评/怎么评):任务分数、公开基准、Elo 竞技场各评一样东西,一个模型要三类都看。
  • 进来时以为:量化是训练技术 → 出去时知道:量化发生在训练完之后(除 QAT 外),是把参数从 32 位浮点压到低位数换显存与速度;书里 AWQ/GPTQ/PTQ/QAT 四种方法按「校准与否、何时算 scale」分两类。
  • 进来时以为:RLHF 是玄学对齐 → 出去时知道:RLHF 是三步流水线(SFT→奖励模型→强化学习调优),原书列的 InstructGPT 数字是它有效的最硬证据:1.3B 的人类偏好胜过 175B 的原始输出。
  • 进来时以为:这三章互相独立 → 出去时知道:它们是「训完之后的三次过关」——先测出问题(评测),再修「太大跑不动」(量化),再修「不听话」(对齐)。

05-app-layer-prompt-rag — 生产站(上):提示、向量库、RAG(覆盖:Part III ch1-3)

  • 进来时以为:生产从部署开始 → 出去时知道:原书生产部的前三章全在模型外面做文章——先调 prompt(不花钱),再上外挂数据(向量库+RAG),最后才碰基础设施。
  • 进来时以为:提示工程是话术技巧 → 出去时知道:原书选的五份资源共同立场是「不是背 10 个最佳提示,而是建立系统化改提示的方法」。
  • 进来时以为:向量库是新型数据库 → 出去时知道:它存的是嵌入向量、按相似度取回,六类应用全是同一动作的变体;选型看 MTEB 榜单选嵌入模型,切块策略决定检索质量。
  • 进来时以为:RAG 是一个框架功能 → 出去时知道:RAG 是「检索→塞进上下文→生成」的管线,进阶六件套都在修「检索不准」这一个环节;验收靠 RAG 三元组(上下文相关/有据/答案相关)。

06-serving-ops-security — 生产站(中):本地跑、部署、优化、运维、安全(覆盖:Part III ch4-8)

  • 进来时以为:本地跑模型是为了省钱 → 出去时知道:原书给的动机是隐私(数据不出机器),五个本地工具的本质差异在量化格式与 GPU 卸载策略。
  • 进来时以为:部署是一种选择 → 出去时知道:local/demo/server/edge 四种部署对应四类「谁来用、多快要答、数据能不能出门」的问题,是一张决策表不是难度阶梯。
  • 进来时以为:推理优化是调参 → 出去时知道:KV 缓存、连续批处理、投机解码三招各修一个瓶颈(重复计算/硬件空转/自回归串行),这是延迟与吞吐优化的全部主轴。
  • 进来时以为:LLMOps 是 MLOps 换个名 → 出去时知道:差异点在「提示即代码」与「输出不可预测」,所以评测与监控前移成核心;安全侧,提示注入是头号漏洞,要红队化测试。

07-agents-and-mcp — 生产站(下):Agent 与 MCP(覆盖:Part III ch9-10)

  • 进来时以为:agent 是提示工程的高级形态 → 出去时知道:agent = LLM + 工具调用 + 循环控制流,原书的课程阶梯(基础→多 agent→专项→评测)每级加一样能力。
  • 进来时以为:记忆就是聊天记录 → 出去时知道:MemGPT/Letta 的两级记忆(上下文内/外)把 LLM 当操作系统,内存不够就换页——这是原书讲得最透的机制之一。
  • 进来时以为:MCP 是又一个 SDK → 出去时知道:MCP 是把「应用↔工具」的 N×M 对接收敛成 N+M 的协议,客户端-服务器架构,一次写好处处可挂。
  • 进来时以为:agent 评测沿用模型基准 → 出去时知道:AgentBench 这类评测在 8 类环境里测「多步任务完成度」,模型分数高不等于 agent 能用。

08-portfolio — 作品集站:从练手到能写上简历(覆盖:Part IV ch1-3 + Afterword)

  • 进来时以为:项目越多越好 → 出去时知道:原书给的是三档(点子→入门 guided→生产级),作者明说教育级项目「不够放上简历」,差别在是否端到端、是否可评测、是否真上线。
  • 进来时以为:生产级项目要大 → 出去时知道:九个生产级项目的共同点是三件套:真实数据、可评测、部署路径;点子档与它的差距不在规模在闭环。
  • 进来时以为:作品集是技术问题 → 出去时知道:它是叙事问题——每个项目要能回答「约束是什么、怎么验证有效、坏的时候怎么发现」。

兑现表预告(总纲写完后逐行核)

  • 总纲主线每一步「为什么这一步在第 N 章讲」在写作时记账。