跳到主要内容

01-outline —《大模型基础》拆解切分(14 章)

原书 6 大章 23 节,约 32.8 万字符。切分按推理链与新词密度,不按字数。 导航章无(chapters.json 23 个全是正文章,无目录/索引被拆出;01 文件尾带第 2 章开篇段、02 文件头带第 1 章溢出段,引用时注意归属)。

差异化定位:本书 = 大模型全景教材,一条「先造出来 → 再调教好」的主线; 与 nndl 系列(深度学习基础)、llm-and-agent(2026,偏 agent 前沿)区分—— 本书重心是训练完成之后怎么改行为的四大手段(Prompt/PEFT/编辑/RAG 各占一到两章)。 姊妹资料 da-mo-xing-ji-chu-paper-list(同库,已拆)提供论文接力链,可做②类交叉引用。

第 01 章 语言模型的第一课:从数数到循环网络(ch1.1–1.2,text/01-ch01.txt)

  • 语言是概率的 → 出去时知道:语言模型=给一段文字算「出现概率」的机器,目标从来是「像」不是「对」
  • n-grams 数数 → 出去时知道:bigrams 拿长颈鹿语料算出 2/15;没见过的句子也能算,但 n 越大越容易撞上零概率
  • n 的权衡 → 出去时知道:n 是「背得像」与「猜得出」之间的旋钮;马尔可夫假设+极大似然是它的统计学户口
  • RNN 环路 → 出去时知道:把「长颈鹿」卷进隐状态,FNN 只看「脖子」会猜「短」,RNN 猜「长」
  • RNN 的代价 → 出去时知道:历史叠得越深矩阵联乘越多,特征值小于 1 梯度消失、大于 1 爆炸;GRU/LSTM 用门控续命
  • 训练配方 → 出去时知道:Teacher Forcing 喂标准答案稳住训练,却带来曝光偏差;自回归串行生成是通用宿命

第 02 章 Transformer 与解码:现代语言模型的引擎(ch1.3–1.5,text/01-ch01.txt)

  • 注意力层 → 出去时知道:每个词拿 query 去和所有 key 对暗号,按匹配度把 value 加权搬回来
  • FFN 与结构细节 → 出去时知道:FFN 占近 2/3 参数、是键值记忆体;残差管梯度、层正则管稳定,Pre/Post-LN 各有软肋
  • 三种预训练配方 → 出去时知道:同一台 Transformer,掩词补全练出 BERT、截断补全练出 T5、下一词预测练出 GPT-3
  • 解码:贪心与波束 → 出去时知道:概率最大化是 NP-Hard;贪心选「是」整句只剩 0.03,波束 b=2 捞回 0.1 的「脖子长」
  • 解码:随机采样 → 出去时知道:Top-K 固定名额会在「裤子」上翻车也会漏掉「打架」;Top-P 按概率质量划线;Temperature 调分布平坦度
  • 评测 → 出去时知道:困惑度管「像不像语料」,BLEU/ROUGE 管重叠,G-EVAL 让 GPT-4 当裁判

第 03 章 三种架构:理解、翻译、生成(ch2.2–2.4,text/03,04,05)

  • 架构分家 → 出去时知道:三种架构的差异全在注意力矩阵:完全(双向)/下三角+交叉/纯下三角
  • BERT → 出去时知道:完型填空(15% 遮掩)+句对判断,[CLS] 一个向量打天下;水豚例走通预训练流水线
  • BERT 三变体 → 出去时知道:RoBERTa 加数据换动态掩码;ALBERT 因子分解+跨层共享把 1.1 亿压到 1200 万;ELECTRA 换成找茬游戏
  • 天花板 → 出去时知道:Encoder-only 止步 6.6 亿参数,生成要反复填空,注定让位
  • T5 → 出去时知道:万物转文本,任务写在输入前缀里=最早的 Prompt;Span Corruption 掩连续片段
  • BART → 出去时知道:五种破坏文本的噪声(遮挡/删除/填空/打乱/旋转),span 长度服从 λ=3 泊松分布

第 04 章 Decoder-only 的胜利:规模、GPT 与 LLaMA(ch2.1+2.5,text/02,06)

  • 扩展法则 → 出去时知道:Kaplan 说算力加 10 倍模型该扩 5.37 倍,Chinchilla 说该各扩 3.16 倍——数据从配角升到主角
  • 涌现 → 出去时知道:能力不是渐增是相变:20 亿→130 亿→1750 亿,上下文学习/代码/推理逐级解锁
  • GPT-1 到 GPT-3 → 出去时知道:三代只换两样东西——解码块数量和语料;1.17 亿到 1750 亿,40GB 到 1TB
  • RLHF → 出去时知道:三步流水线(示范微调→奖励模型→强化学习)把「人类偏好」灌进模型;DPO 砍掉奖励模型
  • 闭源与 LLMaaS → 出去时知道:ChatGPT 起参数语料全部保密,模型变成服务;图灵测试讨论由此而起
  • LLaMA → 出去时知道:路线之争=GPT 模型数据同步涨 vs LLaMA 小模型大数据;LLaMA3 用 50TB 语料让 80 亿打赢 700 亿
  • 生态 → 出去时知道:Alpaca/Vicuna 提性能、CodeLLaMA/LawGPT 进垂域、LLaVA 上多模态,全靠开源底座

第 05 章 绕开平方瓶颈:SSM、RWKV、Mamba 与 TTT(ch2.6,text/07)

  • 瓶颈 → 出去时知道:注意力矩阵随序列长度平方涨,RNN 线性但梯度不稳;现代变体要两头兼得
  • SSM → 出去时知道:控制理论的状态方程,离散化后一鱼两吃:训练用卷积形式并行,推理用递归形式省算
  • RWKV → 出去时知道:WKV=两个 SSM 之比,时间衰减权重让记忆随距离打折;第一个扩到 14B 的非 Transformer
  • Mamba → 出去时知道:选择机制让参数随输入变(牺牲时不变),硬件感知算法换回 GPU 效率;吞吐高 5 倍、百万级序列
  • TTT → 出去时知道:Mamba 超 16k 就饱和;TTT 干脆拿模型自身参数当记忆,推理时边测边训
  • 边界 → 出去时知道:这些架构在长文本上省算力,但生态与验证远不及 Transformer

第 06 章 Prompt 工程:不改参数,改输入(ch3.1–3.2,text/08,09)

  • 范式转变 → 出去时知道:「预训练-微调-预测」变成「预训练-提示预测」;Prompt=任务说明/上下文/问题/输出格式四件套
  • 分词 → 出去时知道:BBPE 从单字节起步迭代合并高频对;DeepSeek/Qwen 一个 token 1.3 个汉字,GPT-3 只有 0.49
  • 软提示与压缩 → 出去时知道:Prompt 变长推理变贵;LLMLingua 压到 1/20;优化格式能改变模型判断结果
  • 上下文学习 → 出去时知道:零样本/单样本/少样本三级;示例把模型「锚定」到预训练学过的概念上
  • 示例选择 → 出去时知道:相似性(KATE)与多样性(Self-Prompting 聚类)顾此失彼,RetICL 迭代着选
  • 影响因素 → 出去时知道:亿级参数才涌现 ICL(最小 Qwen2-0.5B);示例标签错了大模型跟着错,顺序也敏感

第 07 章 思维链:让模型把步骤写出来(ch3.3–3.4,text/10,11)

  • Flat Scaling Curves → 出去时知道:算术/常识/符号推理上堆参数不涨分;CoT 把中间步骤写进输出
  • 三种模式 → 出去时知道:按部就班(CoT/Auto-CoT)、三思后行(ToT/GoT)、集思广益(Self-Consistency 投票)
  • Zero-Shot CoT → 出去时知道:一句「让我们一步一步思考」触发两阶段(先推理后答案),免标注
  • ToT → 出去时知道:拆解/衍生/评估/搜索四件套,24 点游戏里广度优先+「可以/可能/不可能」剪枝
  • 规范编写 → 出去时知道:任务说明放开头结尾(模型偏科首尾)、分隔符混乱会让示例被当成待分类输入
  • 何时用 CoT → 出去时知道:千亿模型受益、十亿模型算出 5+4=9;Chat 系模型已内化 CoT,不提示反而更好
  • 心理暗示 → 出去时知道:角色扮演与情景代入改变输出立场与文风

第 08 章 Prompt 的落地:Agent、数据合成与 Text-to-SQL(ch3.5,text/12)

  • Agent 框架 → 出去时知道:配置/记忆/计划/行动四模块,每个模块都靠 Prompt 驱动;小浣熊兽医走全程
  • 数据合成 → 出去时知道:公共高质量数据预计 2026 年左右耗尽;Self-Instruct 五步把 175 条种子滚成数万条
  • Text-to-SQL → 出去时知道:C3 三件套:清晰提示+提示校准(角色扮演专家)+一致输出(执行结果投票)
  • GPTs → 出去时知道:Instructions 就是预设 Prompt,加知识库与工具即成品应用

第 09 章 不动全量参数:附加与选择(ch4.1–4.3,text/13)

  • 为什么微调 → 出去时知道:ICL 性能有差距、Prompt 贵;指令微调有效但 LLaMA2-7B 全量要 60GB,4090 装不下
  • PEFT 三分类 → 出去时知道:附加(加新模块)/选择(挑旧参数)/低秩(近似更新);80GB A100 上 LoRA 让 OOM 变可行
  • 加在输入 → 出去时知道:软提示只有 20480 个参数(T5-XXL 本体 11B);本意是自动找「咒语」
  • 加在模型 → 出去时知道:Prefix 要 MLP 重参数化稳住训练;Adapter 瓶颈结构参数 2dr+d+r;AdapterFusion 注意力融合多任务
  • 加在输出 → 出去时知道:Proxy-tuning 拿两个小模型的 logits 差指挥大模型,黑盒也能调
  • 选择方法 → 出去时知道:BitFit 只调偏置(0.08%)媲美全量但只在 BERT 级验证过;Child-tuning 用费舍尔信息挑子网络

第 10 章 LoRA:低秩适配与微调实践(ch4.4–4.5,text/14,13尾)

  • 低维假设 → 出去时知道:过参数化模型的更新其实活在低维空间,所以能用两个小矩阵近似 ΔW
  • LoRA 机制 → 出去时知道:B 高斯、A 零初始化(初始不扰动原模型);r×(d+k) 远小于 d×k;推理可合并零延迟
  • 显存走查 → 出去时知道:LLaMA2-7B 单层 4500 万参数缩到 6 万(千分之一);优化器省 25GB 梯度省 14GB,4090 能跑
  • 变体 → 出去时知道:ReLoRA 周期合并攒高秩;AdaLoRA 按重要性分配秩;DoRA 分方向与大小;全量秩是 LoRA 的 10-100 倍
  • 插件化 → 出去时知道:LoRA 可拔下来当插件,LoRAHub 加权组合多任务能力迁移新任务
  • 实践 → 出去时知道:HF-PEFT 参数怎么设(r=4/8/16、alpha 反比、dropout 0.01);FinSQL/TabLLM 两个落地案例

第 11 章 模型编辑:给已固化的知识做手术(ch5.1–5.2,text/15,16头)

  • 动机 → 出去时知道:斑马皮肤答「肉色」;重预训练太贵、微调会灾难性遗忘;第三条路=精准改一个知识点
  • 思想钢印 → 出去时知道:书拿《三体》设备类比;编辑=「与人交流纠正某个错误认知」那一层
  • 五性质 → 出去时知道:准确性/泛化性/可迁移性/局部性/高效性;可迁移性(反问、推理、换实体)是普遍短板
  • 外部拓展法 → 出去时知道:知识缓存(门控+缓存+推理模块,是「求助」非「内化」)与附加参数(GRACE codebook)
  • 内部修改法 → 出去时知道:元学习「学怎么编辑」双层优化,MEND 低秩省算;定位编辑先找参数再动手
  • 键值存储体 → 出去时知道:16 层 Transformer 实验:FFN 的 key 认「斑马的」前缀,value 吐「条纹」分布——FFN 即记忆

第 12 章 解剖两个编辑器:T-Patcher 与 ROME(ch5.3–5.5,text/17,18,19头)

  • T-Patcher 位置与形式 → 出去时知道:只在最后一层 FFN 加补丁;补丁=一个键值对,输出加 ap·vp 的修正项
  • T-Patcher 训练 → 出去时知道:每个要编辑的 token 一个补丁;激活损失管「该响就响」,记忆数据集管「不该响不响」
  • ROME 定位 → 出去时知道:因果跟踪三步(正常/干扰/恢复)+阻断实验,锁死中间层 FFN 处理主体末 token
  • ROME 编辑 → 出去时知道:定键(随机前缀取平均)、优化值(交叉熵+KL 散度)、闭式解插入秩一更新
  • 应用三则 → 出去时知道:Gemini 一天修复猜疑、被遗忘权(GDPR)与 DPEN 遗忘隐私、祛毒与去偏见

第 13 章 RAG:原理、架构与知识检索(ch6.1–6.3,text/20,21,22头)

  • 幻觉两种 → 出去时知道:知识过时(考拉 5000 vs 86,000)与模型自身(树袋熊考拉认成两种,但问别名又能答对)
  • RAG 本质 → 出去时知道:检索器+知识库+LLM 三件套;不改内部知识,绕开更新成本与遗忘
  • 架构黑白盒 → 出去时知道:闭源只能黑盒(检索器微调:REPLUG LSR 用困惑度当监督);开源可白盒协同微调(Atlas)
  • 检索侧基建 → 出去时知道:分块(窗口限制+降噪)、伪查询/标题当锚点、同义改写与多视角分解
  • 检索器 → 出去时知道:稀疏(TF-IDF/BM25)对拼精确、稠密(双编码器可离线)拼效率,交叉编码器留给精排
  • 索引与重排 → 出去时知道:HNSW 图索引、乘积量化压内存;MiniLM/RankGPT 重排把对的文档顶到前面

第 14 章 RAG 的进阶:生成增强与实践(ch6.4–6.5,text/22尾,23)

  • 何时增强 → 出去时知道:非必要不增强——喂错袋熊知识反而答错;判「知不知道」有外部观测(问/一致性/流行度)与内部探针
  • 何处增强 → 出去时知道:输入端拼 Prompt(主流)、中间层交叉注意力(RETRO)、输出端后矫正(REFEED),可组合
  • 多次增强 → 出去时知道:复杂问题分解(DSP 三模块),模糊问题渐进澄清(TOC 树状剪枝),算力指数涨是代价
  • 降本增效 → 出去时知道:困惑度低=信息少可删(LongLLMLingua);KV-cache 复用(RAGCache 树形缓存+PGDSF)
  • 实践 → 出去时知道:LangChain 六模块+LlamaIndex 偏检索;五段代码搭出最小 RAG
  • 应用 → 出去时知道:Agent 四模块全面接入 RAG;医疗多模态(X 光→心肌肥大)是最热的垂域落点

自查记录

  • 「出去时知道」逐行比对:02 章解码两节曾分别写「贪心/波束」与「Top-K/Top-P/Temperature」,合为「解码:贪心与波束」「解码:随机采样」两行,对象不同不合并;11 章「键值存储体」与 12 章「ROME 定位」都涉及 FFN,前者是机制发现(16 层实验),后者是因果定位(1000 例+阻断),不同层次不合并。
  • 14 章超出「预计 10–14」上沿封顶,未再合并:每章对应一条独立推理链且单章原文 17k–34k。