跳到主要内容

大纲 — da-mo-xing-ji-chu-paper-list

切分:六章,跟原书六大主题章走。这本书是一张论文地图,拆解的价值不是复述条目(那是目录红线), 而是把每个主题的「为什么重要、论文怎么一步步推进来、和书架里哪些实现能对上」讲透。 每章主走查 = 拿一个具体任务,把这一主题的论文链条从头走到尾(数字当场声明为演示编的)。

01 语言模型基础:从数数到注意力

  • §1 这一章讲什么 / §2 顶层全景(三代模型 + 采样 + 评测的链条图)
  • §3 统计一脉:进来看以为「1999 年的两本教材只是致敬」→ 出去知道它们立了这行的原始方法论(靠数次数定概率)和原始评测(困惑度),后面每一步都是对「数数」的修补。
  • §4 循环一脉(RNN):进来以为 RNN 只是被淘汰的旧技术 → 出去知道它贡献了「把上文压进一个流动的状态」这个核心思想,以及 LSTM 靠三道门解决「记不住、传不动」,这两条思想都活在了后来的模型里。
  • §5 Transformer 一脉:进来以为这节只是把 2017 年那篇再列一遍 → 出去知道列表挑的是 Transformer 体内三个后来被反复操心的零件(归一化位置、前馈层其实是记忆、残差怎么接),其中「前馈层是键值记忆」直接为第 05 章的模型编辑埋了伏笔。
  • §6 采样与生成控制:进来以为采样是工程小事 → 出去知道「每一步怎么挑词」决定了长文会不会退化,top-p 就是从「神经文本退化」那篇来的,采样策略是模型能力的一半。
  • §7 评测一脉:进来以为评测就是算个分数 → 出去知道评测方法自己也在换代(数重叠→算语义→请大模型当裁判),而「拿模型评模型」把评测变成了第 02 章能力竞赛的一部分。
  • 主走查:同一句「今天天气真__」,分别让数表法、循环网络、Transformer 接下一词,再走温度/top-p 挑词、困惑度打分(数字全部演示编的)。

02 大语言模型:规模定律与三大家族

  • §1 这一章讲什么 / §2 顶层全景(规模定律定方向 → 一个 2017 架构开出三个家族 → decoder-only 胜出 → 架构挑战者)
  • §3 规模定律:进来以为「越大越好」是口号 → 出去知道 Kaplan 2020 先把它变成可算的幂律,Chinchilla 2022 发现大家一直喂字喂得太少、算力要平分给模型和数据,PaLM 2 是照新配方办事的样板。
  • §4 Encoder-only(BERT 家族):进来以为 BERT 只是「另一个老模型」 → 出去知道它是「做完形填空」的路线:每个词的表示都两头看,天生适合理解类任务,四篇后续全在修它的训练配方。
  • §5 Encoder-Decoder(T5 家族):进来以为这是折中方案没故事 → 出去知道它把所有任务统一成「进文本、出文本」,指令多任务训练(T0/FLAN)在这里先行,是 Prompt 时代(第 03 章)的先声。
  • §6 Decoder-only(GPT 家族):进来以为 GPT 系列只是排队发布 → 出去知道这条线是「一个接下去的动作 × 三个放大器」:规模(GPT-3)、指令与人类反馈(InstructGPT→ChatGPT→GPT-4)、开放复刻(LLaMA→2→3 与 Alpaca/Vicuna/QLoRA),外加代码与多模态两个分叉。
  • §7 非 Transformer 挑战者:进来以为这是冷门收藏 → 出去知道它们共同冲的是注意力「两两看、成本平方涨」这笔账,状态空间一线(S4→Mamba)和 RWKV 是两条主要解法,尚未撼动主流。
  • 主走查:一笔固定算力预算怎么花(Kaplan 全给模型 vs Chinchilla 平分,演示数字),再顺着「接下一词→听指令→开放复刻」走 decoder-only 主线。

03 Prompt 工程:不改参数,改输入

  • §1 这一章讲什么 / §2 顶层全景(输入端四层:给例子→给思路→挑着放→接出去)
  • §3 上下文学习:进来以为「给几个例子」是显然的技巧 → 出去知道它是 GPT-3 带来的未解之谜(不改权重就学会任务),例子怎么选、怎么排序都显著影响结果,而「为什么有效」至今是开放问题(隐式贝叶斯 vs 任务识别两派)。
  • §4 思维链:进来以为 CoT 就是「让它一步步想」 → 出去知道这是一条五步推进链:写示例思路(CoT)→ 一句话触发(zero-shot CoT)→ 自动造示例(Auto-CoT)→ 多条路投票(self-consistency)→ 树/图分支探索(ToT/GoT),每步解决上一步的一个具体短板。
  • §5 Prompt 技巧与失效边界:进来以为技巧清单越长越好 → 出去知道信息摆放位置本身就是变量(lost in the middle:中间的信息最容易被丢),给表格结构(C3)、给角色人设(role-play)都只是对「注意力怎么分配」的间接操作。
  • §6 相关应用:进来以为这节是杂物 → 出去知道它收的是「提示写好后往哪接」:当 agent 的大脑(综述/生成式智能体/HuggingGPT),以及数据不够时让模型自己造指令(Self-Instruct)——后者直接喂饱了第 02 章的 Alpaca。
  • 主走查:一道两步算术题,zero-shot 答错→加示例→加思路→三条路投票,一步步看输出怎么变(演示编的)。

04 参数高效微调:不动基座,插小件

  • §1 这一章讲什么 / §2 顶层全景(三种省法:加小件/挑参数/压增量)
  • §3 为什么需要它:进来以为这是省钱技巧合集 → 出去知道背景是第 02 章之后模型大到全参数微调不可行,而指令微调时代人人要有自己的版本;列表头部的几篇综述与指令数据论文(Self-Instruct)交代了需求侧。
  • §4 参数附加一族:进来以为 adapter 和 LoRA 是一回事 → 出去知道「往网络里串小模块」「在输入前学一段虚拟 token」是两条更早的路,LoRA 是第三条;各自的代价(延迟、可容上下文长度)决定了谁能留下。
  • §5 参数选择一族:进来以为「挑哪些参数训」没技术含量 → 出去知道它有思想来源(彩票假设:网里本来就有小子网)与系统证据(挑对偏置项就够了:BitFit),GLUE 在这条线里当试验场。
  • §6 低秩一族(LoRA 赛道):进来以为 LoRA 之后是零散变体 → 出去知道这是全列表最长的一节(28 条),变体按「秩给多少(AdaLoRA/DyLoRA)、改哪部分奇异值(PiSSA/MiLoRA)、往哪扩(优化器内存 GaLore/服务端 S-LoRA/组合 LoraHub)」三个轴分布;也有一条冷水的边界(LoRA 学得少忘得少)。
  • §7 实践与应用:进来以为只是两个应用例子 → 出去知道它们点出 PEFT 的真实生态位:垂直领域(金融 SQL、表格数据)用小预算换专属模型。
  • 主走查:一个 4096×4096 的权重矩阵(约 1677 万个数),LoRA 秩 8 把「要训的数」压到 6.5 万个(约 0.4%),再把这一步放进全流程(数字当场声明)。

05 模型编辑:给大模型改一条知识

  • §1 这一章讲什么 / §2 顶层全景(三条路:外挂记忆/加神经元/改权重,输入一个「改错题」走三条路)
  • §3 为什么需要它、难在哪:进来以为改个事实很简单 → 出去知道要同时满足三件事(改准这条、不伤别的、别的问法也得改),重训不可行、全量微调会「殃及」其他知识,这是它作为独立方向存在的理由。
  • §4 理论前提:进来以为「定位知识」是凭感觉 → 出去知道有两篇地基:前馈层是键值记忆(Geva 2021)+ 知识神经元(Dai 2021),它们让「事实存在某一层某几个维度」变成可检验的命题。
  • §5 三条路线:进来以为方法名记不住 → 出去知道按「改哪里」分三类正好覆盖全节:外挂记忆(SERAC/MEND/GRACE)、加参数(T-Patcher:一个错误一个神经元)、改参数(ROME:因果追踪定位层+一次秩一修改;MEMIT 扩到批量)。
  • §6 应用与反噬:进来以为编辑只用来纠错 → 出去知道它还能挖隐私(训练数据提取/隐私神经元)和去偏见,反过来说明模型「记过什么」是可被审计的。
  • 主走查:把「埃菲尔铁塔位于巴黎」改成「位于罗马」,同一道编辑题分别交给外挂记忆、加神经元、改权重三条路,看各自代价(演示编的)。

06 检索增强生成:让模型开卷考试

  • §1 这一章讲什么 / §2 顶层全景(检索→重排→生成→校验的流水线,论文各占一站)
  • §3 为什么需要它:进来以为 RAG 只是「联网搜索」 → 出去知道它的立论是「参数记忆天然不可靠」(长尾知识答不好、幻觉难消)加一条 1997 年的老定理(没有免费午餐:不靠先验就输),RAG 2020 把「检索器+生成器一起训」定成范式。
  • §4 架构演进:进来以为 RAG 架构只有一个 → 出去知道从「检索结果拼进上下文」(RALM)到「检索器可随任务调」(REPLUG/Atlas)到「模型自己决定查不查」(Self-RAG),主导权一步步从管道移进模型。
  • §5 检索侧四十年:进来以为检索就是向量搜索 → 出去知道这一节是全列表最长的论文史:稀疏(tf-idf/BM25)→稠密(DPR/ColBERT)→生成式检索(DSI)→近似最近邻索引(kd 树到 HNSW 到乘积量化)→用大模型重排(RankGPT),每一段都在解决上一段的一个具体瓶颈。
  • §6 生成侧增强:进来以为查到就能答好 → 出去知道生成端还有一整层:先判该不该查(自适应检索)、检测幻觉(SelfCheckGPT)、压缩长上下文(LongLLMLingua)、把检索编排成多步程序(DSP→DSPy)。
  • §7 实践与应用:进来以为是零散例子 → 出去知道它们圈出 RAG 的适用半径:金融问答、分子/图像生成(检索当下 matériel)、语音、视频——「把已知资料检索进来」成了通用配方。
  • 主走查:问「我们公司 2024 年差旅报销上限是多少」(模型肯定不知道),走 分块→嵌入→向量索引取 top-k→重排→拼上下文→生成→自查 的整条流水线(数字演示编的)。

自查(任意两行「出去时知道」是否同一件事)

  • 01§6 采样 vs 03§4 自洽采样:01 讲的是「挑词层的随机与截断」(top-p/温度),03 讲的是「多条推理路径投票」(self-consistency),不同层,保留。
  • 02§3 规模定律 vs 04§3 需求侧:02 讲「算力怎么分」,04 讲「为什么全参数微调不可行」,不同问题,保留。
  • 01§7 评测 vs 06§6 校验:01 讲「生成文本怎么打分」(G-Eval 一线),06 讲「答案是否忠于检索到的资料」(faithfulness/幻觉),不同问题,保留。
  • 05§4 理论前提 vs 01§5 前馈层:01§5 只点「FFN 像记忆」这个事实并指路第 05 章;05§4 讲它怎么变成编辑的定位依据,分工明确。