跳到主要内容

阅读笔记 — da-mo-xing-ji-chu-paper-list

原书形态:单个 md 文件(text/01-full.txt,987 行,约 7.1 万字符)。它不是教材,是一份论文清单: 《大模型基础》教材的配套论文列表,按教材六大主题分章,每章再分小节; 每篇论文一条记录 = 编号 + 英文题名 + venue 标签 + 作者 + PDF/Code 链接 + 年份。 全文没有一句论文介绍、没有评价、没有导语——价值全在「选了哪些、按什么顺序摆」。

六大主题与小节结构(行号速查)

  1. 语言模型基础(L48–131):统计方法(2 本教材, L53–56) / RNN(L60–75:RTRL1989、LSTM1997、训练难度2012、GRU2014、scheduled sampling2015) / Transformer(L79–91:LayerNorm2016、T5、FFN=KV记忆2021、ResiDual2023) / 采样(L96–102:diverse beam search、神经文本退化) / 评测(L107–129:perplexity、ROUGE、BLEU批评、BERTScore、G-Eval、InstructScore)
  2. 大语言模型(L135–283):规模定律(L140–149:Kaplan2020、Chinchilla2022、PaLM2) / 架构总览(L153–156:Attention is all you need) / Encoder-only(L160–175:survey、BERT、RoBERTa、ALBERT、ELECTRA) / Encoder-Decoder(L179–197:T5、T0、mT5、FLAN、BART、mBART) / Decoder-only(L201–264:GPT-1/2/3、Codex、WebGPT、InstructGPT、ChatGPT、GPT-4(×3 条)、LLaMA/2/3、Alpaca、Vicuna、QLoRA、CodeLlama、LawGPT、Goat、LLaVA、MiniGPT-4) / 非 Transformer(L268–283:S4、S4D、RWKV、Mamba、TTT)
  3. Prompt 工程(L289–492):简介(L292–332:综述、LLMLingua、FIT-RAG、DeepSeek-V2、Spider、MMLU、FinSQL、Alpaca、WizardCoder、生成式智能体) / 上下文学习(L336–408,18 条,GPT-3 领衔,重复收 Emergent Abilities) / 思维链(L412–437:CoT、zero-shot CoT、Auto-CoT、ToT、GoT、self-consistency) / Prompt 技巧(L441–457:lost in the middle、C3、PaLM、role-play) / 相关应用(L461–492:agent 综述、生成式智能体(重复)、HuggingGPT、garbage-in-out、数据枯竭、Self-Instruct、C3(重复))
  4. 参数高效微调(L500–687):简介(L503–527) / 参数附加(L531–555:prompt tuning、prefix-tuning、adapter、AdapterFusion、SparseAdapter、代理微调、稀疏掩码) / 参数选择(L559–589:BitFit、冻结层、PEFT 有效性分析、Child-Tuning、GLUE、彩票假设、动态稀疏) / 低秩适配(L593–677,28 条:LoRA、统一视角、KronA、DoRA(×3 条)、GaLore、S-LoRA、SoRA、ReLoRA、SLTrain、PiSSA、MiLoRA、MoRA、Chain-of-LoRA(×2)、内在维度、LISA、AdaLoRA、LoraHub、DyLoRA) / 实践(L681–687:FinSQL、TabLLM)
  5. 模型编辑(L693–789):简介(L695–707,4 篇综述) / 经典方法(L711–750:SERAC、自然语言补丁、CaliNet、Transformer-Patcher、GRACE、元学习综述、EditableNN、KnowledgeEditor、MEND、FFN=KV、知识神经元、ROME、MEMIT) / 附加参数法 T-Patcher(L754–757) / 定位编辑法 ROME(L761–767:ROME、MEMIT) / 应用(L771–789:训练数据提取、DEPN 隐私、FFN 概念提升、性别偏见、DAMA 去偏)
  6. 检索增强生成(L795–968):简介(L798–804:no free lunch、RAG2020) / 架构(L808–826:RALM、REPLUG、Atlas、RETRO、AAR、Self-RAG) / 知识检索(L830–896:RAG 编年史、GenRead、tf-idf、BM25、DPR、ColBERT、poly-encoder、DSI、生成式 IR、NCI、kd-tree、ball*-tree、NSW、NSG、HNSW、PQ、OPQ、RankGPT) / 生成增强(L900–943:SelfCheckGPT、语义一致性、长尾知识、何时该检索、ROME(重复)、检索反馈、DSP、澄清树、LongLLMLingua、FIT-RAG(重复)、PRCA、TriForce、RAGCache) / 实践(L947–968:agent 综述(作者串行)、多模态检索、FinTextQA、RetMol、Re-Imagen、ASR、VidIL)

关键观察(写拆解要用的)

  • 编者的声音藏在排序里。每小节的条目按「时间 + 递进」排:RNN 节从 1989 排到 2015, 正是「循环网络怎么一步步可训练」的链条;低秩节从 LoRA 排到 2024 一堆变体, 是「LoRA 开出一条赛道后人怎么填空」。编者不写一句评论,但顺序就是评论。
  • 跨节有伏笔:「FFN 是键值记忆」(Geva 2021)同时出现在「基于 Transformer 的语言模型」(L87) 和「模型编辑经典方法」(L740)——它就是模型编辑能「定位到层」的理论前提;ROME(Meng 2022) 出现三次(编辑经典、ROME 节、RAG 生成增强)。检索增强一节把 ROME 列进去,意思是 「另一条改知识的路是编辑参数,不是外挂检索」。
  • 列表的瑕疵(照实写进「边界」):
    • GPT-4o 条目挂在「Gpt-4 technical report」名下,且重复两条(L224–231);
    • Emergent Abilities 在上下文学习节重复收(L378 与 L394);Chain of LoRA 重复(L652、L664); DoRA 出现三条(两条同一篇、年份标得不一样);C3、Self-Instruct、生成式智能体也各出现两次;
    • 「参数选择方法」小节里混进了 GLUE(评测基准)和彩票假设(稀疏结构假说), 它们不是 PEFT 方法,是这条线的「思想来源/试验场」;
    • 上下文学习节里混进了 1997 年的 LSTM(L358)——上下文学习的「上下文」概念确实可追到循环网络, 但摆在 2020–2024 的论文中间没有任何说明;
    • perplexity 论文(Jelinek)标 1997,通常引作 1977(JASA 原始卷期);列表条目两个年份写法不一;
    • 两条条目作者串行:Llama 2 条目挂着 Self-Instruct 作者名(L526–527), agent 综述条目挂着 TriForce 作者名(L949–950);
    • 「Prompt 工程简介」一节混入了 MMLU(评测)、Spider/FinSQL(text-to-SQL 应用)、 DeepSeek-V2(MoE 架构)——它当「这一门的全景杂物间」用,不是纯 prompt 论文。
  • 时效:最晚条目到 2024 年中(Llama 3、MiLoRA、SLTrain、FinTextQA、GaLore)。 之后的推理模型(o1/R1)、原生多模态、agentic 协议(MCP)都不在。
  • 每节标题都带同一颗星形图标(L51 等)——是模板装饰,不是「重点论文」分级信号,拆解里不要误读。

与书架的连线(② 类锚候选,已核对存在)

  • LoRA 数学:ai-frontier-reference/docs/peft/01-lora-math.md(ΔW=B·A、并联支路、B 初始化为零)
  • PEFT 44 种方法三族分类:peft/04-other-methods.md(AdaLoRA SVD、prefix/prompt-tuning 学虚拟 token、IA³)
  • 采样实现:nanogpt/04-sampling.md(temperature、top-k、softmax、multinomial 的最朴素循环)
  • GPT-2 复刻:nanogpt/01-model.md;预训练:nanochat/02-gpt-pretrain.md;分词:nanochat/01-tokenizer.md
  • 后训练(SFT+RL):nanochat/03-post-training.md;偏好对齐:trl/03-dpo.md(InstructGPT 之后的路线)
  • 开放模型全栈:olmo(01-model/02-data/03-trainer/04-eval)
  • 评测判分:openai-simple-evals/02-grading-strategies.md(LLM 当裁判→对应 G-Eval);MMLU:openai-simple-evals/01-sampler-and-eval-protocol.md
  • Prompt:anthropic-prompt-engineering/02-structure-and-thinking.md;提示自动优化对应 DSP→DSPy:dspy/04-optimizers-teleprompt.md
  • 检索:llamaindex/03-retrieval.md(稠密检索、RRF 融合)、llamaindex/02-ingestion-chunking.md(分块)、graphrag/02-graph-extraction.md(图谱 RAG)、RAG 评测:ragas/01-metrics-engine.md(faithfulness→呼应幻觉检测)、向量索引 HNSW:khoj/02-retrieval.mdagentmemory/02-retrieval.md
  • serving/QLoRA:vllm(多 LoRA)、unsloth/04-fast-lora.mdtorchtune/02-model-components.md

模型编辑(ROME/MEMIT/EasyEdit)三个书架都没有对应资源——该章不硬凑 ② 锚。

切分决定

六章,完全跟着原书六大主题走(原书就是按主题组织的论文地图,重新组织只会破坏它的结构价值): 01 语言模型基础 / 02 大语言模型 / 03 Prompt 工程 / 04 参数高效微调 / 05 模型编辑 / 06 检索增强生成。 每章主走查 = 拿一个具体任务把该主题的论文链条从头走一遍(数字全部当场声明为演示)。