跳到主要内容

审查 da-mo-xing-ji-chu-paper-list — 2026-08-27

结论: ISSUES(6 条)

门禁实跑(四条命令末行原样):

book-verify: 1 本有拆解、共 316 处出处、0 处对不上
book-jargon: 1 本,共 0 处专业词没解释就用了
生面孔配额:段级超额 0 处(上限 1)、节级超额 0 处(上限 5)
book-dodged: 1 本,共 0 个词被躲开(阈值:原书出现 ≥15 次)

本案特殊风险核查结果(先记全过的)

  • 目录红线:抽 04、05 两章通读——都是「讲方向的推进链条」不是逐条摘要。04 读完能复述 「全量微调为什么做不起→三条省法各省在哪→LoRA 靠什么长成标准→冷水划边界」; 05 读完能复述「改一条知识为什么难(三标准)→知识可定位的两篇地基→三路线各自代价→ 刀口照出隐私与偏见」。合格。
  • 论文名与归属:抽 5 条回核原文——LoRA :595 确在「低秩适配方法」(L593 起)、 ROME :763 确在「定位编辑法:ROME」(L761 起)、SERAC :713 确在「模型编辑经典方法」 (L711 起)、FLAN :514 确在「参数高效微调简介」(L503 起)、Emergent Abilities :378/:394 确在「上下文学习」(L336 起)且确为同篇重复。归属全对。
  • 自报原文瑕疵:抽 2 条核实——GPT-4o 两条确挂在「Gpt-4 technical report」名下 (:227/:230,链接均指 hello-gpt-4o),已在 02 §8 边界表如实标注;Emergent Abilities 重复收录(:378/:394)已在 03 §8 如实标注。另核 perplexity 标 1997(:110 属实, 01 §5 已标「常见引用是 1977」)。三条全过。
  • 书架锚:抽 peft/trl/dspy/llamaindex 四处,「事实=」逐一与 ../ai-frontier-reference/docs/{peft/01-lora-math, trl/03-dpo, dspy/04-optimizers-teleprompt, llamaindex/03-retrieval}.md 原文比对,全部吻合。
  • 时效声明:index §5 写明「收录截至 2024 年中」,不覆盖清单五项齐全(2024H2 之后、 逐篇介绍、训练工程、安全面、评测方法论),与书卡 notCovered 一致。
  • 脚注:抽 6 条回核原文,全部属实(01[^4]:110、02[^2]:145、03[^17]:443、 04[^17]:595、05[^11]:763、06[^13]:853)。
  • 主走查:04 主走查在 §2 声明、§6.1 走全程带真数(16,777,216→65,536=0.39%=256 倍,乘法精确), 三条路线在 §4.2/§5.2/§6.1 各报数、§6.4 收口;05 主走查在 §2 声明、§4.1–4.3 三路线各走一遍、 §4.3 为主步。机制均落在走查上。数字凡非原书给的均标「演示口径」。合格。
  • 台阶抽检:02 §3 段首句抄列(Kaplan→幂律→可外推→走查主步→Chinchilla)不跳; 01 §3、06 §5 通读不跳。
  • 总纲:六节齐全,§3 主线(一个动作/三次换代/两次改造/两条出路/第三条路/出口) 可独立成篇,机制细节留在章节层;许诺兑现表 18 行,抽 3 行(§3④→02§5.2、01§3.3 伏笔→05§3、 03§4.3→03§5)均真兑现。
  • 书卡:readState=read、readChapters=[全文]、claims/notCovered/summary/soWhat 与拆解 实际覆盖一致(唯 claims 里的篇数与锚数见下)。
  • 台账泄漏:无。index 尾注的 book-verify 提示与样板书一致;§5 表中「数据清洗」是 「书不收什么」的内容范围,非清洗统计。
  • 判断块:10 处全部带「如果错,会错在」;TODO(没懂) 零命中。
  • 完整性:单文件书,六大主题 238 条全部被六章覆盖,sourceChapters 与 chapters.json 一致。

问题清单

  1. [02-large-language-models.md §5.2「族谱」句] 「书架里的极简复刻、第 04 章的冷水, 都是这个门类(强化学习)的变体」——「第 04 章的冷水」是《LoRA Learns Less and Forgets Less》(Biderman 2024),监督微调对比研究,与强化学习无关。论文挂错家族,正是列表书 最高风险的那类错误。 修:删去「、第 04 章的冷水」,或换成同句里已有的 DPO 一线。

  2. [index.md §5/frontmatter essence、02/03/05/06 各章首句、书卡 claims] 主题篇数与实际 不符(逐节实数):大语言模型实际 41(写「约 70」,且称「全列表最大的主题」——实际 最大是参数高效微调 56);上下文学习一节实际 18(03 §3.1 与 §7 写 24);模型编辑实际 25(写「约 30」);检索增强生成实际 51(写「约 60」);Prompt 实际 45(写「约 40」, 勉强)。总数 238≈「约 240」✓;已点名的精确数全对(01=20、decoder-only=21、低秩=28、 知识检索=22、生成增强=14、思维链=6、PEFT 简介=8)。违反「诚实/数字有参照物」—— 这是可回核的数,读者一对就穿。修:全部按实数改写(02 章的「最大的主题」头衔转给 04 章 或删去)。

  3. [index.md §6 判断二、书卡「为什么收它」] 两处均写「共 11 处书架锚」,而 book-verify 实报 15 处(逐行 grep 亦 15:01×2、02×3、03×3、04×2、06×5)。 与门禁输出直接矛盾的元数据。修:改 15;若想按去重源数(12 个源)表述,须写明口径。

  4. [01-language-model-basics.md §3.2] 「但这条线马上撞上两个新问题,列表把修这两个问题 的论文全收了:」连续出现两遍(仅差句首「但」)——编辑残留。修:删一行。

  5. [03-prompt-engineering.md §3.2 首句] 「按第 02 章的流程,『学会新任务』 supposed 要重新训练」——中文句里残留英文。修:改「本应」/「按理」。

  6. [04-parameter-efficient-fine-tuning.md §6.4 走查收口] 「③ LoRA r=8 每层 65,536 个 新数 × 几十层 ≈ 3000 万个新数」——自身乘不出来:65,536×40 层≈260 万,差一个量级; §6.1 的「LoRA 只训几千万个新数」只在「每层多个矩阵都挂补丁」时成立,但图中未写该口径。 违反「走查每步的数要对得上」。修:改写为「每个被改矩阵 65,536 × 每层约 7 个线性层 × 32 层 ≈ 1500 万」,或把「≈3000 万」降为与自乘一致的量级并注明口径。

总评

结构、走查、出处、锚、时效声明、瑕疵披露全部合格;六条问题全是局部可修的事实与文字错 (1、2 是列表书的要害——归属与篇数,必须改;3–6 是元数据对账与编辑残留)。修完重跑 book-verify(门禁现为全绿,修数不会破坏)即可转 PASS。