跳到主要内容

审查 ai-engineering — 2026-08-27

结论: ISSUES(6 条,全部为小修级;四条门禁全绿,5 条抽查出处全部属实,勘正口径成立,三棒接缝一致,不涉及任何红线)

门禁实跑:

book-verify: 1 本有拆解、共 1908 处出处、0 处对不上
book-jargon: 1 本,共 0 处专业词没解释就用了
book-jargon --quota: 段级超额 0 处(上限 1)、节级超额 0 处(上限 5)
book-dodged: 1 本,共 1 个词被躲开(阈值:原书出现 ≥15 次) ← 「期望」,复核见问题 2

复核专项一:dodged「期望」豁免是否成立

判定:豁免实质成立,但写手自查的理由有一处失准,且书卡未按要求记豁免。

  • 全部 28 处逐一定位(08-ch01×5、09-ch02×13、10-ch03×0、11-ch04×3、12-ch05×3、13-ch06×0、15-ch08×2、17-fm×2)。抽 3 处看语义:
    1. 08-ch01.txt:1000「LinkedIn…1 个月就实现了期望体验的 80%」——日常义(期望的=desired);
    2. 09-ch02.txt:1502「它适用于任何期望的格式…并不能保证模型总是输出期望的格式」——日常义;
    3. 09-ch02.txt:1037「训练的目标是找到参数θ,使其在所有训练样本上最小化该期望损失」——概率论义(expected loss,奖励模型目标函数一节)。「28 处均为日常义」不成立,至少此 1 处是术语用法。
  • 概念承接核实:该概念没有被躲。奖励模型训练目标在 03 §4 以「让基础模型朝着『考官打高分』的方向去优化」+「(提示词,胜出,落败)」数据格式承接;训练=最小化损失这层在 10 §4.2 以「损失——模型输出和预期答案之间的差距」承接。术语「期望」在我们体系里确实不承重(原书该处公式经转码已丢失,正文仅一行带过),豁免判定维持。
  • book-dodged 的处置要求是「确实与我们的切分无关的,在书卡里写明为什么跳过」——aiRef/sources/ai-engineering.md 没有记。修法:书卡补一行豁免记录,并把理由改成「27/28 日常义;1 处(09-ch02.txt:1037 期望损失)为概率论义,但该概念已由 03§4(奖励模型优化方向)与 10§4.2(损失/预期答案)承接,术语不承重,故不引入」。

复核专项二:chapters.json 误标勘正

核实成立:17-fm.txt 首行即「第10章 AI工程架构与用户反馈」,实际正文为第 1–10 章(ch08…ch16 + 17-fm)。

  • 阅读笔记 notes/reading-notes.md:3 明确写了「text/17-fm.txt(第10章,chapters.json 误标 fm)」——勘正已讲清;
  • 14 的 sourceChapters/脚注/原文地图全部按「第10章 + text/17-fm.txt」双轨标注,全库仅 14 引 17-fm,无一处引导航章(01–06/18–21),正确;
  • 书卡 readChapters 按勘正后口径填「前言+第1–10章」,与拆解覆盖一致。
  • 按勘正后口径判全章覆盖:第 1–10 章全部有对应拆解章(1→01;2→02+03;3→04+05;4→06;5→07;6→08+09;7→10+11;8→12;9→13;10→14)。完整性过。

复核专项三:09→10 接缝(二棒→三棒)

抽读两章全文比对:引言块格式(「这一章讲三件事…它在全书的位置」)、图说体例、脚注写法、原文地图表、术语(智能体/函数调用/微调/损失)完全一致;09 引言「下一章开始讲第三种适配技术」与 10 引言「内存这笔账是下一章全部设计的出发点」互为咬合。七段结构两章齐全(章引言=第 1 段,顺序无反)。接缝无痕,过。

复核专项四:前棒旧许诺被改指的落点(4 处「这次改的」全核,超出抽 2 行)

改指行许诺原文位置落点核实
03§6→14§2.203:181「这类格式故障在第 14 章的输出防护里还会回来」14§2.2「格式坏了——要 JSON 给出无效 JSON」在输出防护故障清单里,兑现
03§7→05§6+06§703:201「拿最好的那次成绩去报分…第 05、06 两章…正面处理」05§6 坎三「排名不翻译成绝对能力」+ 06§7 公开榜单/考卷泄密,兑现
03§7→10§3.103:211「④ 微调…最彻底,留到第 10 章」10§3.1「让输出符合特定的风格和格式——第 03 章那四种办法里的『微调』,指的就是它」,双向咬合,兑现
07§7→14§2.207:129「双端防护…第 14 章展开」14§2.2「防护分两路:输入拦泄露,输出拦故障」,兑现

总纲兑现表抽 8 行(实核 9 行,全过)

本页§2⑤(内存账→10§4✓/数据主角化→12§2✓)、01§2→13§3.2✓、02§5→13§5.3(KV 54GB 算例)✓、03§6→14§2.2✓、03§7→05§6+06§7✓、04§6→08§3+12§5.3✓、07§7→12§4✓、08§6→09§1(Kitty Vogue 八步)✓、10§7→11§5(模型合并)✓。

三章主走查与数字参照物

  • 11(LoRA):§3.1 显式「主走查:81 个参数怎么变 18 个」,书内原例,对照「不到原来的 1/4」;§4.3 部署账 1.68 亿 vs 2335 万带参照「七个多亿的差距」。落位对;但主走查里有一处数字错误,见问题 1。
  • 13(推理优化):§3.3 显式「本章的主走查」(MBU=1400/2000=70%,当场可复算);推测解码 §5.2 走查四步+1.8/14.1 ms 对照「延迟降一半以上」;KV §5.3 54 GB 算例+3TB 对照。落位对。
  • 12(合成数据):§3.1 显式「(主走查)」六步组装线,每步带真实数目字;§4.4 Alpaca 175→52,000「放大近 300 倍」、Llama 3 六步闸门线 270 万+。落位对。
  • 其余各章主走查均能在 30 秒内指出(01§2 分词、02§5 三数、03§5.2 [1,2] 抽签、04§2 正方形语言 2²=4、05§6 Arena 换算法的账、06§1+SAFE、07 见问题 5、08§2 独热向量、09§1 八步、10§4、14§2.2 掩码—去掩码+§4.2 酒店信号)。

5 条普通脚注回核(全属实)

  1. 09[^5] 13-ch06:958「实习生/生产数据库」——原文句在,拆解为必要短句引用,未整段搬运;
  2. 10[^16] 14-ch07:231「130 万小时/130–260 万美元」——原文在,BloombergGPT 数字全对;
  3. 12[^48] 15-ch08:867「270 万」——原文在(但见问题 6 的命名小疵);
  4. 13[^35] 16-ch09:790「1.8 ms/14.1 ms」——原文在,「延迟降一半以上且不损质量」忠实;
  5. 14[^57] 17-fm:1297「毁掉产品」——原文在,收束句为单句钉引,红线一不破。

其余自检项

完整性✓(勘正口径全覆盖)/ 台阶抽 3 节首句连读(04§1、06§1、10§4.2)基本不跳,唯 10§4.2 有一处数数 slip 见问题 4 / TODO(没懂) 全库零命中 / 判断块均带「如果错,会错在」(book-verify 强制,抽 09§4、总纲§5 人工复核通过)/ 台账泄漏:无(正文出现的「许可」「字符」均为内容本身)/ 红线一:抽查未发现整段搬运 / 总纲第 2 节可独立成篇,机制细节留在章节层,数字各带参照物。

问题清单

  1. [docs/ai-engineering/11-finetuning-peft-lora-merging.md §3.1] 主走查里「GPT-3 有 1.75 亿亿级参数不假」数字错误——GPT-3 是 1750 亿参数(同句下文自己写对:「从 1750 亿砍到 470 万」),「1.75 亿亿」= 10¹⁶ 量级,差了 5 个数量级 — 违反行文第 13 条(数字须可核) — 修:改为「1750 亿」。
  2. [aiRef/sources/ai-engineering.md + 门禁豁免账] dodged「期望」豁免未按 book-dodged 要求写进书卡;且自查理由「28 处均为日常义」失准(见专项一,09-ch02.txt:1037 为概率论义) — 违反豁免记账要求 — 修:书卡补豁免行,理由按本报告改写(豁免本身维持)。
  3. [docs/ai-engineering/13-inference-optimization.md 引言] 中文句混入未翻译英文「这决定了 optimizations 的方向」 — 行文疵 — 修:改「优化方向」。
  4. [docs/ai-engineering/10-finetuning-decision-and-memory.md §4.2] 「训练比推理多两样」,随后列了三样(损失、梯度、优化器),读者会数不上 — 台阶微疵 — 修:改为「训练比推理多存的存储是两样:梯度与优化器状态;要讲它们,先讲损失」。
  5. [docs/ai-engineering/07-prompt-engineering.md] 全书唯一未显式标注「主走查」的章(其余 13 章都自报家门)。§3 的房产例子过 Llama 2 聊天模板拼接、§6 的具体攻击串构成实走查,能指出来,不算不合格,但体例不齐 — 红线二体例一致性 — 修:在 §3 模板拼接处加一句「这是本章的主走查」。
  6. [docs/ai-engineering/12-dataset-engineering.md §4.4] 「Llama 3 的代码数据组装线…270 万+」——原文该处为「Llama 3.1 的监督微调生成…270 万」(15-ch08.txt:867),同族混称 — 准确性小疵 — 修:改「Llama 3.1」或加注「3 系论文」。

一句话总评

三棒接力没有留缝:门禁全绿、出处 1908 处可回核、勘正口径贯彻、改指许诺全部兑现、主走查章章有落点。剩下 6 条全是 30 分钟内可修完的小疵,其中只有问题 1(数量级写错)和问题 2(豁免记账)值得当回事。