跳到主要内容

审查 privacy-and-security-for-large-language — 2026-08-27

结论: ISSUES(3 条)——三条均为小问题(覆盖披露、指针、书卡),承重内容全部核实过硬;逐条修完即可 PASS,无需重写任何章节。

门禁实跑(四条,本地重跑,与中央复核一致):

book-verify: 1 本有拆解、共 634 处出处、0 处对不上 (+1 处书架锚核过,0 处对不上)
book-jargon: 1 本,共 0 处专业词没解释就用了
jargon --quota: 段级超额 0 处(上限 1)、节级超额 0 处(上限 5)
book-dodged: 1 本,共 0 个词被躲开(阈值:原书出现 ≥15 次)

专项核查(任务书点名的六项,全过)

  1. 隐私机制走查实算:三章主走查数字逐一对回原文,全部属实——
    • 04 章 Laplace 走查:14-fm-differential-privacy.txt:85-87 原样(true=1000、sensitivity=1、ε=0.1→噪声尺度 10);privacy loss 0.7/0.6→0.1542 在 15-fm-privacy-loss.txt:36-42;2-匿名四人数据集在 16-fm-k-anonymity.txt:29-39;
    • 05 章成员推断:困惑度阈值 10(21:62,106)、动态阈值 12.3/11.7/13.1/10.8(21:141)、ASR 0.67=4/6(18:37-40)、FPR 0.4(19:37)、重建误差 0.0220(20:42)、Gemma 体检 0.0/1.0000(22:233,252)。注:原书用的读数是 confidence score+FPR,不是 AUC;拆解照书实写,无虚构;
    • 06 章 DP-SGD:ε=1.0、δ=1e-5、C=1.0、σ=1.1(27:20-22,52)与裁剪→加噪→记账流程属实;泄密实验 3 条数据×5 轮(23:81-91,range(5))、SSN 987-65-4321(23:132)、Llama-3.2-1B 对照组只吐感叹号(23:171,245-247)。
  2. 与 ai-security-engineering 差异化:实测那本拆解(docs/ai-security-engineering/,12 章)全文零次出现差分隐私/DP-SGD/联邦学习/同态加密/成员推断/k-匿名,内容是威胁建模、最小权限、验证后信任等攻防设计——index §6 第三判断块「两本互补不互替」成立,非重复。
  3. 作者名更正:书内三处证据确认——前言致谢行 03-fm-preface.txt:95「by Baihan Lin」、前言落款 :157「Baihan Lin, PhD」、About the Author 95-fm-about-the-author.txt:4「Dr. Baihan Lin」;「Baihan Lan」只存在于 epub 元数据(chapters.json bookMeta),书卡更正注记与 index §1 一致。
  4. 玩具做法标注两处在位:08 章 §5 正文+§6+脚注 11(43:46「illustrative only and doesn't provide rigorous DP guarantees」原文核过);14 章 §6 边界「合成数据生成器本身没有形式化保证(第 08 章的坦白在这里依然适用)」;index §2③ 亦有。
  5. 章结构映射:原书 9 个内容章(Ch1/2/3/4/5/6/7/8/9,其中 Ch3、Ch8 无独立 opener 文件)全部有对应拆解章;praise/书名页/colophon/术语表 A–W(74-94)属导航与附录,按规跳过。例外见问题 1。
  6. 脚注抽查 9 条(超出要求的 5 条)全部回核属实
    ^7
    「cannot be replenished」(73:174)、ch07[^1]「not really comparable」(25:77)、ch07[^17] 参与方 <10(44:34)、ch11[^13] Anthropic 40,000/BAD 5,000(59:26)、ch11 对抗训练 adv_steps=3/adv_lr=1e-2(53:38-40)、ch11 多轮红队 num_prompts=200(62:36)、ch12[^6] 探针三对比句(71:302)、ch13[^11] 纽约偏见审计法 2023-07-05/AEDT(72:213)、ch14[^12] 律所「收益大于损失」(73:361)。

其余自检(过)

  • 15 个判断块(14 章×1 + index×3)全部带「如果错,会错在」;
  • 总纲主线节(§2)独立成篇:①起点→②测量→③训练侧→④部署侧→⑤攻击→⑤′防守→⑥伦理法律→⑦落地,机制细节海拔合规(术语均带就地一句解释);
  • 兑现表 24 行抽核 6 行(①⑤⑥⑦及 02§5、03§4 行)均真兑现;例外见问题 2;
  • 红线一:抽查引文均为短句与代码示例,无整段搬运;
  • 红线二:14 章各有主走查(01 三段流水线、04 Laplace/privacy loss、05 Lisinopril 两打法、06 DP-SGD 四步、07 FedAvg 一轮、08 LoRA 0.6475%、09 五道闸、10 GCG、11 PGD 双层循环+多轮红队、12 探针四步、13 供应链八段、14 医疗五步),承重机制均占步、数字为书中原样或当场声明;
  • 台账零泄漏(唯一「许可证」命中是 RAG 泄密案例的正文内容);index 页脚的「重写+回核」说明与样板 what-is-chatgpt-doing 同款,不算台账;
  • frontmatter 齐全;TODO(没懂) 零命中;notes/01-outline.md 在且与正文章序一致;书卡 claims/notCovered/summary/soWhat 与拆解实际覆盖一致。

问题清单

  1. [11-defense-and-red-teaming.md;index.md §4] 原书第 6 章评测部分的四个小节里,「Robustness Under Distribution Shift」(text/65,57 行)与「Agent-Based Evaluation」(text/67,72 行)全拆解零引用、未讲(另两节 64/66 的内容已由 §3 可认证鲁棒、§4 人肉红队、§5 评测读数等效覆盖)——违反完整性自检的诚实口径:整块略过的原书内容未在「覆盖什么/不覆盖什么」记一笔——建议:在 index §4 不覆盖表或 11 §7 边界与局限补一行「原书鲁棒性评测的分布偏移与 agent 评测两小节未逐节展开」;或各补三五句(内容确属外围,补披露即可,不必展开)。
  2. [index.md §7 兑现表] 行「本页 §2 ⑦ |『让不可能的协作发生』的判断 | 14 §6(判断块)」指错节——该判断块在 14 §5「作者的判断与证据」末尾,14 §6 是边界与局限——建议:改为 14 §5。
  3. [aiRef/sources/privacy-and-security-for-large-language.md] readState: readreadChapters: [] 空着——违反 BOOK-TEARDOWN「读完之后如实填书卡 readChapters」(样板卡与 ai-security-engineering 卡均填了章名)——建议:补原书 9 个内容章名(Chapter 1–9,含无 opener 的 Ch3「测量」与 Ch8「社会-技术系统」,以 chapters.json 章名为准)。