跳到主要内容

AI Security Engineering — 全书拆解

30 秒导读: 这本书回答一个问题:当 AI 系统从「生成文本」变成「动手做事」, 安全工程要怎么重做? 作者的答案很反潮流——大部分不用重做: 四十年攒下的安全原则(不可信输入、最小权限、纵深防御……)全部照用, 缺的从来不是新知识,是把老纪律装到新系统上的纪律。 全书真正的新东西只有一小块:AI 系统的四个特性改变了每条老原则的「拧紧程度」。

手上是 Early Release(抢先版),只含第一章十五节;本拆解按概念切成十二章。 读完不必看原书。

1. 先交代清楚:这是谁在什么时候写的

作者Dan Borges——前 Scale AI 安全工程负责人,先后干过 Mandiant、CrowdStrike、Uber,另著过两本攻防安全书1;David Campbell——Scale AI 负责人级 AI 安全主管,搭过大型 AI 红队平台,给美国国会、白宫、北约通报过 AI 风险2
写作时间2026 年夏(书内自述);O'Reilly Early Release,正式版预告 2027 年 10 月
现有内容第一章「The AI and Security Problem Spaces」+ 十五节 + 章末小结
利益相关两位作者都在 AI 公司做安全,且各人另有著作;书里推荐的部分工具(如自写书籍、朋友的方法论)有熟人成分——引他们的判断时记得这是从业者的经验之谈,不是独立评测

读这版要带着的两个预期:

  1. 它是骨架书:第一章的定位就是给全书立概念地基,机制细节在「后面会讲」的部分—— 那些部分目前不存在。我们只拆磁盘上有的内容;
  2. 它是经验书:大量论断以「in my experience(凭我经验)」的口吻出现, 很少配数据。价值在一线判断的方向,不在论证的严密。

2. 全书一条主线(读完这一节,你就懂了这本书)

这是一条从头贯到尾的主线,一环扣一环:每一步都是被上一步逼出来的。 细节全部留给章节层,这里只讲「发生了什么、为什么只能这样」。

① 地基变了:AI 系统的答案不再唯一

传统安全工程的地基是一条假设:系统的行为是确定的——同样的输入,同样的动作。

AI 系统把这条地基抽了:概率(意思是:同样的问题问两遍,答案可能不一样)成了日常,不再是角落情况。

它还不再只输出文本:查内部数据、调 API(应用程序接口——程序访问外部服务的标准门口)、动生产系统,拿的权限常常比多数真人还大。为「确定而乖巧的执行者」设计的全部旧安全假设,在这具执行者身上都要重新过一遍。

② 但地图不用重画:新面孔接回旧类别

作者的第一步不是发明新学科,而是拿出一张旧地图:利用成功的后果几十年没变—— 数据被偷、服务被打挂、权限被拿走。技术只改变「怎么修」,不改变「坏了是什么样」。

于是 prompt 注入接回 SQL(数据库用的查询语言,三十年前的头号攻击)注入。

agent(会自己动手做一连串事情的 AI 助手)权限过大,接回的旧类别是越权访问。

映射(把新问题指认成一个已知类别)成功,四十年的成熟解法直接继承。 (为什么这张映射表成立、怎么用,第 01 章讲。)

③ 把老纪律一条条拧紧

书的主干就是一场「老原则复检」,每条原则对着 AI 执行者拧一下:

  • 入口:门外的一切都是不可信输入——现在门外站着的还有 agent; 门内的一切动作都要已验证的身份加显式授权;信任边界要画出来,控制要 收敛(集中到一处统一执行)——答案是收进中间件(第 02 章)。

  • 寿命:安全控制会静默失效——不报错、不丢日志(系统自己写下的运行流水账), 只是悄悄挡不住东西了。对策是纵深防御:独立控制互相重叠,任何单层都不许被 单独依赖(第 03 章)。

  • 权限总量:每个部件只拿最小权限。对概率性执行者这条要更紧—— 传统系统权限给多,出事还需要有人犯错;agent 权限给多,模型 (驱动 agent 的那套 AI 引擎,本书说的模型都指它)自己走偏就够了 (第 04 章)。行业已经付过学费:agent 删光过用户邮箱,打挂过生产环境。

  • 失效:挡不住是常态。所以三件事必备——观察不到的行为防不了(遥测与集中日志); 失败要有方向(败时只许缩能力,不许涨权限);规划本身就是正式控制手段—— 漏洞最便宜的消灭地点是设计文档(第 05 章)。

④ AI 特性逼出的四个新工程面

老纪律拧完,剩下的部分才是 AI 真正新的地方,共四件:

  • 非确定性:同一输入两次输出不同,而且是故意设计的——引入随机的机关 有好几处,拧到底也关不干净。工程结论因此翻转:别修模型,在模型周围造确定性—— 控制装在精炼与执行模型输出的程序层(第 06 章)。

  • prompt 的身份(prompt,就是提示词——喂给模型的指令文字,本书两个词混用):prompt 之于模型等于源码之于程序——要版本化、要归档、 出事靠它回溯;但同一份 prompt 不是安全边界:文本没有执行力, 「文本撑不住压力」(第 07 章)。

  • 记忆:模型天生没有它(关掉对话就什么都不记得;这里的记忆, 说的是系统跨对话保存信息的能力)。

    它唯一的替代品是上下文窗口(下一次生成时它能读到的全部文字)。 大而乱比小而整更糟;对策是给这段文字做结构、勤做摘要(第 08 章)。

  • 执行者的闸门:AI 写的代码是未审代码,人审过的才叫 AI 辅助代码; 测试要先写、且放在模型够不着的带外,防它自己糊弄自己的验证; agent 动手做事,高风险动作必须停下来等人——人审不是常数瓶颈,是分级 触发的治理层(第 09 章)。

⑤ 装配与自查:边界怎么定,风险怎么排

  • 工具边界:行业最大的失败不是新攻击面,是「demo 惊艳就全权放手」。 对的路是分离职责(单职责→单身份→最小权限)、先锁死再逐个开权限;有论文拿 22 个模型、115 个任务证明:结构化与工具受限不仅更安全,还更准—— 小模型受益最大(第 10 章)。
  • 提前找死法:红队自己。从八连问头脑风暴起步,拿「风险 = 影响 × 可能性」 排序,升级路径是 STRIDE 分类与桌面推演——一切为了把问题暴露在写代码之前 (第 11 章)。
  • 快捷判定卡:一个 agent 同时满足三条——摸得到私密数据、吃得进不可信内容、 送得出去——就是「事故配方」。三条不必全堵死,断掉任意一条配方即失效(第 12 章)。

⑥ 落点:难的不是知识,是纪律

原书小结的最后一句话,也是全书的底:AI 安全难的不是识别新攻击类, 是把已知纪律应用到「感觉新到可以跳过基础功」的系统上。 「新」是跳过基础功最常用的借口——这本书整本都在拆这个借口。

3. 十二章地图

这张表不用记任何术语——每章名字后面写的是「读完你能回答什么问题」。

  • 01 老问题的地图 — 这本书的基本立场是什么?「映射」这个工作方法怎么用?

  • 02 两扇门 — prompt 注入到底「新」在哪?权限为什么四十年修不好?

  • 03 控制会死 — 防火墙规则一直没删,为什么防线没了?「攻击者只需对一次」的下半句是什么?

  • 04 最小权限 — 给 agent 的权限怎么划「刚好够用」?slopsquatting 新在哪?

  • 05 挡不住时 — agent 深夜死循环烧钱,谁先知道、怎么停下、事后靠什么复盘?

  • 06 非确定性 — 为什么温度(模型里管随机度的那个旋钮)拧到 0 也确定不了?

  • 07 提示词当代码 — 喂给模型的指令文字(行话叫提示词)为什么要当源码保存?又为什么不能当权限用?

  • 08 结构胜于大小 — 长会话(一聊几个钟头的长对话)为什么越跑越偏?一个 markdown 文件怎么当五个人用?

  • 09 先验证再信任 — AI 写的代码审什么?怎么防它自己糊弄自己的测试?什么时候必须等人点头?

  • 10 别把钥匙全交出去 — agent 接几个工具、各带多少权限怎么定?为什么结构化反而更准?

  • 11 在攻击者之前 — 没出过事之前,怎么系统地找出一套 AI 系统会怎么坏?

  • 12 致命三件套 — 三问判高危的卡怎么用?为什么说这本书的底是「纪律」二字?

推荐顺序: 01 → 02 → … → 12,原书就是这么讲的。 时间紧的话:第 2 节主线 + 第 06、09、12 三章——「模型周围造确定性、 先验证再信任、三件套判定卡」是全书最有独立价值的三件东西。

4. 这本书覆盖什么、不覆盖什么

覆盖(Early Release 版的第一章十五节,全覆盖且每条原则给足推导):

  • 传统安全的八条原则(不可信输入/访问控制/控制衰减/纵深防御/最小权限/监控/ 失败安全/规划),每条都有「现象 → 原则 → AI 时代的拧法」三段;
  • AI 特性的四个工程面:非确定性、prompt 管理、上下文窗口与记忆、验证与 人在环(关键动作前停下来给人过目);
  • agent 系统的装配纪律:职责分离、权限起步法、ALARA 结构(带评测数据);
  • 方法与快捷方式:威胁建模八连问、风险排序、STRIDE、致命三件套;
  • 大量一线视角的判断:哪些坑最常见、事故都长什么样。

不覆盖(这版书里没有,别在这里找):

缺什么说明
攻击面的操作细节全书几乎不写攻击手法怎么做(符合其防御定位);想看攻击机制要换书
第一章之后的章节多处「后面会讲」(代理网关、HITL 细节设计等)属正式版内容,目前不存在
OWASP Agentic Top 10 的内容提了一句「没列入访问控制」,榜单本身零展开
具体产品的评测Claude Code、skill-scanner、razin、Manus 都只有点名与轶事,无横评
案例的完整档案Claudius 售货机、删邮件事故只有几行,无时间线与复盘
数字口径「衰减多快」「人审的把关线画在哪」「打分怎么校准」——原书都没给数

5. 我们的判断

判断(我们的,不是书里的): 这本 Early Release 的价值排序是—— ① 防御思维框架(老原则的 AI 时代拧法,几乎不会过时) > ② 工具与方法清单(八连问、三件套、起步姿势,拿来能用) > ③ 行业轶事与点名(时效性强,会随产品演进失效)。 引用它时引①②,③当故事读。 如果错,会错在: 如果正式版后续章节把重心压在具体工具与产品评测上, ①的占比会缩水,这个排序就要按正式版重估。

判断(我们的,不是书里的): 「新问题接回旧类别」这张地图在系统层几乎 全适用,但在模型层覆盖最薄:越狱(骗模型无视自己的安全规则)、目标劫持、 多步操纵这类「模型内在行为」的问题,在传统安全里没有等价物, 书里也承认「这个领域确实有真正的新问题」。 拿这张地图做入门票,别拿它当全图。 如果错,会错在: 如果模型行为问题最终也被证明是某种旧类别的变体 (比如把越狱归入「不可信输入」的极端形态),这个边界就画错了—— 但即便如此,现有老解法对模型层问题的命中率确实低,实践上边界依然成立。

判断(我们的,不是书里的): 书里的「原则」是从业者经验的原则化, 不是 Rick Howard 标准下「不派生于其他东西」的第一性原理——比如「监控」原则 就派生自纵深防御。当清单用很值钱,当公理体系用会失望。 如果错,会错在: 如果作者在正式版里重新组织了原则体系、给出推导链, 这个评价要收回。

6. 许诺兑现表

这份拆解里每一处「第 N 章讲」「见第 N 章」,都在这里记一行、逐行核过。

许诺在哪许诺了什么应兑现在哪核过了吗
本页 §2 ②映射表为什么成立、怎么用01 §3、§4(走查)
本页 §2 ③ 入口两扇门与信任边界、中间件02 §3
本页 §2 ③ 寿命衰减案例与纵深防御03 §3.1–3.3
本页 §2 ③ 权限学费案例与「更紧」的理由04 §3.2、§3.3
本页 §2 ③ 失效监控/失败方向/规划三件事05 §3.1–3.3
本页 §2 ④ 非确定性为什么 0 度也不确定、控制的安装位置06 §3.1–3.4
本页 §2 ④ prompt 身份存档方法与「不是边界」07 §3.1–3.5
本页 §2 ④ 记忆形态中段塌陷、plan.md、摘要08 §3.1–3.3
本页 §2 ④ 执行者闸门生成/辅助之分、带外测试、分级自治09 §3.1、§3.4、§3.5
本页 §2 ⑤ 工具边界分离职责、锁死起步、ALARA 数据10 §3.1–3.3
本页 §2 ⑤ 提前找死法八连问、风险公式、STRIDE、推演11 §3.2–3.4
本页 §2 ⑤ 判定卡三条判定与断链策略12 §3.1–3.4
本页 §2 ⑥「纪律」底线12 §6 第 7、8 条(引原书小结原话)
01 §2 映射表右列内容从第 02 章起展开0212 各章
01 §4 走查prompt 注入与 SQL 注入的同构在原书小结有原话12 原文地图第 5 行(19:21)
02 §6 边界「控制加在系统层」的立场第 06 章展开06 §3.4
03 §4set-and-forget 的复审在监控章兑现05 §3.1(定期分析)、§6 第 8 条
04 §3.5 走查外发通道是外泄口,第 12 章收账12 §3.3、§3.5
04 §5 边界「任务所需」由威胁模型定,第 11 章的方法11 §3.2、§5
05 §3.3ALARA 测试结果后文展开10 §3.3
06 §3.4「prompt 不是边界」下一章推到极致07 §3.5
06 §5 边界第二个模型审计留到人在环09 §3.5(AlignmentCheck 补充)
07 §3.3 走查「回溯缺陷源头」是第 16 节的要求09 §3.2
08 §2 图说注意力(模型读文字时给各处分配的关注度)与信息位置(中段塌陷)08 §3.1
10 §3.2权限累积配定期复审,接衰减教训03 §3.3、05 §6 第 8 条
11 §3.5 走查「服务账号病」同款在 02 章走查02 §4
12 §3.2天真一问对应补访问控制02 §3.3、§3.5
12 §5 边界误操作类风险不需要③,散见前文09 §3.5(rm -rf 案例)、05 §3.4
01 §3.2非确定性(两次输出不同)专章讲06 §3.1–3.2
01 §4 走查末输入净化/数据与指令分离的查询写法/输出过滤,逐个讲02 §3.2
02 §3.3零信任第 09 章细讲09 §1
04 §3.2 链图模型输出是概率性的,第 06 章展开06 §3.1

拆解写于 2026-08-27,依据 2027 版 O'Reilly Early Release(2026 年夏文本)。 原始书籍文件不入库,本组文档是我们自己的重写; 每条引用都可用 node scripts/book-verify.mjs ai-security-engineering 回核。

Footnotes

  1. 出处:「About the Authors」第 4 段(text/20-fm-about-the-authors.txt:4,搜「Scale AI」)。Dan Borges:前 Scale AI 安全工程负责人;Mandiant、CrowdStrike、Uber 履历;另著《Adversarial Cybersecurity》;书中还提到他的《Adversarial Tradecraft in Cybersecurity》(「Defense in Depth」第 15 段,text/08-fm-defense-in-depth.txt:15,搜「Adversarial Tradecraft」)。

  2. 出处:「About the Authors」第 6 段(text/20-fm-about-the-authors.txt:6,搜「Head of AI Security」)。David Campbell:Scale AI 负责人级 AI 安全主管;搭建大规模 AI 红队平台 Discovery;向美国国会、白宫、英国议会、北约等通报 AI 风险;OWASP AIVSS 创始成员。