安全:RAG 既是盾也是靶
这一章讲两件事: RAG 为什么本身就是一种安全手段;以及它带来了哪些纯 LLM 时代没有的新攻击面。 主体是一场完整的攻防演习:红队用一个提示词套出系统提示词和库内数据,蓝队用第二个 LLM 挡住它。
1. 先说盾:RAG 作为安全方案
RAG 应用虽然是新东西,但权限这一层可以直接沿用 Web 应用的老办法:按用户或用户组控制能检索到哪些数据, 再加上传输与存储加密——敏感信息只对被授权的人可见1。除此之外还有两条 RAG 特有的安全红利:
- 回答更可靠。 生成时刻接的是你精挑细选的数据源,在医疗、金融、法律这些「错不起」的领域尤其重要2;
- 可溯源。 答案能带上引用,用户可以核实、追溯到原始文档;出了争议,审计有据可查—— 这也是合规的要求3。
2. 再说靶:三类新风险
2.1 黑盒
主流 LLM 参数量(模型内部可调数值的个数)超过一万亿,我们无法解释它内部怎么从输入得出输出4。 黑盒本身不直接造成安全事故,但它让排错变得困难——不知道为什么错,就难防它再错, 这抬高了整个系统的安全风险。学术界在研究可解释 AI(explainable AI,让 AI 的运作透明可理解), 但作者如实说:目前主流 LLM 没有一个是可解释的模型,当下能做的是替代手段—— 在关键环节加人工审核(human-in-the-loop),或者加一个额外的 LLM 给回答做检查5。
2.2 隐私
监管在成形中,Google、Microsoft 这些厂商也在自定保护标准6。 而 RAG 的核心矛盾在这里最尖锐:为了发挥价值,你给了 AI 对公司数据(常常包括客户数据)前所未有的访问, 而载体是一台你不完全理解的机器。 作者的原话是:实现不当的话,这可能是灾难的配方7。 他也公允地补了一句:数据存在哪儿都有风险——但不承担这个风险,也就拿不到这些数据的价值。
2.3 幻觉
幻觉是 LLM 时代独有的新型风险:生成「不存在的数据」。书里列了四个真实案例,一个比一个贵8:
| 案例 | 发生了什么 |
|---|---|
| 金门大桥 | 《经济学人》作家问「金门大桥第二次被运过埃及是什么时候」,ChatGPT 认真答了「2016 年 10 月」 |
| Air Canada(2024-02) | 聊天机器人告诉顾客丧亲票价可以事后 90 天内补申请(与真实政策相反);仲裁庭判航空公司退款,并驳回「网页上的聊天机器人不归我们负责」的抗辩 |
| Mata v. Avianca(2023) | 纽约律师用 ChatGPT 做法律检索,状子里 6 个判例全是编的,被法院制裁 |
| Deloitte(2025-10) | 交给澳大利亚政府的一份约 29 万美元、237 页的报告里,被发现多达 20 处编造的学术引用与虚构的判决引言,公司被迫部分退款 |
幻觉为什么会发生:一段值得整段转述的解释
书里对幻觉机制的解释,是全书少数正面回答「为什么」的地方9: LLM 生成每个 token 时按概率(即某件事发生可能性的大小)挑下一个。
挑的依据是分布——即各选项各自的概率。对知识扎实的主题,下一个词的置信度可以到 99% 以上; 对知识薄弱的主题,最高置信度可能只有 20% 甚至更低——但它仍然是最高分,所以照样被选中。 模型被训练成把 token 串成自然的语言,于是一串低置信度的 token 照样连成「读起来可信」的句子。 听起来可信,和事实上可靠,在生成机制里是两回事。
OpenAI 自己的研究补了更扎心的一刀:幻觉挥之不去,部分原因是现行评测方式奖励猜答案、 惩罚承认不知道——像学生在选择题上宁可瞎猜也不留白10。