Building Reliable AI Systems — 全书拆解
30 秒导读: 这本书回答一个很窄、但每个想把 AI 真正用起来的人都会撞上的问题: 一个在考卷上赢过博士的 AI,为什么一搬到公司自己的活上就掉一大截?
它不讲 AI 内部怎么造出来的,只讲造出来之后怎么让它靠得住: 说得准、做得安全、长期不退化。它最值钱的地方是一把简单的尺子—— 任何一个 AI 系统,都能被摆进「输出 / 动作 / 运营」这三层里,一格一格地查漏。
本组文档是我们重写的完整拆解,二十一章。读完不必看原书。 二十一章已全部落盘。
先约定一个词,后面每一章都要用。 本书从头到尾说的模型——指的是 ChatGPT、Claude 这一类你打字进去、它写字出来的程序。它不是去数据库里查一条记录还给你, 而是自己把回答一个词一个词写出来——这句话看着平常,却是全书一切麻烦的源头。 (它为什么只能这么写,第 02 章讲。)
还有一个动作也先 说清楚。 造这类程序的做法是:喂给它海量人类写下的文字, 反复调它内部那几千亿个数,直到它写出来的东西越来越像那些文字—— 这个反复调数的过程就叫训练(不是「培训员工」那个训练)。 那些被调的数决定了它会写什么、不会写什么。
1. 这是谁在什么时候写的
| 作者 | Rush Shahani —— 一家叫 Persana AI 的公司的 CTO;此前在 Element AI,以及领英负责搜索提问那一块1 |
| 写作时间 | 2026 年,而且是「边写边卖」的未定稿(出版社把没定稿的书先卖给读者,写完一部分更新一次,这一版是第 12 次更新) |
| 预设读者 | 会写 Python、拿程序调用过这些 AI、已经知道什么叫「它会瞎编」的人2 |
| 我们的读者 | 不是这批人。所以这份拆解要补的解释量很大——书里默认你懂的,我们全都从头讲。 |
三件事必须先说,否则会误读这本书。
第一,作者是利益相关方。 他自己在卖「帮企业把 AI 落地」的服务。 书里引的那些商业数字(某某公司靠 AI 省了多少钱、某某产品年收入破了多少 亿) 一个参照物都没给,读的时候要把它们和技术论证分开看。
第二,它是未定稿,交叉引用没校对过。 我们逐处核过,书里至少有三处 「这个我们在第 N 章讲过」指错了章号,还有几处示例代码有实打实的技术错误。 凡是这类地方,我们都在对应的那一章当场点破,并按我们自己的章号重写指路。
第三,它是本库里时代坐标最靠前的一本。 引到 2026 年的事, 所以它讲得到 2024 年那批书里根本没有的东西(比如「同一个 AI 装进不同的外壳, 能力差出一大截」这件事)。代价是这些新说法大多只有一处来源,我们能核的都核了, 核不到的都写明了「书里的说法,我们没核到」。
2. 全书一条主线
这本书是一条从头贯到尾的因果链:每一步都是被上一步的结论逼出来的。 下面把这条链完整走一遍 —— 不看后面任何一章,只读这一节,你也能把这本书讲给别人听。
机制细节全部留给对应的章节,这里只讲「发生了什么、为什么只能这样」。
① 反差:考卷上它已经赢了,生产上它没赢
在一套研究生级的科学考题上,最好的那批 AI 能考到 94 分以上, 而请来的博士专家平均只有 70 分左右3。另一套题更像真活:从真实的软件项目里翻出 真实的缺陷让它改代码——这类源代码人人可看、可下载的项目叫开源项目——它们解决了八成半。
可同一时期,麻省理工的一项调查说:企业里九成半的 AI 试点项目拿不到可测量的回报4 —— 要么测完就废弃,要么根本没上生产,要么低于预期。 (书里用的词叫生成式 AI——指的是它会自己写出新内容,而不是从一个现成的库里挑一条给你。)
考卷赢了、生产输了。落差到底在哪?
② 落差不在能力,在「换个环境还成不成立」
有人把那套软件考题换掉了:同样的题型,但换成这些 AI 从没见过的代码库。 同一批高分选手,从八成半掉到六成上下5。
题没变难,只是不熟了。作者给这段落差起了名字:可靠性落差。 全书的中心论断就一句话:在考卷上强,和在真实世界里靠得住,是两回事6。
那「靠得住」到底要什么?
③ 传统软件那套指标,漏掉了一整维
作者给的定义只有一句:产出准确的输出 + 采取安全的动作 + 在真实条件下长期保持质量7。
要命的是第一项。传统软件看的是在不在线、报不报错、快不快——这些全都测不出「它答错了」。
你的系统可以 99.99% 在线,同时自信地给出错答案。8
这一维叫语义正确性:内容对不对。它在任何一块运维面板上都没有格子。 这就是全书要填的那道缝。
这一维最典型的失效长什么样?
④ 幻觉:一种不会宣告自己存在的错
一位律师让 AI 帮他找判例,拿回六条,案名合规、卷宗号和年份格式完美、法律说理读着也通。 他写进诉状交给联邦法院。然后法官的书记员打来电话:这六个案子一个都不存在9。
这就是幻觉:模型编出事实上错误的内容,却用和它说对时一模一样的自信语气说出来。
它不是 bug,是机制的产物。 关键的一条: 在它开口之前,整条链上没有任何一步去对照真相检查10。 它学的是「权威内容长什么样」,写的是「像样的下一个词」——从来没有「这句是真的吗」这一步。
所以调低它的随机度治不了幻觉(为什么,第 02、03 章讲)。既然治不了,只能围堵。 围堵分三层,这三层就是这本书的目录本身。
⑤ 【第一层 让它说得准】把回答钉在真东西上
把话说清楚(最快、最便宜)
└─ 可它不知道你家的退货政策 ── 训练时没读过,再怎么说也说不出来
└─ 那就先去把政策文档取回来,再让它照着答
└─ 可「取」这一步自己会失败:答案在库里,就是取不到
└─ 那就得懂「取」是怎么回事:文字变成数、按远近找、找完再排一遍
└─ 可有些东西不是「知识」是「行为」
(格式、语气、这一行的判断力)—— 那才轮到改模型自己
图说:每一层都是被上一层的失败逼出来的,不是谁设计了一个体系。
这条链上有三级各带一个名字,你出门到处都会撞见,先挂在这里。
第一级是你打给它的那段话——包括你交代的规矩、你给的材料、你要的格式——这段话就叫提示词。
第二级是「先按你的问题去一堆资料里找出相关的那几段,再让它照着答」, 其中「去找出来」这个动作叫检索。
第三级是「真的去改它内部那些数」,这个动作叫微调。
这里有一条实用判据,值得先记住:微调是最后一步,不是第一步。 作者的起手式是一条阶梯——先把话说清楚,不够就去取资料,要这一行的专长才考虑微调, 要它动手才小心地放权;而「怎么知道它做得对」这件事从第一天就要有11。
说的话可信了,能不能让它动手?
⑥ 【第二层 让它做得安全】赌注换了一个量级
答错很尴尬,做错可能是灾难。 书里给的两个坏结局很具体: 把你订到得州那个也叫巴黎的小城,而不是法国巴黎; 「顺手清理」客户数据库,几秒钟毁掉几年的工作。
而且有一笔账必须先算清:
每一步 85% 可靠的流程,走 10 步,整件事办成的比例只剩约 20%。12 (0.85 自乘十次约等于 0.197。这个数解释了后面九章为什么要花那么大力气。) 「从头到尾整件事办成」这个口径有个名字叫端到端——和「每一步分别对不对」相对。
一件事只要拆成十步交给它自己做,「每步都挺准」根本不够。 于是这一层的全部内容,都是在给 这条乘法上保险:让它记得住上一轮说了什么、 让它能真的去调外部系统、让每一步的失败不要传染给下一步、 让要对接的外部系统多起来的时候不要变成一团谁也改不动的线。
业界管这种「不光会说、还能自己动手办事」的 AI 叫 agent,中文也叫智能体。 这本书的第二层讲的全是它——注意它不是一种更聪明的模型, 而是在同一个模型外面加了几样东西之后的结果(加了哪几样,第 12 章讲)。
它会做事了,怎么知道它一直做得对?
⑦ 【第三层 让它长期不退化】三个被逼出来的发现
第一件事是能不能量——不量就只能凭感觉改。
而一量出来,第一件被颠覆的事是钱和时间到底花在哪: 一次问答里,模型自己吐字这一步吃掉了九成的时间、九成七的费用, 其余所有环节加起来不到一成13。
所以省钱的动作是让它少说话,不是换更快的机器。 这条结论把「该先动哪儿」的次序整个掉了个头。
可这些数字不是量一次就完了。 供应商会悄悄把模型换掉; 用户提问的方式会慢慢变;同一套系统的表现会自己往下走。 于是 必须长期盯着,而不是上线前测一次。
而盯着盯着会撞见一类失效,任何指标都不显示:系统对不同的人不一样好。 它不宕机、不报错、总体准确率也不掉——但它对某一群人系统性地更差。 书里那个最重的案例:一家大公司开发了四年的简历筛选系统, 学会了给写着「女子象棋社社长」的简历扣分,而代码里没有一行写着歧视女性。
这就逼出最后一层。 书的立场很硬:会歧视、会漏数据的系统就是不可靠的,不管准确率多少。
⑧ 闭环:第三层反过来喂回第一层
这三层不是往上叠的三块砖,是一个圈:
①说得准 ──→ ②做得安全 ──→ ③长期不退化
▲ │
└─────────────────────────────┘
量出来的弱点回去改说法 · 盯出来的失败暴露「取」 这一步的漏洞
· 群体差异暴露训练材料本身的缺口
图说:书里原话是「量出来的结果找出弱的说法、盯出来的异常抓到取资料时的失败、
群体差异揭出训练材料的缺口」。这是全书主线的最终形态。
全书收在六条原则上:把输出锚在已核实的信息上 / 把动作约束在安全范围里 / 持续盯着 / 公平对待所有用户 / 保护隐私 / 从第一天就建起「怎么判断它做得对」14。
这本书真正的落点是这个闭环和这六条,不是任何一章的技术。 第 1 章立的三层框架不是事后分类——它就是这本书的目录本身:立完框架,后面十章一章一格地填。
3. 章节地图
这张表不用记任何术语 —— 每一章的名字后面,写的是「读完你能回答什么问题」。
这本书原有 11 章,我们拆成 21 章。 拆的依据是生面孔的密度:原书有八章各自要立起 十五到二十五个「学过这行才懂」的词,一章塞不下,读者必崩。哪几处怎么挪的,见第 5 节。
第一层:让它说得准(01–11)
| 章 | 读完你就能回答 |
|---|---|
| 01 可靠性落差 | 它考试考得比博士好,为什么公司用起来不行?「可靠」到底指什么? |
| 02 幻觉 | 它为什么会一本正经地编?为什么把随机度调到 0 也不管用? |
| 03 挑词的旋钮与选模型 | 同一句话问两遍为什么答案不一样?文档里那几个可调的设定各管什么? |
| 04 提示词的五级阶梯 | 它算错一道小学题,为什么让它「把草稿写出来」就对了? |
| 05 把回答钉在文档上 | 它不知道你家的政策,怎么让它照着文档答?这套做法自己要付什么代价? |
| 06 把意思变成坐标 | 两句话一个共同的词都没有,机器凭什么知道它们说的是同一件事?这一章是后面三章的枢纽,别跳 |
| 07 检索为什么还会失败 | 答案明明在库里却取不到,是怎么回事?为什么「多取一点」反而更差? |
| 08 规模化与漂移 | 几百万份资料怎么还能毫秒级找到?三个月后它为什么开始找不着东西了? |
| 09 检索取对了吗 | 怎么判断这一套到底对不对?为什么「看回答里有没有原文没有的词」这招会两头错? |
| 10 什么时候该微调 | 什么时候该真的去改模型?改了之后为什么反而答不出「这句依据哪份文件」? |
| 11 微调怎么做 | 「训练」这一步到底谁在改什么?为什么只调两千分之一的那些数就够? |
第二层:让它做得安全(12–16)
| 章 | 读完你就能回答 |
|---|---|
| 12 从「会说」到「会做」 |