跳到主要内容

可靠性落差 — 考卷赢了,生产输了

这一章讲三件事: 为什么一个考试成绩极好的 AI,搬到真活上会掉一大截; 「可靠」这个词在这本书里到底指什么(它比你以为的多一整维); 以及作者用来组织后面二十章的那把尺子——三层框架。

它在全书链条里的位置: 它是起点,也是目录本身。 后面每一章都是在往这三层里填一格。不需要任何基础,遇到的生词都在当场解释。

1. 顶层全景:这一章要走的那条路

考卷上的分数(94 分,超过博士)
│ 换个没见过的环境

同一批模型掉到 58–65% ←── 这段落差有名字:可靠性落差
│ 那「靠得住」到底要什么?

可靠 = 说得准 + 做得安全 + 长期不退化
│ 传统运维只能测「在不在线」,测不出「对不对」

多出来的那一维:语义正确性 ←── 它在任何面板上都没有格子
│ 那就按这一维把工程活分成三层

①说得准 → ②做得安全 → ③长期不退化 (顺序不能反)

图说:每一层都是被上一层的结论逼出来的,不是谁事先设计了一个体系。

这一章的主走查是一位律师。 他是原书开篇那个真实场景里的人, 下面每一节都会回到他身上:第 2 节看他凭什么敢用,第 3 节看他不知道什么, 第 4 节看事发之后运维面板上显示了什么,第 7 节看这件事该归三层里的哪一层。

2. 先看现象:两个数字在打架

这一节要回答的是:凭什么说「已经很行了」和「还不能用」可以同时为真。

第一个数字来自考卷。在一套研究生级的科学问答题上,最好的那批 AI 已经能考到 94 分以上;而作为对照,请来的博士专家平均只有 70 分左右1。 在真实的开源软件缺陷上,它们能解决超过八成半

第二个数字来自企业。麻省理工的一项调查说:九成半的生成式 AI 试点项目拿不到可测量的回报2 ——要么测完就废弃,要么根本没上生产,要么远低于预期。

这两个数字都不假,而且它们说的不是同一件事。 要看清这一点,得先弄明白第一个数字是怎么来的。

「基准」到底是什么:怎么给一个会说话的东西打分

先看一个具体的麻烦。 一台机器的算术能力好衡量:给它一万道题,数对了几道。 可「它答得好不好」这种事,答案是一段话,没有唯一正确写法,你拿什么去数?

这一行的解法很朴素:把开放问题改造成考卷。 出一批题,每题准备好标准答案,并且规定好怎么算对;然后让每个模型都做同一批题,报一个分数。 这样一套「固定的题目 + 固定的判分方法」,就叫一个基准测试(常简称基准)。

上面那两套题就是这么来的:

这套考卷题目长什么样怎么判对错
研究生级科学问答生物、物理、化学的博士级选择题,专门挑「上网搜也搜不到答案」的选择题,对就是对
真实软件缺陷从开源项目里翻出真实的问题报告,让模型改代码跑一遍项目自带的测试,通过才算解决

注意第二行:它已经很像真活了——真实的项目、真实的缺陷、自动化的判分。 这也是为什么「解决八成半」这个数字当时那么有说服力。

但基准有一个内建的性质,决定了它能测什么、不能测什么:题目是固定的、公开的、有限的。 「有限」是它可复现的前提,也是它的天花板:

它测的是「在这批题上行不行」,不是「在你还没出的题上行不行」。

回到那位律师:走查第 ① 步

这就是他看到的东西。 一位准备重要案件的律师,读到的正是上面那类数字: 研究生级考题 94 分、真实软件缺陷八成半。他据此下了一个判断:这东西比大多数助理靠谱。

这个判断在当时看毫无问题。它错在哪儿,下一节才看得见。

3. 落差不在能力,在「换个环境还成不成立」

这一节给出全书的中心论断,而且它是被一个实验逼出来的。

有人把那套软件考卷换了:同样的题型、同样的判分方式, 但代码库换成这些模型从没见过的。同一批高分选手,从八成半掉到六成上下(58–65%)3

题没变难,只是不熟了。作者给这段落差起了名字:可靠性落差。 中心论断只有一句:

在基准上强,和在真实世界里靠得住,是两回事。4

这条论断的分量在于它排除了一个最省事的解释。 如果落差来自「能力还不够」,那答案就是等下一代模型——什么都不用做。 可换个代码库就掉二三十个点,说明缺的不是能力,是换个环境还成不成立而这件事没有任何一代模型会替你解决,它是工程活。

回到那位律师:走查第 ② 步

他不知道的正是这件事。 他看到的分数,是在一批公开题目上量出来的; 而他手上的案子,对模型来说就是一个「没见过的代码库」—— 一个具体的争点、一批具体的判例、一个具体的法域。

一句话:他把「在那批题上考得好」当成了「在我这件事上靠得住」。 这本书从头到尾都在填这两句话之间的距离。

4. 面板全绿,答案是错的

这一节是全章的转折点,也是全书最好的一句话所在。

先看现象:六条判例

那位律师让 AI 研究助手找判例,拿回六条。它们看上去无可挑剔: 案件命名符合法律惯例;引注里的卷宗号、页码、年份格式全对;法律说理读着也通。

他写进诉状,提交联邦法院。然后法官的书记员打来电话:这六个案子一个都不存在5

这不是「答得含糊」或者「答偏了」,是凭空造出六个完整、前后不矛盾、格式完美的假东西。 这类错误在这本书里有个专名,总纲里已经点过:幻觉它为什么会发生、为什么修不掉,是第 02 章一整章的内容;这一章只需要它的一个性质——

传统软件的 bug 产出的是明显错的东西:报错、崩溃、乱码。 幻觉产出的是看起来对的错答案。6

走查第 ③④ 步:同一时刻,运维面板上是什么

假设这套系统的运维面板长这样(下面这三个数是为演示编的,不是书里的数):

可用率 99.99% ✅
平均响应 800 毫秒 ✅
接口错误数 0 ✅
──────────────────────────
编造的判例 ??? ← 没有这一行

图说:三项全绿,而六条假判例已经进了联邦法院的卷宗。
面板上不是「这一格是红的」,是**根本没有这一格**。

问题不是指标读数不好看,是这类失效在指标体系里没有位置。 可用率不会因为答案是编的而下降;响应时间不会因为案子不存在而变长; 而这套系统对外的调用入口(行话叫接口)也没有报错——因为从技术上讲,这次请求完美地成功了

那一整维叫什么:语义正确性

先说清楚这一维和别的维有什么不同,再给它名字。

传统软件的可靠性问的是「它有没有正常运转」:在不在线、报不报错、快不快。 这三样都是关于系统本身状态的问题,系统自己就知道答案。

而这里要问的是「它说的内容对不对」。这个问题的答案不在系统里—— 要回答它,必须拿这段话去和外面的世界比对:那六个案子在判例库里查得到吗?

这一维,作者管它叫语义正确性(内容层面的正确)。原书的一句话值得原样记住:

你的系统可以有 99.99% 的可用率,同时自信地生成错答案。7

这就是这本书要填的那道缝。 后面二十章,不论讲的是取资料、改模型内部那些数、 放权给它动手、还是上线之后的监控,都是在给这一维造出一个能测的格子来

5. 「可靠」不是一个开关,是八条属性,而且互相打架

这一节回答:既然要造格子,那到底该造几个。

作者给「可靠」下的正式定义只有一句:产出准确的输出 + 采取安全的动作 + 在真实世界条件下长期保持质量8。展开是八条:

#属性说人话
1准确不编、不造
2一致相似的问题,给出相似分量的回答
3优雅地失败帮不上忙的时候就说帮不上,而不是猜一个
4有据每句话都能追到一个可核实的来源
5公平不因为对方是谁而给出不同质量的服务
6高效在规模上顶得住时间和费用的要求
7有边界地行动放权给它之后,它只在划定的范围里动手
8不退化模型更新了、数据变了,质量不掉

这张表最要紧的不是有八条,是作者紧接着说的那句话:这八条之间有真实的取舍。9 他点名了三组:

  • 准确 vs 快。 让它多想一步、多查一次,答得更准,也更慢;
  • 安全 vs 花钱。 每条回答都再过一道核查,更安全,费用翻倍;
  • 想得深 vs 出得快。 让它把中间步骤都走一遍,质量高,响应慢。

所以「可靠」不能当成一个开关去追求。 作者的原话是:生产上的可靠,意味着有意识地在这些取舍之间做选择, 而不是假装可以同时把每一项都拉满。

这句话决定了后面二十章的读法:每一项技术都是在某几条属性上加分、在另几条上扣分。 读的时候要问的不是「这个技术好不好」,而是「它拿什么换了什么」。

6. 四个行业,四类不同的失效

这一节回答:失效有没有类型可分。有——而且作者选案例的标准就是这个。

他自己说了选例标准:每一个案例突出一种不同的可靠性挑战10。 所以这不是四个成功故事的罗列,是四张不同的失效面孔:

行业典型失效作者给的工程结论
法律编造引用每条输出溯源到权威库、自动核对引注、出庭前强制人工复核11
客服说错政策每条政策回答都落到「检索到的、带版本号的政策文档」上;把握不足就转人工12
编程代码里有洞快不等于可以少审:43% 的 AI 生成代码在上生产前仍需人工调试,而且它写的逻辑错误是人写的 1.7 倍13
企业里让它自己办事动作不安全权限、可回滚、工具够健壮、失败不外溢14

这四句「工程结论」其实就是后面二十章的提纲。 第一条落在第 05 与第 09 章, 第二条落在第 05 与第 19 章,第三条落在第 17 章,第四条落在第 13 与第 15 章。

顺带一件必须说的事:这张表左半边(收益)的数字,我们建议你不要转引。 书里给的是「某公司顶了 700 个全职坐席」「某产品估值 110 亿美元」这类 2026 年的商业数字, 一个参照物都没有,而作者本人是卖 AI 落地服务的。 右半边(风险)的数字有具体研究出处,可信度高得多——所以我们只留了右半边。

7. 三层框架:为什么必须按这个顺序

这一节给出全书的骨架。它的价值不在于「分了三层」,在于这三层不能换顺序。

第一层 说得准 ── 怎么让它给出准确、有据的回答
│ (第 02–11 章:为什么会编 / 怎么把话说清楚 /
│ 怎么让它照着你的文档答 / 什么时候该改模型)

第二层 做得安全 ── 怎么让它安全地动手
│ (第 12–16 章:记忆、工具、循环、协议、拆成多个)

第三层 长期不退化 ── 怎么评、怎么上线、怎么长期负责地跑住
(第 17–21 章:评测、性能、监控、偏见、隐私)

图说:每一层建在上一层之上。箭头是「先决条件」,不是「推荐阅读顺序」。

为什么顺序不能反,作者给了一句很硬的理由:

一个自信地产出错答案的模型,不只是没用,是危险的。15 在它能动手、能自主运转之前,它说的话必须先可信。

把这句话和上一节的四类失效对起来看,就明白了: 一个会编判例的系统,如果你还给了它「自动提交」的权限, 它不是多了一个功能,是把「一条假引注」升级成了「一份已经递进法院的假诉状」。 能力越大,第一层的窟窿被放大得越厉害。

回到那位律师:走查第 ⑤ 步

同一个事故,拆开来正好落在三层上:

事故里的这一段归哪一层为什么
AI 编出六条不存在的判例第一层内容错了。这是「说得准」的问题
系统把文书直接递交出去,中间没有人看第二层动作没有边界。这是「做得安全」的问题
直到书记员打电话才发现第三层没有任何机制在持续地查。这是「长期不退化」的问题

三层各修各的一段,谁也代替不了谁。 只补第一层(换个更强的模型), 第二层那个「不经人看就提交」的设计还在;只补第二层(加一道人工审批), 第三层那个「没人在查」的空白还在——下一次错在别处,照样几周之后才发现。

8. 起手式:一条阶梯,不是一次架构选择

这一节是这一章唯一一条可以马上照做的东西。

新手最常问的是「我该选什么架构」。作者的回答是:这个问题问早了。 他给的是一条阶梯,核心原则一句话:从最简单的做起,只在必要时才让系统变复杂16

① 先把话说清楚(提示词) 免费、几分钟、不动任何代码
│ 不够?

② 去把资料取回来再让它照着答 要建一套索引,每次查询多一段等待
│ 还不够?—— 注意这里问的是「缺知识」还是「缺行为」

③ 真的去改模型内部那些数(微调) 要数据、要显卡、要前期投入
│ 需要它动手办事?

④ 小心地放权给它 赌注从「答错」变成「做错」

⑤ 而「怎么知道它做得对」——从第一天就要有,不是第四步之后才补

图说:①②③ 之间是「不够才往下走」,④ 是另一条轴,⑤ 贯穿全程。

「先按问题从外部资料里取回相关内容,再让模型照着答」这套做法,在这一行叫检索增强。 它的英文缩写是 RAG,即 Retrieval-Augmented Generation 三个词的头字母 ——你在任何一篇相关文档、任何一个产品页面上都会撞见它。 它是第 05 章一整章的内容,这里只需要知道它在阶梯上的位置:比提示词贵,比微调便宜。

回到那位律师:走查第 ⑥⑦ 步

照这条阶梯,他的系统该怎么改?

  1. 第 ① 级先试: 在提示词里写死「只允许引用检索到的判例,查不到就明说查不到」 ——五分钟,不花钱。如果十个真实案子里有八个能过关,到此为止;
  2. 不够就上第 ② 级: 接一个真实的判例库,让它先去查、再照着写。 这一步能治的正是「编造引用」这一类;
  3. 第 ③ 级(改模型)在这里帮不上忙: 判例库天天在更新, 而改进去的知识是死的——这条判断第 10 章会讲透,它是全书最实用的一条决策;
  4. 第 ④ 级要往回退: 「自动提交给法院」这个权限,在第一层还没稳之前就不该给;
  5. 第 ⑤ 级从第一天就要有: 哪怕只是每周随机抽二十条回答,人工核一遍引注真不真。

这五条里没有一条需要更强的模型。 这就是这本书的立场。

9. 作者的判断与证据

这一章有一半是论断,一半是数据。分开标出来,免得把作者的立场当成已验证的结论。

书里给了证据的:

说法证据是什么
换个没见过的环境,同一批模型掉到 58–65%一次具体的实验(Scale AI 做的 SWE-bench Pro),有对照
43% 的 AI 生成代码上生产前仍需人工调试一家公司的开发者调查
AI 辅助写的代码逻辑错误是人写的 1.7 倍一家代码审查公司的分析
每步 85% 可靠的十步流程端到端只剩约 20%算式我们核过:0.85 的 10 次方 ≈ 0.197,和书里说的「约 20%」对得上这笔乘法为什么该决定你把力气花在哪,第 12 章讲

作者的推测或立场(书里没有给证据,也不可能有):

说法它是什么
「可靠 = 准确输出 + 安全动作 + 长期保持质量」一个定义,不是一个发现。 作者自己划的口径,全书据此展开
三层框架一种组织方式。 它好用,但不是唯一切法,也没有实验证明这样分最优
「公平和隐私是可靠性的一部分,不是另一件事」17一个立场。 作者明说会歧视或漏数据的系统就是不可靠的,不管准确率多少
「从简单开始」这条起手式经验法则。 合理,但书没有给出「跳级会付多少代价」的对照数字

判断(我们的,不是书里的): 这一章真正值钱的是语义正确性这一维, 不是三层框架。框架是一种切法,别人也可以切成两层或五层; 而「运维面板上没有这一格」是一个结构性事实—— 它解释了为什么这类系统会「一边全绿一边持续出错好几周」, 而这个现象在第 19 章会以一模一样的形状再出现一次。 如果错,会错在: 如果将来的运维体系把内容质量做成了标准指标 (就像今天的错误率一样人人都在看),这一维就不再是「缺的那一格」, 而只是「多一个要看的图表」——那时这一章的冲击力会消失,但结论仍然成立。

10. 边界与局限

这一章没覆盖的:

  • 「基准」这件事本身的争议一个字没提。 题目泄漏到训练材料里怎么办、 分数怎么被刷上去、同一套题不同实现跑出不同结果——这些都是真实存在的问题,书没讲;
  • 为什么会编,这一章只给了现象。 机制在第 02 章;
  • 三层框架的边界没说。 一个不产出文字、只做分类的系统该怎么套这三层?书没交代;
  • 监管只有一句话。 原书 §1.6 提了「监管的是系统,不是模型」就再没下文, 我们把这一块整段挪到了第 20 章,和那里的合规义务放在一起讲。

已被时间冲刷的:

  • 那批 2026 年的商业数字。 估值、年收入、活跃用户数——这类数字半年就变, 而且书里一个参照物都没给。引这本书时不要引它们;
  • 具体模型名。 书里写到的型号一个都不要记,只记「它们会被换掉」这件事本身 ——这正是第 03 章那条实操建议的由来。

11. 可带走的

全章那条走查,一行写完: 律师看到考卷分数(94 分 vs 博士 70 分)→ 敢用 → 可换个没见过的环境同一批模型掉到 58–65% → 他拿到六条格式完美的判例 → 一条都不存在 → 同期面板全绿(可用率 99.99%、800 毫秒、0 错误,这三个数是为演示编的) → 面板上根本没有「编造判例」这一格 → 三种失效分归三层 → 起手式从第 ① 级开始。

  1. 基准 = 固定的题 + 固定的判分法。 它测的是「在这批题上行不行」, 不是「在你还没出的题上行不行」;
  2. 落差不在能力,在换个环境还成不成立——这就是可靠性落差,它是工程活,不是等代际;
  3. 可靠 = 说得准 + 做得安全 + 长期不退化,这是作者划的口径,全书据此展开;
  4. 传统运维漏掉一整维:内容对不对(语义正确性)。系统可以 99.99% 在线,同时自信地答错;
  5. 八条属性之间有真实取舍(准确 vs 快、安全 vs 花钱、深 vs 快)—— 读任何一项技术都要问「它拿什么换了什么」;
  6. 失效分类型,不同类型修法不同: 编造引用 / 说错政策 / 代码有洞 / 动作不安全;
  7. 三层的顺序不能反: 一个自信答错的模型,给它权限只会把窟窿放大;
  8. 起手式是一条阶梯,不是一次架构选择: 提示词 → 取资料 → 微调 → 放权, 而「怎么知道它做得对」从第一天就要有;
  9. 上面这五步改进,没有一条需要更强的模型。

12. 原文地图

主题原书章原文位置
考卷分数与博士对照Chapter 1: AI Reliabilitytext/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:53(搜「surpassing PhD experts」)
九成半试点拿不到回报Chapter 1: AI Reliabilitytext/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:20(搜「95% of generative AI pilots」)
换代码库后掉到 58–65%Chapter 1: AI Reliabilitytext/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:58(搜「dropped to just 58」)
可靠性落差与中心论断Chapter 1: AI Reliabilitytext/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:59(搜「the reliability gap」) · text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:60(搜「benchmark capability is not the same」)
六条不存在的判例Chapter 1: AI Reliabilitytext/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:186(搜「none of the cases exist」)
幻觉与传统 bug 的区别Chapter 1: AI Reliabilitytext/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:203(搜「wrong outputs like error messages」)
可靠的定义Chapter 1: AI Reliabilitytext/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:37(搜「takes safe actions」)
八条属性Chapter 1: AI Reliabilitytext/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:225(搜「A reliable AI system produces」)
维度之间的真实取舍Chapter 1: AI Reliabilitytext/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:235(搜「real trade-offs」)
语义正确性Chapter 1: AI Reliabilitytext/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:240(搜「semantic correctness」) · text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:241(搜「99.99% uptime while confidently generating wrong answers」)
四个行业的选例标准Chapter 1: AI Reliabilitytext/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:70(搜「each one highlights a different」)
法律与客服的工程结论Chapter 1: AI Reliabilitytext/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:108(搜「high-stakes legal workflows」) · text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:124(搜「ground every policy response」)
43% 与 1.7 倍Chapter 1: AI Reliabilitytext/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:140(搜「43% of AI-generated code」)
自主动作的四件事Chapter 1: AI Reliabilitytext/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:172(搜「when AI systems act autonomously」)
三层为什么不能反Chapter 1: AI Reliabilitytext/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:262(搜「isn't just」)
误差级联那笔乘法Chapter 1: AI Reliabilitytext/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:307(搜「85% reliable at each step」)
公平与隐私是可靠性的维度Chapter 1: AI Reliabilitytext/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:353(搜「fairness and」)
起手式:从简单开始Chapter 1: AI Reliabilitytext/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:392(搜「start simple and add complexity only as needed」)

Footnotes

  1. 出处:「Chapter 1: AI Reliability」第 53 段(text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:53,搜「surpassing PhD experts」)。那套考卷叫 GPQA Diamond。补充(不在书里,来自通用知识):这套题的设计目标就是「专家答得出、非专家上网搜也搜不出」,所以博士那 70 分不是没认真做,是题本来就难。

  2. 出处:「Chapter 1: AI Reliability」第 20 段(text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:20,搜「95% of generative AI pilots」)。书给的引用是一篇转述报道,不是麻省理工报告原文;我们没有核到一手来源,请当成「书里的说法」读。

  3. 出处:「Chapter 1: AI Reliability」第 58 段(text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:58,搜「dropped to just 58」)。这套加难版考卷叫 SWE-bench Pro,由 Scale AI 制作,换成了模型没见过的新代码库。

  4. 出处:「Chapter 1: AI Reliability」第 60 段(text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:60,搜「benchmark capability is not the same」);「可靠性落差」这个名字在第 59 段(同文件 :59,搜「the reliability gap」)。

  5. 出处:「Chapter 1: AI Reliability」第 186 段(text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:186,搜「none of the cases exist」)。原文补充说,这类事已经在世界各地法庭上发生过多次,后果包括制裁与职业信誉受损;而且它们「像到连有经验的法律从业者一开始都被骗过去」

  6. 出处:「Chapter 1: AI Reliability」第 203 段(text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:203,搜「wrong outputs like error messages」)与第 204 段(同文件 :204,搜「answers that look right」)。

  7. 出处:「Chapter 1: AI Reliability」第 241 段(text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:241,搜「99.99% uptime while confidently generating wrong answers」);「语义正确性」这个名字在第 240 段(同文件 :240,搜「semantic correctness」)。

  8. 出处:「Chapter 1: AI Reliability」第 37 段(text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:37,搜「takes safe actions」)。原文:「produces accurate outputs, takes safe actions, and maintains quality over time under real-world conditions」。

  9. 出处:「Chapter 1: AI Reliability」第 235 段(text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:235,搜「real trade-offs」)。八条属性的完整列举在第 225 段(同文件 :225,搜「A reliable AI system produces」)。

  10. 出处:「Chapter 1: AI Reliability」第 70 段(text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:70,搜「each one highlights a different」)。

  11. 出处:「Chapter 1: AI Reliability」第 108 段(text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:108,搜「high-stakes legal workflows」)。原文还引了一位在三千五百名律师中部署过此类系统的负责人的话:「你必须核验系统输出的每一样东西」。

  12. 出处:「Chapter 1: AI Reliability」第 124 段(text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:124,搜「ground every policy response」)。原文点出的要害是:机器人说错退款期限,顾客照着做了,责任在公司

  13. 出处:「Chapter 1: AI Reliability」第 140 段(text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:140,搜「43% of AI-generated code」)。这两个数来自两家不同公司的调查与分析。参照物在原文同段:同一批工具让开发者完成任务快了 30–55%——所以这不是「AI 写代码不行」,是「快了三到五成的同时,要多审的量也上去了」。

  14. 出处:「Chapter 1: AI Reliability」第 172 段(text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:172,搜「when AI systems act autonomously」)。

  15. 出处:「Chapter 1: AI Reliability」第 262 段(text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:262,搜「isn't just」)。原文:「An LLM that confidently produces wrong answers isn't just useless; it's dangerous.」这里的 LLM 是 large language model 的缩写,指的就是总纲开头说的那类「你打字进去、它写字出来」的程序,中文叫大语言模型——「大」说的是它内部那些数多到几千亿个。

  16. 出处:「Chapter 1: AI Reliability」第 392 段(text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:392,搜「start simple and add complexity only as needed」)。原文的阶梯是:提示词(免费又快)→ 不够就加检索来把输出落地 → 要更深的领域专长再考虑微调 → 要动作才加 agent;而评测与监控从一开始就要有。

  17. 出处:「Chapter 1: AI Reliability」第 353 段(text/04-ch01-chapter-1-ai-reliability-building-llms-for-the-r.txt:353,搜「fairness and」)。原文:在这个框架里,公平与隐私是可靠性的维度,不是另一回事——一个会歧视或泄露数据的系统就是不可靠的,不管它准确率多少