会不会重演:那笔安全账,和书里留下的那对张力
这一章讲三件事: 「换个场景还灵不灵」到底该怎么判; 出错的代价该怎么算成一笔可以做决策的账; 以及这本书最后把问题留在了哪里。
它在全书链条里的位置: 这是落点。 第 05 章那个「它一定会出错」,在这一章变成了钱; 第 18 章那条横线,在这一章多了一项。
1. 「换个场景还灵不灵」有两层,而且各对应一笔钱
这一节先把上一章那个问题的判据立起来。
书里先给定义:泛化是指它能在新情况下正确理解环境并执行适当的动作; 泛化能力越强,就越能适应新的条件、解决更多问题1。
书里那个类比很好懂: 假设有两个学生, 一个擅长应试,把时间都花在做考试真题和模拟练习上; 另一个苦练内功,阅读了大量相关书籍、论文和网页。 他俩都能顺利通过考试,但工作后要把学校学的知识用到实际场景时,后者的表现会更好2。
关键在于:书里把泛化拆成了两层,而且这两层各对应一笔钱3:
| 哪一层 | 具体是什么 | 省的是哪笔钱 |
|---|---|---|
| 第一层 | 针对某个功能,在 A 数据集上训练,在数据特点和分布不同的 B 数据集上表现也不错 | 把同一个产品复制到新客户的边际成本很低——正是第 19 章那个「同行业跨客户复制」 |
| 第二层 | 并未针对某个功能准备数据和训练,却学会了该功能(例如英汉翻译);通过微调、甚至只在聊天里举几个例子就能掌握新技能 | 同一个模型提供新功能、产生新业务价值的边际成本很低 |
第 03 章那次「没学过却会翻译」,就是第二层的第一个证据。
书里的结论是有分寸的:大模型确实涌现出了许多泛化能力,体现了一定程度的通用性, 但离真正的通用人工智能还有距离4—— 按书里引的那位首席科学家的标准,通用人工智能是指泛化能力达到人类大学本科生的水平5。
2. 缺陷清单:四条,其中一条你早就见过
这一节把书里散落的缺陷收在一处,因为后面算账要用。
书里那位创业者角色列的是四条: 它会出现幻觉、规划能力差、无法持续学习、缺乏长期记忆6。
加上书里在小结里补的三条边界,一共是这样一张表:
| 缺陷 | 书里怎么说 | 前面哪一章讲过 |
|---|---|---|
| 会瞎编 | 最大的障碍之一 | 第 05 章 |
| 规划能力差 | 书里点名它不擅长做规划 | 第 18 章第 7 节(「避开它的弱项」) |
| 无法持续学习 | 学完就定住了 | 第 02 章 |
| 记不住你 | 缺乏长期记忆 | 第 01 章第 8 节——这就是那句许诺的兑现处:书里到最后是把它当缺陷再提一次,没有给解决办法 |
| 光靠文字建不出一整套对世界的认识(书里叫世界模型) | 图片学习效果还有待验证,视频学习可能要引入新技术7 | 第 06 章第 4 节 |
| 泛化有边界 | 它学到的能力主要集中在跟语言相关的那一类;在图像识别、用户行为预测这些领域未必适合8 | — |
| 涌现是被动的 | 只能通过事后观察来分析浅层的规律,无法做到可知、可预测、可控9 | 第 05 章第 3 节 |
最后一条最要命,因为它直接否掉了一种常见的做法: 你不能把「等它涌现出新能力」写进业务计划。 书里那位创业者角色说得很直接:别依赖于大模型涌现来解决问题10。
3. 有的场景里,缺陷正是卖点
这一节讲一个反直觉但极其实用的判断。
书里给的第一条落地建议是:选好做什么,不做什么11。
理由是:同一个缺陷,在不同场景里的性质完全相反。 书里举的例子是那个角色扮演产品的创始人: 「我并不认为幻觉是需要解决的问题,我甚至很喜欢它,这是模型有趣的特点。」12 书里的解释是:在角色扮演场景中,幻觉是想象力的源泉; 但对另一些容错很低的行业,如医疗诊断、自动驾驶、工业自动化,幻觉却危害显著13。
这一条和第 12 章第 6 节那四个格子是同一件事,只是换了个说法: 容错率不是一个技术指标,是一个场景属性。 先挑场景,再谈技术。
4. 补丁清单:这里只回指
这一节故意写得短,因为该讲的第 05 章已经讲完了。
书里在这里列了几条打补丁的办法: 机器手段包括通过本地数据库查询在对话中带入历史记忆、 通过两个模型间左右互搏的方式识别幻觉; 人工手段包括通过提示工程指引它进行复杂规划、采用人工审核来发现并纠正14。
这些第 05 章第 5、6 节和第 13 章第 8 节都讲过了,不再重复。
这一节唯一要补的是书里那句最实在的话: 以上手段在不同行业场景、不同数据环境下的效果与成本,需要用实践验证; 其综合结果会影响它在这个行业或场景的商业价值14。
「效果与成本」这四个字,就是下一节的题目。
5. 主走查:一个场景的安全账
这是本章的主走查,也是全书最有实用价值的一段。
书里那位创业者角色给的算法是四步15:
到具体行业里,就需要测试不同场景下大模型的错误率, 算出实测错误率和可容忍错误率之间的差距, 找到一个安全措施来降低错误率,以弥补这个差距。
我们把它整理成一条可以照做的走查。
下面每一步的数是我们为演示编的,不是书里的数值。 书里给的是这四步的框架和最后那个配比,没有给任何一个场景的实测错误率。
| 第几步 | 问什么 | 演示数 |
|---|---|---|
| 1 | 这个场景实测错多少? | (演示) 100 次里错 4 次 = 4% |
| 2 | 这个场景能容忍错多少? | (演示) 电商客服可以容忍 1%;医疗诊断接近 0 |
| 3 | 差额是多少? | 4% − 1% = 3 个百分点 |
| 4 | 拿什么补这 3 个点? | 从第 4 节那张补丁清单里挑:两个分身互查、外接知识库、人工抽检 |
| 5 | 每条补丁降几个点、加多少成本? | (演示) 两个分身互查:降 1.5 个点,每次回答的开销翻倍;人工抽检 20%:降 1.5 个点,每 5 次要占一个人一次的工夫 |
| 6 | 配比因此变成几比几? | (演示) 抽检 20% ⇒ 一个人能看 5 台 |
第 6 步那个「几比几」就是书里的原话:业务安全配比。 书里拿自动驾驶做了对照,这段对照极其精确16:
| 阶段 | 人在哪 | 业务安全配比 |
|---|---|---|
| 主驾安全员 | 坐在方向盘后 | 1:1 |
| 主驾无人 | 安全员坐副驾 | 1:1 |
| 前排无人 | 安全员坐后排 | 1:1 |
| 全车无人(远程云代驾) | 人在远端 | 3:1 或 4:1,甚至更高 |
书里那句判断值得抄:人类一点点往幕后退,但业务安全配比始终是 1:1,使得成本过高; 到了全车无人这个阶段,每人同时代驾的车辆数越来越多,就能逐步降低安全成本16。
这张表最要紧的一行是前三行:人往后退了三次,配比一次都没变。 这就是第 19 章那家自动驾驶公司估值从 1750 亿跌到 300 亿的全部原因。
书里那位投资人角色把这笔账翻译成了投资语言: 你这个业务安全配比,其实就在计算它带来的价值贡献跟它带来的安全成本相比,能否接受; 如果配比很高,说明业务价值远远高于安全成本,企业才有动力推广17。
补充(不在书里,依据我们的 agent 书架):今天那些「补丁」已经有了成型的产品形态, 而它们本身也是要花钱的。 第一类是在数据进出模型的两个关口上各挂一串检查函数, 按声明配置好「哪些检查挂在用户输入上、哪些挂在模型输出上」。 依据: shelf=ai-agent-reference/nemo-guardrails#01-config-and-rail-types.md §3 五类护栏 · 04-input-output-rails-and-library.md §1 这是什么 @e961f810ca266e3738c4815df8712a35a71dc7fa 事实=这类工具把护栏分成 input / output / dialog / retrieval / tool 五类, 用一份配置声明哪些检查挂在哪个关口;拦截型护栏本质上是一串检查动作, 命中拦截时要么回一句预设拒答、要么抛异常中止。
第二类是主动去攻自己,把错误率测出来。 依据: shelf=ai-agent-reference/deepteam#index.md §1 这是什么 · §2.1 主线一段话走通 @dc148aad62f71330cfec7121d6afb4c620dfa683 事实=这类工具给定漏洞类别,自动合成对抗输入去打你的模型, 再用另一个模型当裁判判「防住了还是被攻破了」,最后汇成一份风险报告; 你唯一要提供的是一个「喂进一段文字、吐出一段文字 」的函数,它不需要知道你的内部实现。
这两类工具的存在恰恰证明了这一节的判断:安全不是一句口号,是一条会出现在账单上的开销。
6. 书里自己留下的那对张力
这一节是全书的落点,而且书里没有把它合上。
一边是这个: 书里那位创业者角色说, 未来在大模型能胜任的知识工作中,边际成本主要就是推理算力加安全成本18。
另一边是这个: 就在同一段对话往下几句,那位学生角色引了一句话—— 「未来十年的发展变化应该基于这样一个假设:智力的边际成本趋向于零。」19 而书里在小结里给这句话配了一本书: 当智力的边际成本趋向于零时,对应的生产和消费关系会发生什么变化, 有一本《零边际成本社会》曾经对此进行过思考20。
把两句话并排放,矛盾就出来了:
边际成本 = 推理算力 + 安全成本
│ │
│ └── 不随技术进步自动下降
│ (它取决于场景能容忍多少错)
│
└── 随技术进步快速下降
而「智力的边际成本趋向于零」这句话,
只有在第二项也趋近于零的时候才成立。
判断(我们的,不是书里的):这两句话不能同时为真,除非安全成本也趋近于零。 而第 5 节那张表说明了它为什么难降:配比是由「场景能容忍多少错」决定的, 而那个数三年没变——医疗还是医疗,客服还是客服。 所以更可能的图景是:推理这一项趋近于零,安全那一项成为主要成本, 于是「哪些活值得交给它」这个问题的答案,最终由容错率而不是由算力价格决定。 如果错,会错在: 如果护栏、红队和自动核查这些事也被做到接近免费, 那么安全那一项确实会跟着降,那句「趋向于零」就成立—— 可核对的迹象是:同一个场景所需的人工抽检比例是否在逐年下降。 这一条今天可以观测,不必等结论。
书里自己没有合上这对张力。它把两句话放在同一章里,然后翻页了。 这就是这本书留给读者的题。
7. 最好的商业与最好的社会事业
这一节给出书里的五条排序,它是全书唯一一次明确排名。
先补一对概念,因为下面那张表的第 4 行、以及第 13–15 章那个三分类,都是从它长出来的。 书里在进入应用篇之前先把创新分成两类21:
| 哪一类 | 书里怎么说 | 拿什么判 |
|---|---|---|
| 渐进式创新 | 对现有产品、服务或流程做细微的改进和打磨,提高性能、降低成本或改善体验;持续、较小,不颠覆市场 | 你是把它塞进现有系统里,盯着投入产出比和员工愿不愿意用 |
| 颠覆性创新 | 以大幅降低的成本和大幅提升的便利性,改变原有产品的市场定位和商业模式;或者用新产品满足原本满足不了的需求,拿到新市场 | 你要从技术、产品到市场、商业整盘重做,并承担更高 的风险 |
两类之间不是天生的,是被一个量推过去的。 书里给的机制只有一句,但这一句是本节的钥匙: 成本和价格降到某个临界点之后,就打开了全新的市场; 由此带来的产品普及,又能引发更多的产业联动21。
书里配的例子是计算机。 1943 年,IBM 董事长托马斯·沃森预言 「全球市场只需要五台计算机就够了」—— 在那个年代,计算机非常庞大、昂贵,当时的人很难想象它会成为几乎人手一台的东西22。 他没有算错当时那个价位上的需求量,他只是没有算到价格会掉到哪儿去。
把这一句和第 18 章那条横线并排放,两者说的是同一件事: 横线量的是「这个场景现在划不划算」,而临界点说的是「横线降到某个位置, 线下那一大片场景会整片翻到线上」。 第 08 章那条「降价 → 抢市场 → 做大蛋糕」的链,在这里第三次出现。
现在看那五条排序。 书里的原话是五条,按「最赚钱 → 最好」排列23:
| 第几条 | 书里怎么说 | 我们的注解 |
|---|---|---|
| 1 | 卖算力,是短期内最赚钱的商业 | 第 16 章已经验证 |
| 2 | 卖模 型服务,并通过客户积累形成数据飞轮壁垒,做有飞轮效应的水电煤,是最有想象空间的商业 | 第 17 章那一层 |
| 3 | 把能力与行业结合、提高现有业务的生产力,是最现实的商业 | 第 13、14 章那些行业 |
| 4 | 在某个应用场景中形成颠覆性创新,面向最终消费者创造新的价值,引领甚至创造一个新行业及相关就业机会,这是最好的商业 | 「颠覆性」就是本节开头那一类;第 19 章第 8 节那家短视频公司走的就是这条 |
| 5 | 赋能给原本智力资源缺乏的地区,提高教育、医疗这类社会基础服务的质量,实现更高层次的公平,长期可缩小地区间发展差距、形成新的消费市场,这是最好的社会事业 | 书里把它排在商业之外 |
书里还给了一条现实的路径:企业从 2 到 4,或从 3 到 4,也是一种现实可能的发展路线23。
为什么第 4 条是「最好的商业」? 书里那位投资人角色给了理由: 最理想的目标,就是能像第二次工业革命将马车升级到汽车那样, 既开辟了巨大的新市场,同时还带来了增量的就业24; 而那位创业者角色补了一句很重要的话: 增量就业看起来属于社会价值,但它对工业革命的社会接受度和可持续发展很重要; 如果技术变革只能导致裁员、没办法创造新的就业机会,是不能长期立足的25。
这段话把全书首尾扣上了:第 08 章那场砸机器的运动,起因正是「只有替代、没有新岗位」。
书里对「新市场」的具体设想是:那些过去因为知识工作边际成本太高而无法实现的市场—— 一对一的专业服务:教育、法律、医疗、心理咨询; 这些领域的一对一服务老百姓有需求,但高质量专业资源很稀缺、价格昂贵, 只有极少数人能负担得起26。
8. 我们在周期的什么位置
这一节把第 19 章那个问题的答案摆出来,并说清它为什么不可靠。
第 19 章第 7 节说过:以「大模型」为主语,处在第一个上升波段; 以「AI」为主语,处在第二个上升波段、已经在爬坡。 而书里自己承认:解释空间就会很大。
所以本组拆解给一把更硬的尺子:用第 09 章那个四十七年。
判断(我们的,不是书里的):比起「我们在周期的哪个位置」, 更值得问的是「流程重排走到了哪一步」。 第 09 章那把尺子给的是:发电站开张到红利兑现,过了 47 年, 而卡住它的不是电机,是那根没被拆掉的传动轴。 对着这把尺子看今天:大多数企业还停在「把电机换上、传动轴照旧」那一步—— 也就是第 12 章那个副驾。 如果错,会错在: 这个类比假设了流程重排的难度可比, 而软件流程的重排比物理厂房便宜得多、快得多——如果是这样,那 47 年会被大幅压缩。
9. 全书落点:那句「你还需要相信」
这一节讲书的最后一页,它回到了第 03 章。
作者在后记里写道,他在检查书稿时再次看到了那句话: 「在你拥有大规模的高质量数据和算力之后,你还需要相信。」27
然后是全书的最后一个判断:相信,以及相信背后的勇气和担当, 正是它学不到、夺不走的人类品质28。
书里给的最后三句是这样的29:
- 面对零成本但同质化的智能时,找到自己的好奇和兴趣、个性和真情;
- 面对变化和不确定时,利用批判性思维、试错和一轮轮改进来解决问题;
- 未来的教育,或许就是要帮助人们找回这些不变的东西。
判断(我们的,不是书里的):后记这 三句是抒情,不是结论,但第二句有实际内容。 「批判性思维」在这本书里不是一句口号——它有具体的动作,就是第 11 章第 7、8 节那四类追问。 一本讲产业的书,最后落在「怎么问」上,这个落点是站得住的。 如果错,会错在: 如果核查和追问被产品自动化了(见第 11 章末那条判断), 那么「人的批判性思维」就会从必备技能退回成一种偏好。
10. 作者的判断与证据
| 说法 | 性质 |
|---|---|
| 泛化的定义与两个层次 | 书里的整理,概念本身是行业通用的 |
| 四条缺陷 | 事实,当时公认 |
| 「涌现不可预测,别写进计划」 | 作者的判断,而且是全书最该听的一条 |
| 那四步安全账 | 作者提出的框架,没有任何一个场景的实测数据 |
| 1:1 到 3:1、4:1 的配比 | 自动驾驶行业的真实情况 |
| 「边际成本 = 推理 + 安全」 | 作者的判断 |
| 「智力的边际成本趋向于零」 | 引自一位从业者,书里没有论证 |
| 五条商业排序 | 作者的价值排序,不是市场数据 |
| 渐进式 / 颠覆性两类创新 | 借用的现成创新理论,不是作者原创 |
| 「1943 年只需要五台计算机」 | 史料,书里点了年份和说话的人 |
| 「降到临界点就打开新市场」 | 作者的整合,书里只给了计算机这一个例子,没有给临界点在哪 |
必须点破的一处:这一章的落点是一个框架,不是一个结论。 「实测错多少、能容忍多少、差额靠什么补」——这三个问题书里一个都没有替你回答。 它的价值在于:它是全书唯一一处把「安全」变成了一个可以计算的量, 而不是一句「要重视风险」。
11. 边界与局限
- 书里没有给任何一个场景的可容忍错误率。 医疗是多少?客服是多少?一个数都没有。
- 书里没有讨论谁来定这个可容忍错误率。 企业自己定?监管定?用户定? 这是这一整套框架里最大的空白。
- 书里没有把安全成本和第 18 章那条横线合并成一个式子。 两处分别写着, 从没放在一起算过一遍。 本章第 6 节那张图是我们替它画的。
- 后记的抒情部分我们没有拆。 那是作者的私人表达,与判断无关。
12. 可带走的
- 泛化有两层:换个客户还灵不灵,和没学过的活会不会干。两层各省一笔钱。
- 四条缺陷里有一条是「它记不住你」——这就是第 01 章那句许诺的落点: 书里到最后是把它当缺陷再提一次,没有给解决办法。
- 别把「等它涌现」写进业务计划。
- 同一个缺陷,在角色扮演里是卖点,在医疗诊断里是灾难。先挑场景,再谈技术。
- 那笔安全账四步:实测错多少 → 能容忍多少 → 差额靠什么补 → 一个人能看几台。
- 人往幕后退了三次,配比一次都没变——这就是上一轮自动驾驶估值蒸发的原因。
- 书里留下一对没合上的张力:「边际成本 = 推理 + 安全」对「智力的边际成本趋向于零」。 这两句不能同时为真,除非安全成本也趋近于零。
- 创新分两类,而两类之间只隔着一个价格临界点—— 降到那个点以下,原本买不起的人整片翻进来,渐进式就变成了颠覆性。 1943 年那句「全球只需要五台计算机」错的不是需求,是价格。
13. 原文地图
| 主题 | 原书章 | 原文位置 |
|---|---|---|
| 泛化的定义与两个学生 | 17 关于大模型产业的对话:第2集 | text/19-ch17-17-2.txt:68(搜「泛化(Generalization)是指AI能在新情」) · text/19-ch17-17-2.txt:70(搜「假设有两个学生」) |
| 泛化的两个层次 | 17 关于大模型产业的对话:第2集 | text/19-ch17-17-2.txt:445(搜「针对某个功能」) |
| 四条缺陷 | 17 关于大模型产业的对话:第2集 | text/19-ch17-17-2.txt:110(搜「它会出现幻觉、规划能力差」) |
| 三条边界 | 17 关于大模型产业的对话:第2集 | text/19-ch17-17-2.txt:464(搜「纯文本信息还不足以建立完整的世界模型」) · text/19-ch17-17-2.txt:468(搜「大模型的泛化能力是有边界的」) |
| 幻觉在有的场景是卖点 | 17 关于大模型产业的对话:第2集 | text/19-ch17-17-2.txt:501(搜「我并不认为幻觉是需要解决的问题」) |
| 补丁清单 | 17 关于大模型产业的对话:第2集 | text/19-ch17-17-2.txt:508(搜「通过人工或机器手段来给大模型的缺陷打补丁」) |
| 那四步安全账 | 17 关于大模型产业的对话:第2集 | text/19-ch17-17-2.txt:233(搜「就需要测试不同场景下大模型的错误率」) |
| 业务安全配比 | 17 关于大模型产业的对话:第2集 | text/19-ch17-17-2.txt:237(搜「业务安全配比始终是1」) · text/19-ch17-17-2.txt:239(搜「配比就可以达到」) |
| 边际成本 = 推理 + 安全 | 17 关于大模型产业的对话:第2集 | text/19-ch17-17-2.txt:249(搜「边际成本主要就是推理算」) |
| 智力的边际成本趋向于零 | 17 关于大模型产业的对话:第2集 | text/19-ch17-17-2.txt:254(搜「智力的边际成本趋向于零」) · text/19-ch17-17-2.txt:568(搜「零边际成本社会」) |
| 五条商业排序 | 17 关于大模型产业的对话:第2集 | text/19-ch17-17-2.txt:576(搜「卖算力,是大模型产业短期内最赚钱的商业」) · text/19-ch17-17-2.txt:590(搜「这是最好的社会事业」) |
| 两种创 新与那个临界点 | 09 大模型应用的两种创新 | text/11-ch09.txt:11(搜「渐进式创新和颠覆性创新」) · text/11-ch09.txt:24(搜「两种创新类型都有可能通过降低成本来实现」) |
| 1943 年那句预言 | 09 大模型应用的两种创新 | text/11-ch09.txt:27(搜「全球市」) |
| 行业应用分三大类 | 09 大模型应用的两种创新 | text/11-ch09.txt:51(搜「我们将大模型的行业应用分为三大类」) |
| 「你还需要相信」 | 后记 | text/20-fm.txt:29(搜「在你拥有大规模的高质」) · text/20-fm.txt:32(搜「相信,以及相信背后的勇气和担当」) |