战略(下) — 让机器与我们一致、尊严与最后的战略
这一章讲三件事: 「让机器更像我们」的现有技术与它的天花板;为什么真正的杠杆是一个社会学概念(共识);以及全书最后一步——先给人下定义(尊严),再谈机器。 它直接接第 08 章的裁决:第一条路(改造人)被否,本章是第二条路的全部展开加全书的结语。 生词当场解释。
1. 先摆现状:两类老办法和它们的裂缝
这一节讲「让 AI 与 人类价值观一致」的现成技术,行话叫对齐。
对齐,指的是让 AI 的行为与人类价值观保持一致的技术与治理努力——第 08 章 TaskRabbit 事件展示的就是「未对齐」的样子。书里盘点,现有办法大致两类1:
第一类,基于规则的系统——类似预先编程的指令,程序员直接写死「能做什么、不能做什么」。它对简单任务直截了当,「但在复杂的场景中却经常会出现问题,因为系统无法进行实时适应」2。世界不会按规则手册出牌。
第二类,从人类反馈中强化学习**(指让系统在环境里自己行动,做对了给奖励、做错了给惩罚,靠奖励信号慢慢塑造行为的学习方式;「从人类反馈中」就是说奖励由人来打)**。书里的评价:它更适合复杂系统,允许 AI 灵活适应特定环境3。
但第二类有一道著名的裂缝,书里点得很准:奖励要靠人精心设计的奖励函数(把「什么算好」写成可计算的打分规则);任何设计失误——目光短浅、预见不到的情况、或者「人工智能聪明过人」——都可能出**「奖励黑客」:机器在解释模棱两可的指令时,技术上拿了高分,却没做到人真正想要的事**4。拿学生打比方(本文的比方):你按「交作业字数」给分,聪明的学生就学会把作业写长——分数拿到了,你要的「学会」没有发生。奖励黑客就是这句话的机器版。
最后立一个全书坐标,免得这一节被读小:引言把任务拆成两个对齐问题——一个是人类价值观与机器行动在技术层面的对齐(本节所讲),一个是人与人之间在外交层面的对齐5。第 05 章整章讲的其实是第二个:当军备竞赛的谈判本身也要靠机器来兜底,第一道对齐就还缺着一半。
2. 机器的世界观:一切都在「相对真理」之内
这一节解释为什么对齐这么难:机器的默认世界里没有「事实」这个类别。
书里的描述:今天 AI 系统被灌输各种信息,却没有直接体验现实世界,而是「通过由数万亿个概率判断组合而成的现实模型来观察这个世界」——对它来说,从一开始就没有「规则」,也没有任何方法区分科学事实和未经证实的观察;「一切——甚至是物理定律——都仅仅存在于相对真理的范围之内」6。
补救的思路书里也写了:给模型注入一些**「基本真实」常量**——被标记为最终结论的事实,写进模型的嵌入(模型内部给每个概 念配的一组数;这组数构成的空间,就是它的概念地图)里,并且「可以很容易地进行全局更新」;这样模型就能把「更广泛的概率判断」和「更狭义的事实真相评估」融合起来7。
但书里立刻补了一条哲学边的限制:人类自己的基本原理也在不断被修正,「我们不应该把人工智能禁锢在可能错误的『真理』中」;现阶段它需要的是「一棵初级的确定的知识树」8——先给根,别给死。
3. 本章最重要的概念:共识(doxa)
这一节讲书里找出的第三条路,也是最古老的一条。
书里问:比「任何通过惩罚强制执行的规则」更有力、更一致的东西是什么?答案是法国社会学家布迪厄的一个概念——「共识」(doxa,古希腊语,意为普遍接受的信仰):规范、制度、激励机制和奖惩机制的重叠集合,当它们结合在一起时,就会潜移默化地教导人们如何区分善与恶、对与错9。
这个概念的妙处在于它**「没有人工制品对其加以固化呈现」**——它不在法典里,「只是在人类生活中被观察到,并被纳入生活本身」10。你从没读过「不要在电梯里盯着人看」的法规,但你遵守它,因为周围所有人都在遵守。
于是对齐的第三条路有了形状:「共识」的法典无法表述,更无法翻译成机器可以理解的格式。必须教会机器自己完成这项工作——迫使它们从观察中建立起对人类做什么和不做什么的原生理解11。而且书里点明了一个反直觉的宽松:这个过程中「我们不需要,甚至不希望就人类道德和文化的正确表述达成先验一致」——大语言模型既然能从未整理的互联网里找出意义,接地性足够的机器也许同样能吸收「连我们自己都一直难以明确表达的内容」12。
4. 规则金字塔,和「必须依靠 AI 本身」
这一节把共识嵌进执行结构,然后撞上规模问题。
书里给机器设计的 lookup 顺序是一棵**「金字塔级联规则」:从国际条约到国家法律,再到地方法规和社区规范;「只有当人工智能穷尽了整个程序,却找不到任何一层法律能充分适用……它才会参考自己从观察到的早期互动和模仿中得出的结论。这样,即使在不存在成文法律或规范的情况下,它也能按照人类的价值观行事」**13。
对这套机制的四个硬要求,书里列得很工程化:保障措施不能被移除或规避;控制要允许按环境、地域、用户情况变化的可变性;系统要实时处理海量问题、全球适用、能持续学习;对不良行为要防患于未然——「无论何种事后惩罚都只会是为时晚矣」14。
然后是那个绕不开的规模死结。要建立并确保这套规则实施,书里直言:「我们必须依靠人工智能本身」——面对 AI 能做出的数以十亿计的内外部判断,「没有任何一个人或一组人能够达到对此加以监督所需的规模和速度」15。
书里给的具体制度设计是一套「AI 管 AI」的班子:私营企业在政府许可与学术支持下建**「接地模型」(把全球代表性法律、规范乃至人类学整理成训练集和验证套件的基准模型);设计验证测试,认证模型「既合法(跨司法辖区)又安全」;用监督式人工智能**监督各种执行任务的 AI 智能体;模型发布前审查其对法律风俗的遵守程度;并且——这句值得单列——记录模型的演化过程,确保它「不会成为自我抹去训练内容的黑盒,也不会成为非法行为的避风港」16。
5. 一致性的谦卑:道德编码者不是神
这一节讲书里给整个对齐工程上的最后一道保险:对工程本身的怀疑。
技术之外,书里的判断很清醒:机器「具有超人的记忆和服从指令的能力」,学习法律伦理规范也许能比人做得好;但更大的挑战是非技术的——「主要的问题在于,『善』和『恶』并不是不言自明的概念。任何道德的设计者都必须保持谦卑。」17书里引美国法官卡拉布雷西化用《新约》的话:「即使是最优秀的人也必须时刻警惕,以免自己坠落;而最不堪的人也永远可以怀抱希望,期盼得到重生。」有些问题连「共识」也无法回答,因为「善」的概念模糊性「在人类历史的每个时代都得到了证明」18。
由此两条推论。其一:「训练人工智能来理解我们,然后坐等它们尊重我们,这既不安全,也不可能成功」——人类自己也不会统一行为:有人视 AI 为友,有人为敌,有人来不及选19。其二,书里逼所有 人先回答两个问题:「当人类和机器之间的区别变得模糊不清时,人类被视为一个物种的最低门槛是什么?如果被迫向机器妥协,那么人类不可协商的集体红线是什么?」——否则,「定义我们的价值……这一根本任务」会被拱手让给 AI20。
然后是全书立场最硬的一句,值得整段抄:「如果对相应技术进行可靠战略控制的机制不可能实现,那我们宁愿选择一个根本没有通用人工智能的世界,而不是一个通用人工智能与人类价值观不一致的世界。」21
6. 主走查:拿「尊严」的定义过检三个对象
全书的哲学落点是一个定义。定义是用来用的,所以本节把它当检测程序跑一遍。
书里先说清为什么要定义:人类需要的是一组属性,「为『什么可取』提供一个底线,而不是为『什么可能』提供一个上限」;起点是「尊严」——没有共同定义,当 AI 被用作侵犯尊严的手段时,人类的应对就会「束手束脚」22。康德的旧定义被引作地基:人的尊严在于人是能自己做道德判断、自己拿主意的行动者,不应被当作达到目的的手段23。
然后是作者自己的定义(书里自称「抛砖引玉」)24,拆成四个检测要素:
尊严定义 v1:尊严是一些生灵与生俱来的品质——
要素① 生来脆弱(必有一死 → 书里的原文是
「生来脆弱、必有一死」[^23])
要素② 因脆弱而充满不安全感和恐惧
要素③ 有自然的倾向(会受欲望牵引)
要素④ 能够而且确实行使了自由——
「不去追随自己的恶念,而是选择自己的善念」
检测对象 A:普通成年人
①过 ②过 ③过 ④过 → 有尊严,应得到特别尊重 ✓
检测对象 B:「有意识但没有反应的人」(书里自己挑的边界例)
④无法行使 → 定义漏洞暴露
书内补丁:尊严一旦赢得,就不会被剥夺,
「即使在我们无法继续当初赢得尊严的行动时」[^24]
(补丁后 B 通过 ✓,定义升到 v2)
检测对象 C:人工智能
①不过——它「不像人一样出生」
②不过——它们不会死亡
③不过——「不会感到不安全或恐惧」
④不过——没有自然倾向,善恶对它「是『他者的概念』」[^25]
→ 在这个定义下,AI 不能拥有尊严 ✗
图说:注意 C 的判定不依赖「AI 不够聪明」——
四个要素全是处境性的(出生/死亡/恐惧/抉择),
再聪明的模型也不天然具备。定义把「智能」和
「尊严」彻底分了家。
那 AI 该被怎么对待?书里的处理是把它放到文学那边:AI 应该像文学人物一样被哲学性地对待。比喻的支点是哈姆雷特——即使最伟大的文学人物,「也不过是一个特殊的文字组合」;「哈姆雷特」感受不到眼球的刺痛和希望落空的挫败,没有做出新选择的自由,被困在他的剧里——「『哈姆雷特』不是人类,而是人类的一个形象。由一串串代码和一大堆硅片组成的人工智能也是如此」25。
书里还预支了反方。哲学家叔本华早就诅咒尊严是**「所有困惑和空洞的道德家的陈腐信条」26;书里的辩护落在最后一句:「尊严,正如我们所定义的那样,有效地支撑着我们的脆弱**和失败的可能性,赋予我们活力、自由和彰显我们信念的能力。它指向我们有能力追寻但尚未实现的善,并急切地 、严厉地向我们低语:去吧。」27
判断(我们的,不是书里的): 这个定义最要紧的功能不是「把 AI 挡在尊严门外」,而是把尊严从「智能水平」上解绑:一个不聪明但会挣扎着选善的人有尊严,一个聪明绝顶却不出生、不死亡、无恐惧的系统没有——这条线一旦画清,「AI 比人聪明所以人没价值」的推论就在前提处断了。但要诚实:四个要素里①②是生物处境,如果未来造出「会死、会恐惧、在善恶间挣扎」的人工系统,定义不会把它挡在门外——书的作者们对此是知情的(他们承认定义「并不完美」、修改可有无数种)。 如果错,会错在: 如果「尊严」的根基不在处境而在别的(比如某种主观体验的质性感受),那么「处境四要素」测得过的人未必有尊严、测不过的系统未必没有——整个检测程序就测了个空集。
7. 最后的战略,和结语
这一节收拢全书:战略一句话,结语一次跳跃。
战略一句话:如果每个 AI 决策都要人管,好处就全没了——所以是以人类道德的基础作为战略控制的一种形式,同时把战术控制权交给更大、更快、更复杂的系统;「将人类融入由人工智能组成的团队的内部工作,包括通过人工智能来管理人工智能,似乎是最可靠的前进道路」28。
姿态上,书里把张力本身当成了罗盘:「设计我们自己」和「与我们的创造物相一致」之间的张力,「很可能成为我们前进的指南针」——两种需求都对,也都可以走向保守;无限探索会被动甚至瘫痪,控制最大化则是「安全的错觉」29。
结语(原书最后三页)完成最后一跳。它的出发点是一句冷峻的话:「仅靠理性,无论是一台机器的理性,还是一个人的理性,无法准确思考与非人类生命共存和共演进问题」——「还需要深植于人性的某种东西」5。书里引宇宙如棋局的旧比喻,给出全书的最后一个命题:「从被动观察到主动参与不是一次逻辑飞跃。化原则为行动从来是一次信仰飞跃。」30配的画是爱因斯坦那段著名的话:人类像一个走进宏大图书馆的孩童,看不懂书上的文字,却感到那排列「像是一种神秘秩序」31。
书里没有回避代价,三处照实写。其一,危机预言:赢家与输家的立场日趋严厉,「人类很快会被危机吞没。目前尚不清楚人类能否存活,如何存活」32。其二,一个近乎冒犯的追问:「人工智能会不会引发这些未来危机,然后扮演人类的拯救者——制造只有它才能解决的问题,仅仅为了证明它存在的必要?」33其三,程序的悬空:「何人做决定?何人决定赋予或不赋予责任和权威?……我们正在挑选这些人,这些会犯错误的人吗?就在现在?我们是不是不知不觉已经选好了人?」34
方法只剩一句:「增长知识需要自我怀疑,但采取行动需要自信。」突然终止 AI 应用本身可能引发危机,减速在政治上更难管理——所以书里把这一刻**「看作一个新开端」**,号召「以冷静的乐观态度迎接它的诞生」35。
8. 作者的判断与证据(分开标)
| 书里的说法 | 性质 | 证据 |
|---|---|---|
| 规则系统无法实时适应;RLHF(从人类反馈中做强化学习的简写)会出奖励黑客 | 技术描述 | 与 AI 安全领域的公认问题一致 |
| 对 AI 而言一切都在「相对真理」之内 | 机制描述(有争议) |