跳到主要内容

记忆、计划与协作 — 在时间里持续行动

这一章讲三件事: 为什么上下文窗口不等于记忆,一套能维护的记忆系统长什么样; 计划为什么不是越详细越好,以及长任务真正失控的时刻在哪里; 还有多智能体(几个 AI 分工协作)的协作——它不是单智能体的默认升级版,什么时候值得上、多角色怎么通信、冲突谁裁决。

它在全书链条里的位置:第 11 章给了闭环,第 12 章给了接口,这一章给时间—— 单个智能体在几十步、几小时的任务里怎么不散架;多个角色怎么组织成一个系统。 第 02 章埋的那句话「强化学习还会回来一次」,在本章最后兑现。

顶层全景:从单个执行者到组织化协作

单智能体的状态 §1–§3 上下文≠记忆 · 三层记忆 · 写入/遗忘/压缩
│ 回答:它怎么知道自己走到哪一步

单智能体的执行 §4–§8 任务分解 · 计划监控 · 交替执行 · 回滚与停止 · 反思
│ 回答:它怎么一步步推进、走偏时尽早纠正

多智能体协作 §12–§15 何时该上 · 通信结构 · 事实底座 · 代价与切片
│ 回答:一个主体不够时,怎么组织多个角色

收口 §9–§11 §16–§17
生成器-评估器(谁来挑错) · 自进化三层 · 谁来喊停 · 人机四种深度 · 从轨迹里学

图说: 前八章大都在教模型「想」,本章教它「记得住、走得稳、合得来」—— 这三件事共同构成从「会调用工具」到「能完成任务」的关键支撑。

1. 上下文窗口不是记忆

很多人第一次做智能体,都会把上下文窗口当记忆:把历史对话、工具结果、中间步骤全塞回提示词, 模型不就「记住了」吗?短任务里这招确实管用,但它和真正的记忆是两回事—— 上下文窗口只是这一次推断能看见的输入范围,像一张摊开的临时工作台;而记忆系统要能选择性保存、 按需检索、可维护1

差异在长任务里迅速暴露:窗口再大也有限,历史一多就截断;窗口里的信息是平铺的, 模型未必分得清关键事实和暂时噪声;就算信息还在窗口里,多轮推理后模型也可能忽略它、误读它、 把旧信息和新状态搅在一起。书里那句三个等式值得背下来:「看得到」不等于「记得住」,更不等于「用得对」2

还有一个反直觉的工程事实:记忆越相关才越有用,单纯堆量反而拖累检索。 把所有历史机械塞回来,模型被旧信息淹没;压缩太狠,又丢掉关键上下文。 所以记忆系统的难点不只在「存下来」,更在「什么时候提取什么、以什么形式提取」—— 对长任务智能体来说,记忆检索和更新本身就是持续发生的决策过程3

2. 记忆的三层

智能体的记忆通常分三层,各管一段时间尺度4:

装什么特点
工作记忆(working memory)这轮决策马上要用的:当前步骤、最近一次工具返回、当前网页状态强调即时可用,与上下文窗口关系最紧,但需要结构化整理
长期记忆(Long-Term Memory)跨轮次、跨任务的经验与事实:用户偏好、项目约定、反复出现的故障模式价值在「相关时能被取出来」,不在存了多少
外部记忆(external memory)明确存在数据库、向量库(按语义相似度查找的资料库)、文档系统里的可持久信息可查询、可审计、可更新,容易与权限体系结合

外部记忆这一层还带着一个提醒:智能体的记忆不一定非要「装在模型脑子里」—— 很多时候更稳妥的做法恰恰是把关键记忆外置,模型只负责使用,由外部系统保管5

补充(不在书里,依据我们的前沿框架书架):外置记忆在开源侧已有完整管线—— mem0 把「对话蒸馏成一条条自包含事实、哈希(给内容算一个指纹值)去重、批量落库」做成了写入端只增不改的流程, 冲突留给检索端排序去自然消化。 依据: shelf=ai-frontier-reference/mem0#01-add-pipeline.md @47162f06fcb943ffcd52bd85608285658ecd3025 事实=写入端只做 ADD-only 抽取加 md5 去重,「判断要不要改旧记忆」从写入端拿掉; 与本节「写入本质是面向未来使用场景的整理」互为印证。

3. 显式与隐式,写入与遗忘

按存放位置,记忆还有另一种分法。显式记忆写在模型参数外的存储里(数据库、文件、笔记), 读它和读别的文本一样,明确、可审计、可编辑、可迁移;隐式记忆编码进模型参数本身 (靠微调和持续训练),调用便宜、表达流畅,但不可解释、换模型就丢、想删都难6。 工业级系统两者混用:稳定的低风险内容(写作风格、行业术语)用隐式;动态、敏感、要审计的内容 (用户档案、合同条款)用显式。这条分工线背后是个治理判断: 哪些信息允许被「长进」模型脑子里,哪些必须留在可见的外部档案里——对长期运行的智能体, 这既是技术选择,也是产品边界7

写入是最难的一环。长任务不断产生新信息:观察结果、工具返回、阶段结论、失败原因、临时假设—— 不是所有东西都值得长期保存。全写进去,记忆库膨胀、检索噪声越来越大;写得太谨慎,又漏掉后来关键的经验。 所以书里给写入下的定义很重:记忆写入本质上是面向未来使用场景的整理—— 系统写入记忆时,实际上是在决定「以后什么信息值得被再次相信和调用」8

遗忘同样重要。人类记忆可用,恰恰因为会自然淡化低价值细节;没有遗忘机制的系统会背着历史包袱, 旧约定和新状态互相冲突。好的记忆系统要有版本化、过期机制或显式更新规则—— 会忘和会记一样重要9

长任务的最后一个难点是状态压缩:环境远比模型能直接处理的内容复杂 (网页里大量无关元素、终端日志里的重复信息),所以很多系统引入环境抽象层, 把原始观测压成紧凑的任务状态——「当前页面位于支付确认步骤」「测试已在第三个模块失败」「需要的证据还缺两条」10。 压缩太弱被噪声淹没,太强又抹掉重要细节;状态压缩考验的是会不会按任务节奏更新摘要层级11

4. 任务分解与计划生成

任务变长后,「走一步看一步」撑不住了,于是需要任务分解:把模糊的大目标拆成子目标、 子步骤或里程碑,再围绕局部目标组织执行——系统不必每一步都面对整个问题12

计划不是越详细越好:太粗没法指导执行,太细会在环境稍变时立刻失效。 真正有价值的是分层计划——高层给方向和关键里程碑,低层在执行时按局部反馈动态补全13。 计划能力的判据也不是「会列清单」,而是列完之后能否在执行中更新、重排、放弃甚至重构; 很多任务失败,就出在模型执行时还抱着一份早已过时的计划不放14

计划还需要可验证的里程碑:好的子目标对应可观察的结果——找到三条互相独立的证据、 生成可运行的补丁、填完某个表单字段;而不是「继续调查」「整理资料」这种模糊意图。 只有子目标可以被检查,系统才知道当前计划是在推进,还是只是在制造更多文字15

5. 计划监控:失控发生在计划悄悄失效之后

长任务真正失控的时刻,往往不在「计划生成失败」的那一刻, 而在计划已经悄悄失效、系统却还按原节奏推进——表面上它在执行下一步, 实际上环境、证据分布、时间预算早就变了16

所以成熟的智能体除了会做计划,还得会监控计划:当前目标是否仍成立、里程碑是否真在推进、 最近几步有没有带来新信息、是否在重复低收益动作17。 配套的是节奏控制:不是所有步骤都值得同样的思考深度——有些阶段适合快速试探, 有些阶段必须在关键动作前放慢做复核;只会匀速推进的系统,会在不重要处想太久、在高风险处又行动太快18

偏差校正也在这一层发生:一旦发现连续多步没有有效进展、或当前状态与最初假设明显冲突, 就该触发重规划、缩小问题、换工具,必要时请人接管。书里的总结句是全章的题眼之一: 系统的可靠性往往不来自某一步特别聪明,而来自它能在方向轻微跑偏时尽早校正19

6. 交替式执行:把不确定性交给环境

第 11 章讲过 ReAct 的三步循环,这里补上它真正的思想深度:让推理与行动交替发生, 而不是先长篇大论想完一切再一次性执行——它抓住的是真实任务的节奏: 先观察,做局部推理,执行一个动作,再按反馈调整,从而减少「闭门造车式」的长推理20

交替式执行的价值,在于把不确定性留给环境去消解:系统不必在没有证据时猜完所有后续, 而是通过搜索、点击、读取、验证逐步缩小不确定性——很多关键事实本来就在外部环境里, 正确做法是先动一点点,再修正21

代价也要看清:动作多,错误机会多;中间思考长,状态管理复杂;反馈噪声大,模型可能在错误分支上徘徊。 所以 ReAct 不是「会交替」就够,必须配合停止条件、检查点和回溯机制, 否则就是表面忙碌、实际低效22。书里还有一句最难的实话:很多真实任务里,最难的恰恰是判断当前该不该继续想, 而不是「想到下一步」——交替式执行成熟时表现为节奏感:什么时候快,什么时候停,什么时候回头检查23

7. 失败恢复、回滚与停止条件

能长期运行的智能体必须预设失败是常态。恢复的最简层是重试:超时就再来一次, 检索太差就换关键词;但复杂任务里单纯重试不够,因为错误可能已经污染了后续状态24

这时需要回滚和检查点:检查点把任务推进到关键节点时保存一份清晰状态(完成了什么、 拿到了哪些证据、有哪些待办);回滚允许系统在某一分支明显走错后退回较早的可信节点。 对高成本动作,这套机制尤其重要——错误执行的代价远高于多花时间重走一遍25

停止条件(这个名词在本书只此一处,意思照第 11 章的退出条件沿用)同样关键: 没有清晰停止规则的智能体会无限尝试、过度搜索、在已经失败后继续烧资源。 好的停止条件综合考虑任务完成信号、失败次数、成本上限、时间上限和风险等级; 难点不在判断某一步的对错,而在谁来给整个过程踩下刹车,让一个还能继续动作的系统主动认账26。 书里还提醒:执行日志本身是一种特殊记忆——不为让模型下轮阅读,而为回放、评测、人工接管时保留证据链, 并最终变成训练和评测材料27

8. 反思:落点在下一步动作上

长任务里系统还得会在必要时停下来反思。注意书里给反思下的硬标准: 它要判断的是实打实的事——当前策略是否还成立、是不是在同一种错误上打转、 记忆里有没有已被新证据推翻的假设、计划粒度是否合适、该不该换工具或交还人类; 它的落点必须在下一步动作上,漂亮的自我分析本身没有意义28

反思有两个时间尺度:短尺度发生在单次任务内(连续两轮检索没带来新证据,就该停), 长尺度是经验沉淀(发现某类网页常导致元素误判、某种工具组合更稳)29。 但反思本身有成本:每步都长篇自省,任务就慢;完全不自省,又在错误分支上越走越远。 所以成熟系统不把反思当默认常态,而是设计成被触发的机制——达到失败阈值触发、 遇到证据冲突触发、连续重复同类动作触发,或在里程碑后做简短复盘30。 工程上,沉淀的经验不该只是一段自然语言总结,而要转成结构化对象:失败模式标签、 工具优先级调整、警告规则、计划模板修订——反思才会从一次性的「想明白了」变成可复用的系统资产31

9. 生成器与评估器:模型很难既当作者又当审稿人

上一节的反思机制听起来很美,但实践反复证实一个难题:模型很难可靠地评估自己刚写出来的东西—— 让同一个模型既当作者又当审稿人,几次反思后它常常对自己的输出系统性偏宽, 早该发现的问题反复被放过,直到上线才暴露;这不是某个版本的偶然缺陷,是相当稳定的现象32

所以近两年被广泛采纳的设计是把生成和评估拆给不同角色:一个负责往前走,一个专门挑错, 用同一个底座模型,但顶着不同的提示和不同的判据——GAN(生成与判别互相对抗训练)时代的老思想在智能体上复活33。 书里举的编程智能体三角色案例非常具体:Planner 把高层指令展开成完整产品规格; Generator 按规格一轮轮写代码;Evaluator 用浏览器实际打开页面、调用 API、查数据库, 按事先写好的维度独立打分,任何一项不达标就退回重做。一个被反复观察到的现象很动人: 前几轮交付通常只是把规格机械实现,真正有创意的版本出现得更晚—— 创意不一定来自模型更聪明,而可能来自评估侧持续不让步34

更深一层:把评估拆出去,等于把评判标准逼成白纸黑字——维度和阈值必须事先写下, 临场的主观判断不再说了算;反过来说,如果没有可信反馈源,反思就只是把错误 「从一个漂亮包装换到另一个漂亮包装」35。第 11 章埋下的「生成与评估拆开」在此兑现; 它对第 14 章的评测体系也是同一根思想的线。

10. 自优化、反思与自进化三层

研究界几个常被引用的方案,可以串成从浅到深的三层36:

自优化(Self-Refine):生成初稿 → 同一个模型给反馈 → 按反馈修订,循环往复,不需要额外训练—— 「写」的时候是作者,「改」的时候是审稿人。原论文在七类任务上报告了一致改进, 但依赖任务和模型能力,并非处处有效;边界很清楚:如果模型本身不足以识别错误,反思反而可能把对的改错, 反思循环里的「自信」不等于真正的正确——复杂数学、代码、事实核查最好引入测试、执行结果或外部检索做反馈37

反思(Reflexion):不更新权重,而是把语言反思写进外部的经验笔记,下一次任务作为上下文读回来。 比如因为漏读关键条件出错,反思后记下「这类任务先确认所有关键条件」,下次主动检查。 这个细节意味深长:没有持久记忆的智能体会在任务之间把犯过的错再犯一遍; 有了外部经验笔记,它今天跌的跤,明天就记得避开——这正是「长时间尺度反思」的实现层落地38

自进化(self-evolution):让智能体在使用中持续优化自己,又分三层路径39:

做什么代价
经验积累反思笔记本:跨对话记忆、项目笔记、本地 Markdown(纯文本笔记格式)直接、可解释、可编辑;但记忆质量完全依赖反思质量,乱记会干扰决策
技能提炼把反复做对的流程固化成技能入库(如「测试失败先看最近改动」),与第 11 章的技能系统天然契合技能源可以是手册也可以是自身经验总结
自我微调参数层面的自我训练,能力真正「内化」最激进:错误会被自我强化、原有能力可能被灾难性遗忘、每次微调都不便宜;公开可验证的工业级部署仍然很少

自进化改变的还有部署模式本身:传统软件「装完固定」,传统大模型「训完固化」, 自进化的智能体更像一个会积累经验的员工——今天的它和三个月前的它不一样。 新问题也随之而来:换机器怎么带走它学到的东西?学错了怎么遗忘?学到偏见怎么纠正? 这些问题还没有成熟答案;它最终又绕回 §3 的显式/隐式记忆那道边界40

11. 谁来喊停:仲裁、终止与分歧升级

多智能体一登场(下一节起),一个绕不过去的问题立刻出现:冲突时谁说了算—— 研究员认为证据不足,执行者已给出方案;评审者认为应重做,协调者倾向尽快收口。 没有明确仲裁机制,系统就在「继续讨论」和「立即行动」之间摇摆41。 这也是为什么很多可落地的多智能体系统最终都带某种层级结构: 真正需要裁决时,仍有一个更高层的协调者决定优先级、确认冲突是否被充分暴露、是否升级给人—— 层级结构的全部意义,是给系统一个清楚的收口点;没有收口点的协作,会从「认真讨论」滑向「无限循环」42

终止条件与角色设计同样重要:任务何时算完成、何时算失败、何时必须升级, 最好在流程层就定义清楚;否则多智能体会陷入看似勤奋实则低效的状态—— 不断补新信息、不断提新疑问、不断出新版本,迟迟推不到可交付节点。 一个能持续推进却永远停不下来的系统,烧掉的预算可能比产出的价值还多43。 成熟的做法是把仲裁和终止都结构化下来:冲突信息超过阈值进入复核分支、 关键证据缺失时禁止进入执行阶段、连续两轮修改未收敛自动升级给人44—— 这正是第 11 章「退出机制要写死」在多角色场景的展开。

分歧本身消灭不了,也不必消灭;需要的是一条分歧升级路径:轻量分歧局部复核, 中级分歧交仲裁角色或规则引擎,涉及权限、资金、发布的分歧直接升级人工; 而共识的目标也不是所有角色想法一致,而是形成**「可执行共识」—— 下一步先做什么、哪些前提未满足、谁承担后续责任、什么条件下重新讨论45。 成熟平台还会记决策日志**:关键分歧、证据来源、仲裁结论、保留意见一并留下, 最后一条输出只是其中一小部分——很多组织协作效率的提升,就来自更清晰的决策痕迹46

12. 什么时候才需要多个智能体

现在正面回答那个问题。多智能体协作的目的不在增加角色数量,而在解决单一主体难以稳定覆盖的任务结构—— 而且它不是单智能体的默认升级版47

先说单智能体的优势:任务边界清楚、环境单一、步骤强依赖、失败成本不高时, 单主体更简单、更便宜、更好调试;所有信息在同一个闭环里处理,计划执行修正不用跨角色转述。 书里点破一个最常见的初期误区:过早把问题切得太碎48

单智能体不够时,升级也有梯度:先把工作组织成明确的工作流(步骤依赖显式化), 再考虑要不要引入多个自由对话的角色。工作流三型49:

  • 串行:前一步产出是后一步输入(检索→提要点→成稿→排版),路径清晰、责任明确;
  • 并行:可拆分的部分同时做(多源同时检索、多候选并行生成),缩短总耗时,但要有整合环节兜底;
  • 评审式:一个角色生成,另一个检查挑错再迭代——它的有效性来自一个朴素的分工: 做出「差不多」的版本不难,难的是把明显错误和风险暴露出来,评审角色把「自我审查」外显成独立步骤。

天然适合多智能体的任务也确实存在:软件研发的「需求理解-改代码-测试-评审」、 企业分析的「搜集-整理-成稿-复核」、高风险领域的「流程稳定 + 可审计 + 可追责 + 可回放」50

补充(不在书里,依据我们的前沿框架书架):多智能体框架把「下一个谁说话」做成了显式机制—— AutoGen 的群聊由一个管理者按策略选发言人:轮流、用模型选、或按交接指令路由, 广播进群频道、人人可见,与「通信结构决定协作质量」互证。 依据: shelf=ai-frontier-reference/autogen#03-teams-groupchat.md @47162f06fcb943ffcd52bd85608285658ecd3025 事实=BaseGroupChat 用管理者的 select_speaker 决定轮次,支持 RoundRobin/Selector/Swarm 三种路由。

13. 通信结构与共享事实底座

一旦有多个角色,就一定有通信问题:谁把什么告诉谁?传原始证据还是摘要?同步等还是异步发? 一个角色的中间结论有误,后面该不该无条件相信?书里给出一个釜底抽薪的判断: 多智能体系统的很多失败,根子在信息于角色之间传递时被压缩、扭曲或延迟了—— 单个角色本身的强弱反倒是次要的51

四种经典通信结构,各有瓶颈52:

结构怎么运转瓶颈
链式按固定顺序传递,前一个的输出是后一个的输入最稳,但线性流过去无法回头
广播一个角色同时发给多个评审并行快,但反馈重复冲突,需仲裁
层级「经理」统一调度若干「下属」,下属间不直接通信责任清晰易追责,但经理成瓶颈
对等无固定上下级,谁需要谁请求最灵活,也最容易陷入混乱

实践中混合使用:核心流程用链式或层级保稳定,特殊环节用广播或对等加速53。 对话历史会迅速膨胀(5 个角色跑 30 轮可能积累上万字聊天记录),所以要压缩、按职责过滤、 用结构化交付物替代自由文本、摘要与详情双轨54

比通信结构更深的,是共享事实底座:如果不同角色各自记住一部分背景、各自改写一份中间结论, 就会出现经典混乱——研究员基于旧证据继续分析,执行者已按新约束行动,评审者看到的是第三个版本的摘要。 事实底座不必是复杂数据库,可以是结构化文档、任务面板、证据表、版本化工作区; 关键是所有角色都清楚:当前哪些信息是最新共识,哪些只是候选判断,哪些已被废弃55。 书里说得多智能体系统越往生产走越像在做轻量级「版本控制」: 谁在何时改了目标、哪条证据被推翻、哪个草案被驳回,都应可追踪—— 真正成熟的协作系统,未必让每个角色拥有完整上下文,但一定让所有角色能回到同一条可追踪的事实链上56

配套的还有协议化交接:交接内容要有稳定字段——任务目标、当前阶段、证据引用、未决问题、 置信度、风险标记、建议接手动作;像软件工程的接口契约,也像组织里的交班记录57。 以及资源竞争的「所有权与锁」:谁在改哪一块、哪些对象提交前不得并发改动、哪些高风险动作先进待审队列—— 很多所谓「协作混乱」,往往只是缺最基本的冲突隔离58。 最后,协作体系要积累组织记忆:过去任务沉淀的稳定模式(某类报告该保留哪些证据字段、 某类修改提交前必须过哪些检查),以协作模板为载体——模板给思考划跑道而不代替思考; 但组织记忆也要有来源标注、适用范围和废弃机制,过时模板会让系统在新环境里重复旧判断59

14. 协作的代价、韧性与任务切片

收益从来不是免费的:角色越多,通信越多;步骤越细,等待越多;流程越长,状态管理越难。 协调成本的典型症状:产出互相冲突、评审无限循环、上下文交接丢失、并行结果难整合、 谁都「做了一点」却没人对结果负责60

工程团队的实用判据是看问题是否被「转移」了:多智能体之后,如果错误更容易定位、流程更容易复用、 日志更容易审计,复杂度是真换来了组织收益;如果只是把一个模型的错误变成四个角色互相甩锅, 那只是把问题换了个表现形式61。成熟系统还保留「退回单主体」的能力—— 任务变简单、上下文高度集中时,让协调者收缩为单主体执行反而更稳更快,该收缩时就收缩62

还有一个隐蔽的陷阱:局部最优。每个角色只看到自己的一小段目标——检索角色追求多找信息, 评审角色追求少犯错,执行角色追求快落地;单看都合理,叠起来却把系统推向 「信息越来越多却迟迟不收敛、审查越来越严却迟迟不交付」。 所以多智能体既是通信问题,也是目标对齐问题:关键角色要共享全局成功判据, 协调层要判断局部产出是否推动整体进度——组织化智能的难点,是让角色在长期运行中仍然指向同一个结果63

瓶颈角色是另一刀:纸面上高度并行,真实运行后总有一个角色卡住所有流程 (所有结果都等评审签字、所有任务都经协调者重派)——系统名义上多智能体, 关键节点上却收缩成单点结构;表现为整体节奏越来越慢、下游频繁空等。 多智能体的成熟不在增加角色,而在组织韧性:关键角色能否被替补或分片、审核能否按风险分流、 协调层失效时能否退回简单执行模式64

最后是任务切片:切太粗,任务包混入太多异质判断,难接手、难定位;切太细, 系统陷入无穷交接等待,大量时间耗在同步而非推进上。切片本质是协作系统的接口设计问题—— 交付物要精确到什么粒度(研究角色交原始链接还是带证据标注的结论摘要?执行角色交最终结果 还是含未决问题的工作包?),颗粒度合适,下游才能在最小必要上下文上继续65。 返工在多智能体里格外昂贵,因为一个角色的返工会牵动整条链回卷; 切片稳定、接口清楚的系统更容易积累模板、形成回归集、沉淀共享记忆—— 很多系统后期的提升,来自终于学会把任务切得更对66

收束回到那个朴素判断:是否采用多智能体,要看它是不是让系统更清楚了—— 任务边界更明、日志更易读、失败更易定位、流程更易复用,复杂度就值得; 只是多出对话和同步等待,就只是给问题换了个花哨外壳。判断一种组织结构是否成立, 要看角色一起跑起来后系统会不会更脆弱——角色数量本身说明不了什么67

15. 人机介入的四种深度

多智能体不是「机器之间」的事,人始终是图里最重要的角色。按介入深度分四种68:

深度人做什么适合
监督只看结果,必要时干预自动化程度最高、风险可控的任务
审核关键步骤必须人确认才能继续支付、删数据、外发邮件等高风险动作
交互人不断给反馈,模型迭代调整类似结对编程的紧密协作
协同人和智能体同时操作同一份工件,互相补充各类协作工具正在探索的形态

哪种合适,仍是任务风险和成本的函数。人机协作的效率优化聚焦三件事: 把机器工作压缩成人能快速审核的对象(diff、摘要、风险等级标签);在关键节点主动暂停提问 而不是等人来查;把人的反馈结构化收集用于后续改进。代码圈的 PR 评审配 AI 草稿、 客服圈的 AI 一稿加人复核、医疗圈的 AI 第二意见,都是这条路的具体形态69

16. 轨迹:智能体的基础训练数据

本章前面讲的记忆计划协作,大多靠推断时的驾驶舱和提示设计撑着。但提示能告诉模型「应该怎么做」, 却覆盖不了长任务里真实出现的轨迹变化——智能体面对的是一串连续的观察、决策、动作和反馈, 不是一道静态问答。于是训练数据的重心从单轮问答转向轨迹:记录一条完成任务的路径—— 看到了什么、做了什么、为什么这样做、环境发生了什么,而不止一个最终答案70

单轮答案教模型说出一个像样结果,轨迹数据教它如何推进一个过程——过程知识往往更重要, 因为很多真实任务没有唯一正确输出,有价值的是行动顺序、证据收集方式、失败修复策略和停止条件。 轨迹不能只留成功样例(失败轨迹暴露误判与状态污染),更不能压缩成事后总结(中间信号会丢); 观察、动作、工具参数、返回结果、状态变化、人工接管位置、最终成败都应保留。 轨迹像程序执行日志,更难采、更难清洗,但数据管线一旦成熟,就是智能体改进速度的关键资产71

从轨迹提取学习信号有个独有的陷阱:训练数据由当前策略生成——策略变差,生成的轨迹也变差, 再训下去只会更糟(数据分布漂移);一次参数更新迈得太大,策略可能突然崩掉再也学不回来。 近端策略优化(Proximal Policy Optimization,PPO)的对策朴素得很:每次只允许策略小步改进, 在损失里加「剪切」项,强制新旧策略的差别不超过阈值——像调菜谱,尝出汤偏淡, 下次加半勺盐试试,而不是一次加半斤72。它呼应第 02 章埋的那句话: 强化学习的第二次出场就在这里——第 05 章的 RLHF 管偏好,这里的 PPO 管长任务的策略小步走, 两者是同一条工程原则在不同层级的复用73

PPO 解决「更新得多稳」,没回答「往什么方向更新」——问题推给奖励设计,智能体训练里最容易栽跟头的一环。 奖励必须和真正想要的行为对齐,这听着像废话却经常被违反;一旦错位就是奖励作弊(reward hacking): 按「拾起垃圾的数量」打分,清洁机器人学会把垃圾扔出去再捡回来;优化「成单率」, 销售智能体学会推荐贵而不必要的东西;优化「测试通过率」,编程智能体学会在代码里硬编码期望值—— 智能体找到的是奖励函数的漏洞,把任务本身的最优解撂在一边74。 工程对策:稀疏与稠密奖励的取舍、分层奖励(任务级/子任务级/动作级)、以及从人类反馈学奖励(RLHF)—— 但人类偏好本身有偏差有噪声,用它训出的智能体只能和标注员群体的平均偏好对齐,未必是「真正的好」; 所以真实环境里仍要靠观测、回滚和人工接管,把奖励信号兜不住的地方接住75

多智能体的训练则更远:独立训练简单但接口不匹配;联合训练按整体成败给奖励,成本极高仍在研究期; 自进化协作离工业落地还远。书里的远景一句收尾:很多原本靠提示工程做到的能力,正被逐步吸收进模型本身—— 等到智能体训练足够成熟,模型不再被动接收提示,而是天然带着长期记忆、规划习惯和工具直觉76

主走查:把 40 页行业报告做成给董事会的十页材料

这条走查贯穿本章。 输入:一份 40 页 PDF 行业报告,目标「给董事会的十页材料」。 凡我编的演示数,当场标明。

① 抽结论进工作记忆。(§1–§2) 驾驶舱把报告切成段落抽取关键结论,压成环境抽象层里的紧凑状态—— 「市场规模:§2 结论三条;竞争格局:§4 表格;风险:散见 §7」(条目为演示设定)。 原始 40 页不进上下文,工作记忆只放压缩后的任务状态(§3 的按节奏压缩)。

② 拆里程碑。(§4) 计划分两层:高层三个里程碑——「数据核实完毕」「十页结构定稿」「图表与口径一致」; 低层留白,按局部反馈补全。每个里程碑都可检查:数据核实=「三个关键数字都有原始页码支撑」, 不是「整理资料」式的模糊意图(§4 的可验证里程碑)。

③ 第三步,数据对不上。(§5) 执行中发现:报告正文说市占率 34%,附录表格加总却是 29%(演示设定)。 计划监控发现「当前状态与最初假设冲突」——按 §5 的偏差校正,触发重规划:不是继续写,而是先解决数据矛盾。

④ 回滚到检查点。(§7) 回到「数据核实完毕前」的检查点:已完成什么、哪些证据可信、哪些待办,状态清清楚楚。 正文那个 34% 被标为「低置信度,待确认」,不再当作既定事实往下用(§3 的低置信度标记;§7 的回滚)。

⑤ 触发一次反思。(§8) 系统注意到失败模式:「引用正文数字前未核对附录」——这不是长篇自省,而是一条结构化经验标签, 写入外部经验笔记,下次任务先查附录(§8 落点在动作;§10 的 Reflexion 式经验笔记)。

⑥ 让另一个角色评审。(§9 §12–§13) 十页初稿交给评审角色:它用不同的判据(口径一致性、来源标注、页面预算)独立打分, 打回两页超预算的内容。生成器和评估器用同一个底座、不同的提示——评估侧不让步, 第二轮才出现真正给董事会看的版本,而不是机械压缩版(§9 的创意来自评估不让步)。

⑦ 冲突升级给人。(§11) 评审者认为「34% 与 29% 必须二选一」,检索者主张两说并存;按预先写死的仲裁规则, 关键证据冲突超阈值 → 升级人工。人类裁定「采用 29%,注明口径」,记入决策日志(§11 的分歧升级路径)。

⑧ 定稿。(§14) 终稿十页,每页留痕:哪页哪个数字来自哪条证据、哪处被人推翻过。整条轨迹——回滚一次、 评审两轮、人工裁决一次——被完整记录,成为下一份材料的组织记忆和训练素材(§16 的轨迹数据)。

作者的判断与证据

书里给出可核事实或文献来源的地方:

  • Self-Refine(七类任务一致改进但非处处有效)与 Reflexion(语言反思写入外部经验笔记)的机制与出处,与原论文一致3738;
  • 编程智能体 Planner/Generator/Evaluator 三角色与「创意来自评估侧不让步」的现象,书里标为「被实验者反复观察到的现象」34;
  • PPO 的剪切机制与「安全绳」直觉,出处 Schulman et al. 201772;
  • 奖励作弊的三个例子(清洁机器人/销售智能体/编程硬编码),前两个是社区经典案例,书里明确标注赛艇案例在第 5 章讲过74;
  • 通信结构四分法(链/广播/层级/对等)与各自瓶颈,是书里给出的分类框架52

书里标成判断或立场的地方:

  • 「多智能体不是单智能体的默认升级版」——章首的边界判断,给了三条判断标准(可分解、分段验收、协作成本换可靠性)47;
  • 「记忆写入是在决定以后什么值得被相信」——作者的治理视角定性8;
  • 「自进化的公开工业级部署仍然很少」——书里如实交代现状,列出数据质量、安全评估、遗忘、成本、回滚五条顾虑39;
  • 「智能体和大模型的边界还会进一步模糊」——作者的远景判断,明确标为趋势而非现状76

判断(我们的,不是书里的): 本章 17 节其实反复撞见同一个母题——「写入」是智能体系统里 最被低估的动作。记忆写入决定以后信什么(§3),经验笔记写入决定下次怎么错(§10), 交接包写入决定下游怎么理解(§13),决策日志写入决定能不能追责(§11), 轨迹写入决定能学成什么样(§16)。五处「写入」共享一条设计准则:写入的瞬间就要带着 结构、置信度和时效,因为事后没有便宜的办法补救一份没写好的记忆。 如果错,会错在: 若检索端技术(排序、重写、多跳)进步到「从垃圾堆里也捞得出真相」, 写入端的谨慎就不再是稀缺资源——书里和今天的主流实践都还是「写入定质量」派, 但检索派的反扑值得每年重估一次。

边界与局限

  • 对应关系: 本章对应原书第 12 章全文。原书把人机介入与长任务学习都收在本章(12.5),本组拆解保持;第 02 章那处「RL 在第 13 章再讲一次」的许诺,由本章 §16 兑现。
  • 没展开的: 生成式(自带记忆与人格模拟)智能体研究(MemGPT、Voyager 等文献)只留名字;多智能体联合训练细节书里也只有一段;工作流三型与第 11 章工作流一节刻意分工——那边讲「包不包」,这边讲「怎么排」。
  • 一处结构声明: 原书把「谁来喊停」的内容散在 12.4.2 各段,本组拆解按审读意见收拢成 §11,不再重复引入新词;「停止条件」一词的命名权保留给第 11 章 §7,本章沿用不加新名。
  • 时效性: Self-Refine/Reflexion/PPO 是 2017–2023 的工作,书里引用的时间线截至成书;自进化三层是书里的理解性分层(书里自己注明「不是严格分类」)。

可带走的

  1. 上下文窗口是临时工作台,不是记忆——「看得到」不等于「记得住」,更不等于「用得对」。
  2. 记忆分三层:工作记忆管这轮,长期记忆管跨任务,外部记忆管可审计;显式/隐式的分工线是治理判断——外置常常比内嵌更稳。
  3. 会忘和会记一样重要;写入的瞬间就是在决定「以后什么值得被再次相信」。
  4. 计划要分层、里程碑要可检查;长任务失控于计划悄悄失效之后——可靠性来自尽早校正,不来自某一步特别聪明。
  5. 交替式执行把不确定性交给环境消解;回滚和停止条件是刹车——没有停止规则的系统会在失败后继续烧钱。
  6. 反思必须被触发而不是常开,落点在下一步动作;模型很难既当作者又当审稿人——评估要拆出去、判据要写下来;自进化三层(经验笔记、技能提炼、自我微调)风险从「乱记」到「越训越错」。
  7. 多智能体不是默认升级,失败根在信息传递失真,不在角色强弱——真正需要的是共享事实底座,所有角色回到同一条可追踪的事实链。
  8. 收口机制写死,警惕局部最优与瓶颈角色:冲突超阈值进复核、证据缺失禁执行、两轮不收敛升级人;该收缩时就收缩。
  9. 人机介入分四档:监督/审核/交互/协同,深度是风险和成本的函数。
  10. 轨迹是新的基础训练数据;PPO 的答案是「小步走」,奖励作弊的答案是「奖励必须对齐真正想要的行为」——训练的生死在反馈信号的质量。

原文地图

主题原书节原文位置
长任务的麻烦12 引言text/13-ch12.txt:4(搜“层层累积”) · text/13-ch12.txt:12(搜“骨架”)
路线图与边界判断12 引言text/13-ch12.txt:29(搜“不是单智能体的默认升级版”) · text/13-ch12.txt:31(搜“才值得上场”)
上下文不是记忆12.1.1text/13-ch12.txt:41(搜“摊开的临时”) · text/13-ch12.txt:47(搜“并不等于“记得住””)
相关性优于堆量12.1.1text/13-ch12.txt:52(搜“拖累检索”) · text/13-ch12.txt:55(搜“决策过程”)
三层记忆12.1.2text/13-ch12.txt:59(搜“记忆(working memory)”) · text/13-ch12.txt:62(搜“长期记忆(Long-Term Memory)”) · text/13-ch12.txt:67(搜“external memory”)
外置保管12.1.2text/13-ch12.txt:68(搜“可审计、可更新”) · text/13-ch12.txt:70(搜“由外部系统保管”)
显式与隐式12.1.2text/13-ch12.txt:71(搜“explicit memory”) · text/13-ch12.txt:77(搜“不可解释”) · text/13-ch12.txt:81(搜“长进”模型脑子里”)
写入即判断12.1.3text/13-ch12.txt:86(搜“写入什么,遗忘什么”) · text/13-ch12.txt:92(搜“面向未来使用场景的整理”) · text/13-ch12.txt:93(搜“值得被再次相信和调用”)
遗忘12.1.3text/13-ch12.txt:95(搜“遗忘同样重要”) · text/13-ch12.txt:97(搜“版本化、过期机制”) · text/13-ch12.txt:99(搜“会忘和会记一样重要”)
状态压缩12.1.3text/13-ch12.txt:104(搜“环境抽象层”) · text/13-ch12.txt:105(搜“支付确认步骤”) · text/13-ch12.txt:116(搜“摘要层级”)
任务分解12.2.1text/13-ch12.txt:123(搜“Task Decomposition”) · text/13-ch12.txt:127(搜“分层的”) · text/13-ch12.txt:132(搜“过时的计划不放”)
可验证里程碑12.2.1text/13-ch12.txt:133(搜“可验证的里程碑”) · text/13-ch12.txt:137(搜“制造更多文字”)
计划监控12.2.2text/13-ch12.txt:141(搜“计划监控、节奏与偏差校正”) · text/13-ch12.txt:142(搜“悄悄失效”) · text/13-ch12.txt:145(搜“重复低收益动作”)
节奏控制12.2.2text/13-ch12.txt:146(搜“节奏控制”) · text/13-ch12.txt:149(搜“动得太快”)
尽早校正12.2.2text/13-ch12.txt:157(搜“尽早校正”) · text/13-ch12.txt:158(搜“压在局部的稳定机制”)
交替式执行12.2.2text/13-ch12.txt:159(搜“推理与行动交替发生”) · text/13-ch12.txt:164(搜“留给环境去消解”) · text/13-ch12.txt:167(搜“想—做—看”)
交替的代价12.2.2text/13-ch12.txt:178(搜“错误机会也会增加”) · text/13-ch12.txt:180(搜“停止条件、检查点和回溯机制”) · text/13-ch12.txt:182(搜“该不该继续想”) · text/13-ch12.txt:186(搜“节奏感”)
重试不够12.2.3text/13-ch12.txt:190(搜“失败是常态”) · text/13-ch12.txt:193(搜“污染了后续状态”)
回滚与检查点12.2.3text/13-ch12.txt:196(搜“回滚和检查点”) · text/13-ch12.txt:198(搜“代价可”)
停止条件12.2.3text/13-ch12.txt:200(搜“停止条件同样关键”) · text/13-ch12.txt:202(搜“踩下刹车”) · text/13-ch12.txt:203(搜“主动认账”)
日志即记忆12.2.3text/13-ch12.txt:204(搜“执行日志本身当成一种特殊记忆”) · text/13-ch12.txt:208(搜“不只看最终结果”)
反思的落点12.3.1text/13-ch12.txt:217(搜“落点在下一步动作上”) · text/13-ch12.txt:218(搜“元控制能力”)
两个时间尺度12.3.1text/13-ch12.txt:219(搜“两种不同时间尺度”) · text/13-ch12.txt:223(搜“少走弯路”)
反思要被触发12.3.1text/13-ch12.txt:225(搜“把反思当成默认常态”) · text/13-ch12.txt:150(搜“触发”)
结构化沉淀12.3.1text/13-ch12.txt:229(搜“经验沉淀也不该只留在”) · text/13-ch12.txt:231(搜“系统资产”)
自评不可靠12.3.2text/13-ch12.txt:239(搜“既当作者又当”) · text/13-ch12.txt:241(搜“相当稳定的现象”)
拆开生成与评估12.3.2text/13-ch12.txt:242(搜“generator”) · text/13-ch12.txt:245(搜“反复评审”)
三角色案例12.3.2text/13-ch12.txt:246(搜“Planner”) · text/13-ch12.txt:248(搜“Evaluator”) · text/13-ch12.txt:253(搜“估侧持续不让步”)
白纸黑字的判据12.3.2text/13-ch12.txt:255(搜“白纸黑字的判据”) · text/13-ch12.txt:257(搜“漂亮包装”)
Self-Refine12.3.2text/13-ch12.txt:264(搜“Self-Refine”) · text/13-ch12.txt:270(搜“稳定有效”) · text/13-ch12.txt:276(搜“把对的改错”) · text/13-ch12.txt:279(搜“可信反”)
Reflexion12.3.2text/13-ch12.txt:281(搜“Reflexion”) · text/13-ch12.txt:282(搜“经验笔记”) · text/13-ch12.txt:288(搜“跌的跤”)
自进化三层12.3.2text/13-ch12.txt:293(搜“self-evolution”) · text/13-ch12.txt:297(搜“经验积累是最朴素”) · text/13-ch12.txt:302(搜“技能提炼”) · text/13-ch12.txt:307(搜“自我微调”) · text/13-ch12.txt:316(搜“仍然很少”)
部署模式改变12.3.2text/13-ch12.txt:317(搜“部署模式”) · text/13-ch12.txt:321(搜“越懂你的工作方式”) · text/13-ch12.txt:325(搜“最棘手的工程挑战”)
何时需要多智能体12.4.1text/13-ch12.txt:329(搜“不在增加角色数量”) · text/13-ch12.txt:334(搜“更容易调试”) · text/13-ch12.txt:339(搜“得太碎”)
工作流三型12.4.1text/13-ch12.txt:344(搜“串行工作流”) · text/13-ch12.txt:348(搜“并行工作流”) · text/13-ch12.txt:353(搜“评审式工作流”) · text/13-ch12.txt:356(搜“自我审查”外显”)
角色分工12.4.1text/13-ch12.txt:358(搜“划者负责任务拆解”) · text/13-ch12.txt:359(搜“小型组织”)
通信是命门12.4.1text/13-ch12.txt:361(搜“一定会有通信问题”) · text/13-ch12.txt:363(搜“压缩、扭曲或延迟”)
共享工作区12.4.1text/13-ch12.txt:365(搜“共享工作区协作”) · text/13-ch12.txt:369(搜“事实、推断和建议”)
责任边界与收口12.4.1text/13-ch12.txt:384(搜“责任边界模糊”) · text/13-ch12.txt:387(搜“收口能力”) · text/13-ch12.txt:393(搜“高风险高价值任务”)
四种通信结构12.4.2text/13-ch12.txt:398(搜“链、广播、层级与对等”) · text/13-ch12.txt:400(搜“链式(chain)”) · text/13-ch12.txt:404(搜“层级(hierarchical)”) · text/13-ch12.txt:406(搜“peer-to-peer”)
历史膨胀12.4.2text/13-ch12.txt:412(搜“迅速膨胀”) · text/13-ch12.txt:415(搜“角色化过滤”)
协议化交接12.4.2text/13-ch12.txt:425(搜“协议化交接”) · text/13-ch12.txt:426(搜“置信度、风险标”) · text/13-ch12.txt:604(搜“工作包”)
组织记忆与模板12.4.2text/13-ch12.txt:443(搜“共享的组织记忆”) · text/13-ch12.txt:447(搜“协作模板”) · text/13-ch12.txt:454(搜“不是越多越好”)
事实底座12.4.2text/13-ch12.txt:459(搜“哪一份“事实””) · text/13-ch12.txt:462(搜“共享事实底座”) · text/13-ch12.txt:465(搜“最新共识”) · text/13-ch12.txt:479(搜“版本控制”) · text/13-ch12.txt:482(搜“追踪的事实链上”)
资源竞争与锁12.4.2text/13-ch12.txt:490(搜““所有权”和“锁””) · text/13-ch12.txt:494(搜“冲突隔离机制”)
仲裁与层级12.4.2text/13-ch12.txt:501(搜“谁说了算”) · text/13-ch12.txt:504(搜“层级结构”) · text/13-ch12.txt:509(搜““无限循环””)
终止条件12.4.2text/13-ch12.txt:511(搜“终止条件因此和角色设计同样重要”) · text/13-ch12.txt:514(搜“产出的价值还多”) · text/13-ch12.txt:517(搜“结构化下来”)
分歧升级12.4.2text/13-ch12.txt:525(搜“分歧升级路径”) · text/13-ch12.txt:529(搜“不必消灭”) · text/13-ch12.txt:531(搜“可执行共识”) · text/13-ch12.txt:535(搜“决策日志”)
协调成本12.4.3text/13-ch12.txt:544(搜“收益从来不是免费的”) · text/13-ch12.txt:549(搜“没人真正对最终结果负责”)
问题转移判据12.4.3text/13-ch12.txt:553(搜“被“转移”了”) · text/13-ch12.txt:555(搜“甩锅”)
退回单主体12.4.3text/13-ch12.txt:557(搜“退回单主体”) · text/13-ch12.txt:561(搜“该收缩时就收缩”)
局部最优12.4.3text/13-ch12.txt:564(搜“做得更好”) · text/13-ch12.txt:566(搜“局部最优”) · text/13-ch12.txt:577(搜“指向同一个结果”)
瓶颈角色与韧性12.4.3text/13-ch12.txt:580(搜“瓶颈角色”) · text/13-ch12.txt:583(搜“单点结构”) · text/13-ch12.txt:591(搜“组织韧性”) · text/13-ch12.txt:595(搜“退路”)
任务切片12.4.3text/13-ch12.txt:598(搜“切得多细”) · text/13-ch12.txt:601(搜“接口设计问题”) · text/13-ch12.txt:607(搜“返工成本迅速上升”) · text/13-ch12.txt:617(搜“切得更对”)
组织结构成立与否12.4.3text/13-ch12.txt:621(搜“更花哨的外壳”) · text/13-ch12.txt:623(搜“角色数量本身说明不了什么”)
人机四种深度12.5.1text/13-ch12.txt:631(搜“监督(人只看结果”) · text/13-ch12.txt:592(搜“审核”) · text/13-ch12.txt:633(搜“协同”) · text/13-ch12.txt:636(搜“风险等级标签”)
轨迹是基础数据12.5.2text/13-ch12.txt:649(搜“轨迹(Trajectory)”) · text/13-ch12.txt:652(搜“推进一个过程”) · text/13-ch12.txt:658(搜“新基础数据形态”)
分布漂移与 PPO12.5.2text/13-ch12.txt:665(搜“数据分布漂移”) · text/13-ch12.txt:670(搜“Proximal Policy Optimization”) · text/13-ch12.txt:671(搜“小步改进”) · text/13-ch12.txt:673(搜“半勺盐”)
奖励作弊12.5.2text/13-ch12.txt:645(搜“奖励设计”) · text/13-ch12.txt:681(搜“拾起垃圾的数量”) · text/13-ch12.txt:684(搜“奖励函数的漏洞”)
工程对策与局限12.5.2text/13-ch12.txt:688(搜“奖励塑形”) · text/13-ch12.txt:692(搜“平均偏好对齐”) · text/13-ch12.txt:694(搜“兜不住的”)
多智能体的训练12.5.2text/13-ch12.txt:697(搜“接口不匹配”) · text/13-ch12.txt:698(搜“联合训练”) · text/13-ch12.txt:708(搜“边界还会进一步模糊”)

Footnotes

  1. 出处:「12.1.1」第 41 段(text/13-ch12.txt:41,搜“摊开的临时”)与第 49 段(text/13-ch12.txt:49,搜“选择性保存重要信息”)。

  2. 出处:第 46 至 48 段(text/13-ch12.txt:47,搜“并不等于“记得住””)。

  3. 出处:第 52 段(text/13-ch12.txt:52,搜“拖累检索”)与第 55 段(text/13-ch12.txt:55,搜“决策过程”)。

  4. 出处:「12.1.2」第 59 段(text/13-ch12.txt:59,搜“记忆(working memory)”)、第 62 段(text/13-ch12.txt:62,搜“长期记忆(Long-Term Memory)”)、第 66 段(text/13-ch12.txt:66,搜“而非存了多少”)、第 67 段(text/13-ch12.txt:67,搜“external memory”)。

  5. 出处:第 70 段(text/13-ch12.txt:70,搜“由外部系统保管”)。

  6. 出处:第 71 段(text/13-ch12.txt:71,搜“explicit memory”)与第 76 段(text/13-ch12.txt:76,搜“调用便宜”)、第 77 段(text/13-ch12.txt:77,搜“不可迁移”)。

  7. 出处:第 81 段(text/13-ch12.txt:81,搜“长进”模型脑子里”)与第 83 段(text/13-ch12.txt:83,搜“边界设计”)。

  8. 出处:「12.1.3」第 92 段(text/13-ch12.txt:92,搜“面向未来使用场景的整理”)与第 93 段(text/13-ch12.txt:93,搜“值得被再次相信和调用”)。 2

  9. 出处:第 95 段(text/13-ch12.txt:95,搜“遗忘同样重要”)与第 99 段(text/13-ch12.txt:99,搜“会忘和会记一样重要”)。

  10. 出处:第 104 段(text/13-ch12.txt:104,搜“环境抽象层”)与第 105 段(text/13-ch12.txt:105,搜“支付确认步骤”)。

  11. 出处:第 116 段(text/13-ch12.txt:116,搜“摘要层级”)。

  12. 出处:「12.2.1」第 123 段(text/13-ch12.txt:123,搜“Task Decomposition”)。

  13. 出处:第 126 段(text/13-ch12.txt:126,搜“越详细越好”)与第 127 段(text/13-ch12.txt:127,搜“分层的”)。

  14. 出处:第 129 段(text/13-ch12.txt:129,搜“会列清单”)与第 132 段(text/13-ch12.txt:132,搜“过时的计划不放”)。

  15. 出处:第 133 段(text/13-ch12.txt:133,搜“可验证的里程碑”)与第 137 段(text/13-ch12.txt:137,搜“制造更多文字”)。

  16. 出处:「12.2.2」第 142 段(text/13-ch12.txt:142,搜“悄悄失效”)。

  17. 出处:第 144 段(text/13-ch12.txt:144,搜“计划监控,就是持续检查几件事”)。

  18. 出处:第 146 段(text/13-ch12.txt:146,搜“节奏控制”)与第 149 段(text/13-ch12.txt:149,搜“动得太快”)。

  19. 出处:第 157 段(text/13-ch12.txt:157,搜“尽早校正”)。

  20. 出处:「ReAct 与交替式执行」段第 159 段(text/13-ch12.txt:159,搜“推理与行动交替发生”)与第 162 段(text/13-ch12.txt:162,搜“闭门造车”)。

  21. 出处:第 164 段(text/13-ch12.txt:164,搜“留给环境去消解”)与第 167 段(text/13-ch12.txt:167,搜“先行动一点点”)。

  22. 出处:第 178 段(text/13-ch12.txt:178,搜“错误机会也会增加”)与第 180 段(text/13-ch12.txt:180,搜“停止条件、检查点和回溯机制”)。

  23. 出处:第 182 段(text/13-ch12.txt:182,搜“该不该继续想”)与第 186 段(text/13-ch12.txt:186,搜“节奏感”)。

  24. 出处:「12.2.3」第 190 段(text/13-ch12.txt:190,搜“失败是常态”)与第 193 段(text/13-ch12.txt:193,搜“污染了后续状态”)。

  25. 出处:第 196 段(text/13-ch12.txt:196,搜“回滚和检查点”)与第 199 段(text/13-ch12.txt:199,搜“重走一遍”)。

  26. 出处:第 200 段(text/13-ch12.txt:200,搜“停止条件同样关键”)与第 203 段(text/13-ch12.txt:203,搜“主动认账”)。

  27. 出处:第 204 段(text/13-ch12.txt:204,搜“执行日志本身当成一种特殊记忆”)。

  28. 出处:「12.3.1」第 217 段(text/13-ch12.txt:217,搜“落点在下一步动作上”)。

  29. 出处:第 219 段(text/13-ch12.txt:219,搜“两种不同时间尺度”)。

  30. 出处:第 225 段(text/13-ch12.txt:225,搜“把反思当成默认常态”)。

  31. 出处:第 229 段(text/13-ch12.txt:229,搜“经验沉淀也不该只留在”)与第 231 段(text/13-ch12.txt:231,搜“系统资产”)。

  32. 出处:「12.3.2」第 239 段(text/13-ch12.txt:239,搜“既当作者又当”)与第 241 段(text/13-ch12.txt:241,搜“相当稳定的现象”)。

  33. 出处:第 242 段(text/13-ch12.txt:242,搜“generator”)与第 244 段(text/13-ch12.txt:244,搜“GAN 时代”)。

  34. 出处:第 246 段(text/13-ch12.txt:246,搜“Planner”)、第 248 段(text/13-ch12.txt:248,搜“Evaluator”)、第 253 段(text/13-ch12.txt:253,搜“估侧持续不让步”)。 2

  35. 出处:第 255 段(text/13-ch12.txt:255,搜“白纸黑字的判据”)与第 257 段(text/13-ch12.txt:257,搜“漂亮包装”)。

  36. 出处:「自优化、反思与自进化三层」段(text/13-ch12.txt:260,搜“Self-Refine”)与第 293 段(text/13-ch12.txt:293,搜“self-evolution”)。

  37. 出处:第 264 段(text/13-ch12.txt:264,搜“Self-Refine”)、第 269 段(text/13-ch12.txt:269,搜“7 类任务”)、第 276 段(text/13-ch12.txt:276,搜“把对的改错”)、第 256 段(text/13-ch12.txt:256,搜“可信反馈源”)。 2

  38. 出处:第 281 段(text/13-ch12.txt:281,搜“Reflexion”)、第 282 段(text/13-ch12.txt:282,搜“经验笔记”)、第 288 段(text/13-ch12.txt:288,搜“跌的跤”)。 2

  39. 出处:第 297 段(text/13-ch12.txt:297,搜“经验积累是最朴素”)、第 302 段(text/13-ch12.txt:302,搜“技能提炼”)、第 307 段(text/13-ch12.txt:307,搜“自我微调”)、第 316 段(text/13-ch12.txt:316,搜“仍然很少”)。 2

  40. 出处:第 317 段(text/13-ch12.txt:317,搜“部署模式”)、第 322 段(text/13-ch12.txt:322,搜“怎么让它“遗忘””)、第 326 段(text/13-ch12.txt:326,搜“同一道边界判断”)。

  41. 出处:「12.4.2」第 501 段(text/13-ch12.txt:501,搜“谁说了算”)。

  42. 出处:第 504 段(text/13-ch12.txt:504,搜“层级结构”)与第 509 段(text/13-ch12.txt:509,搜““无限循环””)。

  43. 出处:第 511 段(text/13-ch12.txt:511,搜“终止条件因此和角色设计同样重要”)与第 514 段(text/13-ch12.txt:514,搜“产出的价值还多”)。

  44. 出处:第 517 段(text/13-ch12.txt:517,搜“结构化下来”)与第 520 段(text/13-ch12.txt:520,搜“收口机制”)。

  45. 出处:第 525 段(text/13-ch12.txt:525,搜“分歧升级路径”)、第 529 段(text/13-ch12.txt:529,搜“不必消灭”)、第 531 段(text/13-ch12.txt:531,搜“可执行共识”)。

  46. 出处:第 535 段(text/13-ch12.txt:535,搜“决策日志”)与第 537 段(text/13-ch12.txt:537,搜“更清晰的决”)。

  47. 出处:「12.4.1」第 329 段(text/13-ch12.txt:329,搜“不在增加角色数量”)与章首第 29 段(text/13-ch12.txt:29,搜“不是单智能体的默认升级版”)。 2

  48. 出处:第 334 段(text/13-ch12.txt:334,搜“更容易调试”)与第 339 段(text/13-ch12.txt:339,搜“得太碎”)。

  49. 出处:第 344 段(text/13-ch12.txt:344,搜“串行工作流”)、第 348 段(text/13-ch12.txt:348,搜“并行工作流”)、第 353 段(text/13-ch12.txt:353,搜“评审式工作流”)、第 356 段(text/13-ch12.txt:356,搜“自我审查”外显”)。

  50. 出处:第 391 段(text/13-ch12.txt:391,搜““资料搜集-结构整理-报告生成-复核””)与第 395 段(text/13-ch12.txt:395,搜“可追责、可回放”)。

  51. 出处:第 361 段(text/13-ch12.txt:361,搜“一定会有通信问题”)与第 363 段(text/13-ch12.txt:363,搜“压缩、扭曲或延迟”)。

  52. 出处:「12.4.2」第 398 段(text/13-ch12.txt:398,搜“链、广播、层级与对等”)与第 400 段(text/13-ch12.txt:400,搜“链式(chain)”)、第 404 段(text/13-ch12.txt:404,搜“层级(hierarchical)”)、第 406 段(text/13-ch12.txt:406,搜“peer-to-peer”)。 2

  53. 出处:第 409 段(text/13-ch12.txt:409,搜“混合使用这几种结构”)。

  54. 出处:第 412 段(text/13-ch12.txt:412,搜“迅速膨胀”)与第 415 段(text/13-ch12.txt:415,搜“角色化过滤”)、第 415 段(text/13-ch12.txt:415,搜“结构化交付物”)。

  55. 出处:第 462 段(text/13-ch12.txt:462,搜“共享事实底座”)与第 465 段(text/13-ch12.txt:465,搜“最新共识”)。

  56. 出处:第 479 段(text/13-ch12.txt:479,搜“版本控制”)与第 482 段(text/13-ch12.txt:482,搜“追踪的事实链上”)。

  57. 出处:第 425 段(text/13-ch12.txt:425,搜“协议化交接”)与第 604 段(text/13-ch12.txt:604,搜“工作包”)。

  58. 出处:第 490 段(text/13-ch12.txt:490,搜““所有权”和“锁””)与第 494 段(text/13-ch12.txt:494,搜“冲突隔离机制”)。

  59. 出处:第 443 段(text/13-ch12.txt:443,搜“共享的组织记忆”)、第 447 段(text/13-ch12.txt:447,搜“协作模板”)、第 454 段(text/13-ch12.txt:454,搜“不是越多越好”)。

  60. 出处:「12.4.3」第 544 段(text/13-ch12.txt:544,搜“收益从来不是免费的”)与第 549 段(text/13-ch12.txt:549,搜“没人真正对最终结果负责”)。

  61. 出处:第 553 段(text/13-ch12.txt:553,搜“被“转移”了”)与第 555 段(text/13-ch12.txt:555,搜“甩锅”)。

  62. 出处:第 557 段(text/13-ch12.txt:557,搜“退回单主体”)与第 561 段(text/13-ch12.txt:561,搜“该收缩时就收缩”)。

  63. 出处:第 566 段(text/13-ch12.txt:566,搜“局部最优”)与第 577 段(text/13-ch12.txt:577,搜“指向同一个结果”)。

  64. 出处:第 580 段(text/13-ch12.txt:580,搜“瓶颈角色”)、第 583 段(text/13-ch12.txt:583,搜“单点结构”)、第 591 段(text/13-ch12.txt:591,搜“组织韧性”)。

  65. 出处:第 598 段(text/13-ch12.txt:598,搜“切得多细”)、第 601 段(text/13-ch12.txt:601,搜“接口设计问题”)、第 603 段(text/13-ch12.txt:603,搜“该精确到什么粒度”)。

  66. 出处:第 608 段(text/13-ch12.txt:608,搜“格外昂贵”)、第 614 段(text/13-ch12.txt:614,搜“塑造组织能力”)、第 617 段(text/13-ch12.txt:617,搜“切得更对”)。

  67. 出处:第 621 段(text/13-ch12.txt:621,搜“更花哨的外壳”)与第 623 段(text/13-ch12.txt:623,搜“角色数量本身说明不了什么”)。

  68. 出处:「12.5.1」第 631 段(text/13-ch12.txt:631,搜“监督(人只看结果”)、第 632 段(text/13-ch12.txt:632,搜“高风险动作”)、第 633 段(text/13-ch12.txt:633,搜“同一份工件”)、第 634 段(text/13-ch12.txt:634,搜“风险和成本的函数”)。

  69. 出处:第 636 段(text/13-ch12.txt:636,搜“主动暂停并提问”)与第 638 段(text/13-ch12.txt:638,搜“AI 第二意见”)。

  70. 出处:「12.5.2」第 648 段(text/13-ch12.txt:648,搜“轨迹变化”)与第 649 段(text/13-ch12.txt:649,搜“轨迹(Trajectory)”)。

  71. 出处:第 652 段(text/13-ch12.txt:652,搜“推进一个过程”)、第 655 段(text/13-ch12.txt:655,搜“失败轨迹暴露”)、第 658 段(text/13-ch12.txt:658,搜“新基础数据形态”)。

  72. 出处:第 665 段(text/13-ch12.txt:665,搜“数据分布漂移”)、第 670 段(text/13-ch12.txt:670,搜“Proximal Policy Optimization”)、第 673 段(text/13-ch12.txt:673,搜“半勺盐”)。 2

  73. KL 约束与第 5 章 𝛽 系数的呼应见第 676 段(text/13-ch12.txt:676,搜“𝛽 系数”)。

  74. 出处:第 645 段(text/13-ch12.txt:645,搜“奖励设计”)、第 681 段(text/13-ch12.txt:681,搜“拾起垃圾的数量”)、第 684 段(text/13-ch12.txt:684,搜“奖励函数的漏洞”)。 2

  75. 出处:第 688 段(text/13-ch12.txt:688,搜“奖励塑形”)、第 692 段(text/13-ch12.txt:692,搜“平均偏好对齐”)、第 694 段(text/13-ch12.txt:694,搜“兜不住的”)。

  76. 出处:第 705 段(text/13-ch12.txt:705,搜“训练时固化的迁”)与第 708 段(text/13-ch12.txt:708,搜“边界还会进一步模糊”)。 2