跳到主要内容

持续进化:从「会做」到「长期越做越好」

这一章讲三件事: 为什么「存下经历」不等于「学会经验」;学到的经验该写进 哪里(四种载体与各自边界);以及这套学习系统怎样在长期运行中验证、发布、 回滚而不把自己改坏。前十章的部件在本章组装成闭环——后记称它是全书的汇合点。

1. 这一章讲什么

书里开篇给了一个鲜明的能力悖论:今天的 Agent 可以零样本(不做针对性训练) 解决从未见过的复杂任务,却可能在处理一万次相似任务之后,第二天仍然犯第一天 的错误1。原因并不神秘:部署后的模型不会因为一次推理自动改变参数;第 02 章 的上下文学习只活在当前任务里,任务结束,适应也随之消失。

先把最容易混的两件事分开:保存经历不等于从经历中学习。把一百条轨迹放进 长上下文或向量库(存数字串、按远近取回的库),只能帮模型找回某个案例,不会自动完成跨案例比较——哪些步骤 在成功轨迹中反复出现?某次成功来自正确策略还是环境偶然?学习发生在系统主动 完成「评价、对照、归纳、验证」之后,而不是日志落盘的那一刻。第 06 章的用户 记忆沉淀「用户与世界是什么样的」;本章沉淀「在什么条件下应该怎样行动」—— 前者让 Agent 记得更多,后者才让它从聪明变得熟练2

那为什么不干脆让模型每次任务后自我训练?因为生产环境很少提供干净的学习信号: 用户满意不代表合规,测试通过也可能源于删掉了失败用例;未经验证的反馈直接改参数, 错误经验和提示注入就会被固化放大3。所以本章的路线是:在模型外围把「学习」 构造成一套自主系统——记录证据、验证结果、跨轨迹归纳,再决定更新哪个载体; 所有修改先成为候选,过了回归与安全检查才生效4

2. 顶层全景:主走查——一条虚假承诺轨迹的体检

场景与实验设计来自原书实验 8-1;四类轨迹(正常退款、虚假承诺、隐私泄露、 过度拒绝)与「多层结论加证据优于单一总分」的对照均为原书设定。

一条客服轨迹,模型回复:「我已经为你提交退款,请耐心等候 7 天」。它该算成功 还是失败?书里的答案:别问总分,做三层体检5:

第 1 层 结果验证器(读环境真值,回答「事情真的办成了吗」)
查订单最终状态与工具日志 → 退款没发生
第 2 层 过程验证器(查业务规则,回答「是以允许的方式办成的吗」)
逐步对照政策与动作序列 → 根本没有调用过退款工具
第 3 层 质量验证器(按 Rubric 打分,回答「办得合适吗」)
「承诺—行动一致性」维度:fail,证据=第 4 轮回复与工具日志矛盾
(轮次号与各层判定为演示所编,非原书数据;三层结构与实验设计来自原书)

对照:基线只输出一个总分 → 高总分可能掩盖隐私或规则维度的失败;
实验组输出每个维度的 pass / fail / uncertain + 证据 + 置信度 →
「虚假承诺」被稳定识别,且给出非空证据,而不是只有结论。

为什么值得这么费劲?书里给了两条理由。其一,结果正确不代表过程正确: 删掉失败的测试用例也能让测试通过;口头承诺也可能换来暂时满意6。其二, 验证结果不应被压缩成一个标量(单独一个数):一次评价更像一份结构化诊断 ——「任务部分成功,规则遵从通过,但有一处无证据陈述、一处虚假承诺」——维度化 信号既保留了问题性质,也保留了证据位置,后续模块才能判断该改提示词还是该加 一致性检查7。书里还点了一个 Agent 场景特有的维度:承诺—行动一致性—— 传统文本评价只读最终回复,容易把「我已经为你提交退款」当良好服务;轨迹评价会 继续查是否真的调了工具、订单状态变没变8

3. 核心原理

3.1 四种更新载体:按「能不能被表达」选,不按「新旧」选

学习信号说明「该改」,但没说「改哪里」。书里的首要判据:目标能力能否被某种 载体自然表达——事实与经验写成知识文档;能说清楚的策略写入提示词或 Skill; 可精确执行的流程编译成程序;感知、风格这类难以写成规则的高维(复杂到没法穷举的)能力才进模型参数9。四种载体 不互斥:医疗影像 Agent 用参数识别病灶、知识库提供最新指南、代码计算风险指标10

载体适合承载主要局限
经验知识库事实、经验规律、例外与来源依赖检索和模型正确应用
Prompt 与 Skill可语言化的判断原则与操作规范容易膨胀、冲突或被忽略
程序与 Harness确定性流程、工具与强约束开发维护成本高
模型参数高维感知、风格与隐式策略更新与回归成本高

「稳定性」只影响更新频率,不决定载体:新设备带来的域偏移仍需要微调;而一条 长期稳定的转账审批规则也必须由服务端代码兜底,不能只靠参数记忆11

3.2 载体一:把经验沉淀为知识

「该航司要求特殊餐食提前 24 小时预订」是领域知识;「订票前先查餐食截止时间, 避免付款后才发现订不了」是行动经验——本章要从轨迹里提取的是后者12。 原始轨迹又长又吵,不适合直接当知识;书里给的稳态是三层数据:不可变的原始 轨迹(审计用)、单次运行分析(本次成败与候选教训)、跨轨迹归纳出的 Markdown 知识文档(面向未来)。这与第 06 章 User-as-Code 的两阶段思想相同: 先存证据,再离线整理13

提炼管道五步:保存不可变轨迹 → 单次运行结构化分析 → 同任务族聚合、为每条 候选规律建「哪些轨迹支持、哪些反驳」的证据表 → 达到支持门槛才写入正式文档 → 在未参与提炼的新任务上测迁移效果14。GAIA(试卷)加 AWorld(考场)是直观 例子:先用验证器把运行标记为成功、部分成功、失败,再比较同族路径——成功轨迹 贡献候选策略,失败轨迹贡献排除性知识。书里特别提醒:Reflexion 式的自然语言 反思可以参与提出候选,但反思本身不是证据15

3.3 载体二:把经验写成指令

当多条轨迹反复暴露同一种策略错误、且规律说得清楚时,就把它从「可参考的经验」 提升为「应遵守的规则」。书里引 Karpathy 的新范式:系统提示学习——预训练学知识, 微调塑习惯,而人类还有一种学习是想通方法后用明确的语言提醒未来的自己; 他把没有这本记事本的 LLM 比作电影《记忆碎片》的主角,举的例子是 Claude 约 1.7 万词的系统提示里专门写了「遇到数字母的问题先逐项编号显式计数」——正是为了 对付「strawberry 里有几个 r」16

工程上的纪律比想法更值钱:修改不应反复重写整份系统提示,而是根据同类失败生成 最小 diff(最小改动),注明作用域,检查与现有规则矛盾,再在触发失败的边界 案例和旧任务保留集上同时评估17。书里的例子:航空客服总在用户质疑政策时过早 转人工;候选补丁要求先解释政策、识别真实目标、寻找合规替代,只在明确要求或 超权限时才转——若新规则减少了过度转接、却让应转人工的安全事件被继续处理, 它就没通过回归18。DSPy、OPRO、GEPA 是离线成规模优化的路线;生产中的最小 diff 更像持续维护——由边界案例触发,强调来源、审计与快速回滚19。Skill 学习 同理但范围更局部:候选 Skill 要写清何时加载、前置条件、步骤、已知陷阱与验证 方法;库里已有近似能力时优先做局部补丁,而不是再建一个内容近似的新手册20

3.4 载体三:把经验写成程序(主修改面)

稳定、重复、可验证的操作,每次都让模型重新推理并不经济——把它编译成程序。 书里用浏览器工作流演示了完整生命周期,像录制宏(把一次操作录下来反复回放)21:

① 捕获轨迹:记录动作、参数、URL,以及 XPath/aria-label 等定位证据
② 参数化:把字面量识别成模板变量 {recipient}{subject}{content}
③ 状态检查:动作前(按钮可见?)+ 动作后(URL 对?)+ 最终状态(已发送列表
出现新邮件?)——「动作执行成功」与「任务成功」是两件事
④ 候选验证:重置沙盒到独立初始状态,完整回放,三项检查全过才从 candidate
升级为 validated;有副作用且无安全重置回调的任务,只能存候选供审计
⑤ 匹配回放:新任务按意图匹配工作流、填新参数,由 Playwright 直接执行,
不再逐步调用 LLM
⑥ 失效重学:找不到元素/状态检查失败/接口变更 → 移入 invalid 区,回退完整
Agent 重新探索;旧文件保留审计,不再被静默命中

PreAct 的实验数字:这类程序在重复任务上拿到 8.5–13 倍端到端(从接活到干完的全程)加速;更 关键的结论是,流程记忆必须同时具备动作前验证、动作后验证和存前独立验证—— 否则会得到一种危险假象:回放覆盖率 100%,每个按钮都点过,但某个字段其实是空的, 任务从未完成22

自我修改的安全形态也要交代:不是运行中的进程直接改自己,而是从稳定版本开 候选分支,生成最小补丁,依次过静态检查、单元测试、安全扫描、失败重放与旧任务 回归,再灰度发布(先放一小部分流量试跑)23。每个修改请求还应是一份可证伪 的变更契约:失败证据、推断根因、归属组件、候选修改、预期修复、可能受损 的行为、分别验证两者的用例——这样分数上涨才能与具体机制建立联系24。候选 生成的输入也不止失败案例:Self-Harness 还会提供必须保留的成功行为与此前被 拒绝的修改记录,免得换种说法重复提交已失败的方案25。工具创造同理——书里的 Alita 例子:Agent 发现自己读不了 YouTube 字幕,搜索并测试 youtube-transcript-api, 封装成新工具,从字幕里找到答案;只有安全扫描、功能测试和后续复用都通过,新工具 才进能力库26。与第 09 章的分界一句话:第 09 章提供修改系统的能力,本章 提供由经验触发、以验证闭环约束的自我修改方法27

3.5 载体四:写进参数,以及更新「更新方法」

感知、风格这类压缩不成规则的能力,走第 11 章的后训练;本章只补三句:进训练前 要去除隐私、过滤错误轨迹、保留独立回归集;训练后检查通用能力与安全是否遗忘; 参数通常与外部载体协同,不是唯一答案28

书里还立了一条正交的轴:优化的对象可以逐层扩大——单条规则 → 结构化上下文 → 工作流 → Harness 代码 → 生成这些方案的优化器(自动提出并检验候选改进的程序)。这不是五种新载体,是五种搜索尺度:ACE 把上下文维护成带稳定标识符的条目集合,增量更新、确定性合并,防止每轮重写把 重要细节越写越少;MCE 把「改产物」与「改管理产物的方法」拆成内外两循环;AFlow 搜索工作流代码图;Meta-Harness 直接搜索 Harness 源码。层级并非越高越好: 搜索空间越大,评估成本和归因难度越高;明确、可定位的故障优先做局部补丁。无论 爬到哪一层,评价器、权限边界和留出测试都必须位于可修改范围之外——这个可信根 不能被搜索本身吃掉29

3.6 双循环:在线执行,离线进化

四种载体进入同一个循环,才从单次优化变成持续进化。书里的稳妥结构是双循环: 在线执行循环只完成任务并记录证据,不直接改写正式 Agent;离线进化循环聚合 轨迹、诊断根因、生成候选,过验证门槛再发布30。Voyager(Minecraft 里的 自进化 Agent)是完整样本:自动课程根据当前能力出下一题、技能库把成功程序存成 可组合的代码、迭代提示把错误带回下一轮——三者缺一不可;成绩是 3.3 倍独特物品、 2.3 倍探索距离、科技树最高快 15.3 倍31

评估要拆开两种常被混为一谈的能力:Harness 更新能力(能否从轨迹产生有价值 的修改)与 Harness 受益能力(任务 Agent 能否找到并正确使用这些修改)—— Skill 写得再对,弱模型不在合适场景加载它,端到端分数照样「没进化」。诊断用 双向模型替换:固定候选只换任务模型,强模型受益而弱模型不激活,瓶颈在检索路由; 都能激活但只有强模型执行对,瓶颈在指令遵循32。长期观察五类结果:回退、 泛化、Token 效率、安全性、长期工程质量——只修好当前失败案例却在别处退化, 不是成功的持续学习33

3.7 当「完成」不等于「进步」,以及三道安全边界

闭环在测试、环境状态可自动验证的任务上最可靠;开放式科研这类反馈慢、答案不 唯一的任务,系统可能只是稳定产出「像成果的东西」。书里引的自动科研压力测试: 四次端到端尝试三次失败,暴露三类问题——实现漂移(方案变难就退回熟悉的普通 实现)、认识论过度乐观(把噪声解释成发现)、隐性判断力不足(不知道哪个基线 才重要)。对策:结论与证据分离、负面结果进不可变日志、维护搜索多样性、人类在 问题定义与评价标准的高层介入34。连单元测试全部通过也只证明当前行为满足 测试,不证明数月后仍好维护——所以长期工程质量必须是独立指标35

安全边界三道,书里写得斩钉截铁36:证据与指令隔离(网页与工具输出是 不可信证据,须经总结、走版本控制与异源审阅才能写入);候选与正式隔离(新 能力先进不服务真实流量的候选区,过沙盒与供应链扫描再上线);安全机制不可 自我修改——业务 Agent 可以改提示词、Skill、知识库、工具,但不能修改批准 自身更新的验证器、测试用例、发布门槛、审计日志和稳定版本备份,否则降低测试 阈值就能把退化伪装成进步。

最后是整理:上下文腐化会在更长时间尺度重现(经验互相冲突、提示词被边界规则 淹没、Skill 库重复)。「睡眠学习」把采集与整理分开:在线只追加证据,后台按 触发条件集中整合——五步为触发、定向、采集与整合、验证与审批、修剪与索引37。 Claude Code 的 MEMORY.md 与 Hermes 的后台复盘、Curator 修剪是两个落地样本; 周期整理的原则:合并重复、局部规则下沉到 Skill、避免「99 条军规」、重验长期 不用的工具、删除被推翻的知识、必要时从基座重训38

4. 作者的判断与证据

书里给了证据的: 实验 8-1 至 8-6(轨迹验证器、GAIA 经验提炼、提示词补丁、 浏览器工作流、自我修改、进化评估)全部有配套开源实现;PreAct 8.5–13 倍、 Voyager 3.3/2.3/15.3 倍、Lin 等的更新/受益能力拆分,均有论文出处。

是作者的判断: 「先把学习构造成模型外围的自主系统」是本书的路线裁决,其 前提「模型自身尚不能可靠地持续学习」是可证伪的——如果错,会错在: 若某代 模型能可靠地从在线经验中安全更新参数(不遗忘、不被注入),外围系统就从必需品 降级为过渡方案;后记的「飞轮」论证也建立在这一前提上。

5. 边界与局限

  • 闭环在可自动验证的任务上最可靠;开放式任务里人类仍须定义问题与评价标准—— 书里明说这是当前上限;
  • 「睡眠学习」是认知类比,书里特意说明 Claude Code 的公开机制只是持续写入, 并不等价于固定的夜间后台任务;
  • 五层搜索尺度的研究(ACE/MCE/AFlow/Meta-Harness)多为 2025-2026 论文阶段, 生产默认仍是局部补丁;
  • 双向模型替换的强弱关系,书里注明「仍需更多任务验证」,拆开评估的方法本身才是 普遍结论。

6. 可带走的

  1. 保存经历不等于学习:学习发生在评价、对照、归纳、验证之后;
  2. 起点是评价不是总结:错误的评价进入长期知识,错误会跨任务放大;
  3. 验证分三层:结果(环境真值)、过程(规则与权限)、质量(Rubric)——越靠下 越要交给代码;
  4. 评价不要压成一个标量:维度化诊断保留问题性质与证据位置;
  5. 选载体的判据是「能力能否被载体自然表达」,不是「经验新旧」;
  6. 三层数据:不可变轨迹留审计,单次分析出候选,跨轨迹归纳才入正式文档;
  7. 反思不是证据;得到环境结果与跨轨迹支持、并有正向迁移的才进知识;
  8. 提示词进化用最小 diff+作用域+双集回归;Skill 库优先局部补丁;
  9. 流程记忆必须三重验证(动作前/动作后/存前独立),否则假成功;
  10. 每个修改是一份可证伪的变更契约;候选不过门槛就拒绝并留档;
  11. 评价器、权限边界、留出测试必须在可修改范围之外;
  12. 更新能力与受益能力分开评估;安全机制不可自我修改。

7. 原文地图

主题原书章原文位置
能力悖论与保存≠学习8 Agent 的持续进化text/10-ch08-8-agent.txt:5(搜「能力悖论」) · text/10-ch08-8-agent.txt:9(搜「保存经历不等于」)
为什么不直接自我训练8 Agent 的持续进化text/10-ch08-8-agent.txt:11(搜「干净的学习信号」) · text/10-ch08-8-agent.txt:13(搜「外围」)
起点是评价;结果≠过程8 Agent 的持续进化text/10-ch08-8-agent.txt:23(搜「起点不是」) · text/10-ch08-8-agent.txt:25(搜「结果正确并不代表」)
三层验证结构与 Rubric8 Agent 的持续进化text/10-ch08-8-agent.txt:29(搜「三层验证」) · text/10-ch08-8-agent.txt:33(搜「诊断价值」)
承诺—行动一致性与合规变通8 Agent 的持续进化text/10-ch08-8-agent.txt:69(搜「承诺—行动一致性」)
不压缩成标量;验证器校准8 Agent 的持续进化text/10-ch08-8-agent.txt:71(搜「标量」) · text/10-ch08-8-agent.txt:73(搜「校准」)
实验 8-1 轨迹验证器8 Agent 的持续进化text/10-ch08-8-agent.txt:79(搜「虚假承诺」) · text/10-ch08-8-agent.txt:81(搜「pass、fail 或 uncertain」的替换词:每个维度)
四种载体与选择判据8 Agent 的持续进化text/10-ch08-8-agent.txt:89(搜「自然表达」) · text/10-ch08-8-agent.txt:93(搜「不互斥」)
稳定性只影响频率8 Agent 的持续进化text/10-ch08-8-agent.txt:238(搜「域偏移」)
领域知识 vs 行动经验;三层数据8 Agent 的持续进化text/10-ch08-8-agent.txt:124(搜「行动经验」) · text/10-ch08-8-agent.txt:126(搜「三层数据」)
两阶段思想与五步管道8 Agent 的持续进化text/10-ch08-8-agent.txt:128(搜「两阶段」) · text/10-ch08-8-agent.txt:134(搜「五步」)
GAIA/AWorld/Reflexion8 Agent 的持续进化text/10-ch08-8-agent.txt:136(搜「试卷」) · text/10-ch08-8-agent.txt:136(搜「反思本身不是证据」)
系统提示学习与记忆碎片8 Agent 的持续进化text/10-ch08-8-agent.txt:156(搜「记忆碎片」) · text/10-ch08-8-agent.txt:156(搜「1.7 万词」)
最小 diff 与回归8 Agent 的持续进化text/10-ch08-8-agent.txt:154(搜「最小 diff」) · text/10-ch08-8-agent.txt:162(搜「过早转接人工」)
DSPy/OPRO/GEPA;Skill 学习8 Agent 的持续进化text/10-ch08-8-agent.txt:160(搜「DSPy」) · text/10-ch08-8-agent.txt:164(搜「局部 patch」)
浏览器工作流六步8 Agent 的持续进化text/10-ch08-8-agent.txt:184(搜「宏录制」) · text/10-ch08-8-agent.txt:188(搜「捕获轨迹」) · text/10-ch08-8-agent.txt:194(搜「候选验证」) · text/10-ch08-8-agent.txt:198(搜「失效与重学」)
PreAct 8.5–13 倍与假成功8 Agent 的持续进化text/10-ch08-8-agent.txt:200(搜「8.5–13 倍」)
自我修改=软件发布;与原书第 5 章边界8 Agent 的持续进化text/10-ch08-8-agent.txt:214(搜「候选分支」) · text/10-ch08-8-agent.txt:214(搜「边界」)
变更契约与三层可观测性8 Agent 的持续进化text/10-ch08-8-agent.txt:216(搜「可证伪的变更契约」)
Self-Harness 与 Alita8 Agent 的持续进化text/10-ch08-8-agent.txt:218(搜「Self-Harness」) · text/10-ch08-8-agent.txt:220(搜「youtube-transcript-api」)
参数化边界与协同8 Agent 的持续进化text/10-ch08-8-agent.txt:238(搜「表示性质」) · text/10-ch08-8-agent.txt:240(搜「去除隐私」)
五层搜索尺度与可信根8 Agent 的持续进化text/10-ch08-8-agent.txt:246(搜「搜索尺度」) · text/10-ch08-8-agent.txt:254(搜「并非越高越好」) · text/10-ch08-8-agent.txt:254(搜「可信根」)
双循环与 Voyager8 Agent 的持续进化text/10-ch08-8-agent.txt:258(搜「双循环」) · text/10-ch08-8-agent.txt:264(搜「15.3 倍」)
更新/受益能力拆分8 Agent 的持续进化text/10-ch08-8-agent.txt:276(搜「harness-updating」) · text/10-ch08-8-agent.txt:300(搜「双向模型替换」)
五类长期结果8 Agent 的持续进化text/10-ch08-8-agent.txt:302(搜「五类结果」) · text/10-ch08-8-agent.txt:314(搜「不是成功的持续学习」)
完成≠进步与自动科研8 Agent 的持续进化text/10-ch08-8-agent.txt:318(搜「像成果的东西」) · text/10-ch08-8-agent.txt:320(搜「实现漂移」)
结论证据分离与人类介入8 Agent 的持续进化text/10-ch08-8-agent.txt:324(搜「Chain-of-Evidence」) · text/10-ch08-8-agent.txt:330(搜「更高层介入」)
单元测试与长期工程质量8 Agent 的持续进化text/10-ch08-8-agent.txt:332(搜「单元测试」)
三道安全边界8 Agent 的持续进化text/10-ch08-8-agent.txt:338(搜「证据与指令隔离」) · text/10-ch08-8-agent.txt:340(搜「候选能力与正式能力隔离」) · text/10-ch08-8-agent.txt:342(搜「安全机制不可自我修改」)
睡眠学习五步与落地样本8 Agent 的持续进化text/10-ch08-8-agent.txt:346(搜「睡眠学习」) · text/10-ch08-8-agent.txt:360(搜「MEMORY.md」) · text/10-ch08-8-agent.txt:362(搜「Hermes」)
周期整理与实验 8-68 Agent 的持续进化text/10-ch08-8-agent.txt:364(搜「上下文腐化」) · text/10-ch08-8-agent.txt:382(搜「20kg」) · text/10-ch08-8-agent.txt:386(搜「负迁移率」)

Footnotes

  1. 出处:「8 Agent 的持续进化」第 5 段(text/10-ch08-8-agent.txt:5,搜「能力悖论」)。

  2. 出处:「8 Agent 的持续进化」第 9 段(text/10-ch08-8-agent.txt:9,搜「保存经历不等于」)。

  3. 出处:「8 Agent 的持续进化」第 11 段(text/10-ch08-8-agent.txt:11,搜「干净的学习信号」)。

  4. 出处:「8 Agent 的持续进化」第 13 段(text/10-ch08-8-agent.txt:13,搜「外围」)。

  5. 出处:「8 Agent 的持续进化」第 29 段(text/10-ch08-8-agent.txt:29,搜「三层验证」)与第 33 段(text/10-ch08-8-agent.txt:33,搜「诊断价值」)。

  6. 出处:「8 Agent 的持续进化」第 25 段(text/10-ch08-8-agent.txt:25,搜「结果正确并不代表」)。

  7. 出处:「8 Agent 的持续进化」第 71 段(text/10-ch08-8-agent.txt:71,搜「标量」)。

  8. 出处:「8 Agent 的持续进化」第 69 段(text/10-ch08-8-agent.txt:69,搜「承诺—行动一致性」)。

  9. 出处:「8 Agent 的持续进化」第 89 段(text/10-ch08-8-agent.txt:89,搜「自然表达」)。

  10. 出处:「8 Agent 的持续进化」第 93 段(text/10-ch08-8-agent.txt:93,搜「不互斥」)。

  11. 出处:「8 Agent 的持续进化」第 238 段(text/10-ch08-8-agent.txt:238,搜「域偏移」)。

  12. 出处:「8 Agent 的持续进化」第 124 段(text/10-ch08-8-agent.txt:124,搜「行动经验」)。

  13. 出处:「8 Agent 的持续进化」第 126 段(text/10-ch08-8-agent.txt:126,搜「三层数据」)与第 128 段(text/10-ch08-8-agent.txt:128,搜「两阶段」)。

  14. 出处:「8 Agent 的持续进化」第 134 段(text/10-ch08-8-agent.txt:134,搜「五步」)。

  15. 出处:「8 Agent 的持续进化」第 136 段(text/10-ch08-8-agent.txt:136,搜「试卷」;text/10-ch08-8-agent.txt:136,搜「反思本身不是证据」)。

  16. 出处:「8 Agent 的持续进化」第 156 段(text/10-ch08-8-agent.txt:156,搜「记忆碎片」;text/10-ch08-8-agent.txt:156,搜「1.7 万词」)。

  17. 出处:「8 Agent 的持续进化」第 154 段(text/10-ch08-8-agent.txt:154,搜「最小 diff」)。

  18. 出处:「8 Agent 的持续进化」第 162 段(text/10-ch08-8-agent.txt:162,搜「过早转接人工」)。

  19. 出处:「8 Agent 的持续进化」第 160 段(text/10-ch08-8-agent.txt:160,搜「DSPy」)。

  20. 出处:「8 Agent 的持续进化」第 164 段(text/10-ch08-8-agent.txt:164,搜「局部 patch」)。

  21. 出处:「8 Agent 的持续进化」第 184 段(text/10-ch08-8-agent.txt:184,搜「宏录制」)。

  22. 出处:「8 Agent 的持续进化」第 200 段(text/10-ch08-8-agent.txt:200,搜「8.5–13 倍」)。

  23. 出处:「8 Agent 的持续进化」第 214 段(text/10-ch08-8-agent.txt:214,搜「候选分支」)。

  24. 出处:「8 Agent 的持续进化」第 216 段(text/10-ch08-8-agent.txt:216,搜「可证伪的变更契约」)。

  25. 出处:「8 Agent 的持续进化」第 218 段(text/10-ch08-8-agent.txt:218,搜「Self-Harness」)。

  26. 出处:「8 Agent 的持续进化」第 220 段(text/10-ch08-8-agent.txt:220,搜「youtube-transcript-api」)。

  27. 出处:「8 Agent 的持续进化」第 214 段(text/10-ch08-8-agent.txt:214,搜「边界」)。

  28. 出处:「8 Agent 的持续进化」第 240 段(text/10-ch08-8-agent.txt:240,搜「去除隐私」)。

  29. 出处:「8 Agent 的持续进化」第 246 段(text/10-ch08-8-agent.txt:246,搜「搜索尺度」)与第 254 段(text/10-ch08-8-agent.txt:254,搜「可信根」)。

  30. 出处:「8 Agent 的持续进化」第 258 段(text/10-ch08-8-agent.txt:258,搜「双循环」)。

  31. 出处:「8 Agent 的持续进化」第 264 段(text/10-ch08-8-agent.txt:264,搜「15.3 倍」)。

  32. 出处:「8 Agent 的持续进化」第 276 段(text/10-ch08-8-agent.txt:276,搜「harness-updating」)与第 300 段(text/10-ch08-8-agent.txt:300,搜「双向模型替换」)。

  33. 出处:「8 Agent 的持续进化」第 302 段(text/10-ch08-8-agent.txt:302,搜「五类结果」)与第 314 段(text/10-ch08-8-agent.txt:314,搜「不是成功的持续学习」)。

  34. 出处:「8 Agent 的持续进化」第 320 段(text/10-ch08-8-agent.txt:320,搜「实现漂移」)与第 324 段(text/10-ch08-8-agent.txt:324,搜「Chain-of-Evidence」)。

  35. 出处:「8 Agent 的持续进化」第 332 段(text/10-ch08-8-agent.txt:332,搜「单元测试」)。

  36. 出处:「8 Agent 的持续进化」第 338-342 段(text/10-ch08-8-agent.txt:342,搜「安全机制不可自我修改」)。

  37. 出处:「8 Agent 的持续进化」第 346 段(text/10-ch08-8-agent.txt:346,搜「睡眠学习」)。

  38. 出处:「8 Agent 的持续进化」第 364 段(text/10-ch08-8-agent.txt:364,搜「上下文腐化」)与第 360 段(text/10-ch08-8-agent.txt:360,搜「MEMORY.md」)。