跳到主要内容

Agent 是什么:一条公式与它的三个问题

这一章讲三件事: 全书反复使用的那条公式是什么;一次真实任务里 这条公式怎么转起来(三次迭代——循环跑三遍;四次调工具——模型报名字,外部程序替它执行);以及模型与围绕模型的工程 谁吃掉谁的悬念。读完你会拿到全书的坐标系——后面十二章都在这条公式的某个词里展开。

1. 先把话说全:这一章讲什么

「AI Agent」这个词你大概天天见,但它到底指什么,十个人有十种说法。本书的做法是 把它压成一条公式:Agent = LLM + 上下文 + 工具——LLM 是大脑,上下文是它此刻 能看到的信息,工具是它能做的事1

这条公式不只是口诀。它对应三个不会过时的问题:它看到什么(上下文)、它能做什么 (工具)、怎么验证它做得对不对。模型换了一代又一代,这三个问题不变——这是全书 押注的基本盘,后记会回来兑现这个承诺。

2. 顶层全景:公式怎么转

用户任务:「算一下公司全年总收入」

┌────────────────────▼─────────────────────┐
│ LLM(大脑):读上下文 → 决定下一步 │
│ │ │
│ ▼ │
│ 工具(手脚):查汇率、跑代码、发邮件…… │
│ │ │
│ ▼ │
│ 结果写回上下文 → LLM 再看一遍 → 再决定 │
└───────────────────┬─────────────────────┘
│ 循环,直到任务完成

最终答复用户

图说:Agent 不是「问一次答一次」,而是「想→做→看→再想」的循环。
上下文是这个循环的跑道:每转一圈,新增的东西都落在跑道上。

先解释三个词,后面全书都要用:

LLM(大语言模型的缩写,就是 ChatGPT 背后那类机器:读一段文字,预测下一个词 该是什么,一个词一个词往外写)。它是 Agent 的大脑,负责读懂局面、拆解任务、决定 下一步。

上下文(LLM 每次做决策时能看到的全部信息——就像你做题时桌上摊开的所有资料)。 关键在于:LLM 自己没有记忆,上一轮说过什么它并不「记得」,只能靠重新放进上下文。 这一条是第 02 章全部内容的起点。

工具调用(LLM 按约定格式说出「我要用某个工具、参数是什么」,由外部程序替它 执行,再把结果塞回上下文)。LLM 本身只会写字,查汇率、跑代码、发邮件这些事, 全靠工具调用替它伸出手。

3. 核心原理

3.1 公式的三层理解:直觉层与学术层

日常说法里,公式读作「大脑+眼睛+手脚」。作者给了它一个更硬的对应: LLM 对应策略(Policy),上下文对应观察空间,工具对应动作空间——这是强化学习(让程序反复试错、按结果好坏调整行为的训练方法) 的语言2。先解释这个对应为什么值钱:

强化学习(让程序通过反复试错、按结果好坏调整行为的训练方法,训练下棋 AI 用的 就是它)研究了几十年「一个决策体怎么看环境、怎么行动」。把 Agent 翻译成这套语言, 等于宣布:Agent 不是新东西,而是一个老问题的最新实例——几十年的理论积累 (探索与利用、奖励设计、部分可观察)因此都能借过来用。第 11 章讲后训练时, 这个对应会变成实打实的工程。

书里用五个产品(Cursor、Deep Research、Manus、豆包手机助手、Pine AI)验证了 公式的覆盖力:五个产品形态完全不同,但都能按「感知/行动/策略」三维放进同一张表。 它们的共同特征(共性)是:开放式动作空间、内部思考、持续交互——这三条恰好是

「工作流(路径预先写死的自动化流程)脚本」没有的东西。

3.2 主走查:一次多币种汇总,看清循环怎么转

本节走查用的任务、金额与中间结果全部来自原书的例子,不是我们编的。

任务输入:「Q1 收入 250 万美元,Q2 收入 210 万欧元,Q3 收入 180 万英镑, Q4 收入 3.8 亿日元,计算年度总收入和季度平均收入」。关键在于:三笔外币的 汇率,模型脑子里没有今天的数——它必须靠工具去查。

迭代 1 LLM 看到:任务 + 三个待换算金额
思考:「需要把所有货币转换为 USD」
行动:一口气并行发出 3 次工具调用(互相不依赖,所以能并行)
convert_currency(2100000, EUR→USD)
convert_currency(1800000, GBP→USD)
convert_currency(380000000, JPY→USD)
框架执行,把三个结果追加进轨迹:
EUR→USD: 2,282,608.7
GBP→USD: 2,278,481.01
JPY→USD: 2,541,806.02
── 此刻上下文里新增了 4 条消息(1 条调用 + 3 条结果)
迭代 2 LLM 看到:上面的一切 + 三个换算结果
思考:「已获得转换结果,现在需要汇总计算」
行动:调用代码解释器,让真·代码算加法(而不是自己心算)
total = 2500000 + 2282608.7 + …
工具返回:Total: $9,602,895.73
── 上下文再增 2 条
迭代 3 LLM 看到:全部轨迹
这次不再调工具,直接产出最终答复:
「总收入 $9,602,895.73,季度平均 $2,400,723.93」

三个观察,每个都是后文的伏笔:

  1. 共 3 次迭代、4 次工具调用,其中第一次迭代把三个独立调用并行(同时开跑、互不等待)发出—— 「哪些调用能并行」由模型判断,框架只管执行(第 08 章会讲这个判断的边界);
  2. 第二步加法故意不自己算,而是发给代码解释器——「模型该算什么、代码该算什么」 这条分界线,第 09 章整章都在讲;
  3. 每一步能看到完整轨迹(任务执行中不断积累的消息历史),所以第 3 步知道前两步 干过什么。轨迹是这个循环里唯一在「长」的东西——它的结构与膨胀,就是第二至五章 的全部主题3

3.3 五类工具:Agent 能伸出的手

书里按「Agent 与外界互动的方向」把工具分五类4:

干什么例子
感知工具让 Agent 访问信息搜索引擎、读文件、查数据库
执行工具让 Agent 改变世界跑代码、写文件、系统命令
协作工具与其他 Agent 分工派子 Agent、请求人确认
事件触发工具外部输入驱动 Agent 启动新邮件到达、定时器到点
用户沟通工具主动向用户传话发消息、打电话、发卡片

前两类好理解;事件触发工具与前两类有本质区别:它不是 Agent 主动调的,而是 外部世界来「叫醒」Agent——这一条把 Agent 从「你问我答」变成「守在那儿等事情发生」, 第 08 章讲异步事件时整节都在处理它带来的麻烦。用户沟通工具容易和协作工具搞混, 书里给的判据是:给审批者发通知(发消息请人来把关)算协作,通知最终用户算用户沟通。

3.4 模型即 Agent:Harness 登场

2026 年的强模型出现了一个新趋势:工具调用本身被后训练(在预训练完成后再用 专门数据调教的阶段,第 11 章的主角)练进了模型内部——何时调工具、调哪个、传什么 参数,模型自己决定,不需要外部代码编排(预先写好「先调谁、再调谁」的调度逻辑)。书里把这叫「模型即 Agent」5

一个直接证据:Kimi K3(约 2.8 万亿参数的混合专家(MoE,即把模型内部分成多位「专家」、每个问题只请最合适的几位出面)模型——可以把 MoE 想象成 一个专家委员会,每个问题只请最合适的几位专家出面,而不是全员上岗,以此省钱提速) 能连续执行 200~300 次工具调用而保持思路一致,而多数模型几十次后就开始退化6

那模型都这么强了,围绕模型做的那层工程——书里叫 Harness(马具,让马力变成 交通工具的那套套件)——还有存在价值吗?书里的回答是一个退款任务的对照实验:

任务:退掉 3 天前的订单
没有 Harness:看不到退款政策 → 不知道调哪个 API → 编造「已退款」→ 用户发现钱没退
有 Harness: 系统提示词写明 7 天可退 → 提供退款 API → 先查订单状态再操作 →
操作后核验数据库,确认退款真的发生

同一个模型,差别全在 Harness 的五个功能:上下文、工具、约束、验证、纠正。 书里据此给了本章最重要的判断:模型越强,Harness 越关键——因为模型能力边界之外 的部分,恰好就是 Harness 的价值所在7

3.5 五波演进:工程重心的迁移

书里把这几年的工程范式排成一条弧线8:

波次名称管什么
0软件工程系统设计、测试、部署这些老本行
1提示工程(打磨喂给模型的指令文字)改写喂给模型的规则文字
2上下文工程系统管理模型能看到的一切信息
3Harness 工程上下文+工具+约束+验证+纠正整套套件
4Loop 工程设计让 Agent 持续运转、可靠停下的循环

关键在最后一列的关系:五波不是替代,是层层包含。提示词是上下文的一部分, 上下文是 Harness 的一部分,循环把前面全部装进去。当各家模型能力接近、不再是 决定性差异时,竞争就转移到模型之外的工程实践——书里引了一个数字作证: 某基准上不换模型、只改 Harness,任务准确率从 52.8% 涨到 66.5%。 这个数字后记还会再引用一次,那里会给它的另一面。

「Loop 工程」这个词值得单独说一句:它是 2026 年 6 月才被总结命名的,但书里特别 指出,在这名词流行之前,第一梯队的团队早已在按「循环+验证」干活——实践在前、命名在后, 是这本书反复出现的句式9。第 14 章讲多 Agent 协作时,循环的三种失败形态 会正面撞上它。

3.6 工作流还是自主 Agent:一道光谱

「要不要让 Agent 自由发挥」不是非黑即白。书里的判据是执行路径能不能预先写死:

工作流(路径预定)自主 Agent(路径自定)
路径像「订机票」流程图:查票→比价→下单,固定四节点ReAct 循环,每步现想
好处攻击面被限制在单个节点,出错好查能对付没预料到的局面
代价局面一变就失灵行为难预测,必须配停止条件

实用的落点是混合:先上工作流,把确定的段落固定下来;只把真正需要临场判断的 岔路口交给模型。书里给了一条从严的起点原则:能靠改提示词解决就不上 Agent, 能工作流就不自主——每多一层自主,就多一层要防的出错方式10

4. 作者的判断与证据

书里给了证据的:

  • 消融实验(逐个拆掉部件看系统塌不塌)证明上下文五部分缺一不可:去掉工具定义,Agent 完全丧失行动能力; 缺少工具执行结果,Agent 会无限循环;剥掉思考部分,行为前后矛盾;没有历史, 则失忆重做11消融实验(逐个拆掉部件看系统塌不塌,像医生排查病因)是 这本书最常用的证据形态,全书出现十几次;
  • Kimi K3 的 200~300 次连续调用、「52.8%→66.5% 只改 Harness」、3 迭代 4 调用, 都是书里跑过的实验数字。

是作者的判断(有立场,需要知道):

  • 「模型越强 Harness 越关键」——这不是中立观察。作者本人是 Agent 创业公司 Pine AI 的首席科学家,生意就是做 Harness;书里大量例子来自自家产品;
  • 「苦涩的教训在 Agent 时代的读法」——通用方法终将胜出,但作者认为 Harness 是「终将」二字里每段路的铺路石。这个立场在全书结尾会展开成「飞轮」论证,第 14 章收尾时再评。 如果错,会错在: 若真实业务的反馈数据并非训练信号的主要来源(比如主要 来自合成数据(用模型生成的训练材料)),飞轮论就高估了应用层的地位。

5. 边界与局限

  • 本章是概念地图,不解决任何具体问题。 每个话题(缓存、压缩、安全、评估) 都只开个头,细节分散在后面各章——想直接抄答案的读者要等;
  • 「模型即 Agent」的边界在弱模型侧。 200~300 次稳定调用是前沿模型的成绩; 换小模型,「框架替模型做编排」立刻重新变得必要——书里第 02 章那个 6 亿参数模型 的实验就是反例的正面用法;
  • 五类工具的分类是本书自造的整理,不是业界标准;作者自己也说明这是 「为了系统化讨论」而设;
  • 书里引的模型名、版本与数字全部停在 2026 年年中,读时记得打这个折扣。

6. 可带走的

  1. Agent = LLM + 上下文 + 工具;对应三问:看到什么、能做什么、怎么验证—— 模型换代,三问不换;
  2. Agent 的本质是「想→做→看」的循环,轨迹是循环里唯一在长的东西;
  3. 判断一件事该不该上 Agent:路径能写死就写死(工作流),写不死才给自主;
  4. 上下文五部分(系统提示词(给模型的行为规则)/工具定义/用户消息/模型回复/工具结果)缺一不可, 有消融实验为证;
  5. 模型越强,Harness 越关键——但记住说话的人是卖 Harness 的;
  6. 五波演进层层包含:你现在做的每一层,都被下一层包着;
  7. 遇到「并行还是串行」:调用之间没有依赖就并行,有依赖就等——判断者应是模型, 执行者是框架;
  8. 加法尽量交给代码解释器,模型负责决定算什么——这个分界线全书都在用。

7. 原文地图

主题原书章原文位置
核心公式、RL 对应引言text/02-fm.txt:33(搜「核心公式只有一句话」) · text/02-fm.txt:39(搜「Policy」)
whisper coding、实践在前命名在后引言text/02-fm.txt:7(搜「whisper」) · text/02-fm.txt:11(搜「真实的顺序恰恰是反的」)
Pine AI 与作者立场引言text/02-fm.txt:13(搜「首席科学家」)
术语约定 reasoning/inference引言text/02-fm.txt:83(搜「术语约定」)
五类工具1 AI Agent 入门text/03-ch01-1-ai-agent.txt:87(搜「感知工具」) · text/03-ch01-1-ai-agent.txt:93(搜「事件触发工具」)
上下文五部分与消融实验1 AI Agent 入门text/03-ch01-1-ai-agent.txt:154(搜「视野」) · text/03-ch01-1-ai-agent.txt:168(搜「消融实验」)
ReAct 与轨迹1 AI Agent 入门text/03-ch01-1-ai-agent.txt:184(搜「ReAct」) · text/03-ch01-1-ai-agent.txt:186(搜「多币种收入汇总」)
轨迹伪代码与 3 迭代 4 调用1 AI Agent 入门text/03-ch01-1-ai-agent.txt:192(搜「轨迹 =」) · text/03-ch01-1-ai-agent.txt:227(搜「3 次迭代、4 次工具调用」)
模型即 Agent、Kimi K31 AI Agent 入门text/03-ch01-1-ai-agent.txt:134(搜「模型即 Agent」) · text/03-ch01-1-ai-agent.txt:237(搜「混合专家」) · text/03-ch01-1-ai-agent.txt:241(搜「200~300 次」)
Harness 与退款对照1 AI Agent 入门text/03-ch01-1-ai-agent.txt:271(搜「退掉 3 天前的订单」) · text/03-ch01-1-ai-agent.txt:273(搜「马具隐喻」)
苦涩的教训之问1 AI Agent 入门text/03-ch01-1-ai-agent.txt:138(搜「吃掉」)
五波演进与层层包含1 AI Agent 入门text/03-ch01-1-ai-agent.txt:323(搜「第一波创新」) · text/03-ch01-1-ai-agent.txt:325(搜「层层包含」)
三原则、从简单到复杂1 AI Agent 入门text/03-ch01-1-ai-agent.txt:367(搜「保持简单」) · text/03-ch01-1-ai-agent.txt:395(搜「从简单到复杂」)
护栏概览1 AI Agent 入门text/03-ch01-1-ai-agent.txt:497(搜「提示注入防护」)

Footnotes

  1. 出处:「引言」第 33 段(text/02-fm.txt:33,搜「核心公式只有一句话」)。原文:「本书的核心公式只有一句话:Agent = LLM + 上下文 + 工具。三者缺一不可。」

  2. 出处:「引言」第 39 段(text/02-fm.txt:39,搜「Policy」)。原文把三个组件映射到强化学习的 Policy/Observation Space/Action Space,并说明「三种说法对应同一个对象,只是表达层次不同」。

  3. 出处:「1 AI Agent 入门」第 186 段(text/03-ch01-1-ai-agent.txt:186,搜「多币种收入汇总」)与第 231 段(text/03-ch01-1-ai-agent.txt:231,搜「闭环优化」)。原文定义轨迹为「Agent 在执行任务过程中不断积累的消息历史」。

  4. 出处:「1 AI Agent 入门」第 87-97 段(text/03-ch01-1-ai-agent.txt:87,搜「感知工具」;text/03-ch01-1-ai-agent.txt:93,搜「事件触发工具」)。原文强调事件触发工具「不是 Agent 主动调用的,而是作为外部输入来驱动 Agent」。

  5. 出处:「1 AI Agent 入门」第 134 段(text/03-ch01-1-ai-agent.txt:134,搜「模型即 Agent」)。原文:「先进模型通过后训练(特别是强化学习)将工具调用能力内化为原生能力」。

  6. 出处:「1 AI Agent 入门」第 237 段(text/03-ch01-1-ai-agent.txt:237,搜「混合专家」)与第 241 段(text/03-ch01-1-ai-agent.txt:241,搜「200~300 次」)。原文说多数模型「数十次调用后就开始退化」。

  7. 出处:「1 AI Agent 入门」第 271 段(text/03-ch01-1-ai-agent.txt:271,搜「退掉 3 天前的订单」)与第 273 段(text/03-ch01-1-ai-agent.txt:273,搜「马具隐喻」)。原文结论:「模型越强大,围绕模型构建的 Harness 就越关键」。

  8. 出处:「1 AI Agent 入门」第 323 段(text/03-ch01-1-ai-agent.txt:323,搜「第一波创新」)与第 325 段(text/03-ch01-1-ai-agent.txt:325,搜「层层包含」)。52.8%→66.5% 的数字同样出自第 325 段,后记第 37 段再引一次。

  9. 出处:「引言」第 11 段(text/02-fm.txt:11,搜「真实的顺序恰恰是反的」)。原文:「并不是 Anthropic 这些公司先发明了这套做法、再起名字,而是团队早已在做,名词是事后提炼的」。

  10. 出处:「1 AI Agent 入门」第 395 段(text/03-ch01-1-ai-agent.txt:395,搜「从简单到复杂」)。

  11. 出处:「1 AI Agent 入门」第 168 段(text/03-ch01-1-ai-agent.txt:168,搜「消融实验」)。