跳到主要内容

智能体这台机器 — 六大要素与谁在干活

这一章讲三件事: 聊天机器人和智能体到底差在哪;智能体由哪六个部件组成、各自管什么; 以及一个多数人猜错的真相——大模型并不亲自干活,干活的另有其人。 读完你会有一张「智能体 anatomy 图」,第 03 章的按需加载、第 06 章的子智能体都挂在这张图上。

1. 聊天机器人和智能体差在哪

先看现象。 同样是「AI 帮我做番茄炒蛋」:

  • 在聊天机器人(比如 2022 年刚出时的那类产品)里,它会给你背一份完美的菜谱, 然后切菜、颠勺还得你自己来——它像电话那头的「美食顾问」,没有厨房1;
  • 在智能体里,你只要说「做番茄炒蛋」,它动用厨房设施把菜做好端到你面前2

差别用书里两个极简公式一看就明白3:

AI 聊天机器人 = 大模型 + 上下文 (有脑子和记忆,只能纸上谈兵)
智能体 = 大模型 + 上下文 + 工具 + 技能 (配齐了工具和操作说明,能动手)

上下文(context)这个词先按下不表,下一章细讲;这里只需要知道它是大模型的「工作记忆」。

书里还把这套公式和行业里被引用最多的权威定义对了个账:翁荔(Lilian Weng,前 OpenAI 研究副总裁)提出 agent = LLM + 记忆 + 规划 + 工具使用;本书的公式与之在工程落地层面基本对应——上下文对应短期记忆, 技能则是把「规划」固化成可复用的操作说明4

剩下的两个外围要素:一头一尾——一头是触发干活的「指令」(提示词), 一尾是方便接外部工具的「通用插座」(MCP)。合起来正好六个,下一节进厨房。

2. AI 厨房:六个部件一次摆齐

书用一间「AI 厨房」打比方,并事先声明:比方只是帮你记住,不对应真实系统结构5。 六要素逐个过,每个都按「厨房里是什么 → 真实是什么 → 关键性质」三步讲。

要素厨房里真实是什么关键性质
提示词你对厨师下的指令你发给 AI 的输入临时性:只在当前对话生效6
大模型厨师负责理解与判断的「大脑」只下指令,不动手(见第 3 节)
上下文厨房台面大模型的工作记忆容量有限,堆满会「忘事」7
工具刀铲锅具读写文件、执行代码、搜索网页等能力分内置与扩展8
技能菜谱写给大模型看的操作手册名片+正文,可组合9
MCP通用插座连外部工具的统一标准厂商适配一次,智能体支持一次10

几个值得停一下的地方:

大模型「厨师」其实没长手。 需要联网搜索时,它只是发出一条机器指令(技术上叫函数调用—— 让程序去执行某个具体动作的请求格式),真正动手的是智能体运行框架。为了好懂, 书把「大模型下指令」和「框架执行」揉在一起说成「厨师在动手」,第 3 节就把这层窗户纸捅破11

工具为什么分两类。 内置工具像厨房自带的刀铲(读写文件、执行代码、搜索网页,智能体原生就有); 扩展工具像要插电的烤箱(操作浏览器、连数据库、对接飞书,需要通过插件、API 或协议接入)12。 没有工具的智能体,纵有好厨艺也是巧妇难为无米之炊13

技能这道「菜谱」,书里引了 Anthropic 官方定义:「一组有组织的文件集合,为智能体打包可组合的流程性知识」。 拆开看:「有组织的文件集合」=一个文件夹(核心是 SKILL.md);「可组合」=各司其职但能拼起来用; 「流程性知识」=装的不是百科知识,而是「怎么把一件事做好」的流程、规范、检查清单14

一句话厘清工具、技能、MCP 三者的关系(书里原话的意思):工具让智能体能动手干活, 技能教它具体怎么做,MCP 让外部工具无缝接入15

你(下指令、验收)
│ 提示词

┌─────────────────────────────┐
│ 智能体(厨房) │
│ │
│ 大模型(厨师)◄──技能(菜谱) │
│ │ ▲ │
│ 指令│ │结果 │
│ ▼ │ │
│ 框架(后厨管理)──► 工具 │──► 外部世界(经 MCP 插座)
│ │
│ 上下文(台面,容量有限) │
└─────────────────────────────┘

图说:六要素的位置关系。厨师和台面在第 03 章细讲,本章先把框图立起来。

3. 「厨师动手」的真相:框架与模型的分工

这一节是全章的承重墙,也是主走查的舞台。 先给结论:大模型出主意,框架干活。

书里把智能体拆成两部分:核心的「大模型」(大脑,负责思考、推理、下达指令)和 「智能体运行框架」(agent harness,简称框架)——负责加载技能、管理上下文、调度工具的底层程序16。 你用过的 Claude Code、OpenClaw、Codex、Cursor、Copilot,都是不同的框架; 它们里面跑的大模型可能不同,但框架要干的活儿一样17

(harness 这个词工业界尚无统一定义,中文也没有共识译法,书里译作「运行框架」; 它参考了 LangChain 工程师的说法「Agent = Model + Harness」18。)

有了这层区分,技能的工作方式就清楚了。书里给的真实分工是19:

  • 框架负责「递本子」和「跑代码」:把 SKILL.md 的内容和任务所需的参考文档提取出来发给大模型; 如果技能包里有脚本(Python 代码这类),由框架直接在本地运行,不经过大模型
  • 大模型负责「读本子」和「下指令」:阅读 SKILL.md,理解步骤和规则,然后输出一条具体指令, 告诉框架去触发哪个底层脚本。

主走查:一句「帮我查明天的天气」在机器里怎么走

书里给了一个真实格式的例子,我们把它走全程(每一步的部件都来自上面的分工)20:

① 你说(提示词,大白话):
「帮我查明天的天气」


② 大模型读懂意图,向框架发出结构化指令(不再是人话,是机器间协作的数据):
{"action": "search_weather", "date": "tomorrow"}


③ 框架接收指令,调用能联网的搜索工具去查


④ 工具返回结果(如:晴,12~22℃)——框架把它放回大模型的工作记忆(上下文)


⑤ 大模型把数据组织成中文回答,你看到:「明天晴,12 到 22 度……」

(第 ④ 步的「晴,12~22℃」是演示编的示例值,不是书里的数据;其余格式均为书里给出的真实样子。)

这条链上有三个容易忽视的点:

  1. ② 是「身份切换」:面对你时大模型是听指令的厨师;转身面对框架时,它是发号施令的大脑—— 人下的指令(提示词)和大模型下的指令(结构化数据)是两种语言21;
  2. ③④ 大模型全程没参与:真正联网的是框架调的工具,模型只负责决定「查天气」和最后「把结果说成人话」;
  3. ⑤ 的回答质量取决于④的结果有没有被放进上下文——「放进去的东西占地方」这个伏笔,第 03 章展开。

4. 为什么技能能跨平台:标准管住的是框架

第 01 章说过「一次编写,到处运行」,现在能解释原理了。

同一个技能文件夹,装进 Claude Code 或 OpenClaw 都能用,因为 Agent Skills 开放标准规定了 框架应该怎样加载和执行技能22。技能是写给大模型读的文件,而「怎么递本子、怎么跑脚本」 是各家框架的事——标准把框架的行为约定住了,文件格式又有规范(第 01 章的 6 个字段), 两头一夹,技能就平台无关了。

判断(我们的,不是书里的): 书里「工具/技能/MCP 是三样东西」的切分,对应到工程上就是 「能力/流程性知识/连接标准」三层。读者最容易犯的错是把 MCP 和技能混为一谈 (「装个 MCP 是不是就是装了技能?」)——不是。MCP 只解决「接进来」,技能解决「怎么用好」。 如果错,会错在: 如果某个平台的实现把两者捆绑(比如技能只能通过 MCP 分发), 这条切分就会失效;但至少在 Agent Skills 标准和 MCP 标准的文本里,两者是独立的两份规范。

5. 关于 MCP,知道这些就够了

MCP(model context protocol,模型上下文协议)——即智能体对接外部工具的统一标准: 对工具厂商,把插头做成「通用款」,所有支持 MCP 的智能体都能用; 对智能体,装一次「通用插座」,所有适配了 MCP 的工具都能接23

书明确说了:本书只需知道 MCP 在系统里的角色即可,不展开24。 (补充(不在书里,依据我们的 protocol 书架):MCP 的消息格式、传输方式、授权机制, 我们书架上有完整拆解,感兴趣按 ai-protocol-reference/mcp-spec 去读。)

6. 边界与局限

  • 「AI 厨房」是教学比喻。 书里自己警告:比喻无法与真实技术细节一一对应, 只抓像的那部分特征(相似点)25。真实系统里「上下文」不是一块物理台面,工具调用也不总是「框架包办」 (有些产品把工具执行放在模型服务端)。
  • harness 的定义在漂。 书引的说法是「围绕大模型的一组支撑组件」,同时转述了另一种观点: harness 更接近「一套持续优化模型行为的工程机制」。两个口径并存,别当成了定律26
  • 六大要素是 2026 年的快照。 书也承认「智能体世界其实就是智能体世界」的要素清单会随行业变, 例如「智能体团队」在第 06 章出现时还是实验性功能。
  • 书里没讲的: 模型如何被训练、为什么能理解人话——那不是这本书的主题, 我们书架的《这就是 ChatGPT》拆解覆盖了这一层。

7. 可带走的

主走查一行复述:「帮我查明天的天气」→ 大模型输出 {"action": "search_weather", "date": "tomorrow"} → 框架调搜索工具 → 结果放回上下文 → 大模型说成人话。模型只出主意,活是框架带着工具干的。

  1. 聊天机器人 = 大模型 + 上下文;智能体 = 再加工具和技能——差别就是能不能动手;
  2. 六要素:提示词(临时)、大模型(大脑)、上下文(有限台面)、工具(内置+扩展)、技能(菜谱)、MCP(插座);
  3. 提示词只在当前对话生效,这个「临时性」是第 01 章「技能把要求写进文件」的根本原因;
  4. 框架(harness)= 加载技能、管理上下文、调度工具的底层程序;Claude Code、OpenClaw 都是框架;
  5. 技能里的脚本由框架直接运行,不经过大模型——记住这条,第 03 章算上下文账时要用;
  6. 人给模型的是大白话,模型给框架的是结构化指令——两种语言,一次身份切换;
  7. 技能跨平台,因为 Agent Skills 标准管的是「框架怎么加载执行技能」这个行为层;
  8. 工具、技能、MCP 各管一段:能动手、会做事、接得上。

8. 原文地图

主题原书章原文位置
聊天机器人 vs 智能体第 2 章text/03-ch02.txt:34(搜「美食顾问」) · text/03-ch02.txt:37(搜「完备的厨房」)
两个极简公式第 2 章text/03-ch02.txt:45(搜「纸上谈兵」)
翁荔的权威定义第 2 章text/03-ch02.txt:49(搜「翁荔」)
提示词的临时性第 2 章text/03-ch02.txt:68(搜「临时性」)
大模型是厨师、函数调用第 2 章text/03-ch02.txt:81(搜「函数调用」)
上下文=台面、窗口=容量第 2 章text/03-ch02.txt:102(搜「台面上堆放的所有东西」) · text/03-ch02.txt:108(搜「工作记忆」)
工具内置与扩展第 2 章text/03-ch02.txt:124(搜「内置工具」) · text/03-ch02.txt:127(搜「扩展工具」)
技能的官方定义拆解第 2 章text/03-ch02.txt:144(搜「有组织的文件集合」) · text/03-ch02.txt:155(搜「流程性知识」)
框架与模型分工第 2 章text/03-ch02.txt:165(搜「运行框架」) · text/03-ch02.txt:178(搜「递本子」) · text/03-ch02.txt:180(搜「不经过大模型」)
框架即产品、跨平台基础第 2 章text/03-ch02.txt:171(搜「不同的框架」) · text/03-ch02.txt:173(搜「技术基础」)
harness 译名与争议第 2 章text/03-ch02.txt:194(搜「尚无统一定义」)
MCP 通用插座第 2 章text/03-ch02.txt:55(搜「通用插座」) · text/03-ch02.txt:55(搜「通用插座」)
人类指令 vs 大模型指令第 2 章text/03-ch02.txt:236(搜「search_weather」)

Footnotes

  1. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 34 段(text/03-ch02.txt:34,搜「美食顾问」)。

  2. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 37 段(text/03-ch02.txt:37,搜「完备的厨房」)。

  3. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 45 段(text/03-ch02.txt:45,搜「纸上谈兵」)。

  4. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 49 段(text/03-ch02.txt:49,搜「翁荔」)。

  5. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 20 段(text/03-ch02.txt:20,搜「严格的学术定义」)。

  6. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 68 段(text/03-ch02.txt:68,搜「临时性」)。

  7. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 102 段(text/03-ch02.txt:102,搜「台面上堆放的所有东西」);「断片儿」例子见第 98 段(text/03-ch02.txt:98,搜「放了糖」)。

  8. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 124 段(text/03-ch02.txt:124,搜「内置工具」)与第 127 段(text/03-ch02.txt:127,搜「扩展工具」)。

  9. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 144 段(text/03-ch02.txt:144,搜「有组织的文件集合」)。

  10. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 215 段(text/03-ch02.txt:215,搜「统一的对接标准」)。

  11. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 81 段(text/03-ch02.txt:81,搜「函数调用」)。

  12. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 127 段(text/03-ch02.txt:127,搜「扩展工具」)。

  13. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 129 段(text/03-ch02.txt:129,搜「没有用具的厨房」)。

  14. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 144 段(text/03-ch02.txt:144,搜「有组织的文件集合」)与第 155 段(text/03-ch02.txt:155,搜「流程性知识」)。

  15. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 221 段(text/03-ch02.txt:221,搜「动手干活」)。原文:「工具让智能体能动手干活,技能教智能体具体怎么做,MCP 让各种外部工具无缝接入」。

  16. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 165 段(text/03-ch02.txt:165,搜「运行框架」)。

  17. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 171 段(text/03-ch02.txt:171,搜「不同的框架」)。

  18. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 194 段(text/03-ch02.txt:194,搜「尚无统一定义」)。

  19. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 178 段(text/03-ch02.txt:178,搜「递本子」)与第 180 段(text/03-ch02.txt:180,搜「不经过大模型」)。

  20. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 234-236 段(text/03-ch02.txt:236,搜「search_weather」)。原文用它区分「人机沟通」与「机器内部协作」的指令格式。

  21. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 239 段(text/03-ch02.txt:239,搜「发号施令」)。

  22. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 173 段(text/03-ch02.txt:173,搜「技术基础」)。

  23. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 55 段(text/03-ch02.txt:55,搜「通用插座」)与第 215 段(text/03-ch02.txt:215,搜「统一的对接标准」)。

  24. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 223 段(text/03-ch02.txt:223,搜「角色即可」)。

  25. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 105 段(text/03-ch02.txt:105,搜「帮助理解的比喻」)。

  26. 出处:「第 2 章 看门道:理解技能运行的核心逻辑」第 196 段(text/03-ch02.txt:196,搜「持续优化模型行为的工程」)。