跳到主要内容

它只会吐一段文字 — 一圈是怎么转起来的

这一章讲三件事: 那台机器到底会什么、不会什么; 「会自己动手」这件事是怎么被外面的代码拼出来的; 以及在它出现之前,人们让机器办事的老办法各卡在哪一步。

它在全书链条里的位置: 这是全书的地基。 后面十二章——交给模型的那段文字怎么写、工具怎么接、执行器内部长什么样、 多个程序怎么互相说话——全都是这一圈的某一格被放大。

1. 先看它张口就编

这一节要你记住一个现象,别的都先放下:它答得越顺,你越查不出它是从哪儿知道的。

书里有一段作者亲手做的实验。他跟一个聊天机器人聊《浮生六记》, 几个回合下来,对方把书讲得头头是道——而作者自己在旁边注明:它被我带歪了, 《浮生六记》是清代沈复的作品1。它没有查过任何东西,也没有说「我不确定」。

聊天机器人背后那台机器,书里叫它大模型—— 读进一段文字,再一个字一个字往下续写的机器。 它的全部本事就是「照着见过的语感,把这段话接下去」。

下文一律把它简称为模型——就是上面这台机器,不再重复全称。

它见过的东西,是训练——事先拿海量文字反复喂它、把它内部那一大堆数一点点调到位的过程—— 的时候压进去的。压完之后就固定了:哪句话是从哪本书学的,它自己也答不上来。

所以「它编了一段听起来很像真的东西」这件事有个专门的说法, 书里管这叫胡言乱语,行业里更常用的名字是幻觉—— 指模型生成了读起来很顺、前后也不打架、但事实上不存在的内容

为什么这个现象必须放在全书第一节? 因为它直接决定了后面所有设计。 一台答得顺但查不出出处的机器,你不敢把它单独放出去办事。 要么给它接上能真的去查、去算的东西,要么就只能拿它聊天。

2. 它的输出只有文字,没有手

这一节的结论:它能写出「我要去搜一下」,但搜这个动作永远不是它做的。

书里把这件事讲得很直白:语言输出能力是这类程序拥有进一步行动能力的前提条件2。 注意「前提」这两个字——前提不等于本身。它写出一句话,离那句话被执行还差一整段代码。

差的那段代码,书里给了一份伪代码当骨架: 一个函数负责读懂它的输出、把关键信息抠出来,另一个函数负责照抠出来的信息决定下一步干什么3

模型的输出: "我需要先找到目前市场上玫瑰花的一般进货价格……
Action: Search
Action Input: 目前市场上玫瑰花的进货价格"


┌──────────────────────────────────────┐
│ 外面的程序:把这几行拆开 │ ← 这一步是普通代码,不是模型
│ 要调的东西 = Search │
│ 要传的话 = 目前市场上玫瑰花的进货价格 │
└──────────────────────────────────────┘


真的去调搜索,拿回一段结果

图说:模型写下的是一句话,不是一个动作。把这句话变成动作的,
是外面那段普通代码 —— 它是全书所有机制的落脚点。

外面那些「真能干活」的东西,书里统一叫工具:搜索、计算器、查库存的函数、发邮件的服务, 凡是模型自己做不了、要靠外部程序完成的,都算。 而「模型写下要用哪个工具、外面照着去跑」这整件事,有个固定的名字叫工具调用

这种「模型加外面一圈代码」的程序,有个通用的名字,叫智能体(书里通篇用英文写法 Agent)—— 你在别人的文档和产品名里会不断撞见这个词,所以名字必须记住。

3. 主走查:一个真实的问题,一圈一圈走完

这一节是本章的主走查。下面每一步的字串和数字,全部来自原书第 6 章那次真实的调试记录, 没有一个是我们编的。

输入(第 01、03、05 三章都用这一个): 「目前市场上玫瑰花的一般进货价格是多少?如果我在此基础上加价 5%,应该如何定价?」4 **手上有两件工具:**一个网络搜索,一个计算器。

第 1 步 · 问模型(第一次)。 把上面那句话交给模型。它回过来一段文字, 外面的程序从中拆出两样:要调的东西是 Search,要传的话是 目前市场上玫瑰花的进货价格5它没有回答问题,它在派活。

第 2 步 · 跑搜索。 外面的程序真的去调了搜索,拿回十条新闻摘要。 其中一条写着:今年红玫瑰单枝价格普遍在 20 元以上,新晋网红品种 今年基本上进货价都在 25~30 元6这一段是从网上来的,不在模型肚子里。

第 3 步 · 把结果塞回去,再问一次。 十条摘要原样贴回模型面前。 这一次它写道:价格波动很大,取一个中间值,例如 25 元作为计算基础; 然后又派了一次活——要调的东西是 Calculator,要传的话是 25 * 1.057

第 4 步 · 跑计算。 计算器算出 26.258给个参照:进价取的是 25 元,加价 5% 之后贵了 1.25 元。 这个数不是模型算的——第 05 章会讲清楚它是怎么被算出来的。

第 5 步 · 再塞回去,问第三次。 这一次它不派活了, 外面的程序拿到的是一个「结束」类型的产出,命令行上打出一句 I now know the final answer.9循环到此为止。

用户的问题


①问模型 ──▶ 「调 Search,传:玫瑰花进货价格」
│ │
│ ▼
│ ②跑搜索 ──▶ 「今年进价 25~30 元」
│ │
▼ ▼
③问模型(带上第②步的结果)──▶ 「调 Calculator,传:25 * 1.05」
│ │
│ ▼
│ ④跑计算 ──▶ 「26.25」
▼ ▼
⑤问模型(带上第④步的结果)──▶ 「结束」 ← 唯一的出口

图说:一共问了三次模型、跑了两次工具。
奇数步全是问模型,偶数步全是外面在干活 —— 这就是全书那一圈。

把这张图刻在脑子里。 后面每一章都是在往这五步里的某一格加东西: 第 03 章加的是第①步交给模型的那段文字长什么样, 第 04 章加的是第①步「派活」那张单子的格式, 第 05 章加的是把这五步串起来的那个循环体到底写在哪。

4. 哪一轮它不点工具就停

这一节回答:这个圈到底转几次?

答案是没有人规定。书里写得很清楚:如果这一步产生的是任务完成的信号, 循环就终止,并告知任务完成、可以生成结论;否则系统就继续调用并执行指定的工具10

请注意这句话的形状——它不是「转三次」也不是「转到答对为止」, 而是「转到模型自己不再派活为止」。

这一条是「自主」这个词在整本书里唯一的落点。上一节那五步为什么是五步? 因为模型在第⑤步没派活。**如果搜索结果不好,它完全可能在第⑤步再派一次活, 那这一趟就变成七步。**同一个问题跑两遍,步数不一样,这是常态不是故障。

这也意味着一件很实际的事:你事先不知道一次任务要花多少钱、要跑多久。 这一点书里没有正面讨论,但它是后面第 09 章那些麻烦的总根子。

5. 书给的定义:能感知、能决策、能行动

这一节把书里的正式定义补上,免得你之后读别人的文档时对不上号。

书给的定义只有一句:它是一个能够感知环境、做出决策并采取行动的系统11。 拿上一节那五步对一下就明白了:读进搜索结果是感知,写下「调 Calculator」是决策, 外面真的去跑是行动。

书还列了四条特性,作者认为它们合起来才算这类程序。 这张表只是给你一个对照用的说法,不必背:

特性书里的说法在上一节那五步里是哪一步
自主性能根据自身知识和经验独立做决策第①③⑤步,模型自己决定派不派活
适应性能学习和适应环境、不断提高第③步,它按搜索结果改了打算
交互性能与人交互、提供信息和服务第⑤步,最后那句人话
功能性能在特定领域执行特定任务第②④步,搜索和计算

书还给了一套「核心组件」的说法:感知器、知识库、决策引擎、执行器12。 这套词是从更早的教科书传统里来的,这本书后面一次都没再用—— 知道有这么回事就行,不用记。

6. 同一圈的另一种切法:规划、记忆、工具、执行

这一节要说清一件容易让人打结的事:书里同时用了两套切法,它们说的是同一圈。

原书第 2 章开头引了另一位研究者的架构图,把这类程序切成四块: 规划、记忆、工具、执行13。这四个词你在别人的文章里会反复见到,所以要留名。

四块里最需要当场讲明白的是记忆—— 它在这本书里指的不是模型自己记住了什么,而是「你每一轮重新发给它的那段文字」; 分短期(这一轮发给它的那段文字)和长期(外面挂一个库,用的时候搜出来贴进去)两种。 第 08 章整章讲这件事。

为什么工具那一块特别要紧? 书给了一句很硬的理由: 模型一旦训练完成,内部能力和知识边界就基本固定下来,而且难以拓展14。 固定的东西要接上变化的世界,只能靠外挂。

两套切法怎么对上,一张三行的表就够:

第 5 节那套(原书第 1 章)这一节这套(原书第 2 章)在第 3 节那五步里
感知环境记忆把第②④步的结果贴回模型面前
做出决策规划第①③⑤步
采取行动工具 + 执行第②④步

结论:两套切法不冲突,是同一件事的两种分法。 本组拆解后面统一用第二套 (规划/记忆/工具/执行),因为原书第 3 章之后也是这么用的。

7. 在它之前,人们是怎么让机器办事的

这一节回答一个全书只在这里回答一次的问题:为什么非要等这台机器出现?

书里说得斩钉截铁:在它出现之前,没有任何一种技术能够赋予这类程序一个复杂程度 可以与人类大脑相匹敌的「智脑」;上一代那些程序,做不到无障碍地和人交流, 也做不到照人类的指令在稍微复杂的情景里完成一件哪怕不难的事15

书列了四类老办法。下面拿第 3 节那个鲜花定价问题,让每一类各走一遍,看它卡在哪。

第一类,靠规则库办事的(书里叫符号 Agent)。 做法是把知识写成一条条逻辑规则, 遇到问题就在规则里查16它卡在第 1 步:规则库里没有「今天玫瑰进价是多少」这一条, 它就什么也答不出来——书里的原话是无法解决超出它的知识库记录的任何问题。 而且规则越写越多,查一次就越来越贵。

第二类,看到什么做什么的(书里叫反应型 Agent)。 它不做复杂的思考, 只有一个「感知—动作」的快速回路,响应很快、很省17它卡在第 3 步:这个问题要先搜、再算,两步之间还要读懂搜出来的东西; 而它按定义就缺乏复杂的高级决策制定和规划的能力

第三类,靠反复试错练出来的。 它的正式名字叫强化学习—— 让程序在一个环境里一遍遍试,做对了给奖励、做错了给惩罚,一点点把打法练出来; 书里管这一支叫「基于强化学习的 Agent」,下围棋赢过世界冠军的那套系统就属于它18

它卡在第 0 步,连起跑线都没有: 你得先有一个能让它试上几万局的环境, 而「今天玫瑰花该定多少钱」这件事根本没有这样的环境; 书里也直说这条路时间长、要的例子多、还不稳。

第四类,换任务特别快的那一支。 它靠的是迁移学习—— 把在一个任务上学到的东西搬去帮另一个任务,省掉从头再练

这一支还配了另一套本事:不光学「这道题怎么解」,还顺带把「碰上一道新题该怎么上手」 也学下来,所以换任务确实快了很多(这套做法的名字叫元学习, 你在别人的文章里撞见的就是这两个字)19

但它省的是例子,不是判断力: 它照样不会读一段中文新闻、然后决定该调计算器; 而且书里点明,这条路自己还得先吃掉海量的前期训练和大量例子,很难做成通用的。

把四条并排放,结论就自己出来了:

老办法强在哪在鲜花定价这题上卡在哪
规则库每一步都说得清为什么库里没有这条,直接答不了
感知—动作回路快、省接不上「先搜再算」两步
试错练策略无人干预也能在未知环境里学没有可以试几万局的环境
换任务快的那一支少量样本就能上手新任务省的是样本,不是「读懂再决定」

四条路缺的是同一样东西:一个能读懂任意一段自然语言、并据此决定下一步的通用件。 这本书的全部前提,就是那样一个通用件在 2023 年前后突然可用了。

8. 作者真正的主张:路线不写死在代码里

这一节是本章的落点。前面七节都是铺垫,这一句才是作者的主张。

这句主张里有两个词得先讲清。第一个是序列——一串按先后排好的步骤

第二个是硬编码——把这串步骤一条条写死在程序里,跑的时候不能改

作者的原话是:操作的序列并非硬编码在代码中,而是使用大模型来选择执行的操作序列20

拿第 3 节那趟对一下就懂了:没有任何一行代码写着「先搜索、再计算」。 这个顺序是模型在第①步和第③步临场决定的。 换一个问题,顺序就变了;换一天问同一个问题,顺序也可能变。

这句话为什么值得单独拎出来? 因为它是整本书的分界线。 分界线这一侧,程序的路线由人写死;另一侧,路线由模型现挑。 七个实战案例、前后七个现成的框架与开源项目,全都在解决同一个问题: 路线交给模型之后,剩下的怎么办。

书的前言还引了一张外部机构做的分级表,把这条分界线画得更明确: 这类会自己产出内容的应用要经历五个层级,当时的聊天机器人在 L2、编程助手在 L3; 而从 L3 到 L4 的跨越是一个从被动到自主的分水岭21这本书写的全部内容,都在这道分水岭上。

9. 感知与行动这两块,本书点到为止

这一节交代边界,免得你抱着错误的期待往下读。

原书第 1 章还花了两节讲「感知」和「行动」的另一半,但后面十章一次都没回来展开。

一是多模态——指程序能处理和产出不止一种形式的信息:文字之外还有图像、声音、视频22。 它在第 07 章会以「让画图模型出一张首页图」的形式出现一次,但书没有讲它内部怎么工作。

二是具身智能——指让程序拥有物理形态、能在真实世界里动手,通常涉及机器人23。 这一节整节是展望,书里没有任何代码或案例。

这两块本组拆解也不展开,理由和书一样:它们不在这条主线上。 真要了解,得另外找书。

10. 可带走的

  1. 它只会把一段文字往下续写。 「我要去搜一下」是它能写出的最强的东西;搜这个动作永远是外面的代码干的;
  2. 一圈是五步:问模型 → 跑工具 → 塞回去问 → 跑工具 → 塞回去问到它不再派活。 奇数步问模型,偶数步干活;
  3. 出口只有一个:模型自己不派活了。 不是「转三次」,也不是「答对为止」——所以步数、耗时、花费事先都不知道;
  4. 它答得顺不等于它查过。 训练时压进去的东西没有出处,这是全书所有「接外部工具」的动机;
  5. 两套切法说的是同一圈:「感知/决策/行动」是原书第 1 章的说法,「规划/记忆/工具/执行」是原书第 2 章的说法,本组拆解后面统一用后者;
  6. 工具之所以是核心,是因为模型训练完就定型了——固定的东西接变化的世界,只能靠外挂;
  7. **上一代四类办法各缺一块:**规则库没有这条记录、感知回路接不上两步、试错没有可试的环境、迁移省的是例子不是判断力;
  8. 作者真正的主张只有一句:路线不写死在代码里,由模型来选。 全书七个案例都在处理这句话的后果;
  9. 多模态和具身智能这两块,书点到为止,别指望在这本书里找到实现。

11. 原文地图

主题原书章原文位置
它张口就编的真实例子2.5 Agent的推理引擎:ReAct框架text/21-ch02-05-2-5-agent-react.txt:231(搜「胡言乱语」) · text/21-ch02-05-2-5-agent-react.txt:233(搜「浮生六记」)
语言输出是行动的前提1.5 Agent的行动力:语言输出能力和工具使用能力text/12-ch01-05-1-5-agent.txt:5(搜「前提条件」)
解析输出、决定下一步的伪代码1.5 Agent的行动力:语言输出能力和工具使用能力text/12-ch01-05-1-5-agent.txt:43(搜「parse_agent_output 函数」)
观察—思考—行动的循环2.5 Agent的推理引擎:ReAct框架text/21-ch02-05-2-5-agent-react.txt:21(搜「再观察的循环」)
主走查的那个问题6.4 通过create_react_agent创建鲜花定价Agenttext/45-ch06-04-6-4-create-react-agent-agent.txt:76(搜「一般进货价格是多少」)
第一轮派活、搜索结果、第二轮派活、26.25、结束6.5 深挖AgentExecutor的运行机制text/46-ch06-05-6-5-agentexecutor.txt:117(搜「目前市场上玫瑰花的进货价格」) · text/46-ch06-05-6-5-agentexecutor.txt:189(搜「今年基本上进货价都在25~30元」) · text/46-ch06-05-6-5-agentexecutor.txt:217(搜「25 * 1.05」) · text/46-ch06-05-6-5-agentexecutor.txt:243(搜「26.25」) · text/46-ch06-05-6-5-agentexecutor.txt:272(搜「I now know the final answer.」)
循环的退出条件2.1 Agent的四大要素text/17-ch02-01-2-1-agent.txt:77(搜「循环将终止」)
定义、四大特性、核心组件1.2 那么,究竟何谓Agenttext/09-ch01-02-1-2-agent.txt:21(搜「能够感知环境」) · text/09-ch01-02-1-2-agent.txt:57(搜「自主性:Agent 能够根据自身的知识和经验」) · text/09-ch01-02-1-2-agent.txt:67(搜「感知器:Agent通过感知器接收关于环境的信息」)
规划/记忆/工具/执行四要素2.1 Agent的四大要素text/17-ch02-01-2-1-agent.txt:5(搜「四大要素」) · text/17-ch02-01-2-1-agent.txt:27(搜「知识边界就基本固定下来」)
大模型出现之前的四类 Agent1.3 Agent的大脑:大模型的通用推理能力text/10-ch01-03-1-3-agent.txt:23(搜「智脑」) · text/10-ch01-03-1-3-agent.txt:31(搜「符号Agent」) · text/10-ch01-03-1-3-agent.txt:33(搜「反应型Agent」) · text/10-ch01-03-1-3-agent.txt:35(搜「样本效率低」) · text/10-ch01-03-1-3-agent.txt:37(搜「元学习专注学习如何学习」) · text/10-ch01-03-1-3-agent.txt:39(搜「上一代的Agent无法做到这些事情」)
操作序列不硬编码2.5 Agent的推理引擎:ReAct框架text/21-ch02-05-2-5-agent-react.txt:59(搜「操作的序列并非硬编码」)
五个层级与 L3→L4 分水岭前言 一个新纪元的黎明text/04-fm.txt:21(搜「5个层级」) · text/04-fm.txt:25(搜「分别位于L2和L3」) · text/04-fm.txt:27(搜「从被动到自主的分水岭」)
多模态1.4 Agent的感知力:语言交互能力和多模态能力text/11-ch01-04-1-4-agent.txt:15(搜「多模态能力则是指」)
具身智能1.5 Agent的行动力:语言输出能力和工具使用能力text/12-ch01-05-1-5-agent.txt:59(搜「具身智能是指使AI系统」)

Footnotes

  1. 出处:「2.5 Agent的推理引擎:ReAct框架」第 231 段(text/21-ch02-05-2-5-agent-react.txt:231,搜「胡言乱语」)与同节第 233 段(text/21-ch02-05-2-5-agent-react.txt:233,搜「浮生六记」)。原文的用词是「自行其是,在不具备最新前沿知识的情况下胡言乱语」;那张截图的图注是作者自己写的,明说是他把对方带歪的。

  2. 出处:「1.5 Agent的行动力:语言输出能力和工具使用能力」第 5 段(text/12-ch01-05-1-5-agent.txt:5,搜「前提条件」)。原文把行动力拆成「语言输出能力」和「工具使用能力」两块,并说前者是后者的前提。

  3. 出处:「1.5 Agent的行动力:语言输出能力和工具使用能力」第 43 段(text/12-ch01-05-1-5-agent.txt:43,搜「parse_agent_output 函数」)。书里给的是伪代码,两个函数的名字直译过来就是「解析输出」和「决定下一步动作」;作者明说解析逻辑可以用正则表达式或字符串分析来实现——也就是说这一步完全是普通代码,没有模型参与。

  4. 出处:「6.4 通过create_react_agent创建鲜花定价Agent」第 76 段(text/45-ch06-04-6-4-create-react-agent-agent.txt:76,搜「一般进货价格是多少」)。同节第 26 段说明配的两件工具是网络搜索和一个走大模型的数学工具(text/45-ch06-04-6-4-create-react-agent-agent.txt:26,搜「llm-math」)。

  5. 出处:「6.5 深挖AgentExecutor的运行机制」第 117 段(text/46-ch06-05-6-5-agentexecutor.txt:117,搜「目前市场上玫瑰花的进货价格」)。这一步的完整对象在第 115 段起(text/46-ch06-05-6-5-agentexecutor.txt:115,搜「AgentAction(」),里面同时带着模型写下的那段原始文字。

  6. 出处:「6.5 深挖AgentExecutor的运行机制」第 189 段(text/46-ch06-05-6-5-agentexecutor.txt:189,搜「今年基本上进货价都在2530元」)。书里把搜索工具返回的十条摘要原样贴了出来,价格从「2 元一枝」到「一捆 6070 元」都有——这正是下一步模型说「波动很大」的依据。

  7. 出处:「6.5 深挖AgentExecutor的运行机制」第 217 段(text/46-ch06-05-6-5-agentexecutor.txt:217,搜「25 * 1.05」)。模型写下的理由原文是:价格波动很大,「为了计算加价5%后的价格,我们可以取一个中间值,例如25元作为计算基础」。25 这个数是模型自己从十条摘要里挑的,不是书里给的,也不是搜索直接返回的。

  8. 出处:「6.5 深挖AgentExecutor的运行机制」第 243 段(text/46-ch06-05-6-5-agentexecutor.txt:243,搜「26.25」)。原文写的是命令行输出了这一次数学工具调用之后的观察结果。

  9. 出处:「6.5 深挖AgentExecutor的运行机制」第 272 段(text/46-ch06-05-6-5-agentexecutor.txt:272,搜「I now know the final answer.」)。同节第 266 段说明这一步返回的是一个「结束」类型的实例(text/46-ch06-05-6-5-agentexecutor.txt:266,搜「AgentFinish实例」)。作者管这句话叫「任务完成的明确风向标」。

  10. 出处:「2.1 Agent的四大要素」第 77 段(text/17-ch02-01-2-1-agent.txt:77,搜「循环将终止」)。这段讲的是另一个开源项目给的流程图,但作者随后说它和第 2.5 节那套框架「相当吻合」(text/21-ch02-05-2-5-agent-react.txt:33,搜「相当吻合」)。

  11. 出处:「1.2 那么,究竟何谓Agent」第 21 段(text/09-ch01-02-1-2-agent.txt:21,搜「能够感知环境」)。原文这句定义被排版拆成了三行,完整读法是「Agent 是一个能够感知环境、做出决策并采取行动的系统」。

  12. 出处:「1.2 那么,究竟何谓Agent」第 57 段(text/09-ch01-02-1-2-agent.txt:57,搜「自主性:Agent 能够根据自身的知识和经验」)与第 67 段(text/09-ch01-02-1-2-agent.txt:67,搜「感知器:Agent通过感知器接收关于环境的信息」)。四大特性在第 8 节小结里又原样重复了一遍(text/15-ch01-08-1-8.txt:11,搜「自主性:Agent能够在没有人类直接干预的情况下独立做出决策」),可见作者把它当成全书的定义装置。

  13. 出处:「2.1 Agent的四大要素」第 5 段(text/17-ch02-01-2-1-agent.txt:5,搜「四大要素」)。原文注明这张架构图来自研究者 Lilian Weng 的博客,不是作者自己提的。

  14. 出处:「2.1 Agent的四大要素」第 27 段(text/17-ch02-01-2-1-agent.txt:27,搜「知识边界就基本固定下来」)。原文这句是排版拆开的,完整读法是「由于大模型一旦完成预训练,其内部能力和知识边界就基本固定下来,而且难以拓展,因此这些工具显得尤其重要」。

  15. 出处:「1.3 Agent的大脑:大模型的通用推理能力」第 23 段(text/10-ch01-03-1-3-agent.txt:23,搜「智脑」)与第 39 段(text/10-ch01-03-1-3-agent.txt:39,搜「上一代的Agent无法做到这些事情」)。原文特意举了下围棋赢过世界冠军这个反例:那是真突破,但换到「无障碍地和人交流」就不行。

  16. 出处:「1.3 Agent的大脑:大模型的通用推理能力」第 31 段(text/10-ch01-03-1-3-agent.txt:31,搜「符号Agent」)。原文举的经典例子是基于知识库构建的专家系统,并指出它的表达能力很强、推理过程可解释,代价是知识库一大,算力消耗也跟着涨。

  17. 出处:「1.3 Agent的大脑:大模型的通用推理能力」第 33 段(text/10-ch01-03-1-3-agent.txt:33,搜「反应型Agent」)。原文的措辞是「主要基于感知-动作循环,高效地感知环境,并做出反应」,优点是省资源、响应快。

  18. 出处:「1.3 Agent的大脑:大模型的通用推理能力」第 35 段(text/10-ch01-03-1-3-agent.txt:35,搜「样本效率低」)。原文提到早期的做法有 Q-Learning 和 SARSA 两种,后来和深度神经网络结合成为深度强化学习,代表成果是下围棋的那套系统。

  19. 出处:「1.3 Agent的大脑:大模型的通用推理能力」第 37 段(text/10-ch01-03-1-3-agent.txt:37,搜「元学习专注学习如何学习」)。原文对元学习的说法是「专注学习如何学习,能够迅速推断出针对新任务的最优策略」,同时点出两个限制:样本差异太大时迁移会失效,而元学习本身又要海量预训练。

  20. 出处:「2.5 Agent的推理引擎:ReAct框架」第 59 段(text/21-ch02-05-2-5-agent-react.txt:59,搜「操作的序列并非硬编码」)。原文把这句话称作「LangChain 乃至整个大模型应用开发的核心理念」,并用「编程新范式」四个字来形容。

  21. 出处:「前言 一个新纪元的黎明」第 21 段(text/04-fm.txt:21,搜「5个层级」)、第 25 段(text/04-fm.txt:25,搜「分别位于L2和L3」)与第 27 段(text/04-fm.txt:27,搜「从被动到自主的分水岭」)。这张五级表出自一家投资机构,不是作者自己的分级;书里那张表本身是一张图,正文只给了 L2、L3 两个落点和那句分水岭。

  22. 出处:「1.4 Agent的感知力:语言交互能力和多模态能力」第 15 段(text/11-ch01-04-1-4-agent.txt:15,搜「多模态能力则是指」)。原文强调的重点是「整合」——把不同来源的信息合成一个统一的理解,举的例子是自动驾驶要同时用视觉、听觉和车辆状态。

  23. 出处:「1.5 Agent的行动力:语言输出能力和工具使用能力」第 59 段(text/12-ch01-05-1-5-agent.txt:59,搜「具身智能是指使AI系统」)。原文的核心主张是:智能不只是抽象的信息处理,还包括在物理世界中有效操作的能力。这一整节没有代码,也没有案例。