工具与推理 — 让模型出手与出声
这一章讲三件事: 工具调用在底层到底是什么(答案还是那句:续写); 设计工具时哪些规矩是拿教训换的;以及怎么让模型「把思考喊出来」—— 这是提升正确率最便宜的一招。 原书第 8 章是全书最长章,我们拆成两章:本章管「能力」, 第 11 章管「组装成 agent」。
1. 这一章讲什么
到第 09 章为止,模型再强也只是「纸上谈兵」: 它不知道训练集之外的事,算大数会错,而且什么都不能做—— 它买不了机票、发不了邮件、调不了你家空调。
这一章给它装两样东西:手(工具)和出声思考的能力(推理技巧)。
主走查是书里那个恒温器对话:「能帮我把温度调高两度吗?」—— 从 API 调用一路钻到内部提示词,看那十几个 token 里发生了什么。
2. 顶层全景:三个死角,一味药
先立三个死角,它们全从第 01 章的「模仿者」身份推出来1:
- 不知道训练集之外的事:你公司的文档、上周的新闻、此刻的航班余票;
- 算术不可靠:简单的靠背,数一大就「自信地估错」;
- 不能行动:它唯一能影响世界的方式,是求用户替它动手。
工具调用——模型在输出里写出「请调用某个函数、带这些参数」, 由你的应用真的去执行、再把结果塞回对话——一味药治三个死角: 查资料、用真计算器/真程序算、真动手2。
用户 → 应用 → 模型(读到工具清单)
│ 输出:「调用 get_room_temp,参数 {}」
应用 ←─────────┘ 应用真的去调,拿到「74」
应用 → 模型(结果塞回:「74」)
│ 输出:「调用 set_room_temp,参数 {temp: 76}」
应用执行 → 模型 → 输出给人看的答案:「已从 74°F 调到 76°F」
图说:主走查全景。模型从头到尾只做「写文字」;
「执行」永远发生在应用层。agent(智能体)——
能自己决定下一步动作、并通过工具实际执行它们的系统——就是
把这个圈自动转起来的东西,第 11 章正式造它。
2023 年 6 月,OpenAI 推出了专为工具调用微调的模型,各家随后跟上3。