跳到主要内容

智能体与长思维链 — 从解题循环到「想久一点」的新范式

这一章讲两件事: 智能体(agent(能感知环境、自己做决策并行动的系统),第 13 章定义的)怎么从第 13 章的解题循环长成完整系统(记忆/规划/执行三组件, 以及多智能体的通信与协作); 长思维链——o1 与 DeepSeek-R1 代表的「想久一点再答」范式,它的数据怎么造、怎么训, 为什么「答案对得 1 分」这么简单的奖励够用。 主走查: 原书例 11.1 的 RecAgent 轨迹——虚拟用户 Bob 看电影的全过程, 每个组件各占一步。

1. 智能体三组件:记忆、规划、执行

第 13 章给了规划的三件套骨架(规划器/执行器/环境)。原书 11.2 节把它补完成完整 agent, 正式定义是:能感知环境、自主决策并执行动作的系统。 它的演化史是三代:规则式(专家写死规则)→ 模型式(强化学习自己学策略)→ LLM 式 (用自然语言理解、推理、决策的能力当底座)1。一个 LLM agent 由三个组件构成2:

组件干什么关键设计
记忆存历史,分长短两栈短期记忆 = 模型的上下文窗口(容量有限、随用随弃);长期记忆 = 外部存储(文本/数据库),靠检索读取、靠「反思」更新,容量满了删过时条目
规划把任务拆成子任务序列就是第 13 章那一套,可迭代修正
执行照计划行动、收反馈可用模型自身能力,也可调用外部工具

把它们串起来的是一条工作流:感知现状 → 从记忆取相关历史 → 规划出下一个动作 → 执行 → 反馈进短期记忆 → 过滤后写回记忆——循环往复3

主走查:Bob 看电影(例 11.1,原书的真实轨迹)

原书用推荐系统仿真框架 RecAgent 记录了一个虚拟用户的完整行为链,每一步都能指到组件4:

① 调记忆组件:取出长期记忆(Bob 的用户画像、近期经历)与短期记忆(当前时间、近况)
② 写入新观察时给重要性打分:「Alice 想给所有熟人发帖」→ 重要性 6 分
—— 分数决定这条记忆值不值得长期保存
③ 调规划组件:生成计划「Bob 想先进推荐系统找一部感兴趣的电影,
看完,然后和朋友聊聊它」
④ 调执行组件:[推荐系统] Bob 进入推荐系统
→ 接受推荐,观看电影《星际穿越》
→ 与其他 agent 聊起这部电影
图说:①②是记忆组件,③是规划组件,④是执行组件;
一轮走完,新的经历又写回记忆,成为下一轮①的输入。

2. 多智能体:贵在通信规矩,不在数量

单个 agent 会干活之后,自然的下一步是让一群 agent 协作。多智能体系统的搭建分三步: 定义问题 → 按角色造 agent(规划、知识获取、推理各司其职)→ 定交互方式5。 真正的学问在第三步,原书把它拆成两组机制6:

  • 通信三要素:协议(大家约定好「按什么规则、频率、顺序交换信息」的规矩)、 拓扑(谁跟谁能直接说话、谁要经中转)、内容(自然语言/结构化数据/代码); 要求是及时、可靠、安全;
  • 协作三机制:合作(共享资源信息任务)、竞争(资源受限时博弈)、 谈判(目标冲突时协商让步)。

三个标志性案例,各代表一种用法7:

案例形态记住什么
WebGPT(OpenAI)单 agent + 网页浏览环境自主搜索、翻阅、整理,给出带引用的回答——agent 化的 RAG
MetaGPT多 agent 软件公司产品经理/架构师/工程师/测试分角色,按软件工程流程协作;效率远超人类团队,但生成的代码不一定能跑
西部世界沙盘(生成式(专门「生成内容」而非只做分类判断的那类)智能体)多 agent 社会仿真每个角色一份自然语言人设,在小镇里自主生活、社交;行为全部用自然语言记录——LLM 成了社会模拟的底座

3. 长思维链:回答之前,先想久一点

下半章换个主题——第 01 章说的第二次换挡(测试时扩展)的技术内幕。 2024 年 9 月 o1 出现,带来一种新的输出形态:正式答案之前,先生成一段很长的「思考过程」。 原书给了 DeepSeek-R1 的两个实例:问「196 有几个正整数因子」, 它会先做一段非正式但系统的探索(「分解 196」「取指数」……)再答; 甚至问「中国人口最多的城市」这种一句话能答的题,它也要走一遍 「确认最新数据」「澄清」的长流程8

这段思考最值得注意的是其中的触发词:「wait」「double check」「make sure」「avoid」—— 它们对应着验证、反思、回溯这些动作;对 o1 的研究还归纳出六种推理模式 (系统分析、方法复用、分治、自我改进、上下文识别、约束强调)9。 按正文叙述还原 196 题的思考路径(转码文本中思考原文缺失, 具体数字是我们按算术补的):196 = 2² × 7²,因子个数 = (2+1)×(2+1) = 9—— 中途「wait」一下复核分解对不对,再往下走。

为什么这是范式升级?两大优势10: 其一,打破自回归的「一次定终身」——普通生成写出去就收不回, 错了也只能错下去;长思维链把「检查、修改、回溯」也写进输出, 同一段回答里完成试错。其二,文本空间原则上能模拟任何搜索算法—— 前进探索加回头重访,就是第 12 章 ToT/GoT 的效果, 只是不再需要外部脚手架,全在一段自然语言里完成。 (但原书强调:这个能力不是天生的,要靠训练激发,见下两节。)

4. 数据与训练:几千条数据激活,强化学习拔高

长思维链怎么训出来?分两步:先用长 CoT 数据「激活」,再用强化学习「拔高」11

激活:长 CoT 数据从哪来。 三条路12: 蒸馏(让强慢思考模型生成长思考,拿去教别的模型——STILL-2 用 DeepSeek-R1-Lite 与 QwQ-32B 当教师;关键发现:长度分布就是难度信号, 数学题的长思考最值钱);搜索合成(用蒙特卡洛树搜索—— 一种「试走很多步、按结果回溯打分」的搜索算法—— 把解题拆成多步,每步采样多个候选,给能通向正确答案的步骤打高 Q 值, 从根到叶的成功轨迹天然就是带试错痕迹的长 CoT 数据); 多智能体辩论(几个模型互相质疑、反驳、修正,把辩证过程录成数据)。

激活:只要几千条。 用长 CoT 数据做指令微调,两个目标—— 格式遵守(输出=思考+解答两截)与能力激发(激活反思、回溯这些潜在动作)。 数字很惊人:Qwen2.5-32B 只用 3900 条蒸馏数据微调,数学解题就逼近了 o1-preview/QwQ13。 两个附带发现:跨域泛化(只用数学数据训,物理化学也涨—— 因为学的是「推理模式」不是「领域知识」);SFT 有天花板—— 数据够了之后,再加拒绝采样、DPO 的增益递减,模仿学习的局限开始显现; 还有个副作用:简单题也默认长篇思考14

拔高:放大强化学习。 DeepSeek-R1 与 Kimi-K1.5 公开了做法,三个组件15:

  • 策略模型:先用长 CoT 数据暖启;DeepSeek-R1-Zero 更大胆—— 跳过 SFT,只靠「格式奖励」(输出必须是思考+答案两截)直接上 RL,也练成了;
  • 奖励模型:不用训出来的裁判(长思考过程很难评判),改用可验证奖励—— 数学题对答案、代码题跑测试,答案对得 1 分、错得 0 分。 原书专门讨论了「这么简单为什么够」:RL 的本质是用简单的激励引导模型自主探索, 复杂的推理能力会在探索中自己内化——这是它与 SFT「模仿范例」的根本区别。 局限也明显:只适用于有确定答案的任务(摘要这类不行),但练出的模式可以跨域泛化;
  • RL 算法:PPO(第 08 章)要维护一个价值模型,放大训练时太贵; GRPO/RLOO 这类简化算法用启发式方法砍掉了价值模型, 效率更高,成为长 CoT 训练的主流选择。

仪表盘:响应长度。 RL 训练中要盯的指标是平均响应长度—— 能力增长时,思考会自然变长;DeepSeek-R1-Zero 训到 8000+ 步,性能还在稳定上升。 这条「思考越长、推理越强」的曲线,正是 OpenAI 提出的测试时扩展法则 (扩展法则:性能随投入资源按幂律增长的公式——第 02 章讲的是训练时版本,这里讲的是推理时版本)16

5. test-time scaling:拿推理成本换性能的两把尺

把镜头拉远:长思维链只是测试时扩展(用更多推理成本换更好结果)的一种。 自洽性投票(多条路径)、规划与 agent 循环(多次调用)、长 CoT(单次响应内搜索), 本质都是同一笔交易17。比较这些路线,原书给了两把尺: token 效率(每多花一个 token 换来多少性能)与性能上限(最多能推到多高)。 按现有证据,放大 RL 的路线两项都占优——token 效率更高,而且上限远未触顶 (R1-Zero 的 8000+ 步曲线)18。 原书最后留了三个前瞻判断:领域专家级小模型会因此兴起; 推理与硬件成本下降会让这类模型普及; 长思考模型的安全对齐要专门做——它的推理模式独特,旧的护栏不直接适用19

判断(我们的,不是书里的): 这一章下半是第 01 章「三只手」判断的最强证据: o1/R1 的突破不来自参数变大,而来自训练方式换挡(可验证奖励+放大 RL)。 它还顺手改写了前面好几章的结论地位:第 08 章的 RLHF(人类偏好对齐)与这里的 RL(可验证奖励) 是同一个引擎的两种燃料;第 12 章手工搭的 ToT/GoT 脚手架,正在被「内化成长思考」吸收。 如果错,会错在: 可验证奖励只覆盖「有确定答案」的任务; 如果「无标准答案领域的可靠奖励」长期无解,这条换挡路线就有明显的天花板—— 原书自己也承认这一点,并把「通用任务的奖励模型」留作了开放问题。

6. 作者的判断与证据

  • 实例与数据均有出处: RecAgent 轨迹(例 11.1)4、DeepSeek-R1 的两段输出(例 11.2)8、 STILL-2 的 3900 条与长度分布发现13、R1-Zero 的 8000+ 步曲线16, 均来自原书引用的论文与原书示例;
  • 公开方法: R1/Kimi 的可验证奖励与 GRPO 是已公开的技术报告内容15; o 系列本身未公开,原书明确区分了「公开实现」与「推测」;
  • 作者的判断: 「长 CoT 是推理模式不是领域能力」「测试时扩展两把尺」 「安全对齐要专门做」是原书基于文献的归纳与前瞻141819

7. 边界与局限

  • agent 章节的案例全部运行在文本世界;原书自己列的挑战里, 真实世界部署(硬件、机械误差、安全)排在最后也最难20;
  • 长 CoT 的证据主要来自数学与代码;「思考变长=变强」在这些领域外是否成立,书里明确说未知;
  • 3900 条激活的前提是底座够强(Qwen2.5-32B);弱底座上同样数据能否激活,原书未讨论;
  • 多智能体的通信成本随数量上涨,原书把「可扩展的通信协议」列为未解问题6;
  • 本章写于 2025 年初,长 CoT 生态(R1 之后的开源跟进)仍在快速演变,数字会过时,框架未必。

8. 可带走的

  1. agent 三代:规则式 → RL 模型式 → LLM 式;三组件:记忆(长短两栈)、规划、执行;
  2. 工作流:感知 → 取记忆 → 规划 → 执行 → 反馈回记忆;新记忆要打重要性分(例:6 分);
  3. 多智能体贵在通信三要素(协议/拓扑/内容)与协作三机制(合作/竞争/谈判),不在数量;
  4. MetaGPT=角色化软件公司(代码未必能跑);西部世界=自然语言人设的社会沙盘;
  5. 长思维链:先长想再答;触发词(wait/double check)对应验证与反思动作;
  6. 两大优势:打破「一次定终身」;文本空间可模拟树/图搜索(但能力要靠训练激发);
  7. 数据三路:蒸馏(长度分布=难度信号)、MCTS 合成、多智能体辩论;
  8. 3900 条蒸馏数据即可激活慢思考;SFT 有天花板,副作用是简单题也长想;
  9. 拔高靠放大 RL:可验证奖励(对 1 错 0)+ GRPO(砍掉价值模型);响应长度是能力仪表盘;
  10. test-time scaling 两把尺:token 效率与性能上限;放大 RL 的路线两项都占优。

9. 原文地图

主题原书章原文位置
agent 定义与三代11.2.1text/63-ch11-02-11-2-llm-based-agent-systems.txt:3(搜「perceiving its environment」) · text/63-ch11-02-11-2-llm-based-agent-systems.txt:9(搜「reinforcement learning」)
三组件:记忆/规划/执行11.2.2text/63-ch11-02-11-2-llm-based-agent-systems.txt:13(搜「memory component, planning component」) · text/63-ch11-02-11-2-llm-based-agent-systems.txt:19(搜「Short-term memory」) · text/63-ch11-02-11-2-llm-based-agent-systems.txt:53(搜「Long-term memory」)
工作流11.2.2text/63-ch11-02-11-2-llm-based-agent-systems.txt:69(搜「perceives and analyzes」)
例 11.1 RecAgent例 11.1text/63-ch11-02-11-2-llm-based-agent-systems.txt:31(搜「Alice want to post」) · text/63-ch11-02-11-2-llm-based-agent-systems.txt:47(搜「Interstellar」)
多智能体构建与通信协作11.2.3text/63-ch11-02-11-2-llm-based-agent-systems.txt:87(搜「communication protocol」) · text/63-ch11-02-11-2-llm-based-agent-systems.txt:89(搜「cooperation, competition, and negotiation」)
WebGPT/MetaGPT/西部世界11.2.4text/63-ch11-02-11-2-llm-based-agent-systems.txt:97(搜「WebGPT」) · text/63-ch11-02-11-2-llm-based-agent-systems.txt:105(搜「does not always execute successfully」) · text/63-ch11-02-11-2-llm-based-agent-systems.txt:109(搜「generative agent」)
五大挑战11.2.5text/63-ch11-02-11-2-llm-based-agent-systems.txt:117(搜「computational resources」) · text/63-ch11-02-11-2-llm-based-agent-systems.txt:125(搜「real-world environments」)
长 CoT 实例与触发词11.3.1text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:27(搜「double check」) · text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:29(搜「systematic analysis」)
两大优势11.3.1text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:35(搜「one-time」) · text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:37(搜「emulate various search algorithms」)
数据三路11.3.2text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:47(搜「length distribution」) · text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:51(搜「Monte Carlo Tree Search」)
SFT 激活 3900 条11.3.3text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:67(搜「3.9K」)
跨域泛化与 SFT 天花板11.3.3text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:69(搜「physics and chemistry」) · text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:71(搜「performance ceiling」)
可验证奖励与 R1-Zero11.3.3text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:79(搜「format reward」) · text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:81(搜「1 for a correct solution」)
GRPO 与响应长度11.3.3text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:83(搜「GRPO」;同段搜「response length」)
test-time scaling 两把尺11.3.4text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:89(搜「trade additional inference costs」) · text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:91(搜「token efficiency」;同段搜「8000+」)
前瞻三条11.3.4text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:93(搜「expert-level models」)

Footnotes

  1. 出处:「11.2.1 Overview of Agents」第 3-9 段(text/63-ch11-02-11-2-llm-based-agent-systems.txt:3,搜「perceiving its environment」;text/63-ch11-02-11-2-llm-based-agent-systems.txt:9,搜「reinforcement learning」)。

  2. 出处:「11.2.2 Construction of LLM-Based Agents」第 13-53 段(text/63-ch11-02-11-2-llm-based-agent-systems.txt:13,搜「memory component, planning component」;text/63-ch11-02-11-2-llm-based-agent-systems.txt:53,搜「Long-term memory」)。

  3. 出处:「11.2.2 Workflow」第 69 段(text/63-ch11-02-11-2-llm-based-agent-systems.txt:69,搜「perceives and analyzes」)。

  4. 出处:例 11.1 第 21-51 段(text/63-ch11-02-11-2-llm-based-agent-systems.txt:31,搜「Alice want to post」;text/63-ch11-02-11-2-llm-based-agent-systems.txt:47,搜「Interstellar」)。 2

  5. 出处:「11.2.3 Construction Methods of Multi-agent Systems」第 79-81 段(text/63-ch11-02-11-2-llm-based-agent-systems.txt:79,搜「type, number, and characteristics」)。

  6. 出处:「11.2.3 Communication and Coordination Mechanisms」第 87-89 段(text/63-ch11-02-11-2-llm-based-agent-systems.txt:87,搜「communication protocol」;text/63-ch11-02-11-2-llm-based-agent-systems.txt:89,搜「cooperation, competition, and negotiation」)。 2

  7. 出处:「11.2.4 Typical Applications of LLM-Based Agents」第 97-111 段(text/63-ch11-02-11-2-llm-based-agent-systems.txt:97,搜「WebGPT」;text/63-ch11-02-11-2-llm-based-agent-systems.txt:105,搜「does not always execute successfully」;text/63-ch11-02-11-2-llm-based-agent-systems.txt:109,搜「generative agent」)。

  8. 出处:例 11.2 与「11.3.1 Reasoning Patterns Analysis」第 25-27 段(text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:27,搜「double check」)。转码文本中思考过程原文(灰色字)缺失,我们按正文叙述还原;196 的因子分解(2²×7²→9 个因子)是按算术补写的,不是原文数字。 2

  9. 出处:「11.3.1 Reasoning Patterns Analysis」第 29 段(text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:29,搜「systematic analysis」)。

  10. 出处:「11.3.1 Reasoning Advantages」第 35-37 段(text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:35,搜「one-time」;text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:37,搜「emulate various search algorithms」)。

  11. 出处:「11.3.3 Training Methods」第 61 段(text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:61,搜「two methods」)。

  12. 出处:「11.3.2 Construction of Long CoT Data」第 47-57 段(text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:47,搜「length distribution」;text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:51,搜「Monte Carlo Tree Search」)。

  13. 出处:「11.3.3 Long CoT Instruction Tuning」第 67 段(text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:67,搜「3.9K」)。 2

  14. 出处:「11.3.3 Long CoT Instruction Tuning」第 69-73 段(text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:69,搜「physics and chemistry」;text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:71,搜「performance ceiling」)。 2

  15. 出处:「11.3.3 Scaling RL Training」第 79-81 段(text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:79,搜「format reward」;text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:81,搜「1 for a correct solution」)。 2

  16. 出处:「11.3.3 Scaling RL Training」第 83 段(text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:83,搜「GRPO」;同段搜「response length」)与「11.3.4」第 91 段(text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:91,搜「8000+」)。 2

  17. 出处:「11.3.4 Extended Discussion」第 89 段(text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:89,搜「trade additional inference costs」)。

  18. 出处:「11.3.4 Extended Discussion」第 91 段(text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:91,搜「token efficiency」)。 2

  19. 出处:「11.3.4 Extended Discussion」第 93 段(text/64-ch11-03-11-3-long-chain-of-thought-reasoning.txt:93,搜「expert-level models」)。 2

  20. 出处:「11.2.5 Key Technical Issues」第 117-125 段(text/63-ch11-02-11-2-llm-based-agent-systems.txt:117,搜「computational resources」;text/63-ch11-02-11-2-llm-based-agent-systems.txt:125,搜「real-world environments」)。