跳到主要内容

大模型与智能体(「智能体」:能自己接工具、连续做事的系统)— 全书拆解

30 秒导读:「智能体」指的是能自己接工具、连续做事的系统。这本 2026 年的中文教材,回答四个递进的问题:大模型的能力是怎么长出来的、 怎么被塑成一个能合作的助手、怎么被工程化地部署成一个会做事的系统(这样的系统叫智能体**——能自己接工具、连续做事,而不只回一句话)、这件事的风险和边界在哪。** 它的难得之处在「合」:市面上讲原理的书不讲部署,讲部署的书不讲原理, 这本把「造出来」和「用起来」两本账、数字和物理两个世界,写在了同一条主线上。

1. 30 秒导读

读这本书之前,先纠正一个普遍误会:大模型的故事不是「聊天机器人变聪明了」, 而是方向调了个头——过去是人去学机器的语言(写规则、定流程),现在是机器来学人的语言 (读我们写下的一切,自己压出规律)。这一个调头,后面所有的工程、成本、风险全部跟着重新洗牌。

本书分三部:前九章讲「造出来」——从新的学习方式,到统一的底座,到灌进海量文本,到把行为掰向人类意图,一路讲到钢与硅; 中五章讲「用起来」——从伺候亿万用户的系统,讲到会做事的助手; 后四章讲「走出去与守住」——走进物理世界、走进科学,守住边界,望向远景。 我们这份拆解 18 章,对应原书 17 章——原书第 3、6 两章内容太厚,各拆成了两半(第 03/04 章、第 09/10 章)。

2. 这是谁在什么时候写的

作者邱锡鹏,复旦大学教授。他的前一版教材讲的就是「让机器从例子中学规律」——本书是把那条路推进到大模型与智能体时代的续篇;他的团队做过国内最早公开的对话系统之一
写作时间2026 年,作者官网免费公开 PDF。书中案例更新到 2025–2026 年(欧盟 AI 法案分阶段适用、ChatGPT 一系的最新版、Co-Scientist 上 Nature),是少数「写的是当下」的教材
姿态教科书式的克制:几乎每个有争议的判断(那个终极目标的时间表、具身是否必要、生存风险)都摆了两派观点再标「没有共识」
利益相关作者同时写着另一本深度学习(本书地基的高年级版)教材并在高校任教——倾向把读者当未来要动手的工程师培养,而不是当观众科普;引用自家教材的少数几处均已注明

读法建议: 这是教材,不是新闻集。型号、榜单、公司名会过时; 骨架——两本账、六道坎、权限分层、监督预算——不会。

3. 全书一条主线

把整本书融成一条十四步的链,每步一章。只读这一节,应该能把全书复述出来。

第一步:换门。 变化的本质是让机器来学人的语言——不写规则,给例子,让它自己把规律压出来。 没有人告诉它语法(话怎么组织才算通)和事实,那些是「预测下一个词」逼出来的副产品。

第二步:打地基。 这套学习方式能成立,靠的是几十年的积累:能调参数(内部可调整的那堆数值)的那套做法、 能表达复杂函数的堆叠结构、能扛住失败的各种解药。

第三步:统一底座。 一个让任意位置直接互相看、可以无限堆叠、还能把计算拆给许多芯片同时做的结构, 把处理文字的各种旧方案收编成了同一种积木。

第四步:改造底座。 底座被不断改造得更长、更省、更按需出力—— 而每一次改造都必须在能力、练成成本、使用成本、实现起来有多麻烦这四栏上同时记账,只赢一栏的方案活不下来。

第五步:灌进人类文本。 海量文本加上一个朴素目标,规模到位后,总结、翻译、写代码这些能力 自己长了出来——同时欠下三笔账:算力(能调用的计算能力)、数据偏差、以及此时它还不是助手。

第六步:塑形。 用人类示范和偏好把续写器塑成合作者:听得懂指令、知道拒答、学会承认不确定。 但塑形也可能把错误包装得更可信。

第七步:想得更深。 回答之前先花算力打草稿、试错、回头检查—— 难的部分被挪到了回答的时候,难题上去了,成本曲线也变长了。

第八步:打开感官。 图、声、视频都被切成「词」喂进同一个 AI; 但要看住那条警告:它看起来是「看见了」,实际可能是「合理地猜了」。

第九步:钢与硅。 以上一切跑在从一颗芯片到上万张卡、再到专门园区的物理底座上。 训练——把亿万次试错压缩成参数调整的漫长过程——是一门工厂生意:故障是常态,电和水是首先要满足的条件,算力已经和地缘政治绑在一起。

第十步:下半场的账本。 AI 伺候给亿万用户用的那套系统,赌的是每一秒都不出事—— 一次生成被拆成性格相反的两段,最贵的资产是一份随对话变长的缓存(临时记下的中间结果)。

第十一步:会说话变成会做事。 AI 被装进一个「观察—思考—行动—反馈」的循环里; 决定成败的往往不是 AI 多聪明,而是任务定义清不清、行动边界画得严不严、失败能不能被验证。

第十二步:接上世界,在时间里站稳。 一只手伸向外部程序(行话叫工具)、去别处找资料、操控浏览器和终端; 另一只手管住该记住什么、计划和反思——长任务的麻烦从来不是一步做错,而是小错层层累积。

第十三步:从原型到生产。 跑通一次演示和做出一个系统之间隔着一整个闭环: 轨迹是共同语言,评测要分层,发布要过门槛清单,运营要有人值守——救命的常常是那些无聊表格。

第十四步:走出去。 同一套设计原则被带进两个更硬的世界——物理世界(机器人), 和抽象的知识世界(科学研究);两个世界都不宽容失败,也都放大了回报。

主线走到这里并没有结束:第十四步之后是四个方向——物理世界的考官更严苛(第 15 章), 科学发现的加速器没有刹车(第 16 章),能力越强越需要被约束(第 17 章), 而所有线索汇到同一个远景问题上:通用智能到底还有多远、以什么定义算数(第 18 章)。

4. 章节地图

你想弄清楚……去读前置
大模型到底在干什么、这一轮为什么不同01
让机器从例子中学规律——和训练的最小必要知识0201
那个统一底座为什么成了标准0302
把窗口拉长、按需出力,这些改造值不值0403
灌进海量文本怎么就变成了能力,账怎么算0503
练完之后怎么把行为掰向人类意图,那些毛病的来源0605
回答之前多花功夫想,凭什么更强0705–06
看图听声识字之外,「看见了」可能是「猜了」0803、05
造一个练到最强的 AI 要多少卡、多少电、多少天0904–05
伺候亿万用户的系统怎么又快又省又稳1004、09
会说话怎么变成会做事,决定成败的外壳1107、10
接上工具、资料和浏览器,接口(两边约定好的连接方式)怎么设计1211
长任务怎么不散架、几个助手分工什么时候用1311–12
怎么被评测、上线、运营1413
机器人和「给 AI 一个身体」的真实现状1508、13
AI 在科学里到底改变了什么1603、08
风险与治理的全景1706、14
那个终极目标的定义、路线与人的位置1807、15、17

三条推荐读法:

  • 只关心原理:01 → 02 → 03 → 05 → 06 → 07;
  • 要动手做智能体:11 → 12 → 13 → 14(回头补 07);
  • 只想知道该担心什么:01 → 17 → 18。

5. 覆盖什么 / 不覆盖什么

覆盖: 原书 17 章全部覆盖,无遗漏——原书第 3 章拆为我们的第 03、04 章, 第 6 章拆为第 09 章(训练侧)与第 10 章(推断侧),其余各章一一对应。 原书的习题、扩展阅读清单不单独成章,但有价值的类比(装箱问题、电梯操作员、电子祖宗)已并入正文。

不覆盖(原书就没有或明确推给别处的):

  • 各家 AI 的内部实现细节(网络结构、路由公式的具体样子)——原书定位通识,只给到机制层;
  • 具体产品的操作指南(怎么用某个编程智能体、某家 AI 服务的调用入口);
  • 数学推导的完整证明(投机解码为什么能保持输出规律不变的证明、Roofline 的推导)——原书给了,我们只留直觉,要推导请回原文;
  • 练当代最强的 AI 的真实账本(从不公开内部细节与账本,书里与我们全部使用估算口径)。

这份拆解补的(原书没有的): 与我们自己书架的六处互证——工具连接规范、技能规范、群聊协作、记住与取用的管线、评测流水线、资料查找质量,六份我们写过的拆解;书里提到的机制,都能在书架上找到对应原文。 以及每章一条贯穿式主走查——原书案例散在各节,我们把它们串成了带具体数字的完整走线。

6. 我们的判断

判断(我们的,不是书里的): 全书最有复利的一条线是「利用率」—— 从第 05 章的算力估算,到第 09 章的工期差半年,再到第 16 章的能耗差一倍、第 18 章的 「最成熟的系统未必最强」:纸面峰值从来不等于有效算力,中间那个折扣由工程水平决定。 读不懂这本书的人往往把它当成纯讲方法的书,它其实一半是工程书。 如果错,会错在: 若方法突破让「利用率」这个概念本身失效(比如推断与训练融合成新形态), 这条线就要重讲——但截至成书,没有任何迹象。

判断(我们的,不是书里的): 原书最容易被读浅的一章是第 14 章(智能体工程)。 它表面上讲报销单,实际上讲的是**「事故的组织学」**:轨迹、回归集、门槛清单、复盘五资产, 全部在做同一件事——把「这次为什么错」从口头回忆变成可执行资产。 判断一个团队能不能养智能体,看它有没有失败的工单板,比看评测分数准。 如果错,会错在: AI 强到「不修也行」,这套闭环就成了过度工程——但环境漂移 (审批服务改了个栏目名)不随 AI 变强而消失,所以这个风险很小。

判断(我们的,不是书里的): 关于那个终极目标,我们同意书里的克制,但补一个结构: 六道坎里,一本正经地编造、长规划、持续学习是工程规模问题,现有范式内大概率能磨过去;而「一本正经地编造」的行话,指的就是第一样。 因果、物理常识、持续自我是范式问题,可能需要这本书之外的新思想。 「五年还是五十年」的争论双方都对——只是各自在量不同难度的坎。 如果错,会错在: 若测试时扩展(回答前多花算力)加世界模型(系统内部对世界怎么运转的预演)的组合意外攻破第二类坎,乐观派的时间表获胜; 若数据先耗尽,连第一类坎都会重新变难。


兑现表

正文里每一处「第 N 章讲」的许诺与兑现,逐行核过(只列跨章的前向许诺;章内互指不列)。两列只写「章·节号」,节名以各章末尾的原文地图为准。

许诺在哪应兑现在哪
01§202§5;11§1、§5
01§5 切词(主走查复现)05§5
01§5 编造06§12
01§5 看和听08 全章
01§5 身体15§1–§2
01§6 结构03 全章
01§7 三类评法05§12;14 全章
01§8 成本曲线09§2、§13
01§7 提前查危险17§13–§14
01§9 社会争论17§15–§16
01 主走查 闭环11 全章
01 主走查 外部程序12 全章
01 主走查 一天一亿次10 全章(走查⑦)
01 判断 格局问题18§2
01 边界 滥用面17§16
02§4 提速这条线09§6–§7
02§14 评分表写歪06§8;17§9
02§206;13§16
02边界 变形版本04§10(就地改道)
03§6 更长输入04§4
03§7 铺上万卡09§5
03§7 为何只用后半05§4
03§9 规模到位后突然多出的能力,直觉从哪来06§1;05§7
03§10 表达力折中04§8
03§10 那层负责「想」的网络04§4
04§2 那个方案挪去哪09§6
04§710§4
04§912§6–§7
04 主走查 找得准的天花板12§6–§7
04 边界 找资料那条线12§6–§7
05§4 找资料的地基12§6
05§9 利用率判断09 主走查③、§11
05§9 两段瓶颈10§3
05§10 实验室与工业09§8(章内明示)
05§11 隐私层17§7
05§12 评测框架06§14;14§4–§7
05§1206 全章;17 全章
06 引言07§6
06§11 目标错位17§9
06边界 三类攻击17§3–§5
07引言 可选档位11§3
07§3 可解释性17§11
07§4 工具先声12§5
07§1018§4
08 引言 复合环境11§1
08边界 机器人半节15§9、§13
09§210§4
09§14 推断账本10 全章
09§14 脆弱面17§10
10§8 分层收口14§11
10边界 不只更省07;14§3
11§5 动作空间12 全章
11§5 存取分层13§2
11§9 评测全貌14§4–§7
11 边界 训练三步14§2–§3
11 边界 四种深度13§15
11边界13§12–§14
12边界 三层防御17§4
12边界 训练流水线14§2–§3
15§15 具身必经?18§6
16§12 转向17 全章
17§16 智能爆炸与生存风险18§14

许诺核对的说明

  • 原书编号的「第 N 章」(出现在脚注与原文地图里,指原书章节)不计入上表;
  • 02 章边界处「第 05、09 章讲变形版本」的许诺,在该章边界说明里已就地改道为第 04 章承担 (原书第 3 章后半的内容),故表中按改道后记录;
  • 全书 18 章 3786 处出处经 book-verify 全数回核,6 处书架锚全部指向真实文件与 commit。