跳到主要内容

从回答到做事 — 一扇门被换掉了

这一章讲三件事: 这几年真正被换掉的到底是什么; 那两个天天被混着说的词——一个管回答、一个管做事——各自指什么; 以及为什么一件朴素得可笑的差事(猜下一个词)最后长出了这么多本事。

它在全书链条里的位置是起点:后面十七章讲的所有东西, 都在回答这一章立起来的那几个问题。

顶层全景:这本书要走的一条链

先把整本书要走的路摆出来,后面每一章都能在这条链上找到自己的位置:

人说一句话

├─① 它被切成一串小块 ──────────────────── 第 03、05 章

├─② 机器把这串小块读一遍,猜下一块 ────── 第 02–05 章
│ (本事就是在这件事上练出来的)

├─③ 练完之后再被调教成「像个助手」 ────── 第 06、07 章

├─④ 这一切要在几千张显卡上真的跑起来 ──── 第 09、10 章

├─⑤ 给它接上外部程序、网页、文件、终端 ── 第 11、12 章
│ ← 从这里开始,它不只是在说话

├─⑥ 让它在几十步里不跑偏、能纠错 ────────── 第 13、14 章

└─⑦ 然后才轮到问:它会闯什么祸,谁来管 ──── 第 17、18 章

图说: 前四步讲的是「一台机器怎么变得会说话」,后三步讲的是 「一个会说话的机器怎么变成一个会做事的系统」。这一章的任务是把这两半的分界线画清楚。

1. 一扇门被换掉了

2022 年 11 月 30 日,一家美国公司悄悄上线了一个聊天框。头几个小时没什么人当回事—— 过去十几年这种「智能助手」出现过不止一个,大多雷声大雨点小。可几天之后情况变得很奇怪: 它像是在一字一句读你的问题,然后写出一段看起来是在认真回答的话。 五天之内注册用户破一百万1

但真正被换掉的东西,不在「它答得更像人了」这一层。

回想一下过去几十年你是怎么用电脑的。想修图,就去学修图软件的菜单;想查资料, 就打开搜索引擎;想处理表格,就在单元格、函数和筛选器之间来回切。软件当然很强, 但它要求你先学会软件的说法:哪个按钮、哪个菜单、哪个选项、哪种文件格式。

今天反过来了。人越来越多地直接说出自己想要什么,而不再先想「该点哪个按钮」。 帮我总结这份文档,帮我把这段代码改清楚,帮我从一堆网页里挑出真正有用的。 表面上只是把鼠标换成了对话框;往深处看,换掉的是「谁去学谁的语言」这个方向2

这就是为什么书里说它更像是站在一堆软件前面的一个入口,而不是又多了一个软件。 你不再直接面对十几个分散的程序,而是先面对一个能听懂任务、能转换说法、 能替你去调别的能力的中间层。

不过入口不等于万能。人话的好处是门槛低,难处也正在于模糊。 你说「帮我查一下最近最合适的航班」,这句话里藏着省钱、时间、转机、行李、 偏好和容错一大堆没说出口的条件。能听懂只是第一步;要真把事办完, 系统还得能记住、能去查、能动手、能收到反馈再改。这就自然引出了下一节的分家。

2. 一个回答问题,一个完成任务

这一节要把两个天天被混着说的词分开。分不开,后面十七章都会读岔。

先说最底下那个词。模型说的是一台用大量数字搭起来的机器: 你给它一段文字,它拿这些数字算一遍,吐出下一段文字。这些数字不是人一个个填进去的, 是让它读了海量材料之后自己调出来的——怎么调,第 02 章讲。

这些可以被调的数字,行话叫参数(就是那台机器内部会被反复修改的数值, 一台前沿的机器有几千亿到上万亿个)。它的个数常被拿来当规模的粗略标尺, 所谓「千亿模型」说的就是这件事。

于是有了第一个词:大模型(参数规模很大、靠海量数据练出来的那一类机器; 专门处理文字的那种也叫大语言模型)。它最基本的差事可以写成一句话: 根据前面那段文字,猜后面最可能出现的下一块内容3

你在新闻里听到的那些名字,指的都是这一类机器的不同产品: GPT(这一串名字里最有名的一个,三个字母是它英文名的缩写)、 Claude、Gemini、通义、豆包、Kimi。名字会变,这一类机器的形状不会。

但即使这样的机器已经很强,它做的事仍然只是生成输出。 它能告诉你订机票要注意什么,却不会自己打开浏览器去查票; 它能总结一份简历,却不会登录招聘网站去投;它能写一段数据库查询, 却不天然知道该连哪个库、有没有权限、执行失败了怎么恢复4

于是有了第二个词:智能体(一个能在环境里接任务、去拿信息、做决定、 执行动作、再根据反馈继续调整的系统)。在这个说法里,那台机器往往充当大脑, 但系统还需要别的部件:外部程序、能去查资料的模块、能存住前面发生过什么的地方、 任务状态、执行器、监控,有时还得有人在关键处点一次头,以及一套权限管理5

书里给了一句很好记的区分:大模型回答问题,智能体完成任务6。 这句话抓住了主干,但要小心它把事情说得太干脆——现实里的系统几乎都落在两者之间的连续谱上: 有的只生成文字,有的能调几个外部程序,有的能在较长时间里持续推进复杂任务。

理解这条连续谱能帮你避开两种常见误判:把所有会调外部程序的系统都吹成智能体, 或者把真正需要系统设计的问题误解成「只要机器再大一点就自然解决了」。 后面第 11 章会把这条线画得更细。

3. 套娃:四个词的层级

有四个词经常被混着用,像同义词。它们的关系其实是套娃式的同心圆—— 一圈套一圈,而不是并列的四样东西7

最外层是人工智能(让机器表现出某种智能行为的整个研究领域)。 它不是一种具体技术,而是一个目标——1956 年那批学者定的说法是 「让机器做那些如果由人来做、会被认为是智能的事情」。

往里一层是机器学习(不由人手写规则,而是让机器从数据里自己归纳规律的那一类做法)。 判断一封邮件是不是垃圾邮件,你可以手写一大堆规则;它的做法是给机器几万封 标好「垃圾」或「正常」的邮件,让它自己找出哪些模式和垃圾高度相关。

再往里是深度学习(用很多层堆起来的网络,从数据里自动提取一层层表达的那一类方法)。 2012 年之后它成了主流,原因和它此前的三十年低谷一起放在第 02 章。

它和上一层的差别不在「能不能拟合数据」,而在它能自己找出比人手工设计更管用的那些 特征(用来判断的线索,比如一张脸上眉眼的间距、一段文字里的用词习惯)。

最里面才是大模型:深度学习这条路线在规模、数据和工程上走到极致的产物。

这个同心圆背后还压着一条历史脉络:每一圈的扩张,都是在前一圈撞墙之后, 被一种更「不依赖人」的新做法接力推动的。早期靠人写规则,规则编不全、 例外永远比规则多;后来靠人一条条写出正确答案,可这份人工成本随任务种类翻着倍往上涨; 再后来才轮到「数据自己当老师」。

这条谱系还点出一个容易被忽略的事实:不是所有 AI 都是深度学习, 更不是所有深度学习都是大模型。今天工业里跑得最稳的很多预测系统、 推荐系统、风控系统,仍然以更老的那几套做法为主;它们便宜、说得清、好排错8

4. 为什么先在语言上突破

一个更深的问题值得问:为什么是文字这件事先带来了通用本事的突破, 而不是图像、不是声音、不是机器人?

苏联心理学家维果茨基有句被广为引用的话:语言是思维的物质外壳9。 我们用语言交流,也用它思考——在脑子里默念一句话来理顺想法, 把混乱的感受写下来才看清问题;给一件没名字的东西起个名字, 它在我们的认知里才真正「存在」。

把这件事往 AI 推一步,书里给了一个很有冲击力的说法: 人类几千年的写作,包括书、报纸、百科、技术手册、法律条文、科学论文、私人日记、 网络对话,都可以被看成一台巨大的世界压缩机的输出10。 每一篇文字,都把作者脑子里关于某段世界的认识,压成了几十到几千个符号。

于是那批文字虽然只是文字,却间接编下了关于世界的海量知识: 物理的、化学的、社会的、心理的、历史的、技术的。

这就是答案:其他材料要么没有这种「已经被人的认知过滤过一遍」的属性, 要么积累得远远不够。图像大多是世界的原始照片,没经过认知过滤; 机器人采到的数据稀少且昂贵;只有文字,是几千年来人类反复用来思考、记录、 传递的中介物。先在语言上突破,是因为它撞上了人类积累最丰、最密的一座矿藏

当然语言不是世界的全部。它压缩了高层次的认识,却天然丢掉了细微的看、听、 碰和动的经验——这正是第 08 章和第 15 章要补的另一半。

5. 猜下一个词,为什么能逼出世界知识

现在可以看那件「朴素得可笑」的差事了。

把这台机器要练的事剥到最朴素,就是:给一段文字的前面几块,猜后面最可能出现的那一块。 它读到「今天天气」,就给每个可能的下一块打一个可能性分数:很好 0.4、晴朗 0.3、 热 0.15、冷 0.05……11

这里的「一块」不一定是一个字,也不一定是一个词。机器眼里的最小单位叫词元 (把文字切碎之后的小块,可能是一个汉字、一个英文词,也可能只是一个词的一部分)。 为什么要这么切、怎么切,第 05 章讲。

这个想法的祖先可以追溯到 1951 年前后的一个小试验:让人根据前文猜下一个字母或下一个词, 从猜错和猜对的比例去估计英语到底有多少不确定12。今天的做法像是把这个小游戏 放大到了离谱的程度——不是让一个人猜一两句,而是让几千亿个数在互联网级的文字上 玩一场永不结束的接龙。

关键在于:很多空并不能只靠句子的搭配习惯猜出来,而要知道句子背后的世界。 书里给的例子很扎实:

这一句空里该填什么实际考的是
鸡蛋通常是___的椭圆(不是「方」)形状常识
我们把香蕉递给猴子,因为它们饿了「它们」指猴子谁指谁
我们把香蕉递给猴子,因为它们熟透了「它们」指香蕉同一句式的另一种指法
玻璃杯从桌上掉下来,通常会___摔碎(不是「融化」)物理常识
巴黎是法国的___首都地理事实

每个例子表面上都只是补一个词,实际考的却是形状、指代、物理常识和地理事实13

从练的角度看,这台机器在数万亿个这样的小测验上反复被纠正:该接「猴子」时接成「香蕉」, 该接「摔碎」时接成「融化」,分数都会变差。为了少犯这些错,它只能把大量规律 压进那些数字里。于是,表面上是在学文字怎么排列,深层上是在学「什么样的世界 更可能生成这样的文字」

这里要留一句诚实的话:这种世界知识是间接的、纸面上的。它没有亲手摸过鸡蛋, 也没真的看见杯子摔碎;学到的是人类文字里留下的世界痕迹。 所以它擅长文字里反复出现的常识,也会在文字少见、需要当场感知或精确操作的地方出错。 这一点在后面讲「它为什么会一本正经地编」(第 06 章)、「让它也能看和听」(第 08 章)、 「给它一个身体」(第 15 章)时会反复回来。

6. 这一轮为什么和以往不同

把视线拉远一点。早期很多系统靠人写规则,后来靠从数据里学,再后来靠多层网络从原始输入 一路学到最终输出。它们当然一直在变强,但在很长一段时间里都是按任务分工的: 做图像分类的主要做图像分类,做把说话转成文字的主要做把说话转成文字。

这一轮的不同可以收拢成一条线索:先是三件事让它懂得更多,再有一件事让它开始做事14

第一件是统一底座的出现。过去做图像、做声音、做翻译各有一套互不相通的模型家族; 现在同一套结构配上同样的练法,可以先后被用在语言、代码、图像、声音乃至几种材料混着来的任务上。 底座一统一,本事迁移、工程复用和生态扩展都跟着变容易。这套结构是什么,第 03 章讲。

第二件是预训练(先在海量没有正确答案标签的材料上大规模练一遍,把一般本事练出来) 这套做法成熟了。早先的机器大多得先请人把每条数据的正确答案一条条写出来才能起步,贵得吓人; 现在它先从浩瀚文字里学「世界通常是怎么组织的」,再在后一个阶段被塑形成具体的助手。

第三件是规模带来的不成比例的收益。这里的规模既包括参数个数,也包括数据量、 算力(能拿来做计算的机器有多少、有多快)预算和整套工程体系。规模一旦上去, 它在老任务上分数更高,还会冒出一些质的变化:更能用上长材料、更稳地照着要求做、知识覆盖更广。

前三件合起来解释了它为什么「懂得更多」;而真正让它从「懂」跨到「做」的, 是第四件事:模型接上了工具和环境。一旦它能去查信息、调用别的程序、写代码、 操作浏览器、读写文件,它面对的就不再是一个纯文字的安全围栏, 而是一个会被真的改动、会给回反馈、会出错、也会留下后果的真实世界。智能体正是在这里诞生的。

所以这一轮的不同,比「机器更大」「回答更像人」要深: 同一种底座开始承载更多任务,同一个入口开始连接更多系统, 同一台机器开始承担从理解到行动的更长链条

7. 涌现:量变到质变,以及这个说法的争议

有一类现象特别值得单独讲:小机器几乎做不到、大机器突然变得可用的本事。 研究者在一些考卷上观察到,同一道题上,当规模跨过某些区间后, 表现看起来不是缓慢上升,而是从接近零突然跳到「能做」。这被称为涌现 (某种本事在规模跨过某个区间之后才变得可用的现象)15

常被放进这个框架讨论的本事包括:算术和符号推导、多步推导、复杂要求的遵循、 只看几个例子就上手、材料稀少的语言,后来也扩展到代码和调用外部程序。

但这个说法本身有争议,而且这份争议很重要。有研究指出, 争议的重点不一定是「大机器有没有这些本事」,而是「分数曲线是不是真的突然跳变」: 如果只看「答案全对才算对」这种非黑即白的打分方式,曲线当然容易像跳崖; 如果看更连续的部分得分,提升可能平滑得多16

无论哪种解释,结论都一样:我们需要更细致地考它,而不能只盯着几个榜单分数。 这条判断会在第 05 章和第 14 章各被展开一次。

涌现让研究者既兴奋又担忧。兴奋的是,按现有轨迹继续扩,可能解锁今天想不到的新本事; 担忧的是,如果某些本事会在规模或练法变化后突然可用, 那就必须提前去查它有没有危险本事,而不能等出现了再补救。第 17 章会回到这一点。

判断(我们的,不是书里的): 「涌现」这个词今天被用得太松了, 它同时承担了三件不同的事——一个可观测的分数曲线现象、一个关于本事从哪来的假设、 一个用来融资的修辞。读到这个词时最稳妥的做法是先问一句:说的是哪一件? 如果错,会错在: 如果后续研究能给出一个与考卷尺度无关的、稳定可复现的跳变证据, 那么这个词就不只是修辞,我们这条提醒会显得过于保守。

8. 钱花在哪里

每一次技术浪潮里,人们最容易被本事吸引,最容易低估成本。 这一节把成本这本账拆成两半,因为它们的形状完全不同。

第一本账是练出来的成本。公开资料里,2020 年那一代千亿参数机器的训练算力成本 常被估算为数百万美元量级;更新一代的前沿模型则被外界估在数千万到上亿美元量级17。 如果把人员、试验、失败重来、数据和基础设施摊销都算进去,总投入还会更高。

这个数字不是从天上掉下来的。2012 年那次改变方向的试验, 跑起来靠的是一台普通台式机里的两块游戏显卡,每块只有 3GB 显存 (显卡自己那块内存,要算的数和中间结果都得先装进去)18; 十年之后,前沿训练已经进入千卡、万卡乃至数万卡级。

但高成本也不是唯一的路。2024 年底有一份技术报告披露了一组让业界震动的数字: 按每小时 2 美元的显卡租用价算,那一次正式训练约需 278.8 万卡时、 约 557.6 万美元的算力成本19。这个口径不含此前的架构探索、各种试法的试验、 数据处理和大量对照试验,不能等同于公司完整研发投入。 它之所以震动业界,不在「训练突然变便宜了」,而在它说明架构、系统和工程效率 也能显著改变成本曲线。这条线第 09 章会展开。

第二本账是每次使用的成本。书里给了一个很好记的对照: 练出来的成本像造飞机,用起来的成本像每一次飞行的燃油和维护20。 单次对话看起来便宜,但当一个产品每天处理数亿次请求时,这笔钱会迅速累积成天文数字。

这本账直接决定了商业形态。书里把已经分化出来的路径列成五条: 按用量向开发者收费、面向普通用户的月费、面向大公司的专属部署、 把内部那些数字公开出去带动周边服务、以及广告和免费增值21。 对企业来说,本事差一点但成本低十倍,往往比本事强一点但账单爆炸更有吸引力。

两本账加起来,才解释了为什么后面要用整整两章(第 09、10 章)讲工程: 练出来决定它有没有,用得起决定它能不能真的服务到人。

9. 谁会先被改变

这件事的影响不光落在公司的收入表上,也落在普通人的工作里。这一节讲清楚 「谁先被碰到」,以及一个非常容易被误读的口径。

2023 年,一组来自 OpenAI、OpenResearch 和宾夕法尼亚大学的研究者做了一件很务实的事: 把美国职业数据库里的一千多个职业拆成近两万个具体任务,然后逐个问—— 如果用上这类机器或基于它的软件,能不能在保持质量的前提下, 把完成这项任务的时间减少至少一半?22

他们的结论有两个数字值得记住: 约 80% 的美国劳动力所在职业,至少有 10% 的任务可能受影响; 约 19% 的劳动者所在职业,至少有一半任务可能受影响23

这两个数字的参照物必须跟着说,否则会被读成灾难预告: 它们量的是任务被碰到的比例,不是「会失业的比例」,更不是「岗位会消失的比例」。 「受到影响」说的是任务暴露度,不等于任务一定被自动化。

更反直觉的是它落在谁身上。这种影响并不主要落在低技能岗位上。相反,高暴露的那一端是 口译与笔译、调查研究员、作家、公关、报税员、数学家、校对、会计与审计这一类 屏幕前的语言与符号工作;低暴露的那一端是运动员、汽车玻璃安装工、水泥瓦工、 短餐厨师、打桩机操作员、石匠、补胎换胎工、洗碗工、木工助手24

这张表最值得记住的不是排名,而是背后那条分界线: 越是把信息读进去、写出来、转换成另一种符号形式的工作,越容易先被碰到; 越是依赖身体、器械、现场环境和即时操作的工作,短期内越不容易被纯文字的机器直接改变。 翻译、校对、报税、写报告,核心的进出都在文字和表格里; 厨师、石匠、洗碗工要面对火候、重量、摩擦、泥土、吵闹和安全风险,光会说话远远不够。

但高暴露不等于失业预告,理由很朴素:一个职业通常不是一项任务,而是一捆任务25。 写作者不只是打字,还要采访、判断、承担声誉;会计不只是填表,还要理解业务、合规和责任; 翻译不只是逐句转换,还要处理语境、文化和客户信任。

所以先被改变的,往往是这些职业里的干活方式:草稿更快、查资料更快、格式转换更快、 重复劳动更少。再往下,人的位置也开始从「亲手完成每一步」转向 「提出目标、拆清边界、调度工具和评审结果」。 至于最后变成增效、降薪、岗位减少还是催生新角色,取决于企业组织方式、 法律责任、行业规范和人的适应能力——这一层的社会争论留到第 17 章。

10. 格局:三类模型各司其职

最后把产业的形状交代一句,免得读后面章节时把某个名字当成全部。 书里不写赛马榜,而是按路线分成三类26

闭源就是不公开内部那些数字、也不公开代码;这一类前沿模型只能通过网页或 它开放的调用入口去用。它们通常代表当时最强的综合本事,产品体验成熟,安全投入大。 书里的比方很贴切:像大型商业航空公司,航线多、服务稳、票价不低, 发动机内部一般不给你拆开看。

第二类走的是另一条路:把权重——就是第 2 节讲的那些可以被调的数字本身—— 公开出来,别人下载下来就能自己跑、自己改。

要注意它和开源(把源代码也一并公开、允许别人查看和改动)并不是一回事: 这类模型的训练数据和完整训练代码往往并不公开, 所以更准确的叫法是「开放权重」而不是「开源」27

它的意义不止于「免费」,而在于把创新权从少数巨头手里分散出来: 一个研究生、一家小公司、一台机器,也能参与进来。

小而精的模型是第三类。它们跑在端侧 (就是用户自己的手机、电脑、汽车上,而不是远处机房里)。 不是所有任务都需要云端巨无霸:写会议纪要、整理本地文档、做受限场景下的简单客服, 几十亿参数的本地模型配合外部资料或规则系统可能就够了。

书里给出的判断是:未来的生态很可能不是一个超级模型统治一切, 而是这三类各司其职28

主走查:一句「帮我订一张下周去上海的高铁票」

这条走查贯穿本章。 我们跟着这一句话走完全程,看它在每一步变成什么。 下面用到的数字,凡不是书里给出的,都会当场标明是为演示编的。

① 你说出这句话。 注意你没有点任何按钮,也没有填任何表单。 这就是第 1 节说的那扇被换掉的门:表达目标,而不是执行操作。

② 这句话被切成一串词元。 「帮我」「订」「一张」「下周」「去」「上海」「的」 「高铁票」——切成 8 块(这个切法是为演示编的,真实切法取决于每台机器自己那套切法, 第 05 章讲)。机器看到的不是这几个汉字,而是 8 个编号, 比如 [3821, 517, 1094, 6673, 233, 2810, 102, 9455]

③ 它开始逐块往下猜。 读完这 8 个编号,它给每个可能的下一块打一个分数。 假设最高的三个是:「好」0.31、「我」0.22、「订」0.09(这三个数是为演示编的)。 挑一个接上去,变成 9 个编号,再猜第 10 块。这就是第 5 节那件朴素差事, 一次生成就是把它重复几百上千遍。

④ 但它只会说,不会订。 走到这里,它最多写出 「好的,下周去上海的高铁有 G2 次上午 9:00 发车……」——而这段话是出来的, 不是查出来的。它没有联网,不知道下周的实际车次,也不知道有没有票。 这正是第 2 节那条分界线:能表达,未必能行动。

⑤ 接上外部程序之后才真的动手。 系统给它挂上一个能查车次的小程序, 它写出一句 查车次(出发="北京", 到达="上海", 日期="2026-09-02") 然后停住; 外面的程序替它跑一遍,把真实结果塞回去;它再读着这份真实结果决定下一步。 这一圈就是第 11 章要讲的闭环,而怎么挂这些外部程序是第 12 章的主题。

⑥ 每一步都在花钱。 假设这次任务前后一共处理了 3200 个词元 (这个数是为演示编的),按第 8 节那本使用账算,这就是这次任务的成本单位。 一次不多,一天一亿次就是另一回事——第 10 章整章都在讲怎么把这个数压下去。

⑦ 这件事落在暴露度的哪一端? 「订票」这件事的进出全在屏幕上: 读需求、查数据、填表单、确认。按第 9 节那条分界线,它属于高暴露那一端。 但请注意它仍然只是一捆任务里的一项——一个差旅助理的活儿还包括 判断预算合不合规、行程冲突了跟谁商量、出了问题找谁改签,这些没有被这条走查覆盖。

作者的判断与证据

书里给了证据的地方:

  • 任务暴露度那两个百分比有明确来源(一篇 2023 年的研究,后以相近题名发表于 Science), 口径写得很清楚——量的是任务受影响的可能性,不是自动化结论23;
  • 练出来那笔钱的量级给了公开估算区间,并明确说明「越新的前沿模型越难得到准确数字, 因为公司不会把完整账本摊开给竞争对手看」17;
  • 那组 278.8 万卡时的数字给了具体口径(卡时、单价、不含什么)19

书里明确标成推测或争议的地方:

  • 涌现是不是真实的相变,书里两次都写明这是有争议的,并给出了「打分尺度可能放大跳变」 这条反方论证16;
  • 未来生态是三类各司其职,书里用的是「很可能」,是作者的判断而非观测28;
  • AlphaGo 那条线和大语言模型的关系,书里说得很克制: 它们「并不属于同一条」技术线,只是「预演了一个共同主题」29

还有一处译名值得单独点出,因为它会影响你读后面十七章。书里给两个英文词做了区分: Inference 译作「推断」(机器运行起来、根据输入生成输出的那个过程), Reasoning 译作推理(做多步思考、一环扣一环地往下推)30。 网上常把两者一律译成「推理」,本组拆解沿用书里的区分—— 「把机器跑起来」和「一步步想」确实是两件很不一样的事。

边界与局限

  • 这一章的时间坐标停在成书那一刻。 具体的产品名字、版本号、价格和榜单排名 都会很快过时;能留下来的是那几条结构性判断(入口换向、两本账、暴露度落在谁身上)。
  • 书里没有回答「这一轮会不会又是一次寒冬」。 它给了历史脉络(每一圈扩张都是 在前一圈撞墙之后发生的),但没有讨论这一圈会在哪里撞墙。 第 18 章会把这个问题正面摆出来。
  • 任务暴露度那份研究只覆盖美国职业数据库。 不同国家的职业结构、 劳动法规和企业组织方式差别很大,那两个百分比不能直接搬到别处。
  • 书里对开放权重的立场偏正面。 它讲了「把创新权分散出来」这一面, 对「本事扩散带来的滥用风险」着墨很少;那一面在第 17 章才被补上。

可带走的

  1. 被换掉的不是交互方式,是方向。 过去是人学软件的语言,现在是机器尽量理解人的意图。
  2. 大模型回答问题,智能体完成任务。 但现实系统落在这两者之间的连续谱上,两端都有产品。
  3. 四个词是同心圆,不是同义词。 人工智能 ⊃ 机器学习 ⊃ 深度学习 ⊃ 大模型。
  4. 先在语言上突破,是因为文字是被人类反复压缩过的材料。 别的材料没有这个属性。
  5. 「猜下一个词」之所以能逼出世界知识,是因为很多空只靠搭配习惯猜不出来。
  6. 这一轮的不同 = 统一底座 + 预训练 + 规模收益 + 接上工具。 前三件让它懂得更多,最后一件让它开始做事。
  7. 听到「涌现」先问一句说的是哪件事: 一个分数曲线现象、一个关于本事来源的假设,还是营销话术。
  8. 成本有两本账,形状不同。 练出来的成本像造飞机,用起来的成本像每次飞行的油钱。
  9. 任务暴露度量的是任务,不是岗位;越是屏幕前的符号工作越先被碰到。 80% 和 19% 这两个数字的参照物一定要跟着说。
  10. 三类各司其职: 闭源前沿、开放权重、端侧小模型,别指望一个吃掉全部。

原文地图

主题原书节原文位置
上线与早期反应1 章开篇text/02-ch01.txt:3(搜「一家美国公司悄悄上线了一个叫」) · text/02-ch01.txt:7(搜「五天之内」)
聊天只是表象1.1text/02-ch01.txt:48(搜「聊天只是表象」)
通用入口1.1text/02-ch01.txt:57(搜「通用接口」)
大模型是什么1.2text/02-ch01.txt:100(搜「大模型首先是模型」)
智能体是什么1.2text/02-ch01.txt:112(搜「智能体则是系统层的概念」)
一句话区分两者1.2text/02-ch01.txt:122(搜「大模型回答问题」)
术语谱系(同心圆)1.2.1text/02-ch01.txt:134(搜「套娃式的同心圆」) · text/02-ch01.txt:166(搜「并不是所有 AI 都是深度学习」)
语言是思维的物质外壳1.2.2text/02-ch01.txt:180(搜「语言是思维的物质外壳」)
世界压缩机1.2.2text/02-ch01.txt:208(搜「世界压缩机」)
猜下一个词1.2.3text/02-ch01.txt:226(搜「今天天」) · text/02-ch01.txt:230(搜「信息论之父香农」)
五个例子1.2.3text/02-ch01.txt:241(搜「鸡蛋通常是」)
这一轮为什么不同1.3text/02-ch01.txt:266(搜「先是三件事让模型」) · text/02-ch01.txt:284(搜「模型接上了工具和环境」)
涌现与它的争议1.3.1text/02-ch01.txt:300(搜「这被称为涌现」) · text/02-ch01.txt:332(搜「分数曲线是否真的突然跳变」)
AlphaGo / AlphaZero1.3.2text/02-ch01.txt:359(搜「并不属于同一条」)
三类模型家族1.3.3text/02-ch01.txt:372(搜「开源或开放权重模型是第二类」) · text/02-ch01.txt:388(搜「小而精的模型是第三类」)
练出来的成本与门槛1.4.1text/02-ch01.txt:425(搜「数百万美元量级」) · text/02-ch01.txt:432(搜「两块 GeForce GTX 580」)
那组卡时数字的口径1.4.1text/02-ch01.txt:467(搜「278.8 万 H800 GPU 小时」)
用起来的成本与商业模式1.4.2text/02-ch01.txt:477(搜「训练成本像造飞机」) · text/02-ch01.txt:482(搜「API 订阅」)
职业暴露度1.4.3text/02-ch01.txt:514(搜「如果使用 GPT 或基于 GPT 的软件」) · text/02-ch01.txt:516(搜「约 80% 的美国劳动力所在职业」) · text/02-ch01.txt:525(搜「口译员与笔译员」) · text/02-ch01.txt:536(搜「而是一捆任务」)
译名说明1.3.3 脚注text/02-ch01.txt:376(搜「本书把英文 Inference 译作」)

Footnotes

  1. 出处:第 1 章开篇第 3 段(text/02-ch01.txt:3,搜「一家美国公司悄悄上线了一个叫」) 与第 7 段(text/02-ch01.txt:7,搜「五天之内」)。 书里写的是「五天之内注册用户突破一百万;两个月之内月活跃用户估计已过亿」, 后一个数是估计值,书里也这么标。

  2. 出处:「1.1 从聊天机器人到通用接口」第 48 段(text/02-ch01.txt:48,搜「聊天只是表象」) 与第 53 段(text/02-ch01.txt:53,搜「机器尽量理解人的意图」)。

  3. 出处:「1.2 大模型与智能体分别是什么」第 100 段(text/02-ch01.txt:100,搜「大模型首先是模型」)。

  4. 出处:同节第 105 段(text/02-ch01.txt:105,搜「它能回答你订机票要注」)。 三个例子(订票、投简历、连数据库)是书里原有的。

  5. 出处:同节第 112 段(text/02-ch01.txt:112,搜「智能体则是系统层的概念」)。

  6. 出处:同节第 122 段(text/02-ch01.txt:122,搜「大模型回答问题」)。 书里紧接着提醒这句话「只是抓住主干」,现实系统处在连续谱上。

  7. 出处:「1.2.1 AI、机器学习与大模型:术语谱系」第 134 段 (text/02-ch01.txt:134,搜「套娃式的同心圆」)。

  8. 出处:同节第 166 段(text/02-ch01.txt:166,搜「并不是所有 AI 都是深度学习」)。

  9. 出处:「1.2.2 为什么是语言」第 180 段(text/02-ch01.txt:180,搜「语言是思维的物质外壳」)。 这是书里引用的维果茨基的说法;书里同段还引了维特根斯坦「我语言的边界即是我世界的边界」。

  10. 出处:同节第 208 段(text/02-ch01.txt:208,搜「世界压缩机」)。

  11. 出处:「1.2.3 大模型的朴素目标」第 226 段(text/02-ch01.txt:226,搜「今天天」)。 书里给的四个候选是「很好 0.4,晴朗 0.3,热 0.15,冷 0.05」。

  12. 出处:同节第 230 段(text/02-ch01.txt:230,搜「信息论之父香农」)。

  13. 出处:同节第 241 段(text/02-ch01.txt:241,搜「鸡蛋通常是」) 与第 247 段(text/02-ch01.txt:247,搜「实际考的却是形状」)。表格里的五个例子全部来自书里。

  14. 出处:「1.3 为什么这一轮 AI 与以往不同」第 266 段 (text/02-ch01.txt:266,搜「先是三件事让模型」),四件事分列于第 269、273、278、284 段。

  15. 出处:「1.3.1 涌现:量变到质变」第 300 段(text/02-ch01.txt:300,搜「这被称为涌现」)。

  16. 出处:同节第 332 段(text/02-ch01.txt:332,搜「分数曲线是否真的突然跳变」)。 书里在第 4 章 §4.1 再次回到这个争议,并补了两种技术解释(元学习涌现、回路稳定化)。 2

  17. 出处:「1.4.1 训练成本与算力门槛」第 425 段(text/02-ch01.txt:425,搜「数百万美元量级」)。 2

  18. 出处:同节第 432 段(text/02-ch01.txt:432,搜「两块 GeForce GTX 580」)。

  19. 出处:同节第 467 段(text/02-ch01.txt:467,搜「278.8 万 H800 GPU 小时」)。 书里特意写明这个口径「不包括此前的架构探索、各种试法的试验、数据处理、大量消融实验和基础设施摊销」。 2

  20. 出处:「1.4.2 推断成本与商业模式」第 477 段(text/02-ch01.txt:477,搜「训练成本像造飞机」)。

  21. 出处:同节第 482 段起(text/02-ch01.txt:482,搜「API 订阅」),五条路径分列到第 502 段。

  22. 出处:「1.4.3 职业暴露度:谁先被改变」第 514 段 (text/02-ch01.txt:514,搜「如果使用 GPT 或基于 GPT 的软件」)。

  23. 出处:同节第 516 段(text/02-ch01.txt:516,搜「约 80% 的美国劳动力所在职业」)。 书里紧跟着写明「这里的『受到影响』是任务暴露度,不等于任务一定被自动化,更不等于岗位会消失」。 2

  24. 出处:同节表 1.1(text/02-ch01.txt:525,搜「口译员与笔译员」)。

  25. 出处:同节第 536 段(text/02-ch01.txt:536,搜「而是一捆任务」)。

  26. 出处:「1.3.3 代表性模型家族」第 372 段(text/02-ch01.txt:372,搜「开源或开放权重模型是第二类」)。

  27. 出处:「1.4.4 竞争格局」第 570 段(text/02-ch01.txt:570,搜「更准确地说是「开放权重模型」)。

  28. 出处:「1.3.3」第 391 段(text/02-ch01.txt:391,搜「不是一个超级模型统治一切」)。 书里用的是「很可能不是一个超级模型统治一切」,是判断不是观测。 2

  29. 出处:「1.3.2」第 359 段(text/02-ch01.txt:359,搜「并不属于同一条」)。

  30. 出处:「1.3.3」的脚注(text/02-ch01.txt:376,搜「本书把英文 Inference 译作」)。 书里明确说这和网络上「推理服务」「推理框架」一律译作「推理」的习惯不同,是有意区分。