跳到主要内容

本事与产品 — 它凭什么写得了文章却算错数,以及这些本事怎么变成钱

这一章讲三件事: 大模型的本事到底有哪几样、各自靠什么成立; 为什么它一本正经地编造是根除不掉的;以及这些本事怎么变成你手机里的产品。 前四章讲「它是怎么造出来的、要花多少钱」,这一章讲「它能干什么、卖给谁」—— 全书从技术转向生意,转折点就在这一章。

1. 先看现象:它写得了论文,却数不清一句话里有几个字

你大概都碰到过这种落差:

  • 让它写一篇发言稿、改一段话、解释一个概念——相当好;
  • 让它算一道多步的账、把几个数排序、数一数某段话有多少字——经常错,而且错得理直气壮;
  • 让它说一件它不知道的事——它会编一个,连出处都编得像模像样

这三件事不是三个 bug,是同一套机制的三种表现。 这一章讲清那套机制。

2. 顶层全景:从本事到钱,书走了五步

① 它有哪几样本事? ── 看得懂 · 写得出 · 想得清 · 记得住

② 这些本事怎么用? ── 按「人和机器谁做主」分成三档

③ 于是人机交互变了 ── 从「点按钮」变成「说人话」

④ 于是钱多了三处 ── 多收钱 · 多拉人 · 多一种卖法

⑤ 于是入口要换人 ── 大模型取代搜索引擎,顺手砸掉它的广告生意

图说:这五步是一条因果链,不是五个话题。书的原章序也是这个顺序。

先说清第①步那四条是谁定的:是书自己归的。 它在 4.1 节把当时的评测体系摊开——一共 481 个细分任务—— 再把这些任务收成四类:看得懂、写得出、想得清、记得住1这不是学界公认的分法,是这本书自己的整理。 拿它当一张目录好用;拿它当分类学会出问题——下面那条走查里, 「数一数有几个字」这一道题就同时压在「看得懂」和「想得清」两条上。

一条贯穿全章的主走查:「数一数这句话有多少个字」

这一章的每个承重机制,都会回到这一个输入上占一步。 下面这些输出是这类模型的典型表现;写出来的具体数值是为演示编的,不是某一次真实对话的记录。

输入: 「数一数下面这句话有多少个字:『大模型不会数数』」。 正确答案是 7。

走到哪一条本事它实际吐出来的东西对不对
看得懂「好的,我来数一数。」——它读懂了这是一道计数题,没有答非所问
写得出「这句话共有 8 个字。」——一句语法完整、语气自然的中文。而且同一个问题问第二遍,它可能答 6,两次都「有效」
想得清让它把中间步骤写出来:「大 / 模 / 型 / 不 / 会 / 数 / 数 —— 一共 7 个」对了,但多吐了二十几个字
记得住追问「这句话出自哪里」,它答:「出自《人工智能简史》第 3 章第 47 页。」编的。书名、章号、页码,一样不缺

错到底错在哪一步?错在「写得出」之前的那一步:它看到的根本不是七个字。 这句话进模型之前会先被切碎——「大模型」很可能整个算一块,「不会」一块,「数数」一块, 一共三四块它数的是块,不是字;而一块等于几个汉字,各家的切法都不一样 (第 07 章第 8 节会看到:混元一块约 1.8 个汉字,通义千问和千帆一块约 1 个)。

这条走查后面还会用到四次: 第 4 节看它为什么「看着会」(捷径学习)、第 6 节看「让它把中间步骤写出来」多花的那几十个字要付多少钱、 第 7 节看它凭什么编得出页码、第 8 节看三种协作模式各自兜不兜得住这个 8。

3. 先说「涌现」:这个词被用得太随便了

这一节回答:「模型大到一定程度就突然会了」这句话,能信到什么程度。

书是怎么说的

书给的定义是:涌现指的是大模型在执行任务时展现出的出乎意料的行为、思想或想法2。 它还给了两个特征:

  • 非线性——就是「不成正比」:投入翻一倍,产出不一定翻一倍, 可能几乎没变,也可能一下子跳很高。书说模型一大,性能可能发生这种不可预测的变化;
  • 突发性——某个本事可能突然以意外的方式出现,没法靠简单往下推预测。

但这件事有争议,书没提

补充(不在书里): 2023 年 4 月 28 日的一篇论文 《Are Emergent Abilities of Large Language Models a Mirage?》(第一作者 Rylan Schaeffer) 提出了一个很有杀伤力的反驳:所谓「突然会了」,很可能是打分方式造成的错觉。

它的论证是:用「全对才算分」这类非连续的打分方式去量,就会看到断崖式的跳跃; 换成「离正确答案有多近」这类连续的打分方式去量,看到的是平缓、可预测的改善。 换句话说,变的可能是尺子,不是被量的东西。

来源:https://arxiv.org/abs/2304.15004(查阅于 2026-08-25)

判断(我们的,不是书里的): 这条质疑要不要接受,取决于你拿「涌现」干什么。 当描述用,它没问题——「模型做大之后确实多出了一些以前没有的用法」这件事是真的; 当解释用,它是空的——说「因为涌现所以会了」等于什么也没说。 判据很直接:一个说法如果换掉打分方式就消失了,它就不该被当成模型的性质。 如果错,会错在: 如果某项能力在所有连续打分方式下都仍然表现出突变, 那它就不是尺子的问题,「涌现」也就重新成为一个实质性主张。

顺带一提:「基座模型」这个词书用的是第 01 章那份斯坦福报告的定义—— 在大规模数据上训出来、能适应多个下游任务的基本模型3那条定义里点了两种训法的名字,一个一个说。

一种叫自监督: 不用人给标准答案,拿数据自己的一部分当答案去练—— 把一句话遮掉几个字让它填回来,答案就在这句话自己身上。

另一种叫半监督: 只有一小部分数据配了人给的标准答案, 剩下的大部分没有,两边混着一块儿练。

它和「基础模型」是同一样东西的两个中译名,本拆解统一叫基座模型。

4. 四条本事之一:看得懂

这一节最有价值的不是「它有多强」,是「它可能是靠什么强的」。

先看成绩

书给的数字很硬:GPT-4 在一项覆盖大量学科的综合测试上准确率 86.4%, 模拟律师考试进入前 10%,SAT 数学 700 分(满分 800)4

然后是这一章最好的一段:捷径学习

书难得地记下了一个反面证据,而且这个证据比上面所有成绩都重要5:

研究者发现:某些推断题里的线索词(比如英文的 "not")
能帮模型直接猜中答案,而不必真读懂句子
└─ 于是他们把这些线索词去掉,再考一遍
└─ BERT 模型的表现,与随机瞎猜没有区别

图说:这不是说模型什么都不会,而是说它拿到的高分里,有一部分是靠找题目的破绽拿的。

这种「靠数据里的假相关拿分」的现象,书里叫捷径学习。

「假相关」当场解释: 两件事经常一起出现,但其中一件并不是另一件的原因。 比如「题目里有 not,答案多半选否定」——这在题库里成立,在真实语言里不成立。

回到那条走查,捷径学习在这儿长什么样。 把问题改成「这句话一共有多少个字?」,它答对的概率反而高一些—— 不是因为它数得更准,是因为题库里带「一共」的题多半是加法题,它见过太多次。 把「一共」两个字去掉,这点优势就没了——这正是上面那个实验干的事: 去掉线索词,分数掉回瞎猜水平。

由此引出的那个追问,是全书少有的深刻处

书顺着问了一句:既然如此,用为人类设计的考试来考模型,是不是本来就不合适?6

它给的分析很准,但写得抽象。换成具体的东西说一遍:

人是先摸过、烫过、被挠过,才知道「烫」和「痒」是什么; 它是把「烫」这个字和它周围常出现的那些字之间的关系记了下来。 所以同一道 SAT 数学题,人做对是因为想通了, 它做对可能是因为题库里这类题的答案分布它见过—— 上一段那个「去掉 not 就掉到瞎猜水平」的实验,量的正是这个差别。

拿一张为人设计的考卷同时量这两种东西,分数一样,含义不一样。 书自己的原话是:人的语言理解反映的是「对现实世界经验的压缩与抽象」, 而模型强的是「把数据之间的相关性编码下来」。

书还老实记下了学界的分歧:一派认为模型可能已经真的理解了大量概念; 另一派认为它只学会了语言的形式,而没学会意义—— 并举了一个特别好的例子:**「挠痒痒」为什么会引人发笑,人是靠身体的感觉知道的;

模型能熟练使用这个词,却从未体验过那种感觉**7

还有一派的说法最克制,也最实用:大模型更像是「打包和压缩了人类知识的存储库」7记住这句话,它是下面「记得住」那一节的伏笔。

5. 四条本事之二:写得出

这一节回答:它写东西这件事,和「创造」有多大关系。

它的输出天生是不确定的

书给了一组很实用的对照8:

做判断的那类模型做生成的那类模型
同一个输入问两遍结果一样可能不一样,而且两次都算对
不同输入一般结果不同可能得到相同输出
怎么用好把输入整理干净反复试,换着法子把话说清楚

最后一格就是提示工程——「提示」就是你打给模型的那段话, 而书给「提示工程」下的定义是「系统地构建提示,以便改进生成的结果」8

这条差别的实际后果是: 用生成式模型做产品, 你没法保证「同样的输入永远得到同样的输出」—— 这一条会一直追到第 06 章的行业落地和第 08 章的监管。

关于「创造力」,书引了一套很正经的框架

书没有含糊地说「AI 有创造力」,而是引用了心理学家吉尔福德的一组概念9:

概念意思谁更强
聚合思维一步步收拢到唯一正确答案的能力——
发散思维一口气想出很多种不同点子的能力在这类测试上,聊天机器人普遍胜过人类被试

但书紧接着补了关键的一句:人类的最佳创意仍然与聊天机器人不相上下,甚至更好9

判断(我们的,不是书里的): 这两句话放在一起,才是完整的结论: 模型赢在「平均水平」和「产量」,人赢在「上限」。 所以它最合适的位置不是替你想,而是替你把想法的数量堆上去,再由你来挑—— 书自己也把这一条归到「作为提高人类创造力的工具」。 如果错,会错在: 如果某类任务的价值只取决于平均水平(比如论堆算的文案), 那「人赢在上限」这件事就不值钱——判据是这件事的成果是按最好的一件算,还是按总量算。

一个当时的采用率快照

书引了麦肯锡 2023 年 4 月的调研:79% 的受访者至少用过一次生成式 AI 工具, 22% 经常用;60% 的组织机构在用,主要用在销售、产品研发、客户运营三处10

这是咨询公司的调研,不是作者的统计——按第 1 节说的,这类数字要单独看待。

6. 四条本事之三:想得清

这一节讲全书唯一一处讲清了「它怎么变得会推理」的地方。

做法:让它把中间步骤写出来

书归给 Jason Wei 等人的一项工作,叫思维链—— 一句话:与其让模型直接吐答案,不如让它先把一步步的思考过程写出来,再给答案11

书举的例子很好懂:问「小明有 5 支铅笔,又买了 2 盒、每盒 6 支,现在一共多少支」, 模型会自己拆成乘法和加法两步,再算总数12

为什么这么做有效

书没讲透,我们把它补上——而且它接得上第 04 章那条算式:

直接吐答案:模型只有「从输入到输出走一遍」这么点计算余地
└─ 复杂的多步问题塞不进这一遍里

写出中间步骤:每写一步,都把这一步的结果接回输入,再走一遍
└─ 于是「走一遍」变成了「走很多遍」,计算余地被撑开了

图说:思维链不是让模型变聪明了,是让它有地方打草稿。
代价是要多吐很多字——而按第 04 章那条算式,每个字都要花 2 倍参数量次运算。

回到那条走查: 直接答,它吐出「这句话共有 8 个字。」——10 个字,错的; 开思维链,它吐出「大 / 模 / 型 / 不 / 会 / 数 / 数 —— 一共 7 个」——24 个字,对的多花的那 14 个字,就是「想清楚」的价钱;按第 04 章那条算式, 每个字都要花 2 倍参数量次运算,一个 1750 亿参数的模型就是每个字 3500 亿次。

这就是「让它想清楚」和「让它便宜」之间的直接冲突, 第 07 章第 8 节讲按字计费时会把这 14 个字折成钱。

书老实记下的三个局限

局限书的说法
模型不够大就没用要到 PaLM 那样 5400 亿参数的规模,配上思维链才显出优势;小模型基本没效果13
适用范围窄主要在数学题和几类常识推理测试上有效;机器翻译这类任务效果还待评估13
算术仍然会错即便用了思维链,在某个数学题集的子集上仍有 8% 的计算错误13

书由此给了一句很到位的结论: 大模型对基本的数学运算「只是依葫芦画瓢」,并没有真正理解数学逻辑13

两年之后:它已经不是提问技巧了

补充(不在书里): 思维链的原始论文是《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》(第一作者 Jason Wei,2022 年 1 月 28 日提交), 论文的核心结果是:只用八个带推理过程的例子提示一个 5400 亿参数的模型, 就在一个小学数学题集上取得了当时最好的成绩——这和书里说的「模型要够大」完全吻合。

来源:https://arxiv.org/abs/2201.11903(查阅于 2026-08-25)

但书出版之后,这条路发生了性质变化。 2025 年 1 月 22 日公开的 《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》证明: 不需要人手写推理过程当范例,光靠奖惩就能把「先想再答」训进模型里, 而且模型会自己长出自我检查、自我修正这类习惯。

来源:https://arxiv.org/abs/2501.12948(查阅于 2026-08-25)

判断(我们的,不是书里的): 这条变化把书里那三个局限中的第一条推翻了一半。 「模型不够大就没用」在「思维链是提问技巧」的年代成立; 一旦它变成训练目标,小模型也能被训出这个习惯(那篇论文的做法之一就是把大模型的推理习惯迁移给小模型)。 另外两条局限——适用范围和算术出错——仍然成立。 如果错,会错在: 如果小模型学到的只是「推理的样子」而不是推理本身 (也就是写得像模像样但结论照错),那这条推翻就不成立。判据是小模型在可验证任务上的正确率。

7. 四条本事之四:记得住——以及为什么它一定会编

这一节是全章最重要的一节。看懂它,你就永远不会再问「为什么它会胡说」。

知识存在哪儿

书说得很准:在大模型里,知识不再像文件那样存在硬盘上, 而是被转化成上千亿个参数之间的计算关系,再通过计算「模糊地」提取出来14

书还引了 OpenAI 联合创始人 Ilya Sutskever 的一段话来支撑。 他说的世界模型——就是「关于这个世界如何运转的一套内部理解」14:

当我们训练一个大型神经网络来准确预测各种不同文本中的下一个词时…… 它实际上是在构建一个世界模型……神经网络学到的是人类世界的压缩、抽象和可用的表征。

这是转述别人的说法,不是书自己的主张——而且这个说法本身在学界也有争议。

于是编造是必然的,不是故障

从「压进参数」到「一定会编」中间有三级台阶,书一级都没写。补在这里,一段一级。

第一级:压缩为什么会丢东西,以及丢的是哪一类。 它没有把任何一句话原样存下来,存的是**「在这种上下文里,下一个字最可能是什么」这条统计关系**。 而一句只在训练材料里出现过一次的话,和出现过一百万次的话,在这堆数里抢的是同一批位子—— 前者被挤掉了。所以先丢的永远是具体的、罕见的、只出现过一两次的东西: 一个页码、一个人名、一条法条的编号。

第二级:挤掉之后,它并不知道自己挤掉了什么。 它手上永远有一张「下一个字可能是什么」的清单,清单上永远有分数最高的那一项; 「不知道」不是清单上的一个选项。所以它永远答得出来。

第三级:答得出来的那一项,是按语感算出来的,不是按事实查出来的。 挑的是「最可能跟在后面的字」,不是「真的跟在后面的字」—— 所以它编出来的东西一定读着通顺、出处也编得像模像样。

回到那条走查: 追问「『大模型不会数数』这句话出自哪里」, 它答「《人工智能简史》第 3 章第 47 页」。 「《……简史》」是最常跟在「出自」后面的书名格式,「第 N 章第 M 页」是最常见的页码写法—— 每一步它挑的都是分数最高的那一项,每一步都对,合起来是一条不存在的出处。 再接上第 04 章那条算式:它每吐一个字要算 2 倍参数量次运算,算的是「哪个字最可能」, 不是「哪个字是真的」。

这是全书最值得带走的一句话之一15:

知识被压缩进参数 ──→ 取出来时不是原样照搬,而是按「哪个更有可能」重新算一遍
└─ 算出来的东西「像真的」,但不保证「是真的」
└─ 所以它会一本正经地编,而且编得符合语感

图说:书的原话是「无法完全避免」。这不是说工程师不努力,是说这套存取方式本身如此。

书给的三条应对,句句务实15:

  1. 降低概率——只能减少,不能杜绝;
  2. 及时识别和纠正——出了再抓;
  3. 尽量用在不要求严密的场景(书举的例子是写小说、聊天)。

第三条最实用,而且它和第 06 章那条「按容错率排队」的判据是同一件事。

想让它多知道点,只有两条路

怎么做代价
微调真的改动模型里的参数,让它学会新知识、忘掉不必要的16要大量数据和算力,还得有改参数的权限
提示词不动模型,只是每次把资料塞进输入里,给它一段临时的记忆——就是「刚才说过什么、刚喂了什么资料」这类能被它当场看到的东西17塞得下多少,取决于它一次能读多长;而且用完就忘

书给的当时的长度上限很有史料价值: GPT-4 Turbo 支持 12.8 万个 Token; 到 2024 年 4 月,国内 Kimi 支持 200 万字17

书还点出了一个副产品:「提示词工程师」这个新职业—— 并且立刻给了一个很清醒的预判:随着技术进步,对提示词的需求会逐渐减少18

判断(我们的,不是书里的): 这张表少了一行,而那一行才是今天最常用的: 第 04 章讲的「临时喂资料」(检索增强生成)。 它属于「提示词」那一类(不改模型),但比手写提示词强得多——资料是被搜出来的,不是人贴进去的。 书把这套做法放在第 3 章讲数据,把「怎么让模型多知道点」放在第 4 章讲能力, 两处讲的是同一件事,书自己没有连起来。 如果错,会错在: 如果作者是有意按「基础设施 / 模型能力」分栏归类, 那这是体例问题不是遗漏——但读者读到这一节时,拿不到那条最有用的选项。

8. 本事怎么变成产品:一条极好用的分类轴

这一节是这一章第二值钱的地方。

书给的分法不是按产品长什么样分,而是按人机协作时机器承担多少活儿分—— 书自己特别强调这三种**「并不对应某种具体的产品形态」**19

先拆一个雷。 书给第一档起的名字叫「嵌入模式」。 注意它和第 02 章末尾说的那个「嵌入」(把一个词变成一串数)完全不是一回事—— 这里的「嵌」指的是把 AI 嵌进人原有的干活流程里当工具使唤。 为免两个意思打架,本文一律叫它「工具模式」,书里的原名是嵌入模式。

模式谁做主机器干多少书举的例子
工具(书叫「嵌入」)人主导,AI 是执行命令的工具你写提示词让它画图、写文案;ChatGPT、Stable Diffusion、Midjourney20
副驾驶大约五五开,AI 是有想法的搭档一半Office 里的 Copilot:在 Word 里给初稿、在 PPT 里按指令做稿、在 Excel 里做可视化分析21
智能体AI 主导,人只设目标、给资源、验收大部分你给一个目标,它自己拆任务、调工具、干完22

为什么这条轴比「按产品形态分」好用

因为它直接对应「出了错谁负责」。

人主导 → 每一步都是人点的,错了人当场看得见
五五开 → 人在审阅,错了人应该看得见(但常常看漏)
AI 主导 → 人只看结果,错了往往在中间某一步,而人没看

图说:承担的活儿越多,人能兜住的错就越少。这条轴同时是一条风险轴。

书没有把这条风险轴点破,但它把三种模式的定义写得足够清楚,推论是现成的。

回到那条走查,同一个「8」在三种模式下的下场完全不同:

  • 工具: 你让它数,拿到「8」,你自己再数一遍——错当场被你逮住,代价是多花十秒;
  • 副驾驶: 它在你的文档里顺手标了「本段 8 字」,你扫一眼觉得差不多,放过去了;
  • 智能体: 你说「统计这份三千行文档里每段有多少字」,它自己写代码、自己跑、 自己汇总成一张表交给你。那个「8」错在第 1200 行的某一段,而你只看了最后那张表。

同一个错误,兜住它的成本从十秒涨到「重查三千行」。

书对智能体那一档的清醒之处

书在看好它的同时,老实写了两句22:

  • 大多数还停留在「解决任务」和「娱乐」两类应用,没到产品市场契合阶段 (「产品市场契合」指的是产品确实找到了愿意持续付费的人群);
  • 距离大规模商业化还有一定距离。

在一本以看好为基调的书里,这两句是难得的克制。

9. 于是交互方式变了:从点按钮到说人话

这一节回答:为什么所有 App 都开始加一个对话框。

书的说法是:交互范式从图形界面(点按钮、拉菜单,缩写 GUI) 转向自然语言界面(直接说人话,缩写 NUI)23

但书给的判断比多数文章都清醒

它没有说 NUI 会取代 GUI,而是说两者会长期共存,并且给了理由24:

什么时候 GUI 更好什么时候 NUI 更好
复杂、专业的活儿(编程、专业设计)不确定、复杂、有新概念的活儿
概念已经普及、大家都知道该点哪儿需要来回问几次才能把事情说清楚
给用户提供背景、引导他该干什么用户已经知道自己要什么、也说得清

书举的那个例子特别真实: 应用里的搜索框提示「你可以直接向我提问」时, 很多用户会不知所措——而传统界面靠把选项摆出来,替用户回答了「我能干什么」这个问题24

这条洞察今天仍然成立,而且是很多 AI 产品失败的直接原因。

一个必须点破的后果:信息茧房会加剧

书这里写了一段少见的负面判断25:

原本由用户完成的信息粗筛,现在被大模型取代; 大模型对信息筛选的决策权重超过了用户,而用户能接触的信息范围取决于大模型呈现的内容。

这句话值得逐字读。 它说的不是「推荐算法让你只看到爱看的」, 而是更进一步:你连「有哪些东西可看」都不再知道了—— 因为没被选进那段回答的东西,你根本不会意识到它存在。

第 06 章讲媒体行业那三条风险时,会再碰到这一条。

同一节还有两件事,各带一句

  • 它不只是「影响」你的决定,而是替你做掉了一半。 书的对照很准: 过去的信息流推荐是影响决策(按你的浏览习惯把东西推到你眼前), 而对话式交互是辅助决策——它把「收集资料、整合、动手」整条流程打通了, 连明天的日程该怎么排都能替你排好26上面那条信息茧房,正是这一步的副作用。
  • 有些应用从第一天起就是围着大模型造的,不是把大模型加到老产品上。 书举的是 ChatGPT 和百度的「度秘」,并给了一个当时的量: 基于 GPT-3 系列开发的应用与场景已超过 600 个,覆盖写作、设计、编程、测试27

10. 交互变了之后,钱从哪儿多出来:书算的三笔账

这一节回答:一个已经有几亿用户的手机应用,接上大模型之后多赚在哪儿。

书把它拆成三笔——多收钱、多拉人、多一种卖法。 三笔的性质完全不同,别混着读: 第一笔是给现有生意加价, 第二笔是拿内容换人头,第三笔是长出一门原来不存在的生意。

第一笔:多收钱——把大模型变成一个付费点

书把消费类应用分成两种,两种收钱的路子不一样28:

哪一类你打开它是为了大模型加在哪谁掏这笔钱
工具型干一件具体的活儿(写东西、做图、整理笔记)直接拿对话能力做一个「工作助理」用它的人、或者用它的公司直接付费
平台型办吃穿住行里的某件事(健身、打车、订酒店、点外卖)接上聊天机器人,想升级成「什么都能办」的超级平台不直接向用户收,摊给平台上的商家——走广告和信息流

最实的一个例子是 Notion(一款把笔记、任务、知识库合在一起的工具): 它 2023 年 2 月上线 Notion AI,帮用户快速生成内容、翻译、查拼写和语法、列想法清单, 上线两个月就有超过 400 万用户用过; 书说这项功能有望让它的 ARPU(平均每个用户带来多少收入,总收入除以用户数) 增长 50%~100%28

为什么盯着这个数: 用户数涨不动的时候,一家消费类互联网公司只剩这一条路—— 人不变多,就让每个人多花点。 大模型在这里扮演的正是「多花那一点」的理由。

平台型那一侧,书还顺手预告了一件事: ChatGPT 已经接进订餐、旅游、电商这些生活场景的插件; 往后第三方应用做的优化,会从「讨好搜索引擎」转成「讨好大模型」—— 把自家内容整理成大模型好理解、好引用的样子,让它把用户往自己这儿引28

那组付费渗透率:是作者的假设,不是统计

这是这一节唯一一组会被人拿去当依据的数字,所以先说清它是什么29。 先解释那个词:付费渗透率——就是用这个产品的人里,有多少比例真的掏了钱。

阶段书给的假设
商业化早期「尝鲜」心理有望驱动 10%~20% 的用户付费
中期随着能力一代代往上做,书认为 40%~60% 的付费比例「是较为谨慎的」
长期AI 功能「或将进一步打破收入天花板」

判断(我们的,不是书里的): 这三行没有一行是统计出来的,全是作者的假设—— 书自己用的词就是「有望」「我们认为」「假设」,而且没有给出任何一个已发生的付费率数字做锚。 补充(不在书里,来自通用知识): 「先免费用、想要更多再付钱」这类产品的付费率, 行业里的常见量级是个位数百分比;40%~60% 比这个常态高出一整个台阶, 而书把它称作「较为谨慎」——这说明这一段的口径是「乐观情形下的推演」,不是「基准预测」。 实用推论:引用这一节时,把「作者假设」四个字一起引走。 如果错,会错在: 如果 AI 功能确实把付费意愿改变了一个量级(而不只是提高一点点), 那这个区间就不算离谱——判据是上市公司公布的 AI 功能实际付费渗透率, 而书里从头到尾没有引用过任何一个这样的数。

第二笔:多拉人——文娱应用靠开放创作工具换增长

先看现象:文娱这一侧已经没人可拉了30

书给的两个数很说明问题:短视频和网络视频的用户渗透率约 95%—— 几乎每个上网的人都在用;而网络音乐和网络游戏的用户增长率约 −6%,是负的。

于是这一侧的打法不再是「拉新人」,而是把创作工具开放出去,让用户自己生产内容: 内容多了能玩的就多,人自然多待一会儿,也自然会拉来别人。

书举的例子是网易的《蛋仔派对》: 它带一个「用户自己做地图」的编辑器, 再靠教程和现成的工具组件把创作门槛压低; 上线半年,日活(就是一天之内打开过这个应用的人数)突破 3000 万30

书里管这个数叫「日活跃用户数」,英文缩写 DAU——就是同一件事。 它是消费类应用最常报的一个数,因为它同时答了两个问题:有多少人,以及他们多常来。

第三笔:多一种卖法——把一个有名气的形象做成 AI 分身

这一笔和前两笔性质不同:它不是给老生意提效,是长出一门新生意31

书的说法是:大模型的交互足够自然,于是催生了AI 虚拟陪伴、IP AI 分身这类新模式。 做法是拿一个已经有粉丝的形象——动漫或影视角色、网红、明星、虚拟人物—— 用 AI 生成内容加上语音和姿态交互做二次创作, 变成数字人主播、AI 音频、虚拟玩家这类「数字化身」,再把化身产品化卖出去。

「IP」当场解释: 这里指的是已经攒下名气和粉丝的那个形象或角色本身, 比如一个动漫人物、一个明星、一个网红。它值钱的地方在于「已经有人认识、有人喜欢」, 所以拿它做出来的东西不必从零去找观众。

书举的例子: Snapchat 上一位拥有 180 万粉丝的网红 Caryn, 拿自己在 YouTube 上超过 2000 小时的视频内容,在 GPT-4 上微调训练出一个同名的「AI 虚拟伴侣」, 能动态互动、24 小时秒回消息31

判断(我们的,不是书里的): 这三笔账里,只有第一笔有书里真实发生过的数字撑着—— Notion 那 400 万用户是已经发生的事,ARPU 那一条则是「有望」。 第二笔的因果链是断的:《蛋仔派对》日活破三千万靠的是「用户自己做地图」这套玩法, 而书没有给出任何证据说明大模型在其中贡献了多少。 第三笔更是只有一个个案。 实用推论:这一节可以用来看「2024 年产业界打算怎么把大模型换成钱」, 不能用来论证「大模型已经带来了多少钱」。 如果错,会错在: 如果那套地图编辑器里确实是大模型在起主要作用、书只是没写清, 那这条因果就成立——判据是编辑器的哪一步用了大模型,而书里一个字没提。

11. 全书押得最大的一注:入口要换人

这一节讲这本书最大胆、也最值得对账的一个判断。

判断本身

大模型会超越搜索引擎,成为新一代的互联网入口32

书给的理由是两条,而且都站得住33:

  1. 呈现质量更好:它能理解复杂意图,给的是答案不是一堆链接;
  2. 供给方式更省事:传统搜索要你自己拆任务、提关键词、筛信息、再整合; 这四步现在它替你做了。

书还加了一条更狠的:大模型入口会成为用户的终点,不再往外分流—— 因为它靠插件把上游应用的内容和功能都整合进来了,用户不必跳转、不必下载别的应用34

顺手砸掉的东西:竞价排名

这是这一节最硬的一段推理,而且是结构性的,不是程度问题35:

传统搜索引擎的广告怎么赚钱?
└─ 广告主对关键词出价 → 按出价高低排在结果页上 → 按点击次数收费
└─ 前提是:页面上得有一排排可以排序的结果

AI 搜索的页面上是什么?
└─ 一段整合好的答案 + 信息来源
└─ 没有一排排结果 ⟹ 没地方排 ⟹ 竞价排名这套机制不存在了

图说:这不是「广告变少了」,是这套广告机制在结构上失去了落脚点。

书的原话是:传统搜索引擎中的竞价排名机制在 AI 搜索引擎中将不复存在。

回到那条走查,这件事一眼可见: 把「『大模型不会数数』有几个字」丢进搜索引擎,页面上会返回十条蓝链加两三个广告位, 广告主可以为「大模型」这个词出价、买到第一条的位置; 把同一个问题丢给它,页面上只有一行「7 个字」加两条来源链接一行答案上没有第二名可卖——不是广告位变少了,是这套按名次卖钱的机制没有落脚点了。

但成本这一侧更狠

书给了一组直接对照36:

单次成本
ChatGPT 一次对话约 2 美分(2023 年初 OpenAI 首席执行官在社交媒体上透露的数字)
谷歌一次搜索约 0.2 美分(按 2022 年 3.3 万亿次搜索量摊算)
差距10 倍

这一条直接接上第 04 章那条结论:回答问题是天天要花的钱,而且比原来贵一个数量级。

书还补了一句:多数 AI 搜索产品还得付第三方模型的授权费; 而定制训练一个 GPT-4 模型,起步价 200 至 300 万美元36

书给的三阶段路线图

阶段会发生什么书举的证据
培育期大模型作为一项能力被集成进现有产品,格局基本不变微软发言人称大模型让 Bing 搜索结果质量的提升幅度超过过去 20 年所有升级的总和;Bing Chat 上线后 PC 端份额涨 2.38%,谷歌搜索跌 4.16%37
混战期独立应用靠插件连上信息流、靠多终端汇聚流量,格局洗牌ChatGPT 的插件、iOS 与安卓客户端、Windows 里的 Copilot38
统一期作为智能助手的超级应用占据全网 60% 以上流量,国内外各自形成寡头类比搜索市场:谷歌占国际 90% 以上,百度占国内 60% 以上39

最后一节:强者恒强

书的结论是:现有巨头维持地位的可能性最高,给了四条理由40: 现成的用户基数、丰富的产品矩阵抬高了转移门槛、手握海量用户行为数据、以及现金流够厚 (书举的对照很有说服力:谷歌训练 PaLM 花了约 1120 万美元, 只占它 2022 年研发投入的 0.03%)。

而对新兴的模型公司,书的判断是**「前路漫漫」**,三条理由41: 被巨头持续打压、缺乏稳定现金流、以及产品本身还存在场景不明、体验不佳的问题。 书举的证据是 SimilarWeb 的统计:ChatGPT 在 2023 年 6 月的流量下降了约 10.3%。

判断(我们的,不是书里的): 这一节的推理是对的,证据是弱的。 「2023 年 6 月流量下降 10.3%」是一个季节性极强的数字——北半球学校那时正好放暑假, 而当时 ChatGPT 的用户里学生占了很大一块。 拿单月流量波动去支撑「新兴企业前路漫漫」这种结构性判断,证据链是断的。 这本书里这类「用一个短期数字支撑长期结论」的地方不止一处,读的时候要留意。 如果错,会错在: 如果后续几个月的数据同样下滑并且排除了季节因素, 那这个证据就成立——判据是有没有连续多期、去除季节性之后的数据,而书里没有。

12. 作者的判断与证据:哪些有依据,哪些是押注

档次这一章里的例子
有明确依据的事实GPT-4 的各项考试成绩;捷径学习那个实验;思维链的三个局限与 8% 计算错误;当时各家模型的上下文长度;单次对话与单次搜索的成本对照;PaLM 的训练花费占比
转述第三方麦肯锡的采用率调研与 35.6 万亿美元的经济影响预测42;SuperCLUE 的评测排名43;SimilarWeb 的流量统计;Ilya Sutskever 关于「世界模型」的说法
书自己的假设(措辞是「有望」「我们认为」)早期 10%~20% 付费、中期 40%~60% 付费渗透率——第 10 节那三行,一行统计数据都没有
书自己下的判断「大模型将超越搜索引擎成为新一代入口」;「竞价排名将不复存在」;三阶段路线图与「统一期占全网 60% 以上流量」;「强者恒强是大概率事件」
书自己的坦白(最有价值)「幻觉……无法完全避免」;思维链下模型「只是依葫芦画瓢」;智能体「尚未达到产品市场契合」;NUI 对普通用户「使用门槛较高」

最后那一档是这一章最该记住的部分。 一本以看好为基调的书, 在这四处主动写下了限制条件——这些地方比它的乐观预测可信得多。

13. 边界与局限

这一章没覆盖的东西:

  • 没有把「怎么让模型多知道点」讲全——最常用的那条(检索增强生成)被放在了另一章,两处没连起来;
  • 没有讲评测怎么做才算数。 书列了一堆榜单和分数, 但**没有一处提到「测试题泄漏进训练材料就不作数」**这个最基本的问题;
  • 没有讲成本怎么降。 入口那一节把成本差距摆出来了, 但没有一节讲「10 倍的差距怎么缩小」——而这恰恰是这两年真正发生的事;
  • 三种协作模式没有配风险讨论。 分类轴很好用,但书没说「AI 承担得越多,人越兜不住错」;
  • 那三笔账没有一笔算到底。 第 10 节讲了钱从哪儿多出来, 却没有一处提到「多出来的这笔钱要减掉多少回答问题的成本」—— 而按本章第 11 节那组对照,那笔成本正好贵一个数量级。收入侧和成本侧,书自己没有对上账。

已被时间冲刷的部分:

书里的说法现在怎么看
思维链是一种提问技巧,模型不够大就没用前半句已经过时:它现在是训练目标,而且能迁移给小模型
各家的上下文长度(GPT-4 Turbo 12.8 万、Kimi 200 万字)纯粹的时点数字,只有史料价值
「提示词工程师」是个新职业书自己就预判了它会消退,这个预判方向是对的
Notion AI 上线两月 400 万用户、《蛋仔派对》日活 3000 万时点数字,只有史料价值;但「工具型直接收费、平台型摊给商家」这条分法仍然好用
中期 40%~60% 的付费渗透率这是作者的假设,不是统计;引用时必须把「假设」两个字一起带上
AI 搜索单次成本是传统搜索的 10 倍倍数已经不是当年那个数,但**「回答比检索贵」这个结构没变**——这才是要记住的部分

14. 可带走的

  1. 「数一数『大模型不会数数』有几个字」这一道题,把四条本事全考了一遍: 它读懂了任务(对)、答「8 个字」(错)、开思维链答「7 个」(对,但多吐 14 个字)、 追问出处时编出「《人工智能简史》第 3 章第 47 页」——错在它数的是切碎后的块,不是字;
  2. 「涌现」当描述用没问题,当解释用是空的——换个打分方式它可能就消失了;
  3. 捷径学习是这一章最重要的实证:去掉题目里的线索词,模型的表现可能掉到瞎猜水平;
  4. 拿量人的考卷去量模型,解读会依赖一堆对模型不成立的假设——书这一问很深刻;
  5. 生成式模型天生不确定:同一个输入两次可以给出不同答案,而且两次都算对;
  6. 模型赢在平均和产量,人赢在上限——所以它该用来堆数量,由人来挑;
  7. 思维链不是让模型变聪明,是给它地方打草稿——代价是多吐很多字,而字是要花钱的;
  8. 书给的三个局限里,「模型不够大就没用」已经被推翻了一半,另两条仍然成立;
  9. 一本正经地编造是这套存取方式的必然产物,书明说「无法完全避免」;
  10. 应对只有三条:降低概率、及时识别、用在不要求严密的场景;
  11. 让模型多知道点只有两条路:改参数(微调)或改输入(提示词)——而书漏了最常用的第三条;
  12. 三种协作模式按「谁做主」分,同时是一条风险轴:AI 干得越多,人越兜不住错;
  13. 书里第一档叫「嵌入模式」,和第 02 章那个「嵌入」(把词变成一串数)毫无关系——本文改叫工具模式;
  14. NUI 不会取代 GUI——界面的一个重要功能是告诉用户「你能干什么」,对话框做不到;
  15. 信息茧房会升级:你不只是看不到别的,而是不再知道「有别的」;
  16. 接上大模型之后钱从三处来:工具型直接向用户收、平台型摊给商家、文娱型拿创作工具换人头;
  17. 那组付费渗透率(早期 10%~20%、中期 40%~60%)是作者的假设,不是统计——引用必须带上「假设」;
  18. IP AI 分身是唯一一条全新的生意,但书只给了一个个案(网红 Caryn),不足以支撑判断;
  19. 竞价排名在 AI 搜索里是结构性消失,不是变少——页面上没有可排序的结果;
  20. 回答一次比检索一次贵一个数量级——这是全书所有产品判断的成本底座。

15. 原文地图

主题原书章原文位置
基座模型的定义4.1 基座模型的智能涌现text/17-ch04-01-4-1.txt:16(搜「基座模型这一词汇最初由斯坦福大学」)
涌现的定义与两个特征4.1text/17-ch04-01-4-1.txt:19(搜「出乎意料的行为」) · text/17-ch04-01-4-1.txt:19(搜「非线性变化和突发性」)
四条能力与评测体系4.1text/17-ch04-01-4-1.txt:22(搜「内容理解、内容生成、逻辑推理、记忆」) · text/17-ch04-01-4-1.txt:25(搜「481个细分任务」)
不透明性与那句「奇点降临」4.1text/17-ch04-01-4-1.txt:28(搜「奇点降临」)
GPT-4 的考试成绩4.1.1 语言理解能力text/17-ch04-01-4-1.txt:39(搜「MMLU」)
学界分歧与「挠痒痒」4.1.1text/17-ch04-01-4-1.txt:54(搜「挠痒痒」)
捷径学习那个实验4.1.1text/17-ch04-01-4-1.txt:57(搜「随机猜测无异」)
用人类考卷量模型是否合适4.1.1text/17-ch04-01-4-1.txt:60(搜「捷径学习」)
深度生成模型与评测4.1.2 生成能力text/17-ch04-01-4-1.txt:74(搜「深度生成模型」) · text/17-ch04-01-4-1.txt:77(搜「SuperCLUE」)
输出不确定与提示工程4.1.2text/17-ch04-01-4-1.txt:80(搜「提示工程涉及系统地构建提示」)
创造力与吉尔福德的框架4.1.2text/17-ch04-01-4-1.txt:108(搜「吉尔福德」)
麦肯锡的采用率调研4.1.2text/17-ch04-01-4-1.txt:111(搜「麦肯锡2023年4月中旬的调研」)
思维链的定义与出处4.1.3 逻辑推理text/17-ch04-01-4-1.txt:122(搜「思维链」)
铅笔那道题4.1.3text/17-ch04-01-4-1.txt:125(搜「小明有5支铅笔」)
思维链的三个局限4.1.3text/17-ch04-01-4-1.txt:144(搜「5400亿个时」) · text/17-ch04-01-4-1.txt:144(搜「8%的计算错误」)
知识被压进参数4.1.4 记忆能力text/17-ch04-01-4-1.txt:155(搜「海量知识的压缩指对语言建模」) · text/17-ch04-01-4-1.txt:158(搜「Ilya Sutskever」)
幻觉无法完全避免4.1.4text/17-ch04-01-4-1.txt:161(搜「无法完全避免」)
微调 vs 提示词4.1.4text/17-ch04-01-4-1.txt:164(搜「微调是改变模型中的知识」) · text/17-ch04-01-4-1.txt:167(搜「200万字的上下文输入」)
提示词工程师这个职业4.1.4text/17-ch04-01-4-1.txt:170(搜「提示词工程师」)
三种模式强调协作而非形态4.2 三大应用模式text/18-ch04-02-4-2.txt:22(搜「它们更多强调的是人机协作模式」)
工具模式(书叫嵌入模式)与两类场景4.2.1 嵌入模式text/18-ch04-02-4-2.txt:33(搜「嵌入模式是指用户通过与AI进行语言交流」) · text/18-ch04-02-4-2.txt:45(搜「Stable Diffusion」)
副驾驶模式与五五开4.2.2 副驾驶模式text/18-ch04-02-4-2.txt:89(搜「Microsoft 365 Copilot」) · text/18-ch04-02-4-2.txt:92(搜「人机协作程度大约各占50%」)
智能体模式的定义4.2.3 智能体模式text/18-ch04-02-4-2.txt:124(搜「智能体(Agent)模式是指人类设定目标」)
智能体尚未跑通商业化4.2.3text/18-ch04-02-4-2.txt:139(搜「代理即服务」)
GUI 转向 NUI4.3.1 交互方式将被重塑text/19-ch04-03-4-3.txt:24(搜「从GUI到NUI」)
两种界面长期共存的理由4.3.1text/19-ch04-03-4-3.txt:33(搜「NUI与GUI共存」)
信息茧房会加剧4.3.1text/19-ch04-03-4-3.txt:42(搜「信息茧房」)
从「影响决策」到「辅助决策」4.3.1text/19-ch04-03-4-3.txt:39(搜「辅助」) · text/19-ch04-03-4-3.txt:45(搜「地图导航系统取代纸质地图」)
原生于大模型的新应用4.3.1text/19-ch04-03-4-3.txt:60(搜「已超过600个」)
三方面价值提升的总起4.3.2 引入大模型能力将会给消费互联网应用带来三方面价值提升text/19-ch04-03-4-3.txt:71(搜「提升付费率和APRU值」)
工具型/平台型与 Notion AI 的 ARPU4.3.2text/19-ch04-03-4-3.txt:74(搜「Notion AI」) · text/19-ch04-03-4-3.txt:74(搜「向大模型优化转变」)
那组付费渗透率假设4.3.2text/19-ch04-03-4-3.txt:77(搜「付费渗透率假设」)
文娱应用靠创作工具换增长4.3.2text/19-ch04-03-4-3.txt:80(搜「引发用户增长」) · text/19-ch04-03-4-3.txt:83(搜「蛋仔派对」)
IP AI 分身这条新商业模式4.3.2text/19-ch04-03-4-3.txt:86(搜「创新数字资产增值服务」) · text/19-ch04-03-4-3.txt:89(搜「AI虚拟陪伴」)
入口的定义与演进4.4 大模型将成为新的互联网入口text/20-ch04-04-4-4.txt:16(搜「互联网入口汇聚了用户流量」) · text/20-ch04-04-4-4.txt:27(搜「互联网入口的内涵和典型产品」)
优于搜索引擎的两条理由4.4.1text/20-ch04-04-4-4.txt:40(搜「呈现质量方面」)
成为终点、不再分流4.4.1text/20-ch04-04-4-4.txt:47(搜「超级App」)
答案引擎与 Perplexity4.4.2 商业模式变革text/20-ch04-04-4-4.txt:71(搜「Perplexity」)
竞价排名不复存在4.4.2text/20-ch04-04-4-4.txt:77(搜「竞价排名机制在AI搜索引擎中将不复存在」)
单次成本的 10 倍差距4.4.2text/20-ch04-04-4-4.txt:86(搜「两者的成本相差10倍」)
三阶段:培育期4.4.3 三个发展阶段text/20-ch04-04-4-4.txt:101(搜「过去20年Bing所有升级的总和」) · text/20-ch04-04-4-4.txt:106(搜「上涨了2.38%」)
三阶段:混战期与统一期4.4.3text/20-ch04-04-4-4.txt:114(搜「Code Interpreter」) · text/20-ch04-04-4-4.txt:121(搜「占据全网60%以上用户流量」)
强者恒强的四条理由4.4.4 强者恒强text/20-ch04-04-4-4.txt:143(搜「省去从0到1的用户增长过程」) · text/20-ch04-04-4-4.txt:153(搜「1120万美元」)
新兴企业前路漫漫4.4.4text/20-ch04-04-4-4.txt:179(搜「SimilarWeb」)

Footnotes

  1. 出处:「4.1 基座模型的智能涌现」第 22 段(text/17-ch04-01-4-1.txt:22,搜「内容理解、内容生成、逻辑推理、记忆」)与第 25 段(text/17-ch04-01-4-1.txt:25,搜「481个细分任务」)。四类的归法是书自己在这一节做的,书没有说明它依据哪一份公认分类;「481 个细分任务」是它引的评测体系规模。

  2. 出处:「4.1 基座模型的智能涌现」第 19 段(text/17-ch04-01-4-1.txt:19,搜「出乎意料的行为」)与同段(搜「非线性变化和突发性」)。

  3. 出处:「4.1」第 16 段(text/17-ch04-01-4-1.txt:16,搜「基座模型这一词汇最初由斯坦福大学」)。原文的定义是「以自监督或半监督方式在大规模数据上训练的基本模型,能够适应其他多个下游任务」;提出者写作「Bommasani 等人」,与第 01 章补的那份报告是同一批人。

  4. 出处:「4.1.1 语言理解能力」第 39 段(text/17-ch04-01-4-1.txt:39,搜「MMLU」)。MMLU 是一项覆盖大量学科的综合测试,书里没有解释这个缩写。

  5. 出处:「4.1.1」第 57 段(text/17-ch04-01-4-1.txt:57,搜「随机猜测无异」)。原文:「如果避免这些线索词的出现,BERT 模型的表现与随机猜测无异」。

  6. 出处:「4.1.1」第 60 段(text/17-ch04-01-4-1.txt:60,搜「捷径学习」)。原文:「使用用于评估人类理解能力的基准任务来评估模型的理解能力或许不适合」。

  7. 出处:「4.1.1」第 54 段(text/17-ch04-01-4-1.txt:54,搜「挠痒痒」)。「打包和压缩了人类知识的存储库」这个说法也在同一段末尾。 2

  8. 出处:「4.1.2 生成能力」第 80 段(text/17-ch04-01-4-1.txt:80,搜「提示工程涉及系统地构建提示」)。同段给出「针对某一精确的输入提示,生成式 AI 模型在每次提示时都能产生不同的输出,但这些输出都是有效的」。 2

  9. 出处:「4.1.2」第 108 段(text/17-ch04-01-4-1.txt:108,搜「吉尔福德」)。「人类的最佳创意仍然与聊天机器人的创意不相上下,甚至有过之而无不及」也在同一段。 2

  10. 出处:「4.1.2」第 111 段(text/17-ch04-01-4-1.txt:111,搜「麦肯锡2023年4月中旬的调研」)。

  11. 出处:「4.1.3 逻辑推理」第 122 段(text/17-ch04-01-4-1.txt:122,搜「思维链」)。书把它归给 Jason Wei 等人,但没有给出论文出处。

  12. 出处:「4.1.3」第 125 段(text/17-ch04-01-4-1.txt:125,搜「小明有5支铅笔」)。同段还记了一个有意思的对照:ChatGLM-4 面对同一道题不是分步算,而是直接调用外部的代码插件,把推理问题转成了编程问题。

  13. 出处:「4.1.3」第 144 段(text/17-ch04-01-4-1.txt:144,搜「5400亿个时」)与同段(搜「8%的计算错误」)。「依葫芦画瓢」这个说法也在这一段末尾。 2 3 4

  14. 出处:「4.1.4 记忆能力」第 158 段(text/17-ch04-01-4-1.txt:158,搜「Ilya Sutskever」)。「知识通过建模转化为上千亿参数之间的数学计算逻辑」也在同段开头;第 155 段(text/17-ch04-01-4-1.txt:155,搜「海量知识的压缩指对语言建模」)给出「几乎所有的人类知识都被压缩到一个模型中」的说法。 2

  15. 出处:「4.1.4」第 161 段(text/17-ch04-01-4-1.txt:161,搜「无法完全避免」)。三条应对也在同一段。 2

  16. 出处:「4.1.4」第 164 段(text/17-ch04-01-4-1.txt:164,搜「微调是改变模型中的知识」)。

  17. 出处:「4.1.4」第 167 段(text/17-ch04-01-4-1.txt:167,搜「200万字的上下文输入」)。同段给出 GPT-4 Turbo 的 128k 上限。 2

  18. 出处:「4.1.4」第 170 段(text/17-ch04-01-4-1.txt:170,搜「提示词工程师」)。原文:「随着技术的进步,大模型对提示词的需求将逐渐减少」。

  19. 出处:「4.2 基座模型的三大应用模式」第 22 段(text/18-ch04-02-4-2.txt:22,搜「它们更多强调的是人机协作模式」)。

  20. 出处:「4.2.1 嵌入模式」第 33 段(text/18-ch04-02-4-2.txt:33,搜「嵌入模式是指用户通过与AI进行语言交流」)。Stable Diffusion 与 Midjourney 的例子见第 45 段(text/18-ch04-02-4-2.txt:45,搜「Stable Diffusion」)与第 57 段(text/18-ch04-02-4-2.txt:57,搜「Midjourney」)。

  21. 出处:「4.2.2 副驾驶模式」第 89 段(text/18-ch04-02-4-2.txt:89,搜「Microsoft 365 Copilot」)与第 92 段(text/18-ch04-02-4-2.txt:92,搜「人机协作程度大约各占50%」)。这一节还用了不少篇幅讲 Character.AI 这类情感陪伴产品(第 107 段,text/18-ch04-02-4-2.txt:107,搜「Character.AI」)。

  22. 出处:「4.2.3 智能体模式」第 124 段(text/18-ch04-02-4-2.txt:124,搜「智能体(Agent)模式是指人类设定目标」)与第 139 段(text/18-ch04-02-4-2.txt:139,搜「代理即服务」)。「关键竞争领域」那句预判见第 127 段(text/18-ch04-02-4-2.txt:127,搜「关键竞争领域」)。 2

  23. 出处:「4.3.1 消费互联网应用交互方式将被重塑」第 24 段(text/19-ch04-03-4-3.txt:24,搜「从GUI到NUI」)。

  24. 出处:「4.3.1」第 33 段(text/19-ch04-03-4-3.txt:33,搜「NUI与GUI共存」)。「你可以直接向我提问」那个例子也在同一段。 2

  25. 出处:「4.3.1」第 42 段(text/19-ch04-03-4-3.txt:42,搜「信息茧房」)。

  26. 出处:「4.3.1 消费互联网应用交互方式将被重塑」第 39 段(text/19-ch04-03-4-3.txt:39,搜「辅助」)与第 45 段(text/19-ch04-03-4-3.txt:45,搜「地图导航系统取代纸质地图」)。原文的对照是:信息流推荐「影响」用户决策,对话式交互进一步「辅助」用户做决策;第 45 段那个日程例子出自谷歌,书写作「以 Google 的 Agent 为例」。

  27. 出处:「4.3.1」第 60 段(text/19-ch04-03-4-3.txt:60,搜「已超过600个」)。ChatGPT 那个例子见第 54 段(text/19-ch04-03-4-3.txt:54,搜「举两个例子」),百度「度秘」见第 57 段(text/19-ch04-03-4-3.txt:57,搜「度秘」)。

  28. 出处:「4.3.2 引入大模型能力将会给消费互联网应用带来三方面价值提升」第 74 段(text/19-ch04-03-4-3.txt:74,搜「Notion AI」)。工具型与平台型的划分、Notion AI 上线两个月超 400 万用户、ARPU 增长 50%~100%,以及「搜索引擎优化向大模型优化转变」这一句(搜「向大模型优化转变」),都在这一段。小标题见第 71 段(text/19-ch04-03-4-3.txt:71,搜「提升付费率和APRU值」)——注意小标题里写的是「APRU」,正文写的是「ARPU」,前者是笔误。 2 3

  29. 出处:「4.3.2」第 77 段(text/19-ch04-03-4-3.txt:77,搜「付费渗透率假设」)。原文:「在商业化早期,『尝鲜』心理有望快速驱动 10%~20% 的用户付费。在中期,随着 AI 能力的不断迭代,我们认为 40%~60% 的付费渗透率假设是较为谨慎的。长期来看,AI 功能或将进一步打破收入天花板。」——三句话里「有望」「我们认为」「假设」「或将」四个词,是判断它性质的全部依据。

  30. 出处:「4.3.2」第 83 段(text/19-ch04-03-4-3.txt:83,搜「蛋仔派对」)。同段给出短视频与网络视频约 95% 的用户渗透率、网络音乐与网络游戏约 −6% 的用户增长率,以及《蛋仔派对》上线 6 个月日活突破 3000 万;小标题见第 80 段(text/19-ch04-03-4-3.txt:80,搜「引发用户增长」)。原文里「日活」写作「日活跃用户数(DAU)」。 2

  31. 出处:「4.3.2」第 89 段(text/19-ch04-03-4-3.txt:89,搜「AI虚拟陪伴」)。Caryn 那个例子也在同一段(搜「Caryn」):180 万粉丝、YouTube 上超过 2000 小时视频、在 GPT-4 上微调训练、24 小时迅速回复。小标题见第 86 段(text/19-ch04-03-4-3.txt:86,搜「创新数字资产增值服务」)。 2

  32. 出处:「4.4 大模型将成为新的互联网入口」第 16 段(text/20-ch04-04-4-4.txt:16,搜「互联网入口汇聚了用户流量」)。入口演进的三段划分见第 27 段(text/20-ch04-04-4-4.txt:27,搜「互联网入口的内涵和典型产品」)。

  33. 出处:「4.4.1」第 40 段(text/20-ch04-04-4-4.txt:40,搜「呈现质量方面」)。

  34. 出处:「4.4.1」第 47 段(text/20-ch04-04-4-4.txt:47,搜「超级App」)。同段给出短视频平台用户日均使用时长超过 2.5 小时的对照。

  35. 出处:「4.4.2 大模型将引发搜索引擎商业模式变革」第 77 段(text/20-ch04-04-4-4.txt:77,搜「竞价排名机制在AI搜索引擎中将不复存在」)。同段还给出订阅制这条新收入(Perplexity Pro 每月 20 美元)。

  36. 出处:「4.4.2」第 86 段(text/20-ch04-04-4-4.txt:86,搜「两者的成本相差10倍」)与同段(搜「200~300万美元」)。2 美分那个数字书注明来自 OpenAI 首席执行官 2023 年初在社交媒体上的透露,是转述不是测算。 2

  37. 出处:「4.4.3 三个发展阶段」第 101 段(text/20-ch04-04-4-4.txt:101,搜「过去20年Bing所有升级的总和」)与第 106 段(text/20-ch04-04-4-4.txt:106,搜「上涨了2.38%」)。前者是微软发言人的说法,不是第三方测量。

  38. 出处:「4.4.3」第 114 段(text/20-ch04-04-4-4.txt:114,搜「Code Interpreter」)。

  39. 出处:「4.4.3」第 121 段(text/20-ch04-04-4-4.txt:121,搜「占据全网60%以上用户流量」)与第 128 段(text/20-ch04-04-4-4.txt:128,搜「超过90%的国际市场份额」)。

  40. 出处:「4.4.4 强者恒强是大概率事件」第 143 段(text/20-ch04-04-4-4.txt:143,搜「省去从0到1的用户增长过程」)、第 146 段(text/20-ch04-04-4-4.txt:146,搜「Chrome浏览器默认搜索引擎」)、第 153 段(text/20-ch04-04-4-4.txt:153,搜「1120万美元」)。

  41. 出处:「4.4.4」第 179 段(text/20-ch04-04-4-4.txt:179,搜「SimilarWeb」)。同节前面还记了微软与谷歌的市值波动(第 162 段,text/20-ch04-04-4-4.txt:162,搜「飙升了超过800亿」)。

  42. 出处:「4.2 基座模型的三大应用模式」第 16 段(text/18-ch04-02-4-2.txt:16,搜「35.6万亿美元」)。这是麦肯锡的预测,不是已发生的事实。

  43. 出处:「4.1.2」第 77 段(text/17-ch04-01-4-1.txt:77,搜「SuperCLUE」)。原文注明数据来自 SuperCLUE 官网 2024 年 2 月的评测结果。