跳到主要内容

从语言模型到 AI 工程

这一章讲三件事: 这本书说的「AI 工程」到底是一门什么生意; 撑起它的那种「别人训好的现成模型」是怎么从一台接话机器长出来的; 以及动手做一个 AI 应用之前,作者认为你必须先想清楚什么。 这是全书的第一章,后面十三章(怎么评好坏、怎么写指令、怎么查资料、怎么改模型、怎么备数据、怎么跑得更省)都挂在它搭的框架上。 不需要任何基础,遇到的生词都在当场解释。

1. 顶层全景:一条四十年的链

这本书的中心词是 AI 工程——作者给的定义很干脆:在基础模型之上构建应用的过程1

注意这个定义里的「之上」两个字:模型不是你自己造的,是别人造好你拿来用的。这本书讲的全部手艺,都是「怎么把一个现成的、谁都能买到的模型,变成一个好用的产品」。

为什么这件事在 2020 年之后突然成立?书里给了一条四十年的链:

语言模型(1950s 起) 给一段文字,算「下一个词最可能是什么」
│ + 自监督(2000s 末):不要人标数据,全网文字随便学

大语言模型(2018 起) 同样的机器,参数从 1 亿涨到几千亿
│ + 能吃图像等多模态数据 + 一个模型干很多种活

基础模型(2021 起名) 通用的「底座」,谁都能往上盖自己的应用
│ + 模型变成商品,调 API 就能买

AI 工程(2022 起) 一门新学科:不买模型就买不到竞争力
→ 于是人人都成了「模型的装修队」

图说:每一环都是被上一环的瓶颈逼出来的,本章第 2–7 节逐环拆开。

这条链上有三个真正承重的关节:语言模型是什么(第 2、3 节)、它靠什么绕开了人工标数据的瓶颈(第 4、5 节)、以及「基础模型 + 模型即服务」怎么催生出 AI 工程这门学科(第 6、7 节)。第 8、9 节换一个视角:就算你认同了这一切,动手之前还有三关要过。

2. 语言模型:一台只回答「下一个词是什么」的机器

先说你天天在用的东西到底是什么。

语言模型就是一台给语言的统计规律建模的机器。它的全部工作就是回答一个问题:给定前面这段文字,下一个词最可能是什么?2

比如你给它「我最喜欢的颜色是 ___」,它算出 blue 的可能性比 car 大。这件事古老得超出想象:1905 年福尔摩斯就在《跳舞的人》里用「英语里最常见的字母是 e」破过密码;1951 年香农(Claude Shannon)发表「Prediction and Entropy of Printed English」,把这套统计方法正式变成科学3

但它眼里的「词」和你我以为的词不完全一样。它的基本单位叫 token(一个词、半个词,或者几个字母——模型切分文字的最小单位;中文里它有两个名字,一个叫「标记」,一个叫「词元」,本书沿用原文不译)。看原书的例子,这是本章的主走查:

你输入: I can't wait to build awesome AI applications
模型切成:I | can | 't | wait | to | build | awesome | AI | applications
└──┬──┘
共 9 个 token(注意 can't 被拆成了 can 和 't 两个)

图说:一个 token 平均约等于四分之三个单词——100 个 token 大约是 75 个英文单词。

为什么非要切这么碎?书里给了三个理由:碎块能拆出词的内部结构(cooking = cook + ing,两半各自带意思);碎块的总数比所有单词少,模型负担小;碰上没见过的词(chatgpting)也能拆成熟悉的碎块来理解4

一个模型认识的所有 token 的集合,叫它的词表(这本模型的「字典」)。

GPT(OpenAI 公司的模型系列,全名是三个英文单词的缩写,当专名记住就行)-4 的词表是 100,256 个 token,Mixtral 8x7B 是 32,000 个5

这本字典有多厚由模型开发者定,跟你的应用无关——但它决定了一件跟你有关的事:模型按 token 计费时,token 切得越碎,你付的钱越多。

把原文切成 token 的过程叫分词。同一个句子,不同模型的分词结果可能不同,所以「这段话多少个 token」没有跨模型的统一答案——记住这一点,第 13 章算推理成本时它会回来。

3. 两种语言模型,和它的本质动作:补全

语言模型分两家。一家只看前文、挨个往下猜,叫自回归(「自动接着自己的输出往下写」)语言模型——你今天用的所有聊天模型都是这家6

另一家看前后文填空,叫掩码语言模型;这一派的招牌是谷歌 2018 年的 BERT(一个「完形填空」式的老模型,本书只当专名用,后面不再展开)。填空派现在主要用于分类、找错这类「理解」而不是「写作」的活。

这种能用固定词表拼出无穷多种输出的模型,叫生成式模型——「生成式 AI」这个词就是这么来的。这本书之后说「语言模型」,指的都是自回归那一家。

生成式模型的本质动作是补全:你给它一段开头(这段开头叫提示词——你发给模型的那段指令),它把开头续写下去。

续写不是挑一个唯一正确的答案,而是按可能性挑。这个可能性有个正式名字,叫概率:0 到 1 之间的一个数,70% 的意思是「同样的问题问 100 遍,大约 70 遍会得到这个答案」。按概率挑,就不保证每次都一样,也不保证正确——这是全书后面所有麻烦的源头,第 03 章会专门讲。

补全听着简单,但威力在于:翻译、摘要、写代码、解数学,全都可以伪装成补全。 你写「『你好吗』用法语说是……」,它接一句 Comment ça va,翻译就完成了。但也正因为是补全,你问它问题,它可能不接答案,反而再补一个问题接着问——「会补全」和「会对话」是两回事,教它对话是第 03 章的事7

4. 监督学习与人工标数据的瓶颈

第 2 节说语言模型古老,那为什么直到 2018 年后它才突然变厉害?书里的答案是:不是机器变了,是喂机器的方式变了。

先交代一个全书会反复用的词:让模型从数据里学东西的过程,叫训练

最老的一种训练方式是监督学习(有人盯着的学法):人先标好答案,模型照着学——你先标十万张「这是猫」「这不是猫」,它照着总结规律。

这里的标注就是「人工给数据写答案」这件事。

2012 年开启深度学习(用很多层可调的数从数据里学规律的一类方法,第 02 章会拆)热潮的 AlexNet 就是靠监督学习训出来的,它学的是 ImageNet 里 100 多万张人工标好类别的图片8

监督学习的死穴是标注又贵又慢。书里给了一笔账(这是本章的数字锚点):

标注一张图片的成本: 约 5 美分(量大还能到 2 美分)
ImageNet 100 万张图片: 约 5 万美元
如果每张要两人各标一遍: 成本直接翻倍
如果想让模型认识 100 万种东西(而不是 1000 种):
光标注费就要 5000 万美元

图说:类别每扩大一档,标注账单就跟着涨一档。这还只是「认日常东西」这种
不需要专业知识的标注;让医生标 CT 片,价格要上天。

5. 自监督:答案就藏在数据里

绕开标注瓶颈的办法叫自监督(自己给自己出题):不要人标,让数据自己长出答案。

语言建模天然就是自监督的——随便拿一句「I love street food.」,把最后一个词盖住,就是一道「前文是题、被盖住的词是答案」的训练题;一句话能出六道题9。于是全互联网的书、博客、新闻、评论,一分钱不花全变成了训练数据。这一大堆喂给模型的文字,行话叫语料

注意自监督≠无监督学习:无监督是压根没有答案可学(比如只把相似的东西聚成堆),自监督是答案就藏在数据里、自己出题自己答10

数据瓶颈一消失,模型就可以放心造大了。模型的大小用参数量(参数有多少个)来衡量,参数:模型内部那批在训练中不断被调整的数,调对了,模型就「会」了。

参数还有个更常见的名字,叫权重。GPT 的第一版(2018 年)有 1.17 亿个参数,当时叫「大模型」;GPT-2(2019 年)15 亿,前一年的「大模型」立刻降级成「小模型」;写这本书时,千亿参数才敢叫大11

顺着回答一个你可能会有的疑问:模型更大,不该用更少的数据就能学会吗?书里的回答是:目标不是「让小数据发挥出大模型的水平」,而是「让大模型的性能被榨干」——大模型胃口更大,只喂小数据是浪费算力(计算机干活的力气,通常按每秒能完成多少次计算来量)12

6. 大语言模型与基础模型

大了一号的语言模型,行话叫大语言模型;英文里它有个更常用的缩写,叫 LLM

「大语言模型」如今满大街都是,但它有个毛病:这些模型早就不只处理文字了。能同时吃文字、图像等多种数据形态的模型,叫多模态模型(「模态」就是数据的存在形式:文字、图像、声音各算一种)。

2021 年,斯坦福一群研究者给这类模型起了个更准的名字:基础模型——「基础」的意思是,它本身不是一个成品,而是让你往上盖东西的底座13

名字背后的实质变化有两个。第一个:AI 研究过去是按模态分家的——搞文本的、搞图像的、搞语音的各练各的模型;基础模型把这些合进了一个模型。合体同样需要数据,而多模态数据也能自监督:OpenAI 训 CLIP 时,不请人标图,直接去网上收集天然成对的(图, 文字说明),凑了 4 亿对——是 ImageNet 规模的 400 倍,标注成本为零14。CLIP 不是生成式模型,是一种嵌入(把文字和图像各自变成一串数字、让意思相近的东西数字也相近)模型;这串数字是第 04、08 章的核心道具,这里先记住名字。

第二个变化:模型从「一专一能」变成「一通百能」。过去做一个情感分析(判断一段文字是夸你还是骂你)模型就不能翻译,做一个翻译模型就不能分析情感;现在一个模型全都干,只是干得有好有坏。于是「要不要为我的任务专门训一个模型」变成了一笔可以算的账:书里说,适配一个现成模型,可能只要 10 个样本加一个周末;从零训一个,要 100 万个样本加 6 个月15

7. 模型变成商品:MaaS 与 AI 工程

模型又大又通用之后,新问题是谁造得起。造一个基础模型要的数据、算力和人才,只有大公司、政府和少数明星初创负担得起,于是模型即服务(MaaS——模型不白送、不交付,做成在线服务按次卖)兴起了。

模型即服务靠 API(应用程序接口——你的程序和别人的程序之间约定好的「传话口」,你按格式发请求,它按格式回结果)对外提供:你几行代码就能调用一个千亿参数的模型。

买了模型即服务,就不用自己买一台服务器(放在机房里、专门响应别人请求的计算机)16

三件事到齐,AI 工程就成立了:模型变成了通用件(能力)、模型变成了商品(API)、搭应用的门槛塌了(谁都能上手)17。书里有一组数字给你感受这门学科的温度:一家公司的团队负责人告诉作者,2022 年 4 月到 2023 年 4 月,他们的 AI 成本降了大约两个数量级(100 倍);高盛估计 2025 年全球 AI 投资接近 2000 亿美元——作为参照,美国公立中小学的总支出约为这个数的 4.5 倍18

最后一个澄清:为什么不叫「ML 工程」?作者的理由是,和传统 ML 工程(围绕「自己开发模型」)相比,这门新学科有三点实质不同:用别人训好的模型(重心从建模变成适配)、模型大到一个机房才装得下(算力与响应速度成了日常压力)、输出是开放式的(怎么评好坏成了最难的问题)。这三点,正好是本书后面章节分别对付的事19

8. 动手之前的三关:作者的判断(上)

第 1 章后半,作者换了一个身份:从科普者变成劝退者。这部分是他基于几百个应用案例和 50 家公司访谈给的判断。

判断一:大多数应用该先问「要不要做」,而不是「怎么做」。 作者把动机按风险从高到低排:不做会被淘汰(生存威胁)→ 不做会错失利润(机会)→ 只是不想被落下(防御性投入)。配套的问题是自建还是外包:涉及生死就自建,只是提效就先看看市面上的成品20。这条是商业常识,不是 AI 特有——但作者观察到它被普遍跳过,因为「用基础模型做个炫酷演示很容易」。

判断二:先做场景评估,再把目标定成数字。 作者列过 8 类被行业验证过的应用场景:编程、图像视频、写作、教育、聊天机器人、信息聚合、数据组织、工作流(一串首尾相接的办事步骤)自动化。每类都有真实营收证据:GitHub Copilot 两年做到 1 亿美元年收入;麻省理工的实验里,453 名专业人士用 ChatGPT 写作,平均耗时降 40%、质量升 18%;也有反面证据——辅导作业的 Chegg 被 ChatGPT 抢生意,股价从 28 美元跌到 2 美元21

目标必须落成数字,也就是要先定指标(能写成数字、用来打分的度量):你的应用做到多少分才算「能用」。

作者给的框架叫「实用性门槛」,包含质量、延迟(从发问到收到回答要等多久——聊天机器人里这是用户耐心的红线)、成本三类。门槛的高低是相对的:如果人工客服中位响应是 1 小时,AI 只要快过 1 小时就算达标22

判断三(全书最重要的一句预警):「最后一公里」会吃掉你大部分预算。 基础模型的初步成功有误导性——一个周末能做出的演示,做到能上线可能要数月。LinkedIn 团队的真实记录:1 个月做到想要体验的 80%,从 80% 到 95% 又花了 4 个月,「每额外提升 1% 都举步维艰」。作者引了一篇论文的总结:「从 0 到 60 很容易,但从 60 到 100 却变得极具挑战性。」23

9. 护城河与三种适配技术:作者的判断(下)

判断四:AI 产品的护城河,技术和分发多半靠不住,能攒的是数据。 模型人人买得到,你今天的「独家功能」可能只是谷歌下周的一个按钮;真正的防御是数据飞轮——产品越被用,攒下的使用数据越多,数据又把产品改得更好,如此循环24

判断五:三种适配技术,按从轻到重的顺序试。 写产品描述的那个零售商例子,作者用它串起了全书的三条主线技术。第一种是提示工程(把指令写细、给示例,不动模型)。

第二种,检索增强就是「先查资料、再写答案」:先让模型去你的资料库里检索(查资料)一圈,再让它拿着查到的内容来写;它的英文缩写更常用,叫 RAG

第三种是微调(拿你的数据继续训练这个模型,改它本身)。三者分别对应第 07、08、10 章25。作者的立场很明确:能轻的就不上重的——这也解释了全书的章节顺序。

判断(我们的,不是书里的): 这一章写于 AI 投资最狂热的年份,书里引的投资数字(2000 亿美元之类)是当时的顶点叙事,今天引用时应只当「时代坐标」而非事实陈述。真正不过时的是判断三和判断五:最后一公里定律与「先轻后重」的适配顺序,来自工程结构本身,不随行情变化。 如果错,会错在: 如果模型能力涨到「演示即产品」的程度(比如一次生成直接达到 95 分),最后一公里的成本结构会失效——但那需要开放式任务能被可靠评估,而第 04–06 章会告诉你这件事至今没有解决。

10. 边界与局限

  • 本章是全书的导览,几乎所有论断都只有结论没有推导。 token 为什么这样切、评估为什么难、RAG 为什么有效,都要等对应章节。别把本章当论据引用——它告诉你哪些问题值得关心。
  • 应用案例与营收数字全部是 2022–2024 年时点的快照。 书里自己也在变:2019 年 Facebook 还在封禁 AI 头像,2023 年社交平台已内置 AI 头像工具。引用任何一条数字前先想它是不是已被刷新。
  • 作者声明了两处利益相关:她是 3D 角色公司 Convai 的顾问、图像公司 Photoroom 的投资人。涉及这两类应用前景的乐观判断,读时留个心眼26
  • 「AI 工程」这个命名是一个 20 人的小调查投出来的,作者自己也承认。你在别处会看到 LLMOps、MLOps 等叫法,说的是差不多的事。

11. 可带走的

  1. 语言模型只回答一个问题:下一个词是什么。 它读写的最小单位是 token(约 3/4 个单词),模型按 token 计费;

  2. 自监督是这一切的起点:答案藏在数据里,全网文字变成免费训练集,人工标数据的瓶颈被绕开——5000 万美元标 100 万类的账就是这么省掉的;

  3. 基础模型 = 多模态 + 通用任务 + 可当底座;CLIP 的 4 亿对免费图文说明自监督在图像上同样成立;

  4. AI 工程与传统 ML 工程的三点区别:用别人的模型、算力压力大、开放式输出难评估——全书结构就按这三点排;

  5. 适配现成模型可能只要 10 个样本一个周末;从零训要 100 万样本 6 个月——默认先适配,别默认自建;

  6. 动手前先过三关:要不要做(生存/机会/防御)、目标是什么(质量/延迟/成本的门槛)、最后一公里(演示 80% ≠ 产品 95%);

  7. 三种适配技术先轻后重:提示工程(写指令)→ RAG(查资料)→ 微调(改模型);

  8. 能攒的护城河是数据飞轮:使用数据反哺产品,不是技术本身。

12. 原文地图

主题原书章原文位置
AI 工程的定义、三因素第1章text/08-ch01.txt:366(搜「在基础模型之上构建应用」) · text/08-ch01.txt:369(搜「三个关键因素」)
语言模型、福尔摩斯与香农第1章text/08-ch01.txt:82(搜「统计信息进行编码」) · text/08-ch01.txt:88(搜「Prediction and Entropy」)
token、词表、为什么用 token第1章text/08-ch01.txt:106(搜「can和't」) · text/08-ch01.txt:119(搜「100,256个token」) · text/08-ch01.txt:131(搜「chatgpting」)
自回归与掩码、生成式、补全第1章text/08-ch01.txt:159(搜「仅利用前序token」) · text/08-ch01.txt:180(搜「生成式模型」) · text/08-ch01.txt:183(搜「补全机器」)
标注成本账、自监督、语料第1章text/08-ch01.txt:233(搜「5万美元」) · text/08-ch01.txt:240(搜「自行推断标签」) · text/08-ch01.txt:257(搜「无监督学习」)
参数、模型大小、更大模型要更多数据第1章text/08-ch01.txt:268(搜「在训练过程中不断更新」) · text/08-ch01.txt:278(搜「1.17亿」) · text/08-ch01.txt:287(搜「浪费计算资源」)
基础模型、多模态、CLIP、嵌入模型第1章text/08-ch01.txt:304(搜「Bommasani」) · text/08-ch01.txt:319(搜「4亿个(图像,文本)对」) · text/08-ch01.txt:325(搜「嵌入模型」)
三种适配技术、10 个样本一个周末第1章text/08-ch01.txt:340(搜「提示工程」) · text/08-ch01.txt:346(搜「一个周末」)
成本降两个数量级、2000 亿投资第1章text/08-ch01.txt:384(搜「两个数量级」) · text/08-ch01.txt:392(搜「2000亿美元」)
8 类应用与证据(Copilot/MIT/Chegg)第1章text/08-ch01.txt:497(搜「消费级应用和企业级应用」) · text/08-ch01.txt:538(搜「1亿美元」) · text/08-ch01.txt:614(搜「40%」) · text/08-ch01.txt:672(搜「暴跌」)
场景评估、实用性门槛、最后一公里第1章text/08-ch01.txt:815(搜「风险从高到低」) · text/08-ch01.txt:965(搜「实用性门槛」) · text/08-ch01.txt:1000(搜「从0到60很容易」)
数据飞轮、技术栈三层、AI 与 ML 工程之别第1章text/08-ch01.txt:922(搜「数据飞轮」) · text/08-ch01.txt:1087(搜「应用开发层、模型开发层和基础设施层」) · text/08-ch01.txt:1157(搜「更难评估」)

Footnotes

  1. 出处:「第1章」第 366 段(text/08-ch01.txt:366,搜「在基础模型之上构建应用」)。作者同时交代:传统 ML 工程围绕「开发 ML 模型」,AI 工程围绕「利用已有模型」。

  2. 出处:「第1章」第 82 段(text/08-ch01.txt:82,搜「统计信息进行编码」)。原文:语言模型对一种或多种语言的统计信息进行编码,「告诉我们一个词在特定上下文中出现的可能性」。

  3. 出处:「第1章」第 85 段(text/08-ch01.txt:85,搜「跳舞的人」)与第 88 段(text/08-ch01.txt:88,搜「Prediction and Entropy」)。香农那篇论文提出的熵等概念至今还在用——第 04 章讲困惑度时会再见。

  4. 出处:「第1章」第 122–131 段(text/08-ch01.txt:122,搜「为什么语言模型以token」;text/08-ch01.txt:131,搜「chatgpting」)。

  5. 出处:「第1章」第 119 段(text/08-ch01.txt:119,搜「100,256个token」)。100 token ≈ 75 个单词的换算见第 116 段(text/08-ch01.txt:116,搜「75个单词」)。

  6. 出处:「第1章」第 159 段(text/08-ch01.txt:159,搜「仅利用前序token」);掩码语言模型见第 140 段(text/08-ch01.txt:140,搜「掩码语言模型」)。

  7. 出处:「第1章」第 180 段(text/08-ch01.txt:180,搜「生成式模型」)与第 210 段(text/08-ch01.txt:210,搜「添加另一个问题」)。

  8. 出处:「第1章」第 222 段(text/08-ch01.txt:222,搜「欺诈」)与第 225 段(text/08-ch01.txt:225,搜「AlexNet」)。

  9. 出处:「第1章」第 240 段(text/08-ch01.txt:240,搜「自行推断标签」)。价格细节:2024 年 9 月 Amazon SageMaker Ground Truth,5 万张以下每张 8 美分、100 万张以上每张 2 美分,见第 228 段(text/08-ch01.txt:228,搜「8美分」)。

  10. 出处:「第1章」第 257 段(text/08-ch01.txt:257,搜「无监督学习」)。

  11. 出处:「第1章」第 268 段(text/08-ch01.txt:268,搜「在训练过程中不断更新」)与第 277–278 段(text/08-ch01.txt:278,搜「1.17亿」)。「参数/权重/偏置」的口径:作者注明,早年教科书把参数分为权重和偏置,如今习惯用「权重」统称所有参数(第 263 段)。

  12. 出处:「第1章」第 286–287 段(text/08-ch01.txt:287,搜「浪费计算资源」)。

  13. 出处:「第1章」第 304 段(text/08-ch01.txt:304,搜「Bommasani」)。出处论文:「On the Opportunities and Risks of Foundation Models」,2021。

  14. 出处:「第1章」第 319 段(text/08-ch01.txt:319,搜「4亿个(图像,文本)对」)。CLIP 由此成为首个不用额外训练就能泛化到多个图像分类任务的模型。

  15. 出处:「第1章」第 346 段(text/08-ch01.txt:346,搜「一个周末」)。

  16. 出处:「第1章」第 36 段(text/08-ch01.txt:36,搜「模型即服务」)与第 402 段(text/08-ch01.txt:402,搜「API」)。

  17. 出处:「第1章」第 372–405 段(text/08-ch01.txt:372,搜「通用的AI能力」;text/08-ch01.txt:399,搜「门槛降低」)。

  18. 出处:「第1章」第 384 段(text/08-ch01.txt:384,搜「两个数量级」)与第 392–393 段(text/08-ch01.txt:392,搜「2000亿美元」;美国公立中小学支出约 9000 亿美元的对比见原书编者注)。

  19. 出处:「第1章」第 1143–1157 段(text/08-ch01.txt:1146,搜「更少关注建模和训练」;text/08-ch01.txt:1157,搜「更难评估」)。

  20. 出处:「第1章」第 815–832 段(text/08-ch01.txt:815,搜「风险从高到低」)。

  21. 出处:「第1章」第 538 段(text/08-ch01.txt:538,搜「1亿美元」)、第 614 段(text/08-ch01.txt:614,搜「40%」)与第 672 段(text/08-ch01.txt:672,搜「暴跌」)。三类应用与 205 个开源应用、50 家公司访谈的方法说明见第 493–497 段。

  22. 出处:「第1章」第 965–971 段(text/08-ch01.txt:965,搜「实用性门槛」)。延迟细分指标 TTFT(第一个 token 的等待)和 TPOT(之后每个 token 的间隔)第 13 章再细算。

  23. 出处:「第1章」第 1000 段(text/08-ch01.txt:1000,搜「从0到60很容易」)。LinkedIn 的复盘是「Musings on building a Generative AI product」(2024),这本书后半会反复引用它。

  24. 出处:「第1章」第 904–936 段(text/08-ch01.txt:919,搜「技术、数据和分发」;text/08-ch01.txt:922,搜「数据飞轮」)。反例也有:Calendly、Mailchimp 都从「大产品里的一个功能」长成了独立产品。

  25. 出处:「第1章」第 337–343 段(text/08-ch01.txt:340,搜「提示工程」)。

  26. 出处:「第1章」第 704 段(text/08-ch01.txt:704,搜「Convai」)与第 930 段(text/08-ch01.txt:930,搜「Photoroom」)。