跳到主要内容

模型版图与选型 — GPT、Claude、Gemini、Llama 各是什么路数

这一章讲三件事: ChatGPT 这个产品是怎么被「调」出来的; 2024 年年中,牌桌上都有谁、各自走的什么路线; 以及对你最实际的一件事:怎么选模型。 它在全书的位置:第 02 章讲了这类模型共同的构造,这一章讲具体每一家—— 后面所有章节的示例都跑在这些模型上。

1. 这一章讲什么

你用提示工程能榨出多少东西,一半取决于提示,另一半取决于你对面坐着哪个模型。原书第 2 章后半就是一张 2024 年中的「牌桌地图」:OpenAI、Google、Anthropic、Meta、Mistral,五家五种打法。

这一章的主走查是书里的一个实测: 第 01 章那个「乔布斯风格起名」的提示,一字不改地发给三个模型,看回来的三份答案差在哪。这个实验放在本章末尾,因为它要先铺垫一件事:ChatGPT 是怎么办到「听懂指令」的——那是它训练方式里的三道工序。

2. 顶层全景:五家五种打法

OpenAI GPT 系列 闭源 + 付费 API,起跑最早,生态最厚
Anthropic Claude 闭源,主打「按规则清单约束行为」的安全路线
Google Gemini 闭源,押注多模态与超长上下文
Meta Llama 开源权重,赌生态位与业界采纳
Mistral Mistral/Mixtral 开源,小体量高效率的欧洲挑战者

图说:五家的差异不在「聪不聪明」一个维度上,而在
开放程度、上下文长度、价格、可控性四个维度上各有所押[^1]。

一句话记住这张地图:闭源三家在比「谁更强」,开源两家在比「谁更可用」。 这张地图的每一处细节下面逐节展开。

3. 核心原理

3.1 GPT 系列简史:从「不敢放出来」到「闭源收费」

OpenAI 的 GPT 系列——GPT 是三个词的缩写:生成式(generative,负责生成新内容)、预训练、Transformer——第 02 章讲过这个结构——开局有个今天看来颇具戏剧性的插曲:2019 年 GPT-2 发布时,OpenAI 担心被滥用,起初拒绝公开完整模型;等后来真开源了,又反过来成了「人人可用预训练模型搭应用」的开端1

GPT-3 之后,OpenAI 转向了今天的模式:闭源、付费、按量计费。书里交代了资金背景:微软 2019 年先投 10 亿美元,后来追加到 130 亿美元,换其营利部门 49% 的股份2。这笔钱后来变成了 GPT-3.5-turbo——一个更便宜、更快的改进版。

然后是 2022 年 11 月的 ChatGPT。 书里给了一个常被忽略的定性:OpenAI 想要更多来自真实世界的反馈来改进模型,ChatGPT 就是为此而生的3。它是一个为了收集人类反馈而放出来的产品——这句话是理解下一节的钥匙。

3.2 ChatGPT 是怎么调出来的:三道工序

第 02 章讲了预训练和微调两阶段。ChatGPT 在这个基础上多走了一步,这一步的正式名字是 RLHF(reinforcement learning from human feedback):让人类对模型的输出表达偏好,再拿这份偏好去调模型4。书里把它的训练拆成三步5

前两步是「先立标杆」:请来真人,针对一批提示亲手写出理想回答(这叫演示数据);再拿这些「题目 + 标准答案」去微调预训练模型——这种训练时给标准答案的学法,叫监督学习(supervised learning)6

第三步是「再按口味调」:让模型对同一提示生成多个回答,真人给它们排名次;用这些名次训出一个奖励模型——一个专门预测「人会偏爱哪个回答」的小模型——再用它当裁判,回头调主模型5

① 收集演示数据:真人针对一批提示,亲手写出「理想的回答」

② 监督微调:拿这些「标准答案」去微调预训练模型

③ 真人给多个回答排名次 → 训出奖励模型 → 用它当裁判调主模型

图说:三步下来,模型学会的不再是「像互联网」,而是「像人偏爱的回答」。

3.3 第三步里「当裁判」是什么学法:强化学习

「用奖励模型当裁判调主模型」属于强化学习(reinforcement learning):一种不给标准答案、只给「好/坏」奖励信号、让模型自己摸索怎么多拿奖励的训练路子;RLHF 的实质,就是把奖励换成了人的偏好6

这一步具体用的调法叫 PPO(Proximal Policy Optimization)——特点是小步慢挪,防止一次调过头5

这套工序的产物,书里的评价是:比预训练的 GPT-3「更乐于助人、更诚实、更安全」7。而它的商业成果,书里引了瑞银(UBS)的一份研究:到 2023 年 1 月,ChatGPT 两个月攒下 1 亿月活,成为史上增长最快的消费应用8

3.4 GPT-4 与 GPT-4o:更强的内核,更多的感官

GPT-4 是书里全程的默认模型。两个要知道的点:其一,它用了专家混合(mixture of experts,缩写 MoE:内部不止一个「专家」子模型,每个输入只动用其中相关的几个,而不是每次都全体出动)的结构9;其二,书里的标志性证据是考试:GPT-4 在美国律师资格考试里拿了 298/400,排进前 10%10

2024 年 5 月 13 日,OpenAI 发布 GPT-4o:一个模型同时处理文字、音频、图像——三种感官走同一套神经网络,所以更快、更便宜11

「一个模型同时吃多种类型的输入」这件事,行话叫多模态(multimodal):文本是一种模态,图像、音频各是一种。

3.5 牌桌上的另外四家

Google:从 Bard 的翻车到 Gemini。 Bard 于 2023 年 3 月 21 日仓促上线——书里说它「边缘毛糙」,发布演示里还把詹姆斯·韦伯望远镜的事实答错了(幻觉的现场直播)12。2024 年 2 月,Bard 更名 Gemini,v1.5 开始接近 GPT-4 水平,招牌是百万标记的超长上下文。

Anthropic:Claude。 2023 年 7 月发布的 Claude 2 主打两条:一是 10 万标记的上下文窗口——模型一次能考虑的文字总量,窗口越大,能一次性读进去的文档越长13;二是 Constitutional AI(宪法式 AI):拿一张写明的规则/价值观清单去约束模型行为,而不是只靠人逐个打分14。下一代里,Opus 成为第一个被认为够到 GPT-4 智商的竞品;小模型 Haiku 报价每百万标记 0.25 美元——是当时 GPT-3.5-turbo 的一半15

Meta:Llama,走开源。 Llama、Llama 2、Llama 3 依次放出,参数 7B/8B/70B 几档(70B 即 700 亿个参数),权重公开下载。书里的判断:开源让问题被发现得更快、让企业敢用,但也要承认双刃剑——同样的开放也可能被恶意利用16

Mistral:小模型的效率路线。 法国创业公司 Mistral 的 7B(73 亿参数)以小搏大,关键是它用了滑动窗口注意力(每个位置只看附近一段,省计算量),并以宽松的 Apache 许可证发布;很多工程师在它之上微调出衍生模型。它的 Mixtral 8x7b 用了和 GPT-4 同族的专家混合结构,成绩逼近 GPT-3.517

3.6 开源的真正意义:微调这件事被拉下了神坛

开源模型还有一层书里专门讲的价值:你可以自己改它。

两个技术词在这登场。量化(quantization):把参数存得更粗——比如每个数从 32 位小数降到 8 位,模型文件随之大幅缩小,效果却没差多少18

LoRA(low-rank adaptation):微调时不动原模型的全部参数,只加一小片新参数进去单独训练——计算量从「重调几千亿个数」降到「调一小撮」,消费级显卡也跑得动19

两个加起来,含义是:微调不再是数据中心的专利。 小团队可以在自己的硬件上,把开源模型调成行业专用模型——数据还不用出组织的大门。

3.7 主走查:同一个提示,三家三个样

铺垫完了,回到本章开头那个实验。第 01 章修好的那条提示(乔布斯风格 + 格式约定 + 三个例子),原样发给三个模型20:

GPT-4: Product names: iFit, iShoe, iFlexible
Claude 3: Product names: iFit, iComfort, iSole
Llama 3 70b: 「这是你要的清单:……Product names: iFit, OneSize, iWalkFree」
—— 夹带开场白,且 OneSize 不以 i 开头

三份答案里,只有 GPT-4 完全照格式办:逗号分隔、不带废话、名字全部以 i 开头(例子定的风格);Claude 3 格式对了;Llama 3 70b 两头都漏21

作者由此给出全书最重要的选型判据之一:提示工程的第一条判据不是「聪明」,是指令遵循(instruction following)——你写在提示里的规矩,它条不条条照办。而这个能力没法看参数表判断,最快的办法是把你的提示原样跑在几个候选模型上,比输出22

4. 作者的判断与证据

  • 「GPT-4 指令遵循明显更强」是作者的一次实测(一个提示、三个模型、一次输出),不是系统评测。样本极小,当方向性参考用,别当排名用;
  • 1 亿月活、两个月最快引自 UBS 研究8;律师考试 298/400、前 10% 来自 OpenAI 的发布材料10——都是单一来源,引用时保留出处限定;
  • 书里对开源(Llama/Mistral)的态度明显乐观,同时如实写了反方:开放也可能被滥用,OpenAI 等机构的管控主张正是基于此16;
  • 利益相关再提醒一次: 作者运营同主题的 Udemy 付费课程(7 万+ 学员),全书示例生态(OpenAI + Midjourney + LangChain)与课程内容同源23

判断(我们的,不是书里的): 这一章是全书时效性最强的部分——写成于 2024 年年中,模型格局半年一变。今天(2026 年)读它,正确的读法是把每个模型名换成「该阵营当时的主力」,把精力集中在不变的那一半:选型看指令遵循、评估靠同提示对比、开源的意义在可微调。 如果错,会错在: 如果某家后来彻底改换路线(比如 Meta 放弃开源),这张地图的结构就不只过时、而是误导。截至我们写作时,四条路线(闭源领先/安全规则/多模态长上下文/开源权重)仍然都在。

5. 边界与局限

  • 时间坐标:2024 年 5 月(GPT-4o 发布是书中最晚的事件)。 这之后的模型(GPT-5 代际、Claude 后续版本、Gemini 2.x……)一概不在书里;
  • 书里的价格(如 Haiku 每百万标记 0.25 美元)与上下文窗口数字全部是当时快照,今天一定更便宜、更长,引用务必带年份;
  • 全书示例深度绑定 OpenAI 的 API(应用程序接口,即程序之间互相调用的一套约定);用别家模型时,提示原则可迁移,接口细节要重查;
  • 书里有一条负责任的提醒值得保留:这些模型可能拿你的输入去再训练,敏感信息不要发给云端模型——这正是开源自托管路线的另一条理由24

6. 可带走的

  1. 选型第一问不是「哪个最强」,是「哪个最照我的指令办」——同一个提示跑三家,当场对比;
  2. ChatGPT 的「懂规矩」来自 RLHF 三道工序:演示 → 监督微调(拿示范回答再训一轮) → 人排名 + 奖励模型 + PPO;
  3. 上下文窗口是硬预算:8k、100k、128k、100 万标记是 2023–2024 年的竞赛刻度;一本书约 18.5 万标记(第 05 章还会用到这个参照);
  4. 开源模型 + 量化 + LoRA = 消费级硬件上可做行业微调,数据不出门;
  5. 闭源 API 方便但数据要出门;敏感业务优先考虑自托管开源模型;
  6. 提示跨模型不可直接搬运,每次换模型都要重测;
  7. 书里 2024 年的格局判断(OpenAI 领先、Anthropic 最近、开源追赶快)只是快照,方法不过时,结论会过时

7. 原文地图

主题原书章原文位置
GPT 简史与开源转向Ch.2 文本模型导论text/05-fm-what-are-text-generation-models.txt:133(搜「hesitated」) · text/05-fm-what-are-text-generation-models.txt:135(搜「closed-source」)
微软投资Ch.2 文本模型导论text/05-fm-what-are-text-generation-models.txt:139(搜「13 billion」)
ChatGPT 为收集反馈而生Ch.2 文本模型导论text/05-fm-what-are-text-generation-models.txt:141(搜「world feedback」)
RLHF 三步Ch.2 文本模型导论text/05-fm-what-are-text-generation-models.txt:143(搜「three main steps」) · text/05-fm-what-are-text-generation-models.txt:155(搜「Proximal Policy Optimization」)
1 亿月活Ch.2 文本模型导论text/05-fm-what-are-text-generation-models.txt:161(搜「100 million active users」)
GPT-4 考试与专家混合Ch.2 文本模型导论text/05-fm-what-are-text-generation-models.txt:165(搜「90th percentile」) · text/05-fm-what-are-text-generation-models.txt:167(搜「mixture-of-experts」)
GPT-4o 多模态Ch.2 文本模型导论text/05-fm-what-are-text-generation-models.txt:169(搜「GPT-4o」)
Bard 与 GeminiCh.2 文本模型导论text/05-fm-what-are-text-generation-models.txt:173(搜「Bard」) · text/05-fm-what-are-text-generation-models.txt:179(搜「James Webb」)
Claude 与宪法式 AI、上下文窗口Ch.2 文本模型导论text/05-fm-what-are-text-generation-models.txt:209(搜「Constitutional AI」) · text/05-fm-what-are-text-generation-models.txt:213(搜「Haiku」)
Llama 开源与争议Ch.2 文本模型导论text/05-fm-what-are-text-generation-models.txt:185(搜「Llama」) · text/05-fm-what-are-text-generation-models.txt:191(搜「double-edged sword」)
量化与 LoRACh.2 文本模型导论text/05-fm-what-are-text-generation-models.txt:197(搜「low-rank approximations」)
MistralCh.2 文本模型导论text/05-fm-what-are-text-generation-models.txt:203(搜「sliding window attention」)
三模型对比实测Ch.2 文本模型导论text/05-fm-what-are-text-generation-models.txt:223(搜「following instructions」) · text/05-fm-what-are-text-generation-models.txt:254(搜「Llama 3 70b」)
数据隐私提醒Ch.2 文本模型导论text/05-fm-what-are-text-generation-models.txt:266(搜「data privacy」)

Footnotes

  1. 出处:「Ch.2 文本模型导论」第 133 段(text/05-fm-what-are-text-generation-models.txt:133,搜「hesitated」)。

  2. 出处:「Ch.2 文本模型导论」第 139 段(text/05-fm-what-are-text-generation-models.txt:139,搜「13 billion」)。

  3. 出处:「Ch.2 文本模型导论」第 141 段(text/05-fm-what-are-text-generation-models.txt:141,搜「world feedback」)。

  4. 出处:「Ch.2 文本模型导论」第 157 段(text/05-fm-what-are-text-generation-models.txt:157,搜「human feedback」)。RLHF 全名 reinforcement learning from human feedback。

  5. 出处:「Ch.2 文本模型导论」第 143 段(text/05-fm-what-are-text-generation-models.txt:143,搜「three main steps」)与第 155 段(text/05-fm-what-are-text-generation-models.txt:155,搜「Proximal Policy Optimization」)。 2 3

  6. 出处:「Ch.2 文本模型导论」第 151 段(text/05-fm-what-are-text-generation-models.txt:151,搜「supervised learning」)(监督学习的定义)与第 155 段(强化学习部分)。 2

  7. 出处:「Ch.2 文本模型导论」第 157 段(text/05-fm-what-are-text-generation-models.txt:157,搜「helpful, honest, and safe」)。

  8. 出处:「Ch.2 文本模型导论」第 161 段(text/05-fm-what-are-text-generation-models.txt:161,搜「100 million active users」)。 2

  9. 出处:「Ch.2 文本模型导论」第 167 段(text/05-fm-what-are-text-generation-models.txt:167,搜「mixture-of-experts」)。书里没有展开 MoE 的内部结构,只说它「不依赖单一模型的推断」;我们补了一句机制性解释,属通用知识。

  10. 出处:「Ch.2 文本模型导论」第 165 段(text/05-fm-what-are-text-generation-models.txt:165,搜「298 out of 400」)。 2

  11. 出处:「Ch.2 文本模型导论」第 169 段(text/05-fm-what-are-text-generation-models.txt:169,搜「all three modalities」)。

  12. 出处:「Ch.2 文本模型导论」第 173 段(text/05-fm-what-are-text-generation-models.txt:173,搜「rough around the edges」)与第 179 段(text/05-fm-what-are-text-generation-models.txt:179,搜「James Webb」)。那次演示翻车曾让 Google 股价大跌(股价部分不在书里,来自通用知识)。

  13. 出处:「Ch.2 文本模型导论」第 209 段(text/05-fm-what-are-text-generation-models.txt:209,搜「context window」)。

  14. 出处:「Ch.2 文本模型导论」第 209 段(text/05-fm-what-are-text-generation-models.txt:209,搜「Constitutional AI」)。

  15. 出处:「Ch.2 文本模型导论」第 213 段(text/05-fm-what-are-text-generation-models.txt:213,搜「Haiku」)。价格是 2024 年中的快照。

  16. 出处:「Ch.2 文本模型导论」第 185 段(text/05-fm-what-are-text-generation-models.txt:185,搜「Llama」)与第 191 段(text/05-fm-what-are-text-generation-models.txt:191,搜「double-edged sword」)。 2

  17. 出处:「Ch.2 文本模型导论」第 203 段(text/05-fm-what-are-text-generation-models.txt:203,搜「sliding window attention」)。

  18. 出处:「Ch.2 文本模型导论」第 197 段(text/05-fm-what-are-text-generation-models.txt:197,搜「Quantization」)。

  19. 出处:「Ch.2 文本模型导论」第 197 段(text/05-fm-what-are-text-generation-models.txt:197,搜「LoRA」)。LoRA 原论文为 Hu et al., 2021;第 13 章讲图像模型时它还会出现。

  20. 出处:「Ch.2 文本模型导论」第 223 段(text/05-fm-what-are-text-generation-models.txt:223,搜「following instructions」)与第 247-260 段(三份输出的原文)。

  21. 出处:「Ch.2 文本模型导论」第 260 段(text/05-fm-what-are-text-generation-models.txt:260,搜「iWalkFree」)。

  22. 出处:「Ch.2 文本模型导论」第 223 段(text/05-fm-what-are-text-generation-models.txt:223,搜「run the same prompt across multiple models」)。

  23. 出处:「Ch.1 五原则」第 114 段(text/04-ch01-chapter-1-the-five-principles-of-prompting.txt:114,搜「70,000+ students」)与「前言」第 64 段(text/03-fm-preface.txt:64,搜「LangChain」)。

  24. 出处:「Ch.2 文本模型导论」第 266 段(text/05-fm-what-are-text-generation-models.txt:266,搜「data privacy」)。