跳到主要内容

让它看图 — 把图片切成方块当词用

这一章讲三件事: 图片凭什么能和文字塞进同一套算法里; 一张猫的照片和「一张猫的照片」这句话,机器怎么判断它们像不像; 以及在不重训任何一头的前提下,怎么让一个只会写字的模型看懂图。 在全书链条里,这一章是「同一套办法能走多远」的检验—— 前六章讲的全是文字,这一章原样搬到像素上,发现居然不用改。 需要先读第 02、04 章,其余生词都在当场解释。

1. 先看现象:同一台机器,给它一张跑车的照片

这一节回答:所谓「让模型看图」,具体是什么体验。

书拿一张日落时分的橙色跑车照片做了两件事1:

你做什么它答什么
什么都不问,只把图给它「一辆橙色超级跑车在日落时分的路上行驶」
问「写出你在这张图里看到了什么」「一辆跑车在日落时分的路上行驶」
接着追问「开这车得花我多少钱?」「一百万美元」

第三行才是这一章的看点。 书自己的评价: 这个数字非常具体!这表明它具有类似对话的行为,允许进行一些有趣的对话2

注意:它不是「看图说话」,它是「看着图和你聊」。 前两行只是把图翻译成文字, 第三行是图像和你的问题一起被处理了。

书还玩了一个很有意思的例子: 它拿了一张罗夏墨迹图 (旧时心理学实验用的对称墨迹,据说你从中看到什么能反映你的性格)。 模型的回答是:「一幅黑白的蝙蝠水墨画」3

先把书名里那个词讲掉:

多模态——「模态」就是一种数据形式:文字是一种,图像是另一种,音频、视频、传感器读数也各是一种。 能同时处理不止一种形式的模型,就叫多模态模型4

书还提醒了一件常被忽略的事:模型可以接受某种模态作为输入,但无法在该模态下生成内容4这一章讲的全是「能看图但不会画图」的那一类。

2. 顶层全景:三层,每一层都比上一层省钱

【第一层】怎么把图变成机器能吃的东西
│ 答案:切成方块,每块当一个「词」。后面的处理流程一个字都不用改

【第二层】怎么让图和文字落进同一个空间
│ 答案:成对地训——配对的拉近,不配对的推远
│ 做成之后:一张猫的照片和「一张猫的照片」这句话,落在同一个地方

【第三层】怎么让一个只会写字的模型看懂图
答案:两端都冻住,中间只训一座小桥

图说:**这三层是递进的,后一层建立在前一层上。**
而第三层那个念头——「两端冻住,只训中间」——第 09 章会原样再用一次。

这一章全程跟着第 1 节那张图走:一张日落时分的橙色跑车照片。 下面每一层都会写出它在这一层变成了什么数; 凡是书没给的数值,当场标明是为演示编的。 拿来作对照的是第 1 节那张罗夏墨迹图——同一台机器、两张性质完全不同的图。

3. 核心原理

3.1 第一层:图片怎么变成「词」

它解决什么问题: 文字可以切成一小段一小段,图片没法这么切。

书把困难说得很清楚:由于图像不是由单词组成的,那套切词的做法用不了5

它怎么做:一个朴素到让人意外的替换。

一张 512 × 512 的猫的照片
│ 单看一个像素,什么信息也没有;但一小块像素凑在一起,就能看出点东西

把图横竖切开,切成一格一格的小方块(书叫「图像块」)

│ 这里有个坑:不能像文字那样给每块编个号——
│ 因为同一个方块几乎不会在别的图片里再出现,建不了「词表」

所以改成:把每个方块直接变换成一串数


接下来把这串数交给编码器 —— 从这里开始,它和文字词元没有任何区别

图说:**「切块」替代了「切词」,「直接变换成数」替代了「查词表」。**
换完这两处,后面的整条流水线原封不动。

走查第一层:那张跑车照片切完之后,手里有多少块、每块多长。

处理器会先把图缩成模型要的尺寸,这一档模型要的是 224 × 224(3.4 节有实测); 而原始实现切的是 16 × 16 的块。两个数一除就得到块数:

224 ÷ 16 = 14 横着 14 块
224 ÷ 16 = 14 竖着 14 块
14 × 14 = 196 这张跑车照片一共切出 196 块

每一块原始有多少个数?16 × 16 个像素 × 3 个颜色通道 = 768 个数
变换之后,每块仍是一串固定长度的数 —— 于是这张图变成 196 × 768

图说:**196 就是这张图的「词元个数」,768 就是它的「每个词元多长」。**
和第 02 章那句话的 8 × 3,072 是同一种形状,只是换了个来源。

这两个数是从 224 和 16 直接除出来的,不是编的; 而「变换之后仍是 768」这一条取自这一档模型的常见设定,书没有给。

书对最后这一步的说法很有分量,值得原样记住:

一旦嵌入被传递给编码器,它们就被当作文本词元一样处理。 从此之后,文本和图像在训练方式上没有区别。6

这套做法书叫 Vision Transformer(视觉 Transformer,常写作 ViT), 并说明它在图像识别任务上表现出色,对比的是当时默认的卷积神经网络7

卷积神经网络(常写作 CNN)——那之前处理图像的主流做法: 拿一个小窗口在图上滑,每次只看窗口里那一小片,一层层往上叠。 这里只需要知道它是「上一代办法」,后面不再出现。

书顺手交代了那篇论文的标题梗: 演示图里切成 3 × 3 只是为了好看, 原始实现用的是 16 × 16 的块——所以那篇论文的标题就叫「一张图片值 16x16 个词」8

补充(不在书里): 书只提了标题,没给出处和结论。原论文摘要的说法是: Transformer 可以直接作用在一串图像块(就是上面切出来的那些小方块)上,完全不需要卷积网络; 在大数据集上预训练之后,它在多个图像识别基准上达到与最好的卷积网络相当的水平, 而训练所需的计算资源显著更少。 来源:《An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale》 (Dosovitskiy 等,2020-10-22)https://arxiv.org/abs/2010.11929(查阅于 2026-08-25)

判断(我们的,不是书里的): 这一节真正该带走的不是 ViT 这个名字, 而是它示范的一个通用招式:只要你能把一样东西切成有限多个片段、 并把每个片段变成一串数,你就能把它塞进这套流水线。 第 02 章那个「把歌当词元、把歌单当句子」的推荐系统是同一个招式; 蛋白质序列、传感器读数、日志事件,都在被这么处理。 如果错,会错在: 如果某类数据切开之后片段之间的关系是二维或三维的 (比如图像其实有上下左右,不只有先后),那强行按「一串」处理会丢掉结构—— 判据是:把片段的顺序打乱,效果掉不掉。掉得厉害,说明顺序信息是够用的; 掉得不明显,说明这套一维的处理方式确实丢了东西。

3.2 第二层:让图和文字落进同一个空间

它解决什么问题: 图有图的一串数,文字有文字的一串数,两者不在同一个尺度上,没法比。

书把这件事的价值说得很清楚(向量空间就是「把每串数当成空间里的一个点」的那种想象方式): 做成之后,生成的嵌入位于同一向量空间中, 所以可以互相比较——你可以拿一句话去找图片,也可以拿一张图片去找文字9

书点名了这类模型里最著名的一个:CLIP(全称「对比语言-图像预训练」)10

做成之后能干四件事,书列得很整齐11:

用途具体怎么用
零样本分类把图片的那串数,和「一张猫的照片」「一张狗的照片」这些描述的那串数比一比,谁近算谁——和第 04 章那一招一模一样
聚类把一堆图片和一堆关键词一起分组,看哪些词属于哪堆图
搜索在几十亿条文字或图片里,快速找出和输入相关的
生成拿它去驱动画图模型

它怎么训:训练目标只有一句话

准备数据:数百万对「一张图 + 它的配文」


① 图走图像编码器 → 一串数;配文走文本编码器 → 另一串数


② 用余弦相似度量一量这两串数像不像
│ 刚开始一定不像,因为两边还没被摆到同一个空间里

③ 朝一个方向调:配对的那些,相似度往大了推;
不配对的那些,相似度往小了压


④ 换一批数据,回到 ①,重复

图说:**整个训练目标就一句话——配对的拉近,不配对的推远。**
没有人告诉它「猫长什么样」,「猫」这个概念是这么被挤出来的。

书给这套做法的正式名字是对比学习12,并且明确指出它和第 02 章那个 「判断两个词是不是邻居」是同一件事的延续。

补充(不在书里): 书只说了「数百万」这个量级,没有给 CLIP 的实际数字。 原论文摘要给的是:从互联网上收集的 4 亿对(图像,文本)。 来源:《Learning Transferable Visual Models From Natural Language Supervision》 (Radford 等,2021-02-26)https://arxiv.org/abs/2103.00020(查阅于 2026-08-25)

关于「不配对的也要参与」,书说得很好,值得原样带走:

建模相似性不仅要了解什么使事物彼此相似,还要了解什么使它们不同和不相似。13

这就是全书那条暗线的第三次出现(第一次是词与词,第二次是句与句,这次是图与文)。 第 08 章会把这条线完整串起来。

一个可以自己验的数字

书拿一张「小狗在雪地里玩」的图和配文 a puppy playing in the snow 做了一次实测:

相似度是 0.3314

书接着做了一件很关键的事:它承认这个数字单独看没有意义。 原话是:由于我们不知道模型认为什么是低分、什么是高分,这个分数很难解释14。 所以它又加了两张图、两句配文,摆成一个 3 × 3 的对照表—— 这时才看得出 0.33 确实是高的,因为它和另外两张图的相似度低得多15

这个做法值得抄:任何一个「相似度分数」都必须放在对照里读,单独一个数没有意义。

走查第二层:跑车那张图,和四句话各比一次。 照书那个做法,把跑车图和罗夏图摆在一起对照 (下面四个数是为演示编的,书只公布了小狗那一组的 0.33):

跑车照片罗夏墨迹图
「一辆橙色跑车在日落时分的路上行驶」0.610.05
「一幅黑白的蝙蝠水墨画」0.040.29

两条对角线上的数明显更大,这就是「配对的拉近、不配对的推远」训完之后的样子。 注意右下角那个 0.29 比左上角的 0.61 小一半—— 墨迹图本来就说不清是什么,连人都各看各的,分数低是应该的。

书还顺手交代了一个容易踩的细节: 在这类模型里,那个原本用来代表整段文字的特殊词元 [CLS],被拿去代表图像嵌入了16同一个记号,在不同模型里可以指完全不同的东西。

3.3 第三层:让一个只会写字的模型看懂图

它解决什么问题: 从头训一个既会看图又会说话的模型,太贵了。

书说得很直接: 从头创建一个多模态语言模型需要大量的计算能力和数据—— 需要数十亿的图像、文本和图像-文本对;可以想象,这并不容易实现17

它怎么做:不重建,只搭桥。

┌──────────────┐ ┌──────────────┐ ┌──────────────┐
│ 图像编码器 │ ───▶ │ 一座小桥 │ ───▶ │ 语言模型 │
│ 【冻结】 │ │ 【唯一要训的】│ │ 【冻结】 │
└──────────────┘ └──────────────┘ └──────────────┘
别人训好的 你只训这一块 别人训好的

图说:**两端一个参数都不动,只训中间那座桥。**
书给这座桥起的名字叫 Q-Former(查询 Transformer)[^18]。

为什么这座桥能起作用? 因为它模仿了两端的架构: 它内部有两个模块,共享同一套注意力层——一个负责跟冻结的图像编码器打交道, 另一个负责跟语言模型打交道18

桥怎么训:两个阶段

第一阶段:让桥同时学会看和读。

用「图 + 配文」这样成对的数据,在三个任务上一起训19:

任务干什么
图文对比学习就是 3.2 节那件事:配对的拉近,不配对的推远
图文匹配一个二选一的判断:这一对是配的还是不配的
看图写话根据从图里提取到的信息,生成文字

这三个任务一起优化,目的是把文字信息「注入」到那个冻结的图像编码器的输出里20

第二阶段:把桥的输出翻译成语言模型听得懂的东西。

第一阶段学出来的那串数,已经和文字信息在同一个尺度上了。 第二阶段把它送进语言模型——中间还垫一层简单的变换,确保形状和语言模型要求的一致21

书给这串数起的名字很传神:软视觉提示词22

为什么叫「软」? 因为你平时写的提示词是实实在在的文字, 而这串数不对应任何一个词,它直接就是数——但它被摆在提示词的位置上,起同样的作用。 书的说法是:大语言模型将获得关于图像的信息,其方式类似于在提示时提供给它的上下文23

换句话说:图片被翻译成了一段「语言模型看得懂但人读不出来」的提示词。

补充(不在书里): 书没有给这套做法的效果数字。原论文摘要给的是: 它在一项零样本视觉问答任务上比一个 800 亿参数的对手高出 8.7%, 而需要训练的参数少 54 倍。 来源:《BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models》(Li、Li、Savarese、Hoi,2023-01-30) https://arxiv.org/abs/2301.12597(查阅于 2026-08-25)

「少 54 倍的可训参数,还赢了」——这就是「两端冻住只训中间」这个念头的分量。

书还指出这不是孤例: 后来出现的一批同类模型架构不同,但都是把一个预训练好的 类 CLIP 视觉编码器接到一个文本模型上,目标都是把图像的视觉特征投影到语言嵌入里24

3.4 实操上必须知道的两个坑

这一节回答:为什么你自己试的时候效果可能很差。

坑一:你的图会被压成正方形

处理器会把输入图像统一缩放成模型要求的尺寸。 书拿一张 520 × 492 的图演示, 处理完变成 224 × 22425

走查:同一件事落在两张图上,后果差很远。

原始长宽比压成 224 × 224 之后变形了多少
书演示的那张 520 × 4921.061.00几乎看不出来
我们那张跑车照片,假设是 1024 × 576 的宽幅1.781.00横向被挤掉四成多,车看上去又短又胖

1024 × 576 是我们假设的,书没有给跑车原图的尺寸;520 × 492 那一行是书的实测。 这张表要说的是:书那个例子恰好是近似正方形的,所以它没暴露这个坑。

书的提醒很实在:

所有图像的不同原始形状都将被处理成正方形。 因此,输入非常宽或非常高的图像时要小心,因为它们可能会失真。26

长截图、宽幅表格、竖版海报——这三类是重灾区。

坑二:它对特定领域的图会失败

书自己说了:特定领域的图像,如特定卡通人物或虚构创作,可能会失败, 因为该模型主要基于公开数据进行训练27

这条和第 06 章那条「换个领域就不灵」是同一条规律。

书还顺带解释了一个你打印词元时会撞见的怪符号: 有些词元开头有个 Ġ,那其实是一个空格—— 内部实现把某些字符的编号整体上移了 256,好让它们能被打印出来, 于是空格(编号 32)就变成了 Ġ(编号 288)28

这是那种「不知道就会困惑半小时,知道了就一秒钟」的细节。

3.5 两个用例,以及它们各自的边界

书给了两个用例,而它们的差别不是难度,是结构29:

用例输入输出结构
看图写描述只有图文字单向:从一种形式转成另一种形式
看图问答图 + 问题文字两种形式同时进来,一起被处理

第二种才是这一章真正的能力。 书的说法: 我们不遵循这种线性结构,而是尝试同时呈现两种模态30

那多轮对话——就是「你一句我一句地接着聊好几轮」——它怎么做到? 书给的办法朴素得可爱:把之前的问答原样拼回提示里。 它给出的提示词长这样31:

Question: 写出你在这张图里看到了什么。 Answer: 一辆跑车在日落时分的路上行驶。
Question: 开这车得花我多少钱? Answer:

图说:没有记忆,只有「把历史贴回去」——就是第 05 章那个「全量缓冲」的最原始版本。

看图写描述这个用例的实际价值,书举了两个很具体的场景: 一家想给上千件服装挨个生成描述文字的商店;一位没有时间手动标记 1000 多张婚礼照片的摄影师32

4. 作者的判断与证据

说法属于哪一类说明
图像块被送进编码器后和文本词元没有区别结构性事实这是整章的地基,而且它是可验证的6
不能给图像块编号建词表有理由理由是同一个方块几乎不会在别的图片里再出现5
「不仅要知道什么相似,还要知道什么不相似」原则性主张这是全书暗线的第三次现身,但书在这一章没有为它举证13
0.33 这个相似度分数有实测,而且书主动说了它单独看没意义这是这一章最值得表扬的一处诚实14
图会被压成正方形、宽高比失真有实测520 × 492 → 224 × 2242526
特定领域图像会失败断言,无实验但和第 06 章那条规律一致,可信27
「涌现出各种各样的能力」书当成既定事实用了见下一节——这个说法在书出版前就被挑战过
「一百万美元」这个回答书的评价是「非常具体」它没有核实这个数字对不对——见下一节

5. 边界与局限

第一,这一章开头把「涌现」当成了前提,而这个说法有争议。 书说模型涌现出各种各样的能力,并推测多模态输入可能帮助涌现出以前被锁定的能力33

补充(不在书里): 有工作论证,这种「到某个规模突然冒出新能力」的现象 可能是打分方式造成的错觉:用不连续的打分方式会看到突然的跃升, 换成连续的打分方式,曲线就变得平滑、可预测。 来源:《Are Emergent Abilities of Large Language Models a Mirage?》 (Schaeffer、Miranda、Koyejo,2023-04-28)https://arxiv.org/abs/2304.15004(查阅于 2026-08-25)

第二,「一百万美元」那个回答,书夸了它「具体」,却一步都没有去核实它。 书的原话是「这个数字非常具体!」,并据此说模型具有类似对话的行为2但「具体」说的是答案的形状,不是答案的对错。

而且那个问题本身就有歧义:「开这车得花我多少钱」既可以问买车要多少钱, 也可以问开起来一年要花多少钱——书没有说清它拿哪一种当标准答案, 所以连「这个回答算不算对」都没法判定。

判断(我们的,不是书里的): 这里被当成能力证据的,其实只是「答得像模像样」。 同一本书在讲分类时会主动写「这个分数可能不可信」,轮到看图问答却跳过了核实这一步。 这不是它算错了,是它没验;而没验的东西不该拿来当证据。 教训是:演示越像对话,越容易骗过演示者自己。 如果错,会错在: 如果书的本意只是展示「它能接着上一轮往下答」这个行为、 而不是展示答案的正确性,那这就不算漏检,只是表述含糊—— 但它用的词是「非常具体!」,而「具体」正是在夸这个数字本身。

第三,书没有讲怎么评一个多模态模型。 文字模型那边至少列了公开考卷和几个指标,这一章一个评测方法都没有。 你没法知道换一个模型是变好还是变坏。

第四,只讲了「能看图」,没讲「能画图」。 书自己在开头点明了这个边界(能接收某种形式但不能生成), 但读者很容易把这一章当成「多模态全景」——它不是,它只讲输入侧。

第五,今天这一章的具体模型已经全部换代。 书用的那两个演示模型在 2024 年就已经不是最强的了。 但三层结构没有过时:切块当词、成对训练把图和文字摆到一起、两端冻住只训中间—— 今天主流的做法仍然是这三层的组合。

6. 可带走的

  1. 图片变成机器能吃的东西,只需要一个动作:切成方块,每块当一个「词」;
  2. 不能给方块编号建词表,因为同一个方块几乎不会在别的图片里再出现——所以直接变换成一串数;
  3. 切完之后,图像块和文字词元在流水线里没有任何区别。这是整章的地基;
  4. 这个招式是通用的:凡是能切成有限片段、每片能变成一串数的东西,都能塞进这套流水线;
  5. 让图和文字可比,靠的是把它们摆进同一个空间;做成之后可以拿文字搜图、也可以拿图搜文字;
  6. 训练目标只有一句话:配对的拉近,不配对的推远;
  7. 「不配对的」必须参与——只知道什么相似是不够的,还得知道什么不相似;
  8. 任何相似度分数都必须放在对照里读,单独一个数没有意义。书自己承认了这一点;
  9. 同一个记号在不同模型里可以指完全不同的东西(那个 [CLS] 在这里代表的是图像);
  10. 让只会写字的模型看懂图,最省钱的办法是两端冻住、只训中间那座桥;
  11. 桥的输出是一段「人读不出来的提示词」,它不对应任何文字,但摆在提示词的位置上起同样作用;
  12. 少 54 倍的可训参数还能赢——这是「只训中间」这个念头的分量;
  13. 实操坑一:你的图会被压成正方形,长截图和宽幅表格是重灾区;
  14. 实操坑二:特定领域的图会失败,和第 06 章那条「换领域就不灵」是同一条规律;
  15. 多轮看图对话没有记忆,靠的是把之前的问答原样贴回提示里;
  16. 警惕「答得像模像样」:书自己在这一章把一个没核实过的价格当成了能力的证据—— 看演示先问一句「这个答案有人验过吗」。

7. 原文地图

主题原书章原文位置
多模态的定义与「只能输入不能输出」多模态大语言模型text/11-fm.txt:5(搜「多模态模型」) · text/11-fm.txt:7(搜「无法在该模态下生成内容」)
涌现能力被当成前提多模态大语言模型text/11-fm.txt:9(搜「涌现出各种各样的能力」) · text/11-fm.txt:11(搜「帮助涌现出以前被锁定的能力」)
ViT 与卷积神经网络的对比多模态大语言模型text/11-fm.txt:21(搜「Vision Transformer」)
图像不是由单词组成、不能建词表多模态大语言模型text/11-fm.txt:29(搜「图像不是由单词组成的」) · text/11-fm.txt:37(搜「很少会在其他图像中出现」)
切成图像块、线性嵌入多模态大语言模型text/11-fm.txt:33(搜「图像块」) · text/11-fm.txt:39(搜「线性嵌入」)
16x16 与论文标题多模态大语言模型text/11-fm.txt:41(搜「16x16 Words」)
「和文本词元一样处理」多模态大语言模型text/11-fm.txt:43(搜「被当作文本词元一样处理」)
同一向量空间、可以互相搜多模态大语言模型text/11-fm.txt:59(搜「因为生成的嵌入位于同一向量空间中」)
CLIP 的四个用途多模态大语言模型text/11-fm.txt:69(搜「零样本分类」) · text/11-fm.txt:63(搜「对比语言-图像预训练」)
训练数据:数百万对图与配文多模态大语言模型text/11-fm.txt:73(搜「数百万张图像及其对应的描述文字」)
两个编码器、余弦相似度多模态大语言模型text/11-fm.txt:77(搜「文本编码器嵌入文本」) · text/11-fm.txt:81(搜「余弦相似度」)
配对拉近、不配对推远多模态大语言模型text/11-fm.txt:83(搜「最大化相似度」) · text/11-fm.txt:85(搜「对比学习」)
「还要知道什么使它们不同」多模态大语言模型text/11-fm.txt:91(搜「什么使它们不同和不相似」)
0.33 与「这个分数很难解释」多模态大语言模型text/11-fm.txt:253(搜「0.33149648」) · text/11-fm.txt:254(搜「很难解释」) · text/11-fm.txt:258(搜「0.33 的分数确实很高」)
[CLS] 在这里代表图像多模态大语言模型text/11-fm.txt:170(搜「[CLS] 词元实际上用于表示图像嵌入」)
从头训太贵多模态大语言模型text/11-fm.txt:300(搜「大量的计算能力和数据」)
Q-Former 这座桥多模态大语言模型text/11-fm.txt:302(搜「查询 Transformer」) · text/11-fm.txt:304(搜「只需要训练这座桥梁」) · text/11-fm.txt:308(搜「共享注意力层」)
第一阶段的三个任务多模态大语言模型text/11-fm.txt:324(搜「图像-文本对比学习」) · text/11-fm.txt:326(搜「注入冻结的 ViT 的嵌入中」)
软视觉提示词与投影层多模态大语言模型text/11-fm.txt:330(搜「这些嵌入充当了软视觉提示词」) · text/11-fm.txt:332(搜「全连接线性层」) · text/11-fm.txt:336(搜「类似于在提示时提供给大语言模型的上下文」)
后来的同类模型多模态大语言模型text/11-fm.txt:340(搜「LLaVA」)
处理器相当于词元化器多模态大语言模型text/11-fm.txt:373(搜「可以比作语言模型的词元化器」)
图片被压成正方形多模态大语言模型text/11-fm.txt:387(搜「520 × 492」) · text/11-fm.txt:397(搜「它们可能会失真」)
Ġ 那个怪符号多模态大语言模型text/11-fm.txt:433(搜「码位中的字符向上移动 256」)
看图写描述的两个场景多模态大语言模型text/11-fm.txt:449(搜「1000 多张婚礼照片」)
跑车与罗夏图的输出多模态大语言模型text/11-fm.txt:484(搜「orange supercar」) · text/11-fm.txt:518(搜「ink drawing of a bat」)
特定领域的图会失败多模态大语言模型text/11-fm.txt:487(搜「特定卡通人物或虚构创作」)
视觉问答与那个「一百万美元」多模态大语言模型text/11-fm.txt:525(搜「即进行所谓的视觉问答」) · text/11-fm.txt:583(搜「1,000,000」) · text/11-fm.txt:584(搜「类似对话的行为」)
把历史贴回提示里多模态大语言模型text/11-fm.txt:564(搜「What would it cost me to drive that car?」)

Footnotes

  1. 出处:「多模态大语言模型」第 484 段(text/11-fm.txt:484,搜「orange supercar」)、第 557 段(text/11-fm.txt:557,搜「A sports car driving on the road at sunset」)与第 583 段(text/11-fm.txt:583,搜「1,000,000」)。三条输出都是书实际跑出来的。

  2. 出处:「多模态大语言模型」第 584 段(text/11-fm.txt:584,搜「类似对话的行为」)。 2

  3. 出处:「多模态大语言模型」第 518 段(text/11-fm.txt:518,搜「ink drawing of a bat」)。书对罗夏测试的介绍见第 489 段(text/11-fm.txt:489,搜「罗夏测试」),并自嘲式地问了一句「既然这是罗夏测试,你觉得它说明了模型的什么?」

  4. 出处:「多模态大语言模型」第 5 段(text/11-fm.txt:5,搜「多模态模型」)与第 7 段(text/11-fm.txt:7,搜「无法在该模态下生成内容」)。后一句出自图注,很容易被跳过,但它划定了这一章的边界。 2

  5. 出处:「多模态大语言模型」第 29 段(text/11-fm.txt:29,搜「图像不是由单词组成的」)与第 37 段(text/11-fm.txt:37,搜「很少会在其他图像中出现」)。 2

  6. 出处:「多模态大语言模型」第 43 段(text/11-fm.txt:43,搜「被当作文本词元一样处理」)。 2

  7. 出处:「多模态大语言模型」第 21 段(text/11-fm.txt:21,搜「Vision Transformer」)。「卷积神经网络是拿小窗口在图上滑」这个解释是我们补的,书只给了缩写。

  8. 出处:「多模态大语言模型」第 41 段(text/11-fm.txt:41,搜「16x16 Words」)。原文:「为了便于说明,示例中的图像被切分为 3 × 3 的块,但原始实现使用的是 16 × 16 的块。」

  9. 出处:「多模态大语言模型」第 59 段(text/11-fm.txt:59,搜「因为生成的嵌入位于同一向量空间中」)。书举的例子是:搜「小狗的图片」会找到哪些图,反过来哪些文字和这张图最相关。

  10. 出处:「多模态大语言模型」第 63 段(text/11-fm.txt:63,搜「对比语言-图像预训练」)。

  11. 出处:「多模态大语言模型」第 69 段(text/11-fm.txt:69,搜「零样本分类」)。

  12. 出处:「多模态大语言模型」第 85 段(text/11-fm.txt:85,搜「对比学习」)与第 83 段(text/11-fm.txt:83,搜「最大化相似度」)。书把这个概念的完整讲解留给了原书第 10 章,即我们的第 08 章。

  13. 出处:「多模态大语言模型」第 91 段(text/11-fm.txt:91,搜「什么使它们不同和不相似」)。 2

  14. 出处:「多模态大语言模型」第 253 段(text/11-fm.txt:253,搜「0.33149648」)与第 254 段(text/11-fm.txt:254,搜「很难解释」)。 2 3

  15. 出处:「多模态大语言模型」第 258 段(text/11-fm.txt:258,搜「0.33 的分数确实很高」)。对照表是三张图配三句描述,见第 256 段(text/11-fm.txt:256,搜「相似度矩阵」)。

  16. 出处:「多模态大语言模型」第 170 段(text/11-fm.txt:170,搜「[CLS] 词元实际上用于表示图像嵌入」)。

  17. 出处:「多模态大语言模型」第 300 段(text/11-fm.txt:300,搜「大量的计算能力和数据」)。

  18. 出处:「多模态大语言模型」第 308 段(text/11-fm.txt:308,搜「共享注意力层」)。

  19. 出处:「多模态大语言模型」第 324 段(text/11-fm.txt:324,搜「图像-文本对比学习」)。

  20. 出处:「多模态大语言模型」第 326 段(text/11-fm.txt:326,搜「注入冻结的 ViT 的嵌入中」)。

  21. 出处:「多模态大语言模型」第 332 段(text/11-fm.txt:332,搜「全连接线性层」)。

  22. 出处:「多模态大语言模型」第 330 段(text/11-fm.txt:330,搜「这些嵌入充当了软视觉提示词」)。

  23. 出处:「多模态大语言模型」第 336 段(text/11-fm.txt:336,搜「类似于在提示时提供给大语言模型的上下文」)。

  24. 出处:「多模态大语言模型」第 340 段(text/11-fm.txt:340,搜「LLaVA」)。书点名的两个后续模型是 LLaVA 和 Idefics 2。

  25. 出处:「多模态大语言模型」第 387 段(text/11-fm.txt:387,搜「520 × 492」)与第 396 段(text/11-fm.txt:396,搜「224, 224」)。 2

  26. 出处:「多模态大语言模型」第 397 段(text/11-fm.txt:397,搜「它们可能会失真」)。 2

  27. 出处:「多模态大语言模型」第 487 段(text/11-fm.txt:487,搜「特定卡通人物或虚构创作」)。 2

  28. 出处:「多模态大语言模型」第 433 段(text/11-fm.txt:433,搜「码位中的字符向上移动 256」)。

  29. 出处:「多模态大语言模型」第 447 段(text/11-fm.txt:447,搜「用例1:图像描述生成」)与第 525 段(text/11-fm.txt:525,搜「即进行所谓的视觉问答」)。

  30. 出处:「多模态大语言模型」第 525 段(text/11-fm.txt:525,搜「同时呈现两种模态」)。

  31. 出处:「多模态大语言模型」第 564 段(text/11-fm.txt:564,搜「What would it cost me to drive that car?」)。

  32. 出处:「多模态大语言模型」第 449 段(text/11-fm.txt:449,搜「1000 多张婚礼照片」)。

  33. 出处:「多模态大语言模型」第 9 段(text/11-fm.txt:9,搜「涌现出各种各样的能力」)与第 11 段(text/11-fm.txt:11,搜「帮助涌现出以前被锁定的能力」)。