跳到主要内容

让它看见 — 同一副骨架换个前端

这一章讲三件事: 一个能看图的模型内部到底多了什么(答案比多数人想的简单); 微调它时该动哪一块、不该动哪一块; 以及它有哪两个纯文本模型没有的坑。

它在全书链条里的位置: 全书总纲那条线在这里继续—— 第 15、16 章是在给模型找裁判,而第 17、18、19 章是在演示裁判缺席时会烂成什么样。 这一章的形态是:能自动算的指标在这里压根不可靠,人评不是可选项。

★ 第 14 章有一句话是这一章的钥匙:「token 对它代表什么是无所谓的, 它们只是被映射到向量空间的一串离散编号。」 那句话就出在第 14 章第 4 节, 它在那里被拿来讲临床概念,这一章拿它讲图像。

1. 先看现象:理赔材料里附了一张片子

回到那家保险公司。这次申请材料里附了一张腰椎核磁的影像。

★ 直觉的想法:图像要另一套模型来处理,那是另一个项目。

★ 书给的答案:不是。**是同一副骨架,换个前端。**

书为什么要讲这件事

开篇那句给了理由1:

单靠语言是不够的。世界是经由视觉、声音和感觉抵达我们的, 而只处理文本的模型,错过了人类交流内容与方式的大部分。

★ 近年语言模型的一大发现是:同一套架构也能容纳别的模态。

(「模态」就是输入的形式:文字是一种模态,图像是另一种,声音、视频、传感器读数各是一种。 能同时吃两种以上模态的系统,就叫多模态系统。)

而书强调了一件事:这不是「分别处理几种输入」1:

这些系统并不是各自独立地处理多种输入类型,而是学习联合的表示。

主走查(全章共用): 那张腰椎核磁进模型走一遍。 书给了一套真实的放射科微调配方,我们照它走—— 4 位加载、冻住视觉编码器、投影层全训、语言层挂秩 16 的旁路、单张 24GB 卡、 几千条例子训 500 到 1000 步。 编造的数每次出现都会标明。

2. 顶层全景:三件套骨架

一张图 一段文字
│ │
① 视觉编码器 │
把原始图像处理成一串连续的数 │
│ │
② ★ 投影层 │
把这串数**搬进语言模型的嵌入空间** │
│ │
└──────────► 拼在一起 ◄──────────────────────┘

③ 语言模型主干:以「视觉那部分 + 文字那部分」为条件,照常往下写


★ 输出序列全是文字

图说:**这三步的名字叫「编码 → 投影 → 生成」,而书说它在各家实现之间惊人地稳定。**
★ 第 ② 步是这一章的中心:它是后训练最主要的着力点(§4),也是微调的甜点(§5)。

三个部件各自可以换,但骨架不变2:

部件可以是什么
视觉编码器一个视觉版的 transformer、一类图文对比预训练出来的编码器、或者自定义的
投影层一个线性层、一个多层感知机,或者一组交叉注意力模块
语言主干几乎任何语言模型

顺带兑现第 14 章那句话

第 14 章第 4 节引过书里的一句总结:token 对它代表什么是无所谓的, 它们只是被映射到向量空间的一串离散编号3那句话在第 14 章被用来讲一个临床模型怎么把整个疾病概念塞进词表; 这一章是它的第二次兑现,塞进去的换成了图。

★ 具体怎么塞:
图被切成一个个小方块(通常 14×14 或 16×16 像素),
每一块过一遍视觉编码器,再被投影进语言模型的 token 空间——
**于是语言模型看到的,就是一串「视觉 token」,和文字 token 并排。**

★ 而这和第 02 章「把一句话切成小块、每块叫一个 token」是同一个主意,
只是切的对象从句子换成了图。

3. 机制一:视觉指令微调,难的只是把两头连起来

那个「优雅的观察」

书给这件事的定性,决定了这一整章的力气该往哪儿花4:

★ 语言模型已经会跟随指令,视觉编码器已经会表示图像。 难的不是从零教会其中任何一项,而是把两者连起来, 让「跟随指令」这件事适用于视觉内容。

数据要越过「一张图配一句话」

书给了一个很好用的构造思路5:

❌ 简单的图-文对:一张图 + 一句描述
✅ 结构化的交互:**同一张图可以支撑几十种指令类型**

拿那张腰椎核磁举例:
├「描述你看到了什么」
├「数一数有几个椎间盘出现了信号改变」
├「比较 L4-L5 和 L5-S1 这两段」
├「找出任何提示需要进一步检查的征象」
├「推测在这次成像之前发生过什么」
└「预测如果不干预,接下来会怎样」

★ 关键:**这些指令类型练的是不同的推理能力,而不只是不同的措辞。**

训练目标就是普通的下一个词预测,只有一处要小心

这一条直接接上第 05 章那个损失掩码6:

★ 损失只在回答那一段上算。

为什么不能在视觉 token 上算损失:
→ 那等于在教模型去**生成**视觉表示。而那不是目的。

为什么不能在指令上算损失:
→ 那会鼓励模型鹦鹉学舌地复述提示词。

★ 这和第 05 章「掩码该盖住哪一段」是同一件事,只是多了一段视觉 token 要盖。

通常分阶段来

书给的分期很清楚7:

阶段训什么目的
第一阶段只训投影层,视觉编码器和语言模型都冻住建立模态之间的基本对齐
第二阶段可能解冻语言模型的一部分参数更深地整合

4. 机制二:投影层为什么是那个甜点

它在架构上的位置

书对它的定性很高8:

★ 投影机制是我们对模型输出最有力的杠杆,因此也是后训练的中心焦点。

两种实现的取舍8:

实现好处代价
线性投影高效、易训可能丢信息
交叉注意力保留更多视觉细节加参数、加算力

为什么它是微调的最优目标

书给了三条理由,而第三条是这一节的关键9:

① 只训投影层**算力开销不大**
② **遗忘风险极小**
③ ★ 在底层的视觉能力和语言能力都已经具备时,它能达成可观的适配——
**因为它要模型学的不是新的视觉概念、也不是新的语言概念,
而是「既有概念之间的新映射」。**

书还专门开了一个小注强调这件事的安全性10:

只训投影层,既不冒犯视觉编码器的视觉词汇,也不冒犯语言模型的语言能力。 ★ 往深里走——解冻编码器或者主干——只应该发生在 「投影层训练明确达不到要求」的时候。

★ 而冻不冻语言主干,是最要命的那个决定

书用了「最有后果的架构决定」这个说法11:

冻住语言主干训语言主干
保住通用能力;发生变化的只是「视觉信息如何呈现给它」能更深地整合视觉理解
代价是语言能力灾难性遗忘的风险(第 04 章那件事)

一张五策略对照表

书给了一张表,我们照它整理12:

训什么什么时候用要多少数据风险
只训投影层多数任务的默认1000–10000 例低,几乎不遗忘
语言模型 + 投影层需要更深的适配1 万–10 万例中等,可能丢通用能力
视觉编码器 + 投影层新颖的视觉域10 万例以上高,可能丢视觉词汇
全模型最大限度的适配极大量领域数据最高,需要仔细正则
语言模型挂旁路 + 投影层全训适配与效率的平衡5000–5 万例低到中

编码器该不该训,书给了一条可以当场判的口径13:

视觉编码器装着模型基础的视觉词汇:对边缘和纹理、物体和空间关系的理解。 ★ 多数企业应用的视觉领域,落在编码器预训练分布之内——冻住就够了。 只有新颖的视觉域(特殊的医学影像模态、罕见的工业检验场景、 领域特定的文档版式)才可能需要训编码器,而那需要多得多的数据。

参数高效方法在这里怎么用

书给的常见组合就是上面那张表的最后一行14:

★ 在语言模型上挂低秩旁路 + 冻住视觉编码器 + 完整训练投影层。

超参数要相对纯文本做调整:投影层的学习率可能要比旁路更高, 预热可能要拉长,好让两种模态的对齐稳定下来。 但基本的机器可以直接搬过来。

「预热」是训练开始时的一段过渡: 学习率不是一上来就用目标值, 而是从很小开始、用几十到几百步慢慢升上去为什么这里要拉长: 投影层是从头开始学「怎么把视觉表示搬进语言空间」的, 一上来就迈大步,很容易把它推到一个乱七八糟的映射上,而后面每一步都建立在那上面。

5. 机制三:走查 —— 那张片子的完整配方

书给了一个完整的放射科例子,我们照它走一遍。

起点:它懂图,但对这一行一无所知

这一段把「要训的到底是什么」说得非常清楚15:

起点是一个广泛地懂图像、但对放射学一无所知的底座。 它的视觉编码器在自然图像上预训练过,已经能表示边缘、纹理和空间关系, ★ 但它从来没学过怎么把胸腔积液和正常的肋膈角区分开; 而语言模型说话流利,但医学知识浅而不可靠。

★ 微调的目标不是从零教会它放射学(那需要的数据和算力远超多数组织), 而是把它已经表示出来的那些视觉模式,连到放射科医生使用的临床语言上。

数据

书点了一个公开数据集16:

规模8 万多张放射影像,配的是从学术文献里来的、专家写的图注
格式化成一段对话:用户消息里含图像 + 临床问题(「描述这张胸片的所见」),助手消息是专家的描述

配方

这一段的每一个数都是书给的17:

★ 4 位加载 + 低秩旁路(第 11、12 章那两套)
★ 视觉编码器:冻住
★ 投影层:完整训练
★ 秩 16 的旁路:挂到语言模型的注意力层
★ 学习率 2×10⁻⁴,余弦衰减
★ 批量 2,梯度累积 4 步
★ 单张 24GB 卡放得下
★ 几千条例子,训 500 到 1000 步

→ 效果:模型开始恰当地使用心脏肥大、实变、纵隔增宽这些术语,
并按放射科医生期待的格式组织所见。

参照物: 对照第 12 章那份 700 亿模型的配方——那里秩也是 16, 但学习率是 5×10⁻⁶ 那一档;这里是 2×10⁻⁴,高了一个多数量级。 因为这里训的是一个小得多的模型,而且投影层是从头对齐的。

只训投影层不够的地方

书给了一个很具体的分层结果18:

只训投影层:
✓ 足以把视觉模式关联到放射学术语
✗ 但描述会停在泛泛的层面:「左下叶阴影」,再往下就没有了

给语言模型也挂上旁路:
✓ 临床语言才被深化

★ 但接着出现了这一章最反直觉的一件事

这是这一章最值得记住的发现18:

一项近期研究发现:领域预训练与指令对齐叠加起来会产生干扰—— ★ 词面重合类的表面指标可能下降,而诊断准确率在上升, 因为模型从啰嗦重复的描述,转向了简洁、临床聚焦的表述。

★ 这意味着自动指标单独无法指导训练决策; 放射科医生的评估不是可选项,而是必需品。

★ 这一条是第 10 章那条三角测量在这一章的实战: 「三者发散本身就是最重要的信号」,在这里成了「表面指标掉了反而是好事」。

6. 机制四:视觉幻觉,以及为什么它更难察觉

现象

书把它称作视觉语言模型的标志性失效模式19:

模型自信地描述图里没有的物体、数错数量、编造元素之间的空间关系。

★ 它为什么比纯文本幻觉更阴险

★ 纯文本幻觉:读者没有可以对照的东西,所以他至少会保持一点怀疑。
★ 视觉幻觉:**图就在旁边**——于是人反而更信那段描述。

书的判词:**这种虚假的安全感,让它格外阴险。**

于是对齐多了一个维度

书把这件事说得很结构化20:

维度内容
老的三条有帮助、无害、诚实(第 08 章那三条)
新增的一条视觉保真:关于图像的断言,要对应图像的内容

而文本对齐的技法只能部分迁移,标注成本还会上升—— 标注员必须仔细看图,而不只是读文本20

自动检测有一个根本困难

这一条书写得很干净21:

检查模型的置信度、比对多次生成的一致性、用辅助模型核验断言—— 这些能抓到一些幻觉,但会漏掉细微的。

★ 根本的困难在于:如果模型的视觉理解本身有毛病, 你不能用它来核验它自己的视觉理解。

★ 最阴险的一种:面对歧义

书举了一个很经典的例子,而且这个例子把问题讲得比任何抽象论述都清楚22:

那张著名的鸭兔错觉图。

★ 被训成「描述图像时不容忍歧义」的模型,会说它是鸭,或者说它是兔。
★ 而实际上:**两者都不是。**

书给的对策和它的难处22:

设计良好的视觉模型能容忍歧义,而做到这一点靠的是「在歧义的难反例上做强化学习」。 训练数据必须包含「承认不确定」的正确回答—— 比如「这张图既可能是实变,也可能是肺不张;侧位片有助于区分」, 而不是自信地断言其中之一。

★ 难就难在:大多数训练集奖励的是自信、具体的回答, 而标注员也倾向于把歧义解决掉,而不是把它保留下来。

降幻觉是三段的,没有哪一段能单独解决

书给的三段依次是23:

做什么
① 示范训练用高质量、视觉有据的数据打一个准确描述的基线
② 偏好优化教它偏好有据的回答,而不是幻觉的(第 09 章那条主路,或者下面那个更省的变体)
③ 推理时的技法带视觉约束的搜索、多次采样做自洽检查、辅助的验证模型

书的判词:没有哪一段能单独消灭这个问题,但每一段都能减少它。23

走查:偏好数据怎么造

书给了一条很实用的构造法,而且它的理由很有说服力24:

★ 最有效的做法:**让「被拒的那份回答」由微调后的模型自己产生。**

① 每张图在较高温度下采 3 到 5 个补全
② 让标注员挑出含幻觉的那些,当作被拒的
③ 最好的模型回答、或者人写的标准答案,当作被偏好的

★ 好处:**它精确瞄准的是模型自己会犯的幻觉模式**,
而不是那些「可能对不上它失效分布」的合成错误。

★ 代价(书给的数):**5000 张图的数据集,要生成 15000 到 25000 条候选回答,
并花 100 到 200 个标注员小时来构造偏好对。**

书还提了一个更省的变体25:

第 09 章那条主路需要同时维持两到四份模型副本; 而一个叫 nSFT 的简化做法,是把被拒回答里的有用信号抽出来、并进标准的示范训练损失里。 ★ 它在幻觉基准上提升了 15 个点,显存需求显著低于完整的偏好优化。 对已经做完示范训练、又不想让显卡预算翻倍的团队,这是一条实用的中间路线。

7. 机制五:标注的双重负担

每一条数据要同时满足两个约束

这是这一章的经济学核心26:

每一个图文对必须满足的不是一个约束,而是两个: 文本必须适合这个任务,而且必须准确反映图像的内容。

★ 一条漂亮的指令-回答对,如果错误描述了图像 → 一文不值
★ 一条完全准确的图像描述,如果不服务于训练目标 → 也一文不值

它要求标注员有双重能力

书说得很直接27:

这需要具备双重能力的标注员: 足以注意到相关细节的视觉感知能力,加上把这些细节说清楚的语言能力。 ★ 找同时具备两者的人,比找只具备其中一样的人难得多。

实测后果:视觉语言模型的标注成本,通常是同等长度纯文本标注的两到三倍; 质量控制的复审时间也更长27

领域场景会把这个交集进一步压小

书列了三种,每一种都在缩人才池28:

场景需要什么背景的标注员
医学影像有放射科训练背景的人
制造检验熟悉缺陷分类体系的人
文档理解懂表单、发票、合同结构的人

★ 领域专长 × 标注技能的交集,进一步缩小可用人力, 使领域多模态数据集稀缺而昂贵。而模型只能学到数据教它的东西。28

★ 那个可行的杠杆:让强模型出草稿,专家复核

这一条把上面那笔账拉回可行范围29:

做法:用一个强的商用模型给你的领域图像**生成草稿标注**
→ 再让领域专家**复核并修正**

★ 本质上就是第 17 章那套合成数据流水线,搬到多模态。

★ 经济账(书给的数):
一位放射科医生**从零标注**:每小时 10 张
同一位医生**复核修正模型生成的标注**:每小时 40 张

→ **四倍。**

但书紧接着给了它的风险,而且这个风险不容易被抓到30:

风险是模型生成的标注共享系统性偏差。 ★ 如果那个商用模型一贯地认错某一种病变,逐条修正抓得到个别错误, 却可能看不出这个系统性的模式。

对策:混用模型生成的和人原创的标注,并按来源分别追踪错误率。

书还给了一条给受监管行业的补充30:

因为隐私或监管原因不能把图像送到外部接口的组织(医疗、国防常见), 可以用本地部署的开源模型担同样的草稿角色—— 草稿质量低一些,但「复核修正」仍然胜过从零标注,而且数据不出组织。

选标注格式的判据

书给了一条很硬的原则31:

★ 标注格式决定模型能学到什么。

格式教会什么教不了什么
框出物体的位置定位不教推理
指令-回答对推理可能没有空间上的落地
密集描述监督最丰富每张图贵三到五倍

★ 按任务需求匹配,不按「哪种看起来最全面」匹配。

书给的反例很具体31:

制造检验系统需要的是:**缺陷的框 + 严重度标签**
❌ 而描述整个场景的密集描述,是把标注预算花在无关细节上。

★ 口径:从「可能够用的最小标注」起步,
只在简单做法明确失败时才加丰富度。

8. 机制六:为什么这一章的评估必须有人

这一节是这一章的落点,也是它和第 10 章接上的地方。

学术基准会骗人

书的理由很具体32:

标准学术基准给出有用的信号,但把它当成真实表现的代理会误导: 模型可能在某个基准那种受限的短答格式上表现出色, 却在开放式的企业场景里给不出有用的回答。

解法是构造「镜像部署条件」的评估集。——这就是第 10 章那套自建题库。

★ 纯文本上还算靠谱的那些指标,在这里失灵了

书专门开了一个小框讲这件事,而且这一条是这一章最该带走的33:

对纯文本模型,词面重合类指标和困惑度往往与人的判断相关得不错。 ★ 对视觉语言模型,不存在这样可靠的代理。

一个自动指标可以检查「狗」这个词有没有出现在一张狗的图注里, ★ 却评不了这段图注有没有抓住这只狗的品种、体型、动作、神情。

★ 在视觉理解的指标成熟之前,人评不是可选项,而是必需品。

那条实操协议

书给的分工和第 10 章那一摞完全同构34:

① 自动基准做筛选
② 幸存下来的候选,再上人评做部署决策
★ 而且:自动筛选之后,**永远接一轮领域特定的人评。**

书还给了几类基准各管什么34:

基准类型管什么
通用能力型(大学级题目、细粒度能力剖面)筛候选
文档理解型文档密集的流程
临床型(比如一套八项临床胸片任务)医疗

★ 书的判词:没有单一基准能覆盖某个特定应用要的东西。34

★ 那条不能省的边界声明

书专门开了一个警告框,而它对任何做受监管场景的人都是必读35:

★ 一个在某个医学视觉问答基准上拿到 90% 准确率的模型,不是一个诊断工具。

基准准确率衡量的是「标准化问题 + 无歧义答案」上的表现; 而真实的临床放射学涉及歧义、不确定性,以及影像与病史的整合。

监管框架要求的临床验证,远超基准表现。 ★ 追求医疗部署的组织必须为临床试验、监管申报和持续监测预算—— 而这些成本,使微调那点投入相形见绌。

参照物:书给了一个生产级模型的规模36:

一个大学出品的生产级放射模型,训练数据是:
**610 万条指令-回答对**
来自 **110 万张独特的胸片**
取自 **28 个公开数据集**

★ 对照上面那个走查配方:几千条例子、500 到 1000 步。
**差着三个数量级。**

书还提了另一条绕开标注瓶颈的路36:

有一项工作走了完全不同的路线:不用语言监督, 视觉编码器只在放射影像上做自监督预训练。

(「自监督」指训练信号从数据自己身上来,不需要人标注—— 比如遮住图的一块让它补出来。第 02 章讲过的「预测下一个词」就是文本上的自监督。) ★ 它不需要配对的图文数据,也能取得有竞争力的表现—— 对拿不到大规模配对医学数据的实践者,这条路绕开了标注瓶颈。

9. 作者的判断与证据

说法是哪一类说明
三件套骨架在各家之间稳定作者的观察他逐一对比了几家实现,结论是骨架不变、连接件在变2
「难的只是把两头连起来」作者对那项工作的转述书称之为「一个优雅的观察」4
损失只在回答上算机制的直接后果两条理由都可以自己推6
投影层是甜点作者的判断 + 三条理由第三条(学的是既有概念之间的新映射)是它的机制9
冻不冻主干是最要命的决定作者的判断没有配实验对比11
那张五策略对照表的数据量经验区间书没有给出处,当量级看12
多数企业应用落在编码器预训练分布内作者的经验判断没有配数据13
视觉幻觉比纯文本更难察觉机制论证理由是「图就在旁边,人反而更信」19
鸭兔图那个例子作者构造的说明它是这一章最好的教学例子22
标注成本是纯文本的两到三倍实测后果书没有配调研出处,是行业经验量级27
每小时 10 张 vs 40 张书给的具体数字同样没有配出处;但它是这一章最实用的一个比值29
模型生成标注共享系统性偏差机制论证它的阴险之处是「逐条修正抓不到系统模式」30
领域训练与指令对齐会互相干扰他引的一项近期研究这是这一章最反直觉、也最重要的一条18
视觉语言模型上不存在可靠的自动代理作者的立场他给了一个很具体的例子(狗的品种/体型/动作/神情)33
90% 基准准确率不是诊断工具作者的边界声明书专门开了警告框;监管要求是可查证的事实35
那个 610 万条的规模有据书给了尾注36
nSFT 提升 15 个点他引研究书给了尾注25

10. 边界与局限

  1. 各家开源模型的对照表我们只交付判断,不抄清单。 书给了一张六款模型的表(参数、编码器、许可、长处), 属于会随季度变的信息;书自己给的默认建议是「拿不准就用那款文档理解最强的 70 亿模型」。
  2. 训练框架的接口与代码我们不抄。 书给了两段完整的代码清单和一组超参, 我们只交付那组超参和它的量级对照
  3. 书里有一个保存时的坑我们只提一句: 某些视觉架构上「合并并保存」可能没有正确合并旁路, 判据是「保存后的模型输出与底座一模一样」;这属于工具的 bug,会被修掉。
  4. 一种用专门化的专家投影器服务不同医疗任务的架构做法,我们只提一句。 书说它避开了多任务场景里「训一个任务把另一个训坏」的拔河问题, 洞见是「连接视觉与语言的那一层,有时受益于任务特定的专门化」;但书只给了一段。
  5. 书里那两个「让编码助手做多模态数据策展」的专栏,我们按全书口径不覆盖。
  6. 书里有两处把「合成数据那一章」误写成了第 10 章(实为它的第 11 章, 也就是我们的第 17 章);另有一处尾注引的是某个模型的上一代论文,却给了新一代作注。 我们照实点出来,不跟着错。

11. 可带走的

  1. 处理图像不需要另一套模型,是同一副骨架换个前端: 视觉编码器 → 投影层 → 语言模型,而输出序列全是文字;
  2. 三个部件各自可以换,但「编码 → 投影 → 生成」这个骨架在各家之间惊人地稳定; 选底座多数情况下可以只看实际因素(参数量、许可、框架支持);
  3. 图被切成小方块当 token 用——这和第 02 章「把一句话切成小块」是同一个主意;
  4. 难的不是从零教会任何一项:语言模型已经会跟随指令、编码器已经会表示图像, 难的是把两者连起来;
  5. 数据要越过「一张图配一句话」:同一张图可以支撑几十种指令类型, 而它们练的是不同的推理能力;
  6. 损失只在回答上算:在视觉 token 上算等于教它生成图像(不是目的), 在指令上算会让它鹦鹉学舌;
  7. 投影层是微调的甜点:算力小、遗忘风险小, 而且它要模型学的不是新概念,是既有概念之间的新映射;
  8. 冻不冻语言主干是最要命的决定:冻住保通用能力,训它能更深整合、 但冒语言能力灾难性遗忘的风险;
  9. 五种策略的数据量量级:只训投影层 1000–10000 例(默认)· 语言模型+投影 1 万–10 万 · 编码器+投影 10 万以上(只在新颖视觉域才需要) · 挂旁路+投影 5000–5 万;
  10. 多数企业应用的视觉域落在编码器预训练分布之内——冻住就够;
  11. 常见组合:语言模型挂旁路 + 冻编码器 + 完整训投影层; 超参要调整:投影层的学习率可能要更高,预热要拉长;
  12. 那份放射科配方:4 位加载 · 冻编码器 · 投影层全训 · 秩 16 旁路挂语言层 · 学习率 2×10⁻⁴ · 单张 24GB 卡 · 几千条训 500–1000 步;
  13. 只训投影层能把视觉模式关联到术语,但描述会停在泛泛; 给语言模型也挂旁路,临床语言才被深化;
  14. ★★ 领域训练与指令对齐叠加会互相干扰:表面指标下降,而诊断准确率在上升—— 所以自动指标单独无法指导训练决策;
  15. 视觉幻觉比纯文本幻觉更难察觉:图就在旁边,人反而更信那段描述;
  16. 对齐因此多一个维度:视觉保真;而标注员必须仔细看图,不只是读文本;
  17. 自动检测有一个根本困难:如果模型的视觉理解本身有毛病, 你不能用它来核验它自己的视觉理解;
  18. 最阴险的是歧义信号(鸭兔图:说是鸭或是兔都错,正确答案是两者都不是); 对策是在歧义难反例上做强化学习,而难处在于大多数训练集和标注员都在奖励自信;
  19. 降幻觉是三段的:示范训练打基线 → 偏好优化教它偏好有据的 → 推理时兜底; 没有哪一段能单独解决;
  20. 偏好数据里的「被拒回答」最好由微调后的模型自己产生—— 它精确瞄准模型自己会犯的幻觉模式;代价是 5000 张图要 1.5 万到 2.5 万条候选、 100 到 200 标注员小时;
  21. ★★ 标注的双重负担:每条要同时满足感知和语言两个约束, 标注成本通常是纯文本的两到三倍;
  22. 领域专长 × 标注技能的交集更小,使领域多模态数据集稀缺而昂贵;
  23. 可行的杠杆:强模型出草稿、专家复核。 一位放射科医生从零标注每小时 10 张,复核修正每小时 40 张——四倍;
  24. 但草稿会共享系统性偏差:★ 逐条修正抓得到个别错误,看不出系统模式; 对策是混用来源、分开追踪错误率;
  25. 标注格式决定模型能学到什么:框教定位不教推理、指令对教推理但可能没空间落地、 密集描述监督最丰富但每张贵三到五倍; ★ 按任务需求匹配,不按「哪种看起来最全面」匹配;
  26. ★★ 纯文本上还算靠谱的自动指标,在这里不存在可靠的对应物: 它能查「狗」有没有出现在图注里,却评不了图注有没有抓住这只狗的品种、体型、动作、神情;
  27. 人评在这里不是可选项,是必需品;实操是「自动基准筛选 → 幸存者上人评」, 而且自动筛选之后永远接一轮领域人评;
  28. 90% 的基准准确率不是一个诊断工具——基准测的是标准化问题加无歧义答案, 而临床要的验证与持续监测,成本让微调那点投入相形见绌;
  29. 生产级的规模量级:610 万条指令对、110 万张独特影像、28 个数据集—— 比走查那份配方大三个数量级;
  30. 还有一条绕开标注瓶颈的路:不用语言监督,编码器只在领域影像上做自监督预训练。

12. 原文地图

主题原书章原文位置
语言不够 · 学的是联合表示Pixels Meet Prosetext/148-fm-pixels-meet-prose.txt:5(搜「Language alone is not enough」) · :7(搜「learn joint representations」)
三件套骨架 · 投影层是中心Pixels Meet Prosetext/149-fm-pixels-meet-prose.txt:11(搜「a vision encoder that processes raw images」) · :15(搜「our most powerful lever over model outputs」)
只训投影层最安全 · 冻不冻主干 · 骨架稳定Notetext/150-fm-note.txt:3(搜「neither the vision encoder」) · :5(搜「the most consequential architectural de」) · :9(搜「remains remarkably stable」)
视觉指令微调 · 数据要越过图文对 · 损失只在回答上 · 分阶段Notetext/150-fm-note.txt:15(搜「Language models already know how to follow instructions」) · :17(搜「beyond simple image-caption pairs」) · :19(搜「An initial phase trains the projection layer」)
视觉幻觉 · 两个对齐维度 · 自动检测的困难Notetext/150-fm-note.txt:25(搜「signature failure mode of VLMs」) · :27(搜「the novel requirement of visual fidelity」) · :29(搜「miss subtle ones」)
鸭兔图 · 容忍歧义 · 降幻觉三段Notetext/151-fm-note.txt:3(搜「duck-rabbit illusion」) · :5(搜「RL on ambiguous hard negatives」) · :7(搜「The three-stage approach to reducing hallucination」)
双重约束 · 双重能力 · 领域交集 · 草稿加复核Fine-Tuning VLMs for the Real Worldtext/152-fm-fine-tuning-vlms-for-the-real-world.txt:7(搜「not one but two constraints」) · :9(搜「dual competencies」) · :11(搜「annotators with radiological training」) · :79(搜「generate draft annotations」)
标注格式决定能学到什么 · 模型草稿的系统偏差Choosing Your Annotation Strategytext/153-fm-choosing-your-annotation-strategy.txt:3(搜「The annotation format shapes what the model can learn」) · :5(搜「not to what seems comprehensive」) · :7(搜「share systematic biases」)
冻结问题 · 投影层是最优目标 · 参数高效方法VIBE CHECK: MULTIMODAL DATASET CURATIONtext/154-fm-vibe-check-multimodal-dataset-curation.txt:7(搜「fundamental visual vocabulary」) · :9(搜「the optimal target for efficient fine-tuning」) · :11(搜「keeping the vision encoder frozen」) · :13(搜「when to use」)
放射科走查 · 数据 · 配方 · 干扰现象VIBE CHECK: AGENT-ASSISTED VLM DATA PREPARATIONtext/155-fm-vibe-check-agent-assisted-vlm-data-preparation.txt:9(搜「knows nothing about radiology」) · :11(搜「80,000 radiology images」) · :13(搜「the vision encoder stays frozen」) · :50(搜「opacity in the left lower lobe」)
90% 不是诊断工具 · 生产规模 · 偏好优化 · nSFTWARNINGtext/156-fm-warning.txt:3(搜「is not a diagnostic tool」) · :5(搜「6.1 million instruction-answer pairs」) · :13(搜「generates rejected responses from the fine-tuned model itself」) · :15(搜「negative supervised fine-tuning」)
学术基准会骗人 · 人评不可或缺WARNINGtext/156-fm-warning.txt:21(搜「Standard academic benchmarks」) · :25(搜「more so than for text-only models」)
没有可靠的自动代理Why VLM Evaluation Needs Humanstext/157-fm-why-vlm-evaluation-needs-humans.txt:3(搜「no such reliable proxies exist」)

Footnotes

  1. 出处:「Pixels Meet Prose」第 5 段(text/148-fm-pixels-meet-prose.txt:5,搜「Language alone is not enough」)与第 7 段(text/148-fm-pixels-meet-prose.txt:7,搜「learn joint representations」)。第 5 段那句「同一套架构也能容纳别的模态」后面,作者还加了一句按语:这件事其实藏得并不深。 2

  2. 出处:「Pixels Meet Prose」第 11 段(text/149-fm-pixels-meet-prose.txt:11,搜「a vision encoder that processes raw images」)与「Note」第 9 段(text/150-fm-note.txt:9,搜「remains remarkably stable」)。第 9 段那句「选底座多数情况下可以只看实际因素(参数量、许可、框架支持)」是这一节最省事的一条口径。第 7 段(text/149-fm-pixels-meet-prose.txt:7,搜「the most mature and widely deployed class」)还提醒:这套三件套结构太成功,以至于人们容易把它当成一种架构上的必然,而它其实只是一个功能上的描述。 2

  3. 出处:「Symbolic Tokenization: When Vocabulary Expansion Beats Fine-Tuning」第 11 段(text/21-fm-symbolic-tokenization-when-vocabulary-expansion-.txt:11,搜「agnostic as to what they represent」)。原文那句是:词表被扩充的不是新的词,而是一整个新的模态——这之所以可能,是因为 token 归根到底对「它代表什么」是无所谓的,它们只是被映射到向量空间的一串离散编号这句话第一次出现在第 14 章第 4 节(那里讲的是一个把整个疾病概念塞进词表的临床模型),这一章是它的第二次兑现。

  4. 出处:「Note」第 15 段(text/150-fm-note.txt:15,搜「Language models already know how to follow instructions」)。原文称这是「一个优雅的观察」。 2

  5. 出处:「Note」第 17 段(text/150-fm-note.txt:17,搜「beyond simple image-caption pairs」)。原文列的指令类型包括:描述所见、数某类物体、比较两个区域、找出安全隐患、推测此前发生了什么、预测接下来会发生什么。

  6. 出处:「Note」第 19 段(text/150-fm-note.txt:19,搜「An initial phase trains the projection layer」)。「损失只在回答 token 上算」及其两条理由(在视觉 token 上算等于教它生成视觉表示;在指令上算会鼓励复述提示)也在这一节。 同段还提到多图与视频的指令微调不需要根本上新的技术,但显存需求大涨——每多一张图就多几百个视觉 token 2

  7. 出处:「Note」第 19 段(text/150-fm-note.txt:19,搜「establishing basic alignment between modalities」)。原文说当前实践越来越倾向分阶段:先训投影层对齐模态,必要时再选择性解冻语言模型的部分层。

  8. 出处:「Pixels Meet Prose」第 15 段(text/149-fm-pixels-meet-prose.txt:15,搜「our most powerful lever over model outputs」)。原文同时给了线性投影与交叉注意力两种实现的取舍,并说「对打算微调的人,投影层往往是甜点:参数够多能有意义地适配,又少到能在有限数据上高效训练」。 2

  9. 出处:「VIBE CHECK: MULTIMODAL DATASET CURATION」第 9 段(text/154-fm-vibe-check-multimodal-dataset-curation.txt:9,搜「the optimal target for efficient fine-tuning」)。第三条理由的原话是:它要模型学的不是新的视觉或语言概念,而是既有概念之间的新映射。 2

  10. 出处:「Note」第 3 段(text/150-fm-note.txt:3,搜「neither the vision encoder」)。这是书里一个独立的小注。

  11. 出处:「Note」第 5 段(text/150-fm-note.txt:5,搜「the most consequential architectural de」)。原文:冻住主干保住通用能力,只让「视觉信息如何呈现给它」发生变化;训主干能更深地整合视觉理解,代价是语言能力灾难性遗忘的风险 2

  12. 出处:「VIBE CHECK: MULTIMODAL DATASET CURATION」第 13 段(text/154-fm-vibe-check-multimodal-dataset-curation.txt:13,搜「VLM Fine-Tuning Strategies」)。这是书里的表 12-2,五行,列出了训什么、何时用、要多少数据、什么风险。那些数据量区间书没有给出处,当量级看。 2

  13. 出处:「VIBE CHECK: MULTIMODAL DATASET CURATION」第 7 段(text/154-fm-vibe-check-multimodal-dataset-curation.txt:7,搜「fundamental visual vocabulary」)。原文列的三种「新颖视觉域」是:特殊的医学影像模态、罕见的工业检验场景、领域特定的文档版式。 2

  14. 出处:「VIBE CHECK: MULTIMODAL DATASET CURATION」第 11 段(text/154-fm-vibe-check-multimodal-dataset-curation.txt:11,搜「keeping the vision encoder frozen」)。原文那句关于超参的提醒是:投影层的学习率可能要比旁路适配器更高,预热可能要拉长,好让多模态对齐稳定下来。 第 65 段(text/154-fm-vibe-check-multimodal-dataset-curation.txt:65,搜「an embarrassment of riches」)是关于选底座的三问(硬件够不够、应用要什么、用哪个框架),并给了一个具体的硬件参照:两款 70 亿以下的模型用 4 位可以在单张 24GB 卡上微调,而某款 110 亿的至少要 40GB。

  15. 出处:「VIBE CHECK: AGENT-ASSISTED VLM DATA PREPARATION」第 9 段(text/155-fm-vibe-check-agent-assisted-vlm-data-preparation.txt:9,搜「knows nothing about radiology」)。那句「它从来没学过怎么把胸腔积液和正常的肋膈角区分开」是这一段最具体的一句。

  16. 出处:「VIBE CHECK: AGENT-ASSISTED VLM DATA PREPARATION」第 11 段(text/155-fm-vibe-check-agent-assisted-vlm-data-preparation.txt:11,搜「80,000 radiology images」)。书还点了一个策展子集(含 X 光、CT、超声)和一个视觉问答数据集的名字。

  17. 出处:「VIBE CHECK: AGENT-ASSISTED VLM DATA PREPARATION」第 13 段(text/155-fm-vibe-check-agent-assisted-vlm-data-preparation.txt:13,搜「the vision encoder stays frozen」)。这一整套配方的每一个数(4 位、秩 16、学习率 2×10⁻⁴ 余弦衰减、批量 2、累积 4 步、单张 24GB 卡、几千条例子训 500 到 1000 步)都是书里给的。 那三个术语(心脏肥大、实变、纵隔增宽)也是书举的例子。

  18. 出处:「VIBE CHECK: AGENT-ASSISTED VLM DATA PREPARATION」第 50 段(text/155-fm-vibe-check-agent-assisted-vlm-data-preparation.txt:50,搜「opacity in the left lower lobe」)。这一段有两件事:只训投影层会停在泛泛的描述;以及那个干扰现象——表面指标可能下降而诊断准确率在上升,因为模型从啰嗦重复的描述转向了简洁、临床聚焦的表述。 结论那句是:自动指标单独无法指导训练决策,放射科医生的评估不是可选项而是必需品。 同节还提到推理时的一个实操:医疗应用里温度设得很低,以偏向确定性、临床保守的输出。 2 3

  19. 出处:「Note」第 25 段(text/150-fm-note.txt:25,搜「signature failure mode of VLMs」)。「人看到图就在旁边反而更信那段描述、这种虚假的安全感让它格外阴险」也在这一段。 2

  20. 出处:「Note」第 27 段(text/150-fm-note.txt:27,搜「the novel requirement of visual fidelity」)。原文明说文本对齐的技法只能部分迁移,而且标注成本上升——标注员必须仔细看图,而不只是读文本 2

  21. 出处:「Note」第 29 段(text/150-fm-note.txt:29,搜「miss subtle ones」)。那句根本困难(不能用一个视觉理解有毛病的模型去核验它自己的视觉理解)是这一节最该记住的。

  22. 出处:「Note」第 3 段(text/151-fm-note.txt:3,搜「duck-rabbit illusion」)与第 5 段(text/151-fm-note.txt:5,搜「RL on ambiguous hard negatives」)。那个「这张图既可能是实变也可能是肺不张,侧位片有助于区分」是书举的正确回答范例。 第 5 段那句难处的原话是:大多数训练集奖励自信、具体的回答,而标注员也倾向于把歧义解决掉而不是保留它。 2 3

  23. 出处:「Note」第 7 段(text/151-fm-note.txt:7,搜「The three-stage approach to reducing hallucination」)。原文那句收口是:没有哪一段能单独消灭这个问题,但每一段都能减少它。 2

  24. 出处:「WARNING」第 13 段(text/156-fm-warning.txt:13,搜「generates rejected responses from the fine-tuned model itself」)。那句理由(它精确瞄准模型自己会犯的幻觉模式,而不是可能对不上其失效分布的合成错误)是这条做法值得记住的原因。 第 11 段(text/156-fm-warning.txt:11,搜「a preferred response」)说明数据格式与纯文本偏好优化一致。

  25. 出处:「WARNING」第 15 段(text/156-fm-warning.txt:15,搜「negative supervised fine-tuning」)。书给了尾注。原文明说它不必像那两条路那样同时维持两到四份模型副本,而是把被拒回答里的有用信号并进标准的示范训练损失里。第 17 段(text/156-fm-warning.txt:17,搜「Connector Mixture-of-Experts」)是那种用专门化专家投影器的架构做法,它的洞见是:连接视觉与语言的那个投影层,有时受益于任务特定的专门化而非一刀切的训练。 2

  26. 出处:「Fine-Tuning VLMs for the Real World」第 7 段(text/152-fm-fine-tuning-vlms-for-the-real-world.txt:7,搜「not one but two constraints」)。原文那两句对偶是:一条漂亮的指令-回答对若错误描述了图像就一文不值;一条完全准确的图像描述若不服务于训练目标也一文不值。

  27. 出处:「Fine-Tuning VLMs for the Real World」第 9 段(text/152-fm-fine-tuning-vlms-for-the-real-world.txt:9,搜「dual competencies」)。那个「两到三倍」的成本量级书没有配调研出处。 2 3

  28. 出处:「Fine-Tuning VLMs for the Real World」第 11 段(text/152-fm-fine-tuning-vlms-for-the-real-world.txt:11,搜「annotators with radiological training」)。原文那句收口是:模型只能学到数据教它的东西。 2

  29. 出处:「Fine-Tuning VLMs for the Real World」第 79 段(text/152-fm-fine-tuning-vlms-for-the-real-world.txt:79,搜「generate draft annotations」)。那个「每小时 10 张 vs 40 张」的对照是书给的具体数字,但没有配出处。 原文明说这本质上就是第 11 章(我们的第 17 章)那套合成数据流水线搬到多模态——注意书在这里把章号误写成了第 10 章。 2

  30. 出处:「Choosing Your Annotation Strategy」第 7 段(text/153-fm-choosing-your-annotation-strategy.txt:7,搜「share systematic biases」)。原文的对策是混用模型生成与人原创的标注,并按来源分别追踪错误率;第 9 段(text/153-fm-choosing-your-annotation-strategy.txt:9,搜「locally deployed」)给了受监管行业的替代路径:用本地部署的开源模型担草稿角色,草稿质量低些,但复核修正仍胜过从零标注,而且数据不出组织。 2 3

  31. 出处:「Choosing Your Annotation Strategy」第 3 段(text/153-fm-choosing-your-annotation-strategy.txt:3,搜「The annotation format shapes what the model can learn」)与第 5 段(text/153-fm-choosing-your-annotation-strategy.txt:5,搜「not to what seems comprehensive」)。那句「从可能够用的最小标注起步,只在简单做法明确失败时加丰富度」和第 09 章那条「举证责任在复杂的那一侧」是同一个形状。 2

  32. 出处:「WARNING」第 21 段(text/156-fm-warning.txt:21,搜「Standard academic benchmarks」)。原文那句警告是:模型可能在某个基准那种受限的短答格式上出色,却在开放式的企业场景里给不出有用的回答。

  33. 出处:「Why VLM Evaluation Needs Humans」第 3 段(text/157-fm-why-vlm-evaluation-needs-humans.txt:3,搜「no such reliable proxies exist」)。这是书里一个独立的小方框。那个「狗的品种、体型、动作、神情」的例子是它最有说服力的地方。 2

  34. 出处:「WARNING」第 25 段(text/156-fm-warning.txt:25,搜「more so than for text-only models」)与第 29 段(text/156-fm-warning.txt:29,搜「VLM Evaluation Benchmarks」)。第 27 段是那张基准对照表(六个,各管一块);它的口径是:没有单一基准能覆盖某个特定应用要的东西,自动筛选之后永远接一轮领域特定的人评。 2 3

  35. 出处:「WARNING」第 3 段(text/156-fm-warning.txt:3,搜「is not a diagnostic tool」)。这是书里一个独立的警告框。那句「这些成本使微调那点投入相形见绌」是它对预算的直接含义。 2

  36. 出处:「WARNING」第 5 段(text/156-fm-warning.txt:5,搜「6.1 million instruction-answer pairs」)。书给了两项工作的尾注。第二条路(不用语言监督、编码器只在放射影像上做自监督)的价值,书明说是「对拿不到大规模配对医学数据的实践者,绕开了标注瓶颈」。 2 3