跳到主要内容

回头看:16 篇论文其实在说同一句话

这一章不对应原书任何一章。 它存在的理由有四个,每个都是别处放不下的: 全书的落点在共性上、五种适配方法书里从来没比过、 「微调会破坏图文关联」有三处互相独立的证据分散在三章、 以及一个必须说清的时间戳。 它在全书链条里的位置:前 19 章各讲一件事,这一章把它们摞起来看。

⚠️ 这一章不引入任何新概念。 出现的每一个词,前面都讲过。

1. 顶层全景:一句话,四个证据,三笔账

① 落点:16 篇里 11 篇的核心动作是同一个 —— **冻住主干,只动外围一小块**

② 而且方向反直觉:**最有效的几招都是减法**
删掉两个层(8.3 → 18.5)、只调两个数、干脆不训练

③ 为什么减法有效?书里有三处互相独立的证据指向同一句话:
**微调会破坏那个模型原有的图文关联**

④ 那五种适配办法到底该选哪个?书里从没比过,我们排一张表
(**表头写死:设定不同,不可直接比较**)

⑤ 这条路线的代价有三笔,书里都写了:
推理变慢 · 学出来的东西读不懂 · 偏见照单继承
再加第 04 章那张难题清单里**八条一次没回来处理的**

⑥ 时间戳:书里的判断停在 2024 年 12 月

图说:①→②→③ 是一条因果链(现象 → 方向 → 机制),
④⑤⑥ 是三份账单。

这一章的主走查:同一个任务——把一个已经训好的图文模型适配到一个新数据集, 手上每类只有 16 张标注图——让几条路各走一遍,看四项成本。

⚠️ 这张表只有前六行可比。 它们全部来自原书第 7 章的同一张表: 同一块消费级显卡、同一个主干、同一个数据集、同一批 16 张样例。 后两行来自别的章,主干和设定都不同,列在这里只为完整,不能和上面比。

走法准确率训练时长单次推理显存换到素描版还剩多少
① 什么都不做(零样本)60.33010.22 ms2227 MiB35.44
② 只训一个线性分类器56.1313 分钟19.13
学那句话(第 08 章)62.9514 小时 40 分299.64 ms7193 MiB31.04
④ 外挂一个两层小网络(第 09 章)63.5950 分钟10.59 ms2227 MiB35.68
干脆不训练:查表(第 09 章)62.030 分钟10.42 ms2227 MiB35.90
⑥ 查表 + 微调 20 轮(第 09 章)65.515 分钟10.53 ms2227 MiB36.00
⚠️ 测试时当场学(第 08 章)不可比:另一个主干与设定0每张图要多跑 65 次前向
⚠️ 塞进每一层 + 搜索(第 10 章)不可比:主干是另一个预训练模型6.3 GPU 小时

四条读法1:

  1. 第 ② 行是负的:只在特征上训一个分类器,比什么都不做还低 4.20—— 而它换到素描版之后掉到 19.13,不到零样本的六成;
  2. 第 ③ 行的账最难看:训了 14 小时 40 分,推理慢 29 倍,显存 3 倍多, 换环境之后 31.04,反而低于什么都不做的 35.44;
  3. 第 ⑤、⑥ 行是这张表的答案:零训练拿到 62.03,而花 5 分钟就到全场最高的 65.51, 换环境之后还是最高的;
  4. 最后两行提醒你一件事:这一行的论文常常各用各的主干、各用各的样例数, 所以「谁比谁高」这种话在跨论文时基本没有意义。

2. 第一个落点:16 篇里 11 篇在做同一件事

这一节给出全书的共性,以及我们是怎么数的。

数法先写清楚

数法(我们的):逐章看一个问题——这一篇有没有从头训练、或者全参数微调一个主干? 没有的,就算「冻住主干,只动外围一小块」。

结果

类别原书哪几章篇数
造模型(从头训一个主干)第 2、3、4 章3
训了新的生成主干(只把文本编码器冻住)第 16、17 章2
冻住主干,只动外围第 5、6、7、8、9、10、11、12、13、14、15 章11

这 11 篇动的分别是什么:

原书章我们的第几章它动的那「一小块」
508喂进去那句话里的几个词向量
608同上,但只在测试时、只调一步
709编码器输出之后的一个两层小网络 / 一张查表
810塞进每一层内部的三种模块
911什么都不动,只在推理时乘一个数
1012检测器要训,但 CLIP 两个编码器全冻
1113什么都不动,只删掉两个层
1214视角之间的一个小网络(而且是第 09 章那个)
1315两个扩散模型全冻,只训两个小 30 倍的网络
1416什么都不动,只调两个数
1517三块先验全冻,只优化一个立体表示

判断(我们的,不是书里的): 这个 11 比 5 的比例,反映的不是学术偏好,是经济现实。 主干那几亿到几十亿个数,已经花掉了几百万美元; 而一个具体任务的预算是几十张标注图加一张显卡。 两边差着五六个数量级,所以「只动外围」几乎是唯一可行的形状。 如果错,会错在: 这本书的选材本身就偏向编者自己那条线(总纲第 1 节说过, 16 篇里 11 篇有编者署名)。如果换一本别人编的合集,这个比例可能完全不同。

⚠️ 两个 11 别读串了: 上面这张表数的是「冻住主干只动外围」的 11 篇, 署名那个数的是「作者行里有编者名字」的 11 篇,两批不是同一批,只是数目碰巧一样 (前者是原书第 5–15 章连着的 11 篇,后者是原书第 5、7、8、9、10、12、13、14、15、16、17 章)。

3. 第二个落点:最有效的几招都是减法

这一节把全书最反直觉的一条摆出来。

哪一章做了什么减法效果
第 13 章删掉注意力池化里的 query 和 key 两个嵌入层分割分数 8.3 → 18.5,翻了一倍多
第 16 章只调两个缩放因子,不训练、不加参数、不加显存、不加时间美学分 5.675 → 5.994,FID 43.82 → 40.79
第 09 章干脆不训练,把样例特征存成一张表来查1 张样例时就赢过训了 14 小时 40 分的对手
第 11 章不改任何权重,推理时给每一类乘一个数新类校准误差 13.84 → 7.00
第 14 章投影四步全是不带参数的几何操作零样本 23.78 → 64.22

判断(我们的,不是书里的): 这五处的共同点不是「简单」,是顺序—— 它们都先去搞清楚了那个已经训好的模型内部原本有什么,再决定要动什么。 第 13 章是先看懂了「各位置的答案一直都在,只是被平均掉了」; 第 16 章是先看懂了「主干管去噪、跳连灌高频」; 减法是理解的结果,不是节俭的结果。 如果错,会错在: 这五个例子都发生在「已训好的模型远强于你手上那点数据」的场景里。 如果新任务和它当初见过的东西差得极远,减法就不够了。 第 10 章那个「专门设备图像上反而略输」的结果,就是这个边界的一个证据。

4. 第三个落点:一句话,三处互相独立的证据

这一节做的事只有一件:把散在三章的三处实验放在一起。

那句话是:微调会破坏那个模型原有的图文关联。

证据在哪一章具体是什么它单独成立吗
① 失败实验第 13 章按常规做法拿 CLIP 权重初始化一个分割网络再一起微调:学过的类 83.4,没学过的类 3.7单独看,可以解释成「那个映射器不好」
② 消融第 08 章(依据原书第 6 章)四组可调参数里,调视觉编码器那一组最差单独看,可以解释成「那一组的训练设置没调好」
③ 对照第 12 章用蒸馏提升新类的方法,旧类从 61.8 掉到 59.5;而不动主干的做法旧类是 61.0,没掉单独看,可以解释成「那个蒸馏方案的问题」

三处放在一起才有分量,理由是它们的失败方式不同、任务不同、作者不同: 一处是分割、一处是分类、一处是检测; 一处败在没学过的类上、一处败在参数组的对照上、一处败在旧类被牺牲上。 三条独立的路指向同一个结论,这比任何一条单独的证据都强。

注意书里从来没有把这三处放在一起说过——这一节是我们做的汇合。

5. 第一笔账:这条路线的三笔代价

书里对代价的记录密度异常高,但它们散在各章。汇总如下。

代价一:推理变慢

哪一章慢在哪具体
第 08 章学那句话:文本特征不能预先算好推理慢 29 倍(299.64 ms 对 10.22 ms)
第 08 章测试时当场学:每张图要增广 64 次书里只说「变慢」,没给倍数
第 12 章每个条件都要过一遍解码器1203 类时 1.49 秒 → 23.84 秒,并行化后仍慢 6 倍以上
第 11 章(反例)基于图像的校准15.88 秒对 0.13 秒,慢 120 倍

这四行合起来说明一件事:准确率的提升,常常是拿推理时间换的。 而论文的主表里通常只有准确率那一列。

代价二:学出来的东西读不懂

第 08 章那条路学出来的是一串没有字面意思的数。 书里做过一件老实事:把学出来的向量拿去词表里找最近的词,结果读不出任何意思; 作者自己明说这不是结论、只是观察。

这正好对上第 04 章那堵「可解释性」的墙——而那堵墙全书没人回来处理。

代价三:偏见照单继承

哪一章报告了什么
第 15 章训练用的是名人脸,与普通人的长相分布有偏;还可能被用来恶意篡改真人脸
第 17 章外观设成「医生」多半生成男性,设成「护士」多半生成女性
第 19 章一切依赖 CLIP,而 CLIP 在某些词–图搭配上有偏;罕见景象生成不了

三章都只是「报告」,没有一章「处理」。

再加一笔:第 04 章那张清单的结账

第 04 章列了原书自己点名的十四堵墙,并在那一章末尾逐条核过。结论是: 六条被正面或部分处理,八条一次没回来。

没回来的那八条是:延迟与实时、多机训练与联邦学习、模态鸿沟、可解释性、 持续学习、数据偏向西方、长尾与罕见概念、伦理与隐私。

判断(我们的,不是书里的): 把这三笔代价和那八条放在一起看, 会得到一个比书本身更冷静的结论: 这是一本关于「怎么把已有模型用好」的书,不是一本关于 「怎么让这类系统可信、可维护、可上线」的书。 没回来的那八条里,延迟、联邦学习、可解释性、持续学习、伦理这五条, 恰恰是真正部署时最先撞上的如果错,会错在: 这可能只是编者划定的范围问题,不是这一行的空白—— 那五条在别的会议、别的社群里也许有大量工作,只是不在这本书的选材里。 我们没有能力从这本书内部判断这一点。

6. 时间戳:书里的判断停在 2024 年 12 月

这一节必须写,因为书里有几个判断带着明显的年份色彩。

最典型的是第 05 章那个「开源模型差在哪三处」的判断—— 那是 2024 年 12 月这个时间点上的判断。

补充(不在书里,来自通用知识): 到 2026 年, 开源与闭源之间的差距、以及「测试时多花算力去想」这条线, 都和书里写的时候不一样了——第 08 章那个「测试时当场学」的做法, 在语言模型那边已经长成了一条独立的主线。

⚠️ 这一段我们这一轮没有联网核对,所以只写到「不一样了」为止, 不给具体的模型名、日期和数字。 需要精确坐标的读者请自行查证。

判断(我们的,不是书里的): 这本书里会过时的和不会过时的,界线其实很清楚。 不会过时的是机制:图和字怎么被钉进同一个空间、注意力池化里那三样东西是什么、 扩散模型学的是噪声不是内容、UNet 里两条路各干什么——这些十年内不会变。 会过时的是排名和数字:谁比谁高几个点、哪个开源模型追上了哪个闭源模型。 所以读这本书的正确姿势是:记机制,不记排名。 如果错,会错在: 如果这一行发生了范式级的更替(比如某种全新的表示方式取代了 「把图和字映到同一个空间」这个基本假设),那连机制部分也会一起过时。 书里没有讨论这种可能性,我们也无法预判。

7. 我们对这本书的四条判断

前面各节的判断块都针对具体内容。这一节是对整本书的。

判断(我们的,不是书里的)之一:这本书今天最大的价值,是那组成本数字。 「什么是图文模型」那部分只有原书第 1 章,而且是综述口径,别处有更好的材料。 真正稀缺的是第 1 节那张表:同一块显卡、同一批样例、五种办法的 准确率、训练时长、推理时延、显存被摆在了一起。 这种数据在论文里几乎从不出现,因为它对论文的卖点没有帮助。 如果错,会错在: 如果读者关心的是「怎么从头训一个更强的模型」, 那价值排序要倒过来——原书第 2、3、4 章才是重点,而那三章更新得最快。

判断(我们的,不是书里的)之二:这本书对失败的记录密度异常高, 这是它区别于普通论文集的地方。 第 13 章先写「我们按常规做法试了,全废」; 第 08 章承认「学出来的东西读不懂」并且拒绝下结论; 第 12 章照实写慢 6 倍以上;第 14 章照实写 3D 检测的绝对分只有 11.53; 第 18 章照实写「只按语义检索比不检索还差」。 拿它当「这条路走到哪儿了」的实况来读,比当教科书读更划算。 如果错,会错在: 这些坦白多数出现在作者自己已经拿到好结果的章节里, 属于「赢了之后才敢说的失败」;真正卡死、没发表的路子,这本书里同样看不到。

判断(我们的,不是书里的)之三:读这本书要当心它的选材偏向。 16 篇里 11 篇有编者署名,而且大量互相引用、互相当对照。 一个具体后果是:「把喂给模型的那句话换成可训练的数」这一路被反复当成主要靶子来打, 五章里有四章拿它当对照。 如果错,会错在: 如果那几年这一路确实就是公认的最强基线, 那这不是选材偏向,而是合理的对照——但书里没有交代选材标准,我们无从判断。

判断(我们的,不是书里的)之四:这本书里最该被带走的不是任何一个方法, 是三个提问方式。

  1. 「这个能力是不是原本就在权重里,只是被某一步抹掉了?」(第 13 章)
  2. 「这个部件是为训练加的,推理时它还该原样保留吗?」(第 16 章)
  3. 「这条流水线里有没有哪一段是在旧数据上训的、而且绕不过去?」(第 12 章)

这三问都不需要任何算力,而书里最漂亮的三个结果正是它们各自问出来的。 如果错,会错在: 这三问都属于「在一个已经很强的现成模型上做文章」的思路。 在没有这样一个现成模型的领域里(比如书里反复提到的 3D),它们无从下手—— 那时候要解决的是「先得有一个」,而不是「怎么用好一个」。

8. 可带走的:整本书浓缩成十二条

  1. 起点是一件已经做成的事:4 亿对图文训出一个模型,配对的拉近、不配对的推远, 副产品是分类不再需要分类器;
  2. 代价有两层:算力(数千张卡、数百万美元)和下游数据太少(每类十几张)—— 第二层才是这本书所有方法的真正前提;
  3. 适配一个已训好的模型,一共三个下手处:输入端那句话、主干内部、输出端那串数;
  4. 19 个数据集上没有任何一种办法全胜,而且各自对超参极其敏感;
  5. 「换环境」有两级台阶:同一批类换个画风扛得住,换一个数据集就废;
  6. 准确率之外还有一个独立的问题:它报的把握准不准——而微调会让它对新类过度自信;
  7. 挪到检测、分割、3D 上,同一个障碍反复出现:它只见过整张图配一句话,不知道东西在哪儿;
  8. 后半本从「认」转向「造」,CLIP 从主角退成打分器—— 而打分器有天花板:它只看得懂单张图,判断不了一个过程;
  9. 16 篇里 11 篇的核心动作是同一个:冻住主干,只动外围一小块;
  10. 最有效的几招都是减法,而减法是理解的结果,不是节俭的结果;
  11. 三笔代价必须一起算:推理变慢、学出来的东西读不懂、偏见照单继承;
  12. 记机制,不记排名——机制十年不变,排名一年就翻。

9. 跳转表:想复查某一条,去哪儿

这一章不引用新的原文,所有依据都在前面各章。下面是跳转表。

本章的说法去哪一章复查那一章对应原书
那张五种办法的成本对照第 09 章第 1 节原书第 7 章
学那句话推理慢 29 倍第 09 章第 6 节原书第 7 章
换数据集就废的那组数第 08 章第 6 节原书第 6 章
删掉两个层 8.3 → 18.5第 13 章第 5 节原书第 11 章
只调两个数白捡质量第 16 章第 6 节原书第 14 章
1 张样例时零训练就赢第 09 章第 4 节原书第 7 章
新类校准误差 13.84 → 7.00第 11 章第 7 节原书第 9 章
3D 零样本 23.78 → 64.22第 14 章第 5 节原书第 12 章
微调失败:83.4 对 3.7第 13 章第 3 节原书第 11 章
提升新类不牺牲旧类第 12 章第 8 节原书第 10 章
检测慢 16 倍第 12 章第 9 节原书第 10 章
只按语义检索比不检索还差第 18 章第 9 节原书第 16 章
十四堵墙的逐条结账第 04 章第 5 节原书第 1 章 §1.3
三章各自的偏见声明第 15、17、19 章原书第 13、15、17 章

Footnotes

  1. 出处:「7. Learning Efficient Feature Adapters for Vision-Language Models」第 43 段(text/37-ch07-7-learning-efficient-feature-adapters-for-vision.txt:43,搜「single NVIDIA GeForce RTX 3090」)与第 105 段(text/37-ch07-7-learning-efficient-feature-adapters-for-vision.txt:105,搜「299.64 ms」)。表里前六行的准确率、训练时长、单次推理、显存全部来自原书第 7 章的同一张表,所以它们之间可比;「换到素描版还剩多少」那一列来自同章的分布漂移表。第 ⑦ 行(测试时当场学)出自原书第 6 章、第 ⑧ 行(塞进每一层 + 搜索)出自原书第 8 章,主干与设定都不同——第 8 章那一篇用的甚至不是 CLIP,而是一个在大型图像库上预训练的视觉主干(见我们的第 10 章开头那条警告)。「29 倍」「3 倍多」这些倍数是我们做的除法。