章节切分大纲 — large-vision-language-models-pre-training
这一份是动笔前的节级大纲:一节一行,每行「进来时以为 → 出去时知道」。 两头是同一件事的节已经合掉或改写(合并记录在末尾「自查」一节)。定稿后正文的节序与这里一致。
每一章除下面列出的核心原理节外,还固定带:顶层全景 / 作者的判断与证据 / 边界与局限 / 可带走的 / 原文地图。 这五段不逐行列,免得一页纸变成流水账。
避开的文件: text/55、text/56、text/57 三个文件的内容来自另一本讲模数转换芯片的书
(epub 打包 污染,约 50k 字符),一律不读不引;本书自己的索引与总参考文献因此缺失。
2026-08-29 第二稿。 按审读意见改了十处,改动清单在文末「审读意见处理记录」。 最大的一处结构改动:章数从 18 变 20 —— 原书第 1 章 §1.3(难题清单)独立成第 04 章, 原来的 08 章按外挂/内嵌切成 09、10 两章。因此 09 及以后的编号全部后移。
切法:17 章切成 20 章,不是一一对应
原书是论文合集:17 章 = 17 篇论文,编者三人自己写了其中多章,第 1 章是唯一的导游, 其余 16 章互相独立。一章对一章会让读者读到 17 篇互不相干的论文摘要,所以按新词密度重切。
四条改动都有具体理由:
| 改动 | 为什么 |
|---|---|
| 原书第 1 章 §1.2 + §1.4 → 拆成我们的 01/02/03 三章 | 它一章里塞着 CLIP、注意力、ViT、三种架构、三种目标、四类数据。这是全书新词最密的一段,也是后面 16 章的全部地基,塞不进一章 |
| 原书第 1 章 §1.3 → 独立成我们的 04 章 | §1.3「Navigating the Complexities」是 11.2k 字符、占该章正文三成的一整节,列了 14 个具名难题(算法 6 / 算力 4 / 数据 4)。它正好是后面 16 篇的问题清单,放在 04 位置上,读者往后每读一章都知道这一篇在解哪一条;而且其中八条(模态鸿沟、可解释性、持续学习、延迟、分布式与联邦学习、数据偏向、长尾、数据伦理)后面 16 篇一次都没回来处理,不给它落点就是漏掉三成正文 |
| 原书第 5+6 章合成我们的 08 | 这两章是同一条因果的两级:第 5 章证明学出来的提示词在同域漂移上更稳,第 6 章证明它跨数据集就废。分开写会把这条因果切断 |
| 原书第 7 章 → 我们的 09,第 8 章 → 我们的 10(不合并) | 原计划合成一章,实测节级大纲有 10 节、其中一节要装六张生面孔。按标准拆节 + 拆章:09 讲「在编码器外面挂东西」,10 讲「塞进每一层内部,以及让机器去搜」 |
| 原书第 10/11/12 章各自成章(我们的 12/13/14),不合并 | 检测那一章要从零讲清 DETR 的物体查询与匈牙利匹配,分割那一章要拆开注意力池化的 q/k/v,3D 那一章要讲投影四步 —— 三套机制各带 6 个以上生面孔 |
另加一章 20「回头看」:全书真正的落点不在任何一章里,而在 16 篇的共性上; 另外三件事也只能在这里做 —— 五种适配方法的横向对照(书里从来没比过)、 三处互相独立的「微调会破坏图文关联」证据、以及 2024 年 12 月之后这条线的走向。
| 原书 | 拆成 |
|---|---|
| 1. Foundations of VLMs §1.2.1 + §1.4.1 + 5. §5.3(CLIP 背景) | 01 |
| 1. §1.2.2(特征表示)+ 8. §8.3.1.1 + 11.(注意力池化) | 02 |
| 1. §1.2.2(架构/目标/数据)+ §1.4.1(连接器) | 03 |
| 1. §1.3 全节(算法/算力/数据三类难题) | 04 |
| 2. InternVL | 05 |
| 3. Multimodal LLMs for Video(InternVideo2) | 06 |
| 4. Generative Multimodal Models Are In-Context Learners(Emu2) | 07 |
| 5. Differentiable Prompt Learning(CoOp)+ 6. Test-Time Prompt Tuning(TPT) | 08 |
| 7. Learning Efficient Feature Adapters(CLIP-Adapter / Tip-Adapter) | 09 |
| 8. Neural Prompt Search(NOAH,含 Adapter/LoRA/VPT 三件套) | 10 |
| 9. Confidence Calibration(DAC) | 11 |
| 10. Open-Vocabulary Object Detection(OV-DETR) | 12 |
| 11. Unlocking CLIP for Zero-Shot Dense Segmentation(MaskCLIP) | 13 |
| 12. Adapting CLIP for 3D Understanding(PointCLIP V1/V2) | 14 |
| 13. Collaborative Diffusion | 15 |
| 14. FreeU | 16 |
| 15. AvatarCLIP | 17 |
| 16. Text-Driven 3D Human Motion(MotionDiffuse / ReMoDiffuse / FineMoGen) | 18 |
| 17. Text2Light | 19 |
| 全书 + 我们的判断 | 20 |
文件名:01-clip-shared-space · 02-inside-the-encoders · 03-architectures-and-objectives ·
04-the-hard-parts · 05-internvl-scaling-up · 06-internvideo2-time-axis ·
07-emu2-generative-pretraining · 08-prompt-learning-and-test-time · 09-adapters-and-cache ·
10-embedded-tuning-and-search · 11-confidence-calibration · 12-open-vocabulary-detection ·
13-maskclip-dense-segmentation · 14-pointclip-3d · 15-diffusion-and-collaborative-control ·
16-freeu-unet-inside · 17-avatarclip-3d-humans · 18-text-to-motion · 19-text-to-scene ·
20-what-they-all-say