跳到主要内容

多模态 — 看见、听见与理解

这一章讲三件事: 「把图和字放进同一个空间」这个听起来很抽象的操作,为什么是多模态的全部地基; 图、声音、视频三条线各自多出来的那道难题是什么; 以及为什么说多模态的关键不是「传感器越多越好」,而是不同感官要在同一个事件上互相校验。

它在全书链条里的位置:前面七章都在纯文本世界里, 这一章把模型的感官打开。第 11 章的智能体要面对的环境—— 浏览器、桌面、文档、语音、摄像头——本来就是这一章铺开的复合世界。

顶层全景:三条线,一个地基

地基:对比学习把不同模态放进同一个向量空间 §2
(「这段文字和这张图是不是一对」——4 亿对数据)

统一手法:每种模态都切成词元,喂给同一个模型 §3

┌──────────┬──────────┬──────────┐
图 §4 §5 声音 §6 §7 视频 §8
多出来的难题: 多出来的难题: 多出来的难题:
空间关系、 语气、打断、 时间一致性——
计数、小字 情绪、背景声 这一维最贵
└──────────┴──────────┴──────────┘

生成:先把图破坏成噪声,再学着还原 §10

真正的问题:声音和画面在同一个事件上互相校验 §9 §12

图说: 这一章的名词很多,但结构就三层: 一个地基(同一空间)、一个手法(都变词元)、一个真正的问题(互相校验)。 三条模态线只是在这个骨架上各自加一道难题。

1. 隔着一层语言描述的世界

五六年前,要让计算机看懂一张菜的照片,大致得这样: 先收集几万张菜的照片,每张人工打上标签——「麻婆豆腐」「鱼香肉丝」「番茄炒蛋」—— 然后训练一个专门的菜品分类器(只见照片就报菜名的模型)。今天,你可以直接把照片拍给一个通用的对话模型, 问「这是什么?怎么做?」,它会告诉你菜名、说出可能用到的调料和大致步骤, 甚至接住你「能不能用豆腐代替鸡蛋」之类的临场问题1

纯文本模型有一个天然局限:它对世界的接触,始终隔着一层语言描述2。 很多信息本身就不容易被文字完整表达:一张复杂图表的视觉结构、 一段音频里的语气变化、一个动作发生的时间顺序、 界面布局里按钮与状态之间的空间关系。 对人类来说这些信息是直接可感知的; 对纯文本模型来说,它们只能通过别人先写好的描述间接进入系统。

书里那份财务报告的例子很准:报告里既有正文,也有表格、图表和截图, 「只会处理文本」就会捉襟见肘——它也许能读懂正文, 却未必能把图中的趋势、表格里的对齐关系和页面布局整合起来。 多模态的价值,在于打通这些被分开的感知通道, 少了中间这道人工转写,模型看到的才是任务里真正的原始证据3

先立一个词:模态指的是信息呈现自身的形式——文字、图像、语音、视频、触觉, 各是一种模态。这本书从这一章起会密集使用它。

2. 同一个空间:4 亿对「是不是一对」

变化背后有一次方向上的转折。2021 年前后,一系列研究开始把互联网上 「图像-文字成对出现」的海量数据直接变成训练信号。 其中一个代表路线的做法并不复杂:它不为任何特定分类任务预先设计标签, 而是让模型学习「这段文字和这张图是不是一对」4。 这套思路一旦打通,模型就不再被某个数据集的固定词表框住, 而是在海量配对里逐步学到「大多数视觉概念在语言中大致对应什么」5

这个代表路线叫 CLIP,2021 年发布,用了约 4 亿对来自互联网的图文数据: 让配对的图文在空间中靠近、不配对的远离6。 它用的正是第 05 章 §4 讲过的对比学习——不预测具体值,只学习「谁和谁相似」。 书里那张地图的比方很好记:CLIP 做的事,就是让「猫的照片」和文字「猫」住得近一点, 让「狗的照片」和文字「狗」住得近一点,同时把不相干的东西推开7

把「空间」说得具体一点。第 03 章讲过,每个词元在模型内部是一串数字(向量), 串里的每个数可以想象成地图上的一个坐标——几千个坐标就构成一个向量空间 (所有这样的串组成的巨大空间,相似的含义在其中住得近)。 CLIP 的关键动作,是让图和字住进同一个这样的空间。

这一步看起来平凡,却影响深远。书里点出了它的推广逻辑: 只要两种数据形式能找到大规模天然配对——图与说明、视频与字幕、音频与转写、代码与文档—— 就可以用同一套办法推进对齐。 音频-文字、视频-文字、代码-文字的模型陆续验证了这种通用性, 对比学习因此成了跨模态(横跨图像与文字等不同形式)对齐的「通用粘合剂」8

对齐之后,三件事立刻成为可能: 零样本(不训练、直接上手)分类——不给它专门训练,给它一张图和一组候选文字, 比较哪段文字与图最接近就行(把候选类别写成「一张{类别}的照片」,挨个算相似度); 跨模态检索——用文字搜图、用图搜文字; 文生图的条件信号——CLIP 自己并不会画图, 但它替会画图的模型解决了「到底要画什么」这件事: 一个不会生成的模型,也能支撑起整个生成生态9

3. 都变成词元:拼接式和原生两条路

地基之外,另一个关键是第 03 章那套结构本身: 只要某种输入能被切成一串词元,就有机会纳入同一套处理框架10

模态怎么切
文本天然是词元序列
图像切成小块,每块当作一个词元
视频切成时空块,每块是「时间 × 空间」的词元
音频切成片段或频谱特征,每段一个词元

一旦不同模态都变成了词元序列,就可以混在一起喂给同一个模型处理11

但「什么时候开始混」分成了两条路线,这道选择题贯穿全章:

拼接多模态:在原有大语言模型的基础上,通过后训练加上其他模态—— 用专门的编码器处理图像或语音,再把输出送给语言模型。 前面像「翻译官」,把图像翻译成语言模型能读懂的向量;后面像「总编辑」,负责组织回答。 原生多模态:从训练开始就用多模态数据训练一个统一模型, 文字、图像、音频不是后来临时接上的插件,而是在模型内部共同参与表示和生成12

书里的对照很传神:拼接式像给一个文字专家配上摄影师和翻译; 原生式则像从小培养一个既会读书、又会看图、还会听声音的人。 原生通常潜力更大——不同模态能在内部深度融合, 省去先「翻译」成文字再处理那一步; 代价也明显:训练数据更复杂、算力更贵、评估更难13。 §10 会再回到这两条路线。

4. 从看图说话到围绕图对话:视觉编码器、投影层与两阶段训练

目前最成熟的多模态方向是视觉语言模型。 CLIP 已经把图和字推进了同一空间,但它本质上是个「打分器」—— 能判断哪段文字最配一张图,却不会围绕这张图自然交流14。 后来的模型换了条路径,要回答的问题是: 一个本来只认识文字的模型,怎么「看到」图像?答案很简洁:把图像变成词元15

主流结构由三个模块组成,这一节值得慢读16:

模块一:视觉编码器。 把图像切成小块—— 比如每块 14×14 像素,一张 224×224 的图被切成 16×16 = 256 块, 每块对应一个视觉词元(图像切出的小块在模型里的向量形式,地位等同于一个文字词元)。 常用 CLIP 训过的编码器,它产出的向量已经和语言对齐得比较好。

模块二:视觉投影器。 一个小网络,负责把视觉向量「翻译」到语言模型能理解的空间。 它要学会把「图片里的红色小汽车」这种视觉特征, 搬过去,落到和文字「红色小汽车」相似的向量上。 训练时,这个小网络的参数最关键。

模块三:语言模型本身,不变。 投影器输出的视觉词元和原本的文字词元合在一起,组成一条序列喂进去。 模型不知道某些词元「不是字」——它只看到一串向量, 做它平时做的事:注意力、推理、生成回答17

这个「视觉编码器 + 投影器 + 语言模型」的简洁结构, 就是 2023 年在开源社区爆红的一条架构路线。 书里那个比方很准:它有点像给一个只会读文字的学生配了一副眼镜—— 眼镜本身不负责写作文,但它把画面转换成学生能理解的线索18

训练通常分两阶段,各训一块:

阶段冻住谁训谁用什么数据学会什么
一:特征对齐视觉编码器和语言模型投影器图文对(图 + 一句话说明)「视觉 → 语言」的翻译
二:视觉指令微调视觉编码器语言模型(或只动低秩适配)「图 + 问 + 答」三元组从看图说话到针对图回答问题、基于图做推理

第一阶段相对便宜,因为大部分参数不动;第二阶段走完, 模型才从「描述模型」变成「对话模型」19

还有一个工程细节值得记:视觉词元一旦多起来(高分辨率图、多图、视频), 会迅速吃掉语言模型的上下文预算——一张图 256 个词元, 十张图就是 2560 个,还没开始聊天,窗口先去了大半。 于是一类做法用一组「查询词元」(通常 32 个)通过注意力去「提炼」视觉特征, 把几百个视觉词元压缩成 32 个,代价是牺牲一些细节20

能力上,这类模型早已不止「看图说话」。 以 2023 年前后的系统为代表,它们从「给图贴标签」走向了「围绕图像对话」: 给一张菜单照片,它能帮你找素菜;给一张手写公式照片,它能尝试认出符号并给出解题思路21。 这种能力在视障人群里引起了极大反响——读药瓶说明、看收据金额、判断衣服搭配, 很多过去无法独立完成的事变得可能。 有应用在 2023 年把视觉模型接入视障服务,用户拍下任何东西, AI 就用一段自然语言把画面描述清楚。 书里的评价很重:它让一部分人第一次能独立完成原本要依赖他人的事22

5. 视觉模型的短板:看起来是「看见了」,实际可能是「合理地猜了」

这一节是全书最该记住的警告之一: 视觉语言模型很容易暴露一种典型问题——它看起来像是「看见了」, 实际却可能只是「合理地猜了」23。 看错图片里的小字,却用非常自信的语气解释; 根据文字问题,脑补图中不存在的物体。 这些错误会被语言模型流畅的表达掩盖掉—— 系统不能只会生成一段像样的话,还得真的把视觉证据和结论对应起来。

书里列了几类典型短板,按理解和生成两侧分开24:

短板长什么样
理解空间推理「A 在 B 的左边」「C 在 A 和 B 之间」这类关系仍然较弱
理解计数图中有几个物体常常数不准,多于 5 个时尤其明显
理解细节小字、细微纹理识别不稳定
理解专业领域病理切片里的「异常细胞」和普通照片里的「猫」不是同一种难度,需要专门训练
生成一致性同一个角色在不同图中保持一致外貌仍然困难
生成物理合理性手指数量、物体穿插、光影方向偶尔出错

文档理解场景尤其能暴露问题的真正位置: 很多时候,模型并非识别不出单个字, 而是不能稳定地把版面、表格、图示和正文逻辑整合起来。 多模态的难点并不总在感知最底层,而常常出现在「感知之后如何组织信息」这一层25

6. 声音:级联和原生,丢掉语气的代价

与图像相比,音频的挑战更特殊:它天然带有时间展开结构26。 书里那个例子人人都有过:闭着眼睛走进厨房,光听「滋啦」一声就知道锅里下了油; 听到杯子落地的清脆碎裂声,不用看也会心里一紧。 声音里除了文字内容,还裹着语气、节奏、情绪、背景声和环境事件—— 把声音转成文字只是第一步27

先把语音两端的老技术各用一句话带过。 语音识别(把语音转成文字)很老,但 2022 年一个开放模型用 68 万小时的多语言数据 把这个领域往前推了一大步——68 万小时,相当于一个人不吃不喝连听 78 年。 它的骨架值得知道名字:先把声音切成小片、算出每片里各种频率的强弱, 排成一张「时间 × 频率」的二维图(这张图叫梅尔谱, 相当于一张「声音的照片」),再交给模型像读图一样读出文字28语音合成(把文字转成语音)经历了拼接式、参数式、神经网络式三代, 今天最强的一批已接近真人;2023 年有工作把音频也离散化成「音频词元」, 只给约 3 秒提示音,就能合成接近该说话人声线的新语音—— 从此「听起来像某人」不再等于「真是某人说的」29

这一波真正的变化,不在识别或合成各自变强,而在它们怎么和语言模型结合。 两种思路30:

级联(一段接一段):语音识别把用户说的话转成文字 → 语言模型读文字生成回答 → 语音合成把回答读出来。每一步都用最成熟的模型,拼起来就是产品。 问题也很明显,书里列了三条: 延迟高——三段串联,端到端(从你开口到它作答的全程)容易停留在秒级; 丢失非语言信号——转成文字后,用户的语调、情绪、重音、叹息、笑声全都不见了, AI 回答时照着文字念,语气是「中性」的; 不会「打断」——人类对话里一方会在另一方没说完时接话、补充、「嗯」一声鼓励对方继续, 级联系统做不到31

原生语音:把语音也变成词元,让语言模型直接处理。 整套架构三块:音频分词器把波形切成一段段「语音词元」—— 其中语义词元编码「说了什么」,声学词元编码「音色、语气、韵律、背景」, 两类结合才能既表达内容又保留声音特点; 语言模型在文字词元和语音词元的混合序列上做预测; 最后由声码器(把语音词元还原成可播放的波形的部件)还原成声音32

这套架构带来的能力,正是级联做不到的三件事: 低延迟流式——语音词元一个个生成,生成一个就可以喂给声码器播放, 端到端延迟可以降到几百毫秒量级,接近真人对话 (2024 年 5 月,大众第一次强烈感受到这种体验); 保留语气——AI 回答时不必永远像机场广播,可以兴奋、安抚、讲故事, 甚至故意压低声音制造悬念; 全双工——「听」和「说」并行建模,AI 可以一边听你说话一边思考怎么回应, 必要时插话、附和、打断33。 书里那句总结可以带走:具体模型名称会变化, 但「把语音直接变成可预测的词元」这条路线会长期存在34

7. 音频理解:不只是「听懂字」

语音识别只解决了一件事:把「说了什么」转成文字。 但声音里有远多于文字的信息:狗叫、玻璃碎裂、音乐的风格、 说话人的情绪、背景噪音的类型。音频理解要听懂的就是这些非语言信息35

原理和视觉语言模型相似:先用音频编码器把声音变成向量,再送给语言模型理解、回答。 早期代表是 CLIP 的音频版——用大规模「音频-文字」对做对比学习, 把「一只狗在叫」「古典钢琴曲」「雷雨声」这样的声音和描述映射(在数学上对应摆放)到同一个向量空间, 从而支持零样本的音频分类和搜索36。 到了音频-语言大模型阶段,模型可以回答这样的问题: 「这段音频里几个人在说话?」「背景音乐是什么风格?」 「说话人听起来紧张还是开心?」「刚才是不是有玻璃破碎声?」37

这些能力对应的应用已经很实:音频内容审核(检测危险声音)、 安防监控(识别玻璃破碎、呼救等异常)、 无障碍辅助(告诉听障用户「门铃响了」「婴儿在哭」)、 生态监测(识别野生动物鸣叫)38

如果再把画面加进来,音频理解就从「听见了什么」变成 「这声音属于谁、从哪里来、和画面里的哪件事有关」。 同一段狗叫声,单独听只能知道附近有狗;连同视频看, 模型才可能判断狗在画面内还是画面外。 这个区别很重要,因为很多真实任务并不满足「声音和画面一一对应」—— 会议里有人离麦克风很远,街景里有画外车辆,监控里警报声可能来自隔壁房间。 模型必须学会保留这些不确定性,别把所有声音都硬绑到可见物体上39。 这条线索 §9 会展开成整整一节。

8. 视频:多出来的那一维叫时间

如果说图像增加的是空间维度,视频增加的就是时间维度40。 一个人「拿起杯子」和「放下杯子」,单帧看起来可能相似, 真正的区别在于动作顺序——模型若只把视频当作很多张独立图片, 就会失去真正重要的时序结构。

书里那个对比让人忘不了:一张图错了,最多是一只猫多长了一条腿; 视频错了,这条腿还可能前一秒在左边,后一秒瞬移到右边,第三秒顺便把桌子穿过去。 视频理解和视频生成的难点,正是让画面在时间中保持一致41

理解侧,主流做法是把视频当成一串有序的图,在视觉语言架构上扩展四步: 抽帧(按固定间隔抽,比如每秒 1 帧——一个 40 分钟的视频抽成 2400 帧)、 每帧编码成视觉词元、按时间顺序串成一条很长的序列(帧之间可以插入时间戳——标明第几秒的标签)、 交给语言模型处理42。 最大挑战是上下文长度:每帧几百个词元,一部电影展开就是上百万词元, 远超多数模型的窗口。应对办法有降帧率(「有变化的段多抽、静止段少抽」)、 词元压缩(每帧 256 个词元压到 32 个甚至更少)、 层级式处理(先粗看整体,每 10 秒采 1 帧,发现可疑段落再回去细看)43。 书里那个比方很形象:就像看监控回放,2 倍速还能看懂, 200 倍速就只能祈祷自己不要错过重点了44

生成侧更难。图像模型只要在一个瞬间里「看起来合理」; 视频模型必须让几十到上百帧的内容都连贯:一个人从椅子上站起来, 衣服褶皱要跟着动,脚不能穿过地板,杯子不能忽然变成两只, 镜头切换时人物长相还要一致。 书里一句话点破:难度不在「多画几张图」,而在让这些图在时间中组成一个可信的世界45

当前最有代表性的路线需要两个关键技术,名字都该留: 直接在像素上做生成对视频太贵——一段 10 秒、每秒 24 帧、1080p 的视频, 全部像素值在数亿到十亿级——所以先用一个视频压缩器把它压到低维的隐空间 (一个信息密度更高的压缩表示空间,在那里一个向量对应一小块时空, 而不是一个像素),时空同时缩小,整段视频变成一个小得多的「立方体」, 生成在这个隐空间里进行,完成后再还原回像素46; 然后,去噪的骨干网络改用那套熟悉的结构——把隐空间立方体切成一个个时空小块, 每块当作一个词元来处理,这让「画面里有什么」和「这些东西应该怎么动」 有机会被同时记住(但并不自动保证物理一致)47。 这条路线就是公开报告里那个知名视频生成模型(从文字直接造出视频的那类生成模型)所用的,所以它常被当作典型代表。

视频生成仍有五大挑战,书里列得很干脆: 时间一致性(不能一个镜头里狗突然长出第五条腿——这仍然是最容易穿帮的地方)、 物理合理性(水流、火焰、布料、头发仍然出错)、 长度(几秒钟的短片和几小时的电影不是同一种工程)、 一致的角色音画同步(嘴型、对白、脚步声对不上,观众立刻出戏)48。 所以书里判断:未来的进步,比「分辨率更高」更要紧的是 时间更稳、物理更可信、角色更一致、控制更精细49

9. 音画智能:声音和画面要互相解释

视频章节的最后一道挑战——音画同步——留下了一个看似不起眼的问题, 把它拉下去,会发现远不止「嘴型对不对得上」。 真实世界里,声音和画面很少分开出现:你在厨房听见「啪」的一声, 转头看见地上的碎玻璃——理解发生了什么,靠的不是单独的声学分类, 也不是单独的图像识别,而是把声音的时间线和画面的空间线索绑在一起: 哪个物体发声、什么时候发声、声音是不是来自画面之外、 画面里的动作有没有产生这个声音。 2026 年一篇综述把这个方向整理为音画智能, 覆盖理解、生成和交互三条主线50

书里按三层来看这件事:

理解世界:模型要回答的不止「视频里有什么」,还有 「声音从哪里来」「画面里的哪件事导致了这段声音」「这个事件有没有发生在画面外」。 一个会看视频的模型如果忽略声音,可能看不出门外有人敲门; 一个会听声音的模型如果忽略画面,又不知道这声「砰」是关门、掉书,还是杯子碎了51

创造世界:视频生成若只是先生成无声画面、再随便配一段音轨,就容易处处穿帮。 真正难的是让脚步声跟步伐对上、让雨声跟画面里的雨量一致、 让玻璃碎裂声出现在撞击之后而不是之前—— 真正高质量的生成,需要画面和声音共享同一条事件线52

进入世界:在对话助手、游戏角色、机器人和智能体里, 音画已经从被动的输入材料,变成了交互状态的一部分—— 用户还没说完时的停顿、屏幕上闪过的按钮、房间里突然响起的警报、 机器人夹爪接触物体时的声音,都可能改变下一步动作53

这一节的结论值得原样带走:多模态的关键不在「传感器越多越好」, 而在不同感官能否在同一个事件模型里互相校验。 声音提供时间、节奏、情绪和不可见线索;画面提供空间、对象、动作和可见证据。 两者对不上时,系统该做的不是硬猜,而是把不确定性如实暴露出来—— 也许声音来自画外,也许视频被剪过54。 这条要求会贯穿后面的智能体章节:一个会行动的系统, 必须知道自己听见的和看见的到底是不是同一件事。

10. 统一多模态与生成:先把图破坏成噪声,再学着还原

多模态的另一半是生成。谈生成,绕不开扩散模型—— 它的做法很反直觉:先把图破坏成噪声,再训练模型把噪声还原回图。 具体说,先把一张干净图逐步加噪到完全的随机噪声, 再训练一个网络逐步去噪;生成时从随机噪声出发,一步步去噪,最终得到一张新图。 这条路比直接生成像素更稳定:每一步只学「下一步该去掉多少噪声」, 比「凭空画出整张图」容易得多55

文字怎么进来?把文本提示编码成向量,在每一步去噪中作为「条件」参与计算—— 模型学到的不只是「怎么画图」,而是「给定这段文字,应该画成什么样」。 CLIP 的文本编码器在这里又派上用场:它产出的向量已经和图像对齐过, 用它做条件相对自然——§2 埋的那条线在这里收上了56。 另外,直接在像素上做扩散对一张 1024×1024 的图也太贵, 主流做法是先把图压进隐空间再扩散,生成完再还原—— 算力成本下降几十倍57

统一的两条路线在这里合流。 拼接式(§3)之外,原生统一的代表动作发生在 2024 年 5 月: 有模型从训练阶段就让模型同时接收文本、图像、音频,输出也可以是三者之一—— 语音对话延迟降到几百毫秒,能直接「听」用户的语气、笑声、停顿,回答时也能带情感, 这种端到端的体验是「识别 + 语言模型 + 合成」三段式做不到的58。 再推到极致是「任何模态进、任何模态出」: 把所有模态都转成离散词元——文字、图像、语音、音乐各用一个分词器切成离散序列, 在同一个模型的混合词元序列上做预测,输出再用对应解码器还原。 有开源研究模型在 2024 年证明了这条路的可行性, 让「任何进、任何出」不再只是大公司的产品想象59

但书里也留了一句冷静的话:原生统一的难点不只是「能不能做出来」, 而是**「做出来的质量能不能稳」**。 文本生成被打磨了很多年,错一个字就显眼;图像可以容忍一定的「创作性」; 音频对节奏和音色要求又高——把这些不同标准放在一个模型里同时优化, 是工程上的多目标平衡。 当前大多数原生统一模型,文本仍略弱于专门的文本模型, 图像仍略弱于专门的图像模型:统一是趋势,专业化短期内仍有它的位置60。 更可能的长期形态是「部分统一、部分专门化」: 核心推理层越来越共享,感知前端和生成后端仍按模态差异保留专门设计—— 多模态统一的目标不是抹平差异,而是在保留差异的前提下建立协作61

11. 它今天在替谁干活

多模态早已走出实验室。书里按行业扫了一遍,挑四个最能说明问题的。

无障碍:技术在这里没有半点炫技。 视障用户过去常常需要请人类志愿者描述画面; 现在 AI 可以帮助读药瓶标签、看菜单、识别快递单、检查衣服颜色是否搭配。 听障用户靠实时字幕把电话、视频、现场对话转成文字,多人会议转写还能标出「谁在说什么」。 还有声音银行:让罹患渐冻症这类疾病的人在丧失说话能力前录下自己的声音, 日后用接近自己声线的合成语音交流——相比过去机械感十足的合成器, 这是一种更有尊严的表达方式62

教育:那个永远不会翻白眼的陪练。 有产品在 2023 年推出基于大模型的家教:学生把自己写的数学题拍给 AI 看, AI 不直接报答案,而是像苏格拉底一样反问、引导—— 「这一步你用了什么公式?为什么选这个?」 教育学上有个著名的难题:高质量一对一辅导能显著改善学习效果,但供给极其稀缺。 多模态 AI 的希望正在这里:把「看学生写到哪一步」和「用语言引导下一步」结合起来63。 语言学习也类似:过去最稀缺的资源是耐心陪练, AI 至少可以先当那个永远不会翻白眼的陪练64

创作:从「空白画布上硬画」到「提出方向、筛选方案、精修结果」。 很多设计师会先用 AI 快速出几十个方向,再挑一两个继续细化。 2022 年,一幅 AI 生成作品在美国一个州博览会上获奖, 引发了「AI 作品算不算艺术」的全球争论——这个故事的分量不在那张图本身, 而在它把一个问题摆到了所有人面前: 当创作门槛下降后,艺术家的核心能力究竟是手上的笔,还是脑中的审美和判断?65 「一人公司」这个说法的流行,背后就是多模态工具把原本分散在 编辑、设计、摄像、剪辑这些岗位上的能力,压缩到了个人工作台上66

医疗:必须停在辅助层。 医疗天然是多模态的:病历(文字)、影像(图像)、心电脑电(信号)、基因(序列)、对话(语音)。 模型从眼底扫描图像中识别多种眼病并给出转诊建议,已是医学 AI 的经典案例。 但书里三次强调边界:医学影像 AI 不是「看一眼就替医生下结论」, 而是辅助筛查、辅助报告、提示风险; 考试分数可以说明模型掌握了不少医学知识,但不能直接等同于临床可靠性—— 真实医疗场景有病人差异、设备差异、责任边界、隐私合规和监管审批,远比选择题复杂; AI 在临床决策中始终停在「辅助」这一层,最终拍板的还是医生67

12. 评测与边界:答案对了,证据可能是错的

多模态能力越强,评测就越不能只看语言表面输出—— 一段回答文字看起来很流畅,并不代表模型真的读对了图、听对了音。 相比纯文本,多模态系统的失败模式更隐蔽:错误往往藏在感知环节, 最后却以非常自然的语言形式出现68

书里最值得记住的是「联合评测」这一层: 模型的答案可能正确,却用错了证据。 问「杯子为什么碎了」,模型只看画面猜到答案,并没有真正利用碎裂声; 或者只听到警报声就断定画面里有危险,忽略了警报可能来自画外。 所以好的评测不能只看最终答案, 还要尽量检查模型是否真的依赖了该依赖的模态69。 多模态输出看起来更「有证据」——一张图、一段音频、一段视频摆在那里, 用户更容易放松警惕,因此这类系统需要更明确的不确定性提示和出处追踪70

其余几类挑战,一句话一个: 模态对齐——不同模态的信号有根本差异(密度、时间特性、抽象层级都不同), 让模型从浅层就合理融合而不是简单拼接,是最难啃的一块; 音画因果——声音和画面即使时间上对齐,也不等于因果上对齐; 评估困难——综合多模态能力的评估至今没有标准, 没有好的评估,进步很难量化; 计算成本——视频训练尤其贵,一段一分钟每秒 24 帧的视频展开是 1440 帧, 每帧又是高分辨率图像,前沿多模态模型只有少数几家大公司训得起; 隐私与同意——图片里有脸,语音里有声纹,视频里有家庭环境和地理线索, 多模态数据比纯文字更容易暴露个人身份,也更难抹掉身份痕迹(匿名化——把「是谁」的信息洗掉——对图像声音尤其难); 来源与水印——当图像、音频、视频都能生成, 社会需要知道「这段内容从哪里来」,这是长期的攻防71

边界也要画得更清楚:一个会看医学影像的模型,并不自动意味着它可以独立做医学判断; 多模态系统尤其容易因为「看起来很懂世界」而被高估, 高风险场景里,证据溯源、人工复核和权限边界仍然不可缺少72。 书里那句关于未来的提醒,放在这一节正合适: 一个全感官助手如果没有权限边界,就不是助手, 而是一个住在手机里的八卦邻居73

主走查:一张麻婆豆腐照片,从像素到「能不能用豆腐代替鸡蛋」

这条走查贯穿本章。 你拍了一张麻婆豆腐的照片,问模型「这是什么?怎么做?」, 再追问「能不能用豆腐代替鸡蛋」。跟着这三句走完本章的承重机制。 凡不是书里给出的数,都当场标明是为演示编的。

① 先验一验「这张图和这句话配不配」。(§2) 在 CLIP 空间里,「麻婆豆腐的照片」这个向量和文字「麻婆豆腐」的相似度是 0.31, 和「鱼香肉丝」是 0.22,和「飞机」是 0.02(这三个数是为演示编的)。 注意:这一步本身不会回答任何问题,它只是证明了图和字住在同一个空间里—— 后面所有的「看图回答」都站在这个地基上。

② 照片被切成视觉词元。(§3 §4) 照片是 224×224 像素,按 14×14 一块切开,得到 16×16 = 256 块, 每块经过视觉编码器变成一个视觉词元。 照片从此不再是照片,而是 256 个向量——地位等同于 256 个文字词元。

③ 投影器把它们「翻译」进语言模型的空间。(§4) 每个视觉词元过一遍投影器:那块有红色油光的区域, 被映射到和文字「红」「辣」「油」相近的向量(这个对应关系是为演示编的)。 这一步就是两阶段训练里第一阶段单独训出来的那块小网络—— 视觉编码器和语言模型当时都被冻住,只有它在学「视觉 → 语言」的翻译。

④ 视觉词元和文字词元排成同一条序列。(§4) 你的问题「这是什么?怎么做?」切成 8 个文字词元(这个切法是为演示编的), 接在 256 个视觉词元后面,组成一条 264 个词元的序列。 语言模型不知道前 256 个「不是字」——它只看到一串向量, 做它平时做的事:注意力、推理、生成。

⑤ 逐词生成回答。(§4) 「这是麻婆豆腐,一道川菜。家常做法:嫩豆腐切块焯水, 锅里下油炒香豆瓣酱和肉末,加豆腐轻推,勾薄芡,撒花椒粉和葱花。」 注意这段回答里的「豆瓣酱」「花椒粉」并不全在图里—— 一部分来自视觉证据(红色汤汁、块状物),一部分来自语言模型里「麻婆豆腐怎么做」的统计知识。 这正是 §5 那条警告在这条走查上的样子:它看起来是「看见了」,其中有一部分是「合理地猜了」。

⑥ 追问「能不能用豆腐代替鸡蛋」。(§4 §5) 追问的文字切成词元接在序列后面——256 个视觉词元还在上下文里,照片不用重发。 模型回答:「这道菜本来就是豆腐做的,你是不是想问别的菜?比如鸡蛋类的菜里……」 它能接住这个临场问题,靠的是视觉词元和对话词元同在一条序列里—— 这就是 §4 说的「围绕图对话」,而不是「给图贴标签」。 但如果你追问的是「盘子左边那小碟是什么」, 它就踩在 §5 的短板上了:空间关系和小物体,正是它最容易「合理地猜」的地方。

作者的判断与证据

书里给了硬证据的地方:

  • CLIP 的数据规模(约 4 亿对图文)和零样本分类的做法 (候选类别写成「一张{类别}的照片」),来自原论文的描述69;
  • 三模块结构和 256 个视觉词元的具体数字(224×224 图、14×14 一块、16×16=256), 是书里给的明确算式16;
  • 语音模型 68 万小时的训练数据,来自论文报告28;
  • **「延迟降到几百毫秒」**是产品发布时的公开展示数字33;
  • 视频像素的数量级(10 秒 1080p 视频数亿到十亿级),是可复算的估算46

书里明确标成判断或趋势的地方:

  • **「多模态统一的目标不是抹平差异」**和「部分统一、部分专门化」的长期形态, 是作者的架构判断,不是共识61;
  • 「统一是趋势,专业化短期内仍有它的位置」,书里给了证据(各项略弱于专门模型), 但「短期」有多长,没有答案60;
  • 音画智能的三条主线(理解、生成、交互),来自 2026 年一篇综述的整理框架50

判断(我们的,不是书里的): 这一章三条模态线的难度排序—— 图最成熟、声音次之、视频最难——本质上是由**「配对的天然监督信号有多少」**决定的。 图有 4 亿对图文;声音有字幕和转写,但量级小得多; 视频里「声音和画面在同一事件上」的监督几乎全靠自己同步, 没有人为它标注。所以视频的突破不会来自「更大的图模型加一维」, 而会来自谁能找到视频版的「4 亿对」。 如果错,会错在: 合成数据(用模型生成带完整标注的视频)可能补上这个缺口, 让「天然配对」不再是瓶颈——书里对合成数据在视频上的作用着墨很少。

边界与局限

  • 这是全书最长的一章原书,应用部分(8.8)我们只保留了四个行业。 办公、游戏、机器人等节在书里有更细的描述;机器人那半节与第 15 章有重叠,留到那里展开。
  • 具体产品名和版本全部有时效性。 书里自己也说「真正值得记住的是能力结构」。
  • 图像生成的编辑工具链(挖空补画、姿态控制、风格适配)只点了一句; 音乐生成的版权一节(那首被下架的 AI 歌曲)并进了 §11 的判断里,没有单独展开。
  • **视频生成的另一条路线(离散词元加自回归——像写字一样一个接一个往外吐)书里讲了一节,**我们只留了一句「两条路线还在竞合」。
  • **「梅尔谱」「声码器」这类音频部件只给了功能解释,**信号处理的推导(傅里叶变换那一步)略过。

可带走的

  1. 纯文本模型对世界的接触,始终隔着一层语言描述。 少了人工转写,看到的才是原始证据。
  2. 多模态的地基是「同一个空间」: 4 亿对「是不是一对」,把图和字对齐到能互相比较。
  3. 统一的手法是「都变成词元」,三模块记住:视觉编码器切块、投影器翻译、语言模型不变。 训练分两阶段,先训翻译,再训对话。
  4. 它看起来是「看见了」,实际可能是「合理地猜了」;答案对了,证据可能是错的。 空间关系、计数、小字、专业影像是四类稳定软肋,评测要检查它真的依赖了该依赖的模态。
  5. 级联丢掉的三样东西:延迟、语气、打断;音频理解也不止「听懂字」。 原生语音把语音直接变成词元,三样都捡回来。
  6. 视频多出来的那一维叫时间。 一张图错了是多条腿,视频错了是腿在时间里瞬移。
  7. 多模态的关键不是传感器越多越好,而是不同感官在同一个事件上互相校验。 对不上时,该暴露不确定性,而不是硬猜。
  8. 扩散模型一句话:先把图破坏成噪声,再学着还原——每一步只学「该去掉多少噪声」。
  9. 统一是趋势,专业化短期内仍有位置。 长期形态大概是「部分统一、部分专门化」。
  10. 边界两条:医疗必须停在辅助层;没有权限边界的全感官助手,不是助手,是住在手机里的八卦邻居。

原文地图

主题原书节原文位置
菜品分类器到通用对话8 引言text/09-ch08.txt:10(搜「然后训练一个专门的菜品分类器」) · text/09-ch08.txt:12(搜「它会告诉你菜名」)
隔着一层语言描述8.1text/09-ch08.txt:32(搜「始终隔着一层语言描述」)
少了人工转写8.1text/09-ch08.txt:48(搜「少了中间这道人工转写」)
是不是一对8 引言text/09-ch08.txt:17(搜「这段文字和这张图是不是一对」) · text/09-ch08.txt:19(搜「固定词表框住」)
CLIP 与 4 亿对8.2.1text/09-ch08.txt:58(搜「约 4 亿对来自互联网的」) · text/09-ch08.txt:59(搜「配对的远离」)
地图比方8.2.1text/09-ch08.txt:73(搜「想象成一张地图」)
通用粘合剂8.2.1text/09-ch08.txt:108(搜「大规模天然配对」) · text/09-ch08.txt:111(搜「通用粘合剂」)
不会画图但解决了画什么8.2.1text/09-ch08.txt:84(搜「a photo of a」) · text/09-ch08.txt:113(搜「并不会画图」)
都变成词元8.2.2text/09-ch08.txt:118(搜「能被表示成词元」) · text/09-ch08.txt:124(搜「每块当作一个词元」)
拼接与原生8.2.2text/09-ch08.txt:133(搜「拼接多模态」) · text/09-ch08.txt:144(搜「摄影师和翻译」)
打分器8.3text/09-ch08.txt:149(搜「本质上是个“打分器”」)
把图像变成词元8.3.1text/09-ch08.txt:189(搜「把图像变成词元」)
三模块与 2568.3.1text/09-ch08.txt:192(搜「16 × 16 = 256 个 patch」) · text/09-ch08.txt:196(搜「红色小汽车」) · text/09-ch08.txt:198(搜「不知道某些词元」)
眼镜比方8.3.1text/09-ch08.txt:202(搜「配了一副眼镜」)
两阶段训练8.3.1text/09-ch08.txt:207(搜「第一阶段是特征对齐」) · text/09-ch08.txt:210(搜「从看图说话走向针对图回答问题」)
查询词元压缩8.3.1text/09-ch08.txt:215(搜「压缩成 32 个」)
围绕图对话8.3.2text/09-ch08.txt:223(搜「它能帮你找素菜」)
视障应用8.3.2text/09-ch08.txt:229(搜「第一次能独立完成原本要依赖他人的事」)
三条路线8.3.3text/09-ch08.txt:233(搜「主流大致分三条线」) · text/09-ch08.txt:242(搜「异常细胞」)
合理地猜8.3text/09-ch08.txt:176(搜「看起来像是“看见了”」) · text/09-ch08.txt:181(搜「把视觉证据和结论对应起来」)
感知之后如何组织信息8.3text/09-ch08.txt:183(搜「并不总在感知最底层」)
视觉模型短板8.3.4text/09-ch08.txt:267(搜「几类典型短板」) · text/09-ch08.txt:268(搜「计数」)
文生图获奖8.3.4text/09-ch08.txt:251(搜「生成作品获奖」) · text/09-ch08.txt:253(搜「脑中的审美和判断」)
能改比能画更重要8.3.4text/09-ch08.txt:259(搜「“能改”比“能画”更重要」)
音频的时间结构8.4text/09-ch08.txt:276(搜「天然带有时间展开结构」) · text/09-ch08.txt:282(搜「滋啦」)
语音识别与梅尔谱8.4.1text/09-ch08.txt:293(搜「68 万小时」) · text/09-ch08.txt:301(搜「声音的照片」)
语音合成三代与 3 秒克隆8.4.2text/09-ch08.txt:310(搜「三代技术的迭代」) · text/09-ch08.txt:321(搜「接近该说话人声线的新语音」)
级联三个问题8.4.3text/09-ch08.txt:344(搜「拆成三段独立的过程」) · text/09-ch08.txt:346(搜「叹息、笑声全都不见了」) · text/09-ch08.txt:347(搜「不会“打断”」)
原生语音三块8.4.3text/09-ch08.txt:351(搜「音频分词器把波形切成一段段」) · text/09-ch08.txt:352(搜「语义词元」)
低延迟、语气、全双工8.4.3text/09-ch08.txt:360(搜「端到端延迟可以降到几百毫秒量级」) · text/09-ch08.txt:366(搜「一边听你说话一边思考怎么回应」)
长期存在的路线8.4.3text/09-ch08.txt:369(搜「这条路线会长期存在」)
音频理解8.4.4text/09-ch08.txt:389(搜「把“说了什么”转成文字」) · text/09-ch08.txt:407(搜「刚才是不是有玻璃破碎声」)
声音不硬绑到可见物体8.4.4text/09-ch08.txt:416(搜「声音和画面一一对应」) · text/09-ch08.txt:417(搜「保留这些不确定性」)
视频的时间维度8.5text/09-ch08.txt:442(搜「视频增加的就是时间维度」) · text/09-ch08.txt:447(搜「前一秒在左边,后一秒瞬移到右边」)
理解四步8.5.1text/09-ch08.txt:462(搜「40 分钟的视频抽成 2400 帧」)
上下文挑战8.5.1text/09-ch08.txt:471(搜「一部电影展开就是上百万词元」) · text/09-ch08.txt:479(搜「200 倍速」)
生成的难8.5.2text/09-ch08.txt:495(搜「杯子不能忽然变成两只」) · text/09-ch08.txt:496(搜「组成一个可信的世界」)
隐空间与时空块8.5.3text/09-ch08.txt:506(搜「数亿到十亿级」) · text/09-ch08.txt:512(搜「切成一个个时空块」)
五大挑战8.5.4text/09-ch08.txt:561(搜「狗突然长出第五条腿」) · text/09-ch08.txt:569(搜「比“分辨率更高”更要紧」)
音画智能8.6text/09-ch08.txt:580(搜「Audio-Visual Intelligence」) · text/09-ch08.txt:588(搜「看不出门外有人敲门」)
共享事件线8.6text/09-ch08.txt:594(搜「共享同一条事件线」)
互相校验8.6text/09-ch08.txt:599(搜「传感器越多越好」) · text/09-ch08.txt:601(搜「把不确定性如实暴露出来」)
扩散模型8.7.1text/09-ch08.txt:646(搜「先把图破坏成噪声」) · text/09-ch08.txt:649(搜「下一步该去掉多少噪声」)
文本条件与隐空间8.7.1text/09-ch08.txt:651(搜「从“随机生成”变成“按需生成”」) · text/09-ch08.txt:658(搜「算力成本下降几十倍」)
原生统一8.7.2text/09-ch08.txt:691(搜「原生统一多模态」) · text/09-ch08.txt:693(搜「几百毫秒」)
Any-to-Any8.7.3text/09-ch08.txt:721(搜「所有模态都转成离散词元」) · text/09-ch08.txt:743(搜「开放社区和普通研究者也能参与探索」)
质量能不能稳8.7.3text/09-ch08.txt:744(搜「做出来的质量能不能稳」) · text/09-ch08.txt:750(搜「专业化短期内仍有它的位置」)
部分统一8.7text/09-ch08.txt:638(搜「在保留差异的前提下建立协作」) · text/09-ch08.txt:639(搜「部分统一、部分专门化」)
无障碍8.8.2text/09-ch08.txt:789(搜「没有半点炫技」) · text/09-ch08.txt:794(搜「声音银行」)
教育8.8.3text/09-ch08.txt:805(搜「像苏格拉底一样反问」) · text/09-ch08.txt:817(搜「永远不会翻白眼的陪练」)
创作8.8.4text/09-ch08.txt:828(搜「提出方向、筛选方案、精修结果」) · text/09-ch08.txt:838(搜「一人公司」)
医疗停在辅助层8.8.5text/09-ch08.txt:853(搜「看一眼就替医生下结论」) · text/09-ch08.txt:856(搜「不能直接等同于临床可靠性」)
失败模式更隐蔽8.9text/09-ch08.txt:915(搜「不能只看语言表面输出」) · text/09-ch08.txt:919(搜「以非常自然的语言形式出现」)
用错证据8.9text/09-ch08.txt:949(搜「却用错了证据」) · text/09-ch08.txt:952(搜「真的依赖了该依赖的模态」)
其余挑战8.9text/09-ch08.txt:926(搜「模态对齐」) · text/09-ch08.txt:933(搜「音画因果」) · text/09-ch08.txt:957(搜「隐私与同意」)
八卦邻居8.9.1text/09-ch08.txt:978(搜「住在手机里的八卦邻居」)

Footnotes

  1. 出处:「第8章 多模态大模型」引言第 10 段(text/09-ch08.txt:10,搜「然后训练一个专门的菜品分类器」) 与第 12 段(text/09-ch08.txt:12,搜「它会告诉你菜名」)。

  2. 出处:「8.1 为什么模型需要多模态」第 32 段(text/09-ch08.txt:32,搜「始终隔着一层语言描述」)。

  3. 出处:同节第 42 段(text/09-ch08.txt:42,搜「打通这些被分开的感知通道」) 与第 48 段(text/09-ch08.txt:48,搜「少了中间这道人工转写」)。

  4. 出处:引言第 17 段(text/09-ch08.txt:17,搜「这段文字和这张图是不是一对」)。

  5. 出处:引言第 19 段(text/09-ch08.txt:19,搜「固定词表框住」)。

  6. 出处:「8.2.1」第 57 段(text/09-ch08.txt:57,搜「影响极大的答案」) 与第 58 段(text/09-ch08.txt:58,搜「约 4 亿对来自互联网的」)。 2

  7. 出处:同节第 73 段(text/09-ch08.txt:73,搜「想象成一张地图」)。

  8. 出处:同节第 108 段(text/09-ch08.txt:108,搜「大规模天然配对」) 与第 111 段(text/09-ch08.txt:111,搜「通用粘合剂」)。

  9. 出处:同节第 84 段(text/09-ch08.txt:84,搜「a photo of a」) 与第 113 段(text/09-ch08.txt:113,搜「并不会画图」)。 2

  10. 出处:「8.2.2」第 118 段(text/09-ch08.txt:118,搜「能被表示成词元」)。

  11. 出处:同节第 128 段(text/09-ch08.txt:128,搜「混在一起喂给同一个」)。

  12. 出处:同节第 133 段(text/09-ch08.txt:133,搜「拼接多模态」) 与第 138 段(text/09-ch08.txt:138,搜「原生多模态」)。

  13. 出处:同节第 142 段(text/09-ch08.txt:142,搜「深度融合」) 与第 144 段(text/09-ch08.txt:144,搜「摄影师和翻译」)。

  14. 出处:「8.3」第 149 段(text/09-ch08.txt:149,搜「本质上是个“打分器”」)。

  15. 出处:「8.3.1」第 189 段(text/09-ch08.txt:189,搜「把图像变成词元」)。

  16. 出处:同节第 191 段(text/09-ch08.txt:191,搜「三个模块组成」) 与第 192 段(text/09-ch08.txt:192,搜「16 × 16 = 256 个 patch」)。 2

  17. 出处:同节第 198 段(text/09-ch08.txt:198,搜「不知道某些词元」)。

  18. 出处:同节第 202 段(text/09-ch08.txt:202,搜「配了一副眼镜」)。

  19. 出处:同节第 207 段(text/09-ch08.txt:207,搜「第一阶段是特征对齐」) 与第 210 段(text/09-ch08.txt:210,搜「从看图说话走向针对图回答问题」)。

  20. 出处:同节第 212 段(text/09-ch08.txt:212,搜「吃掉 LLM 的上下文预」) 与第 215 段(text/09-ch08.txt:215,搜「压缩成 32 个」)。

  21. 出处:「8.3.2」第 221 段(text/09-ch08.txt:221,搜「围绕图」) 与第 223 段(text/09-ch08.txt:223,搜「它能帮你找素菜」)。

  22. 出处:同节第 226 段(text/09-ch08.txt:226,搜「读药瓶说明」) 与第 229 段(text/09-ch08.txt:229,搜「第一次能独立完成原本要依赖他人的事」)。

  23. 出处:「8.3」第 176 段(text/09-ch08.txt:176,搜「看起来像是“看见了”」) 与第 178 段(text/09-ch08.txt:178,搜「合理地猜了」)。

  24. 出处:「8.3.4」第 267 段(text/09-ch08.txt:267,搜「几类典型短板」) 与第 268 段(text/09-ch08.txt:268,搜「计数」)。

  25. 出处:「8.3」第 183 段(text/09-ch08.txt:183,搜「并不总在感知最底层」)。

  26. 出处:「8.4」第 276 段(text/09-ch08.txt:276,搜「天然带有时间展开结构」)。

  27. 出处:同节第 282 段(text/09-ch08.txt:282,搜「滋啦」) 与第 284 段(text/09-ch08.txt:284,搜「语气、节奏、情绪、背景声和环境事件」)。

  28. 出处:「8.4.1」第 293 段(text/09-ch08.txt:293,搜「68 万小时」) 与第 298 段(text/09-ch08.txt:298,搜「先把声音变成图像」) 与第 301 段(text/09-ch08.txt:301,搜「声音的照片」)。 2

  29. 出处:「8.4.2」第 310 段(text/09-ch08.txt:310,搜「三代技术的迭代」) 与第 321 段(text/09-ch08.txt:321,搜「接近该说话人声线的新语音」)。

  30. 出处:「8.4.3」第 338 段(text/09-ch08.txt:338,搜「级联语音对话」) 与第 341 段(text/09-ch08.txt:341,搜「把语音也变成词元」)。

  31. 出处:同节第 344 段(text/09-ch08.txt:344,搜「拆成三段独立的过程」) 与第 346 段(text/09-ch08.txt:346,搜「叹息、笑声全都不见了」) 与第 347 段(text/09-ch08.txt:347,搜「不会“打断”」)。

  32. 出处:同节第 351 段(text/09-ch08.txt:351,搜「音频分词器把波形切成一段段」) 与第 352 段(text/09-ch08.txt:352,搜「语义词元」) 与第 357 段(text/09-ch08.txt:357,搜「还原成音频波形」)。

  33. 出处:同节第 360 段(text/09-ch08.txt:360,搜「端到端延迟可以降到几百毫秒量级」) 与第 363 段(text/09-ch08.txt:363,搜「全双工」) 与第 366 段(text/09-ch08.txt:366,搜「一边听你说话一边思考怎么回应」)。 2

  34. 出处:同节第 369 段(text/09-ch08.txt:369,搜「这条路线会长期存在」)。

  35. 出处:「8.4.4」第 389 段(text/09-ch08.txt:389,搜「把“说了什么”转成文字」) 与第 390 段(text/09-ch08.txt:390,搜「玻璃碎裂、音乐的风格」)。

  36. 出处:同节第 393 段(text/09-ch08.txt:393,搜「CLAP」) 与第 398 段(text/09-ch08.txt:398,搜「零样本」)。

  37. 出处:同节第 407 段(text/09-ch08.txt:407,搜「刚才是不是有玻璃破碎声」)。

  38. 出处:同节第 418 段(text/09-ch08.txt:418,搜「音频内容审核」) 与第 419 段(text/09-ch08.txt:419,搜「门铃响」)。

  39. 出处:同节第 416 段(text/09-ch08.txt:416,搜「声音和画面一一对应」) 与第 417 段(text/09-ch08.txt:417,搜「保留这些不确定性」)。

  40. 出处:「8.5」第 442 段(text/09-ch08.txt:442,搜「视频增加的就是时间维度」) 与第 444 段(text/09-ch08.txt:444,搜「拿起杯子」)。

  41. 出处:同节第 447 段(text/09-ch08.txt:447,搜「前一秒在左边,后一秒瞬移到右边」) 与第 448 段(text/09-ch08.txt:448,搜「在时间中保持一致」)。

  42. 出处:「8.5.1」第 462 段(text/09-ch08.txt:462,搜「40 分钟的视频抽成 2400 帧」)。

  43. 出处:同节第 471 段(text/09-ch08.txt:471,搜「一部电影展开就是上百万词元」) 与第 476 段(text/09-ch08.txt:476,搜「发现可疑段落再回到那段细看」)。

  44. 出处:同节第 479 段(text/09-ch08.txt:479,搜「200 倍速」)。

  45. 出处:「8.5.2」第 494 段(text/09-ch08.txt:494,搜「几十到上百帧」) 与第 495 段(text/09-ch08.txt:495,搜「杯子不能忽然变成两只」) 与第 496 段(text/09-ch08.txt:496,搜「组成一个可信的世界」)。

  46. 出处:「8.5.3」第 506 段(text/09-ch08.txt:506,搜「数亿到十亿级」) 与第 508 段(text/09-ch08.txt:508,搜「时空同时降采样」)。 2

  47. 出处:同节第 511 段(text/09-ch08.txt:511,搜「扩散 Transformer」) 与第 518 段(text/09-ch08.txt:518,搜「这些东西应该怎么动」)。

  48. 出处:「8.5.4」第 561 段(text/09-ch08.txt:561,搜「狗突然长出第五条腿」) 与第 566 段(text/09-ch08.txt:566,搜「音画同步」)。

  49. 出处:同节第 569 段(text/09-ch08.txt:569,搜「比“分辨率更高”更要紧」)。

  50. 出处:「8.6」第 579 段(text/09-ch08.txt:579,搜「2026 年一篇综述」) 与第 580 段(text/09-ch08.txt:580,搜「Audio-Visual Intelligence」)。 2

  51. 出处:同节第 588 段(text/09-ch08.txt:588,搜「看不出门外有人敲门」) 与第 590 段(text/09-ch08.txt:590,搜「掉书,还是杯子碎了」)。

  52. 出处:同节第 592 段(text/09-ch08.txt:592,搜「让脚步声跟步伐对上」) 与第 594 段(text/09-ch08.txt:594,搜「共享同一条事件线」)。

  53. 出处:同节第 596 段(text/09-ch08.txt:596,搜「交互状态的一部分」) 与第 597 段(text/09-ch08.txt:597,搜「机器人夹爪接触物体时的声音」)。

  54. 出处:同节第 599 段(text/09-ch08.txt:599,搜「传感器越多越好」) 与第 601 段(text/09-ch08.txt:601,搜「把不确定性如实暴露出来」)。

  55. 出处:「8.7.1」第 646 段(text/09-ch08.txt:646,搜「先把图破坏成噪声」) 与第 649 段(text/09-ch08.txt:649,搜「下一步该去掉多少噪声」)。

  56. 出处:同节第 651 段(text/09-ch08.txt:651,搜「从“随机生成”变成“按需生成”」) 与第 653 段(text/09-ch08.txt:653,搜「CLIP 文本编码器在这里又派上用场」)。

  57. 出处:同节第 654 段(text/09-ch08.txt:654,搜「1024 × 1024 的图像太贵」) 与第 658 段(text/09-ch08.txt:658,搜「算力成本下降几十倍」)。

  58. 出处:「8.7.2」第 691 段(text/09-ch08.txt:691,搜「原生统一多模态」) 与第 693 段(text/09-ch08.txt:693,搜「几百毫秒」)。

  59. 出处:「8.7.3」第 721 段(text/09-ch08.txt:721,搜「所有模态都转成离散词元」) 与第 743 段(text/09-ch08.txt:743,搜「开放社区和普通研究者也能参与探索」)。

  60. 出处:同节第 744 段(text/09-ch08.txt:744,搜「做出来的质量能不能稳」) 与第 750 段(text/09-ch08.txt:750,搜「专业化短期内仍有它的位置」)。 2

  61. 出处:「8.7」第 638 段(text/09-ch08.txt:638,搜「在保留差异的前提下建立协作」) 与第 639 段(text/09-ch08.txt:639,搜「部分统一、部分专门化」)。 2

  62. 出处:「8.8.2」第 787 段(text/09-ch08.txt:787,搜「请人类志愿者描述画面」) 与第 789 段(text/09-ch08.txt:789,搜「没有半点炫技」) 与第 794 段(text/09-ch08.txt:794,搜「声音银行」)。

  63. 出处:「8.8.3」第 805 段(text/09-ch08.txt:805,搜「像苏格拉底一样反问」) 与第 811 段(text/09-ch08.txt:811,搜「用语言引导下一步」)。

  64. 出处:同节第 817 段(text/09-ch08.txt:817,搜「永远不会翻白眼的陪练」)。

  65. 出处:「8.3.4」第 251 段(text/09-ch08.txt:251,搜「生成作品获奖」) 与第 253 段(text/09-ch08.txt:253,搜「脑中的审美和判断」)。

  66. 出处:「8.8.4」第 838 段(text/09-ch08.txt:838,搜「一人公司」)。

  67. 出处:「8.8.5」第 853 段(text/09-ch08.txt:853,搜「看一眼就替医生下结论」) 与第 856 段(text/09-ch08.txt:856,搜「不能直接等同于临床可靠性」) 与第 867 段(text/09-ch08.txt:867,搜「停在“辅助”这一层」)。

  68. 出处:「8.9」第 915 段(text/09-ch08.txt:915,搜「不能只看语言表面输出」) 与第 919 段(text/09-ch08.txt:919,搜「以非常自然的语言形式出现」)。

  69. 出处:同节第 949 段(text/09-ch08.txt:949,搜「却用错了证据」) 与第 952 段(text/09-ch08.txt:952,搜「真的依赖了该依赖的模态」)。

  70. 出处:同节第 939 段(text/09-ch08.txt:939,搜「看起来更“有证据”」)。

  71. 出处:同节第 926 段(text/09-ch08.txt:926,搜「模态对齐」) 与第 933 段(text/09-ch08.txt:933,搜「音画因果」) 与第 941 段(text/09-ch08.txt:941,搜「评估困难」) 与第 954 段(text/09-ch08.txt:954,搜「1440 帧」) 与第 957 段(text/09-ch08.txt:957,搜「隐私与同意」) 与第 960 段(text/09-ch08.txt:960,搜「来源与水印」)。

  72. 出处:同节第 922 段(text/09-ch08.txt:922,搜「看起来很懂世界」)。

  73. 出处:「8.9.1」第 978 段(text/09-ch08.txt:978,搜「住在手机里的八卦邻居」)。