跳到主要内容

把图切块当词 — 让同一台机器同时看、听、说

这一章讲三件事: 「模态」是什么,以及为什么过去按感官分家的 AI 必须合流; 合流的那一步简单得出奇——把图、声、视频统统切成「词元」,喂给同一台文字机器; 三条感官线各自的路线图:图像怎么「看懂」、语音怎么保住语气、视频怎么熬过时间的考验。

它在全书链条里的位置: 第 21 章结尾说扩散与语言两股力量正在合流——本章就是合流的现场。 它也是第 23 章(AI 进实验室)和第 24 章(机器人)的共同底座:不会看世界的 AI,进不了实验室,也上不了路。

1. 只读文字的模型缺了什么

书里给了一个一句话就能体会的缺口:只读文字的模型遇到「苹果」会犹豫——这是水果,还是公司? 配上一张照片,歧义立刻少了一半;再加上语音语气和你正在看的屏幕,它才接近一个真正理解场景的助手1

多模态的价值,书里分成递进的三层2:第一层,交互变自然——你不必把世界翻译成规整的文字, 直接说、拍、指、圈,模型就能接住;第二层,创造从「描述」走向「成品」——一句提示词变海报, 一段梗概变短片,创意和作品之间那串技能门槛被抽掉了几级;第三层最现实, 进入那些本来就混合多种信号的场景——视障人士读药瓶说明,医生综合影像和病历。 书里那句总结可以背走:「模态多」不是为了听起来高级,真实世界从来就不是单声道3

2. 模态:机器的感官通道

模态指数据的一种形式:文字、图像、音频、视频、3D、动作。它们本性迥异4: 文字是离散的符号序列,图像是连续的像素网格,音频是时间序列的波形,视频是图像再加时间。 对应关系很直觉:文字像「读到的」,图像像「看到的」,音频像「听到的」,3D 点云像「摸到的」4

过去的 AI 恰恰按模态分了家:视觉系统只会看图,语言模型只会读写,语音系统只会听5。 分工让每个领域深耕了自己的特点,代价是一堵堵隔墙——只会读字的助手看不了你拍的照片, 只会识图的模型接不住你的问题。这一章的全部内容,就是拆这堵墙。

3. 拆墙的那一步:把图切块当词

拆墙的思路简单到不像关键创新,前提只有一个:只要某种输入能表示成词元序列, 它就有机会进同一套处理框架6。而切块这件事,各模态都凑巧成立6:

模态怎么切块
文本天然是词元(词或子词)
图像切成小方块,每块当一个词元
视频切成「时间 × 空间」的时空块
音频切成片段或一段「声音的照片」,每段一个词元

一旦都变成了词元,就可以混在一条序列里,喂给第 10 章那块积木。 多模态的整个魔法,就藏在这张表的第二列。

4. 主走查:一张菜单照片进模型

用一个书里反复出现的场景走完全程:你拍下一张菜单照片,问「有素菜吗?」7

① 视觉编码器(通常是一个 ViT):把照片切成小方块,比如 224×224 的图
切成 16×16 = 256 块,每块 14×14 像素 → 256 个「视觉词元」;
块与块之间靠注意力互通信息
② 投影器:一个小网络,把视觉词元「翻译」到语言模型听得懂的空间——
编码器的输出维度和语言模型对不上,这一步是换接头
③ 拼序列:256 个视觉词元 + 「有素菜吗」的文字词元,拼成同一条序列
——语言模型并不知道哪些词元「不是字」,它只看到一串向量
④ 大语言模型:照常做注意力、推理,回答「有的,第 3 行的麻婆豆腐是素菜」

这张图看的是全部机关:看图的本事不在语言模型里,而在前两步的「翻译」上; 翻译完之后,理解、推理、表达,用的都是它本来就有的功夫。

这个「视觉编码器 + 投影器 + 语言模型」的三件套有个开源社区爆红的代表,叫 LLaVA: CLIP 的视觉编码器 + 一个小投影 + 一个微调过的语言模型。书里的比方贴切: 给一个只会读文字的学生配了一副眼镜——眼镜不负责写作文,只负责把画面变成他能理解的线索8

5. 两阶段训练:先对齐,再学答题

三件套装好还不够,得教,而且分两步教,省钱与学艺各有分工9:

  1. 特征对齐:冻住视觉编码器和语言模型,只训中间那个投影器, 用成对的「图 + 说明」数据学会「视觉 → 语言」的翻译。因为绝大部分参数都冻着,这一步相当便宜;
  2. 视觉指令微调:解冻语言模型(或用第 16 章的 LoRA 轻量微调), 用「图 + 问 + 答」三元组训练。这一步教的不是「看图说话」,是「针对图回答、基于图推理」—— LLaVA 就是从描述模型升格成对话模型的。

顺序颠倒就费钱:让整个模型从零学会「看」,远比先接好翻译再教答题贵。

6. 高分辨率怎么办

走查里那张 224×224 的小图是理想情况。真实手机照片动辄上千像素, 256 个词元根本装不下小字、细线和远处的人脸10。两个流派:

  • 压缩流(Q-Former):用一组固定的「查询词元」(通常 32 个)通过注意力把几百个视觉词元 提炼成 32 个——上下文大省,代价是丢细节;多图、长视频场景的好帮手11;
  • 切片流(动态切片):把大图切成多个小块,每块各自走一遍视觉编码器再全部拼进序列—— 细节保住了,词元预算翻倍涨10

7. 拼接式与原生式:两条哲学

上面整套「外挂视觉」的路线,行话叫拼接多模态:文字模型是主体,其他感官是后配的翻译官。 另一条更激进的路线叫原生多模态:从第一天起就用多模态数据训练一个统一模型, 文字、图像、声音不是后接的插件,而是在模型内部共同参与表示和生成12

书里的比方把两条路线的性格说尽了13:拼接式像给一个文字专家配上摄影师和翻译; 原生式像从小培养一个既会读书、又会看图、还会听声音的人。 原生潜力更大(感官在深处融合,不是翻译成字再处理),代价也直白: 数据更复杂、算力更贵、评估更难。书里同时给了句诚实的边界声明: 「原生」是技术路线,不等于我们知道自己每个闭源模型的内部结构14

8. 声音:先变成一张图

视觉线讲完,换听觉线。语音识别的老将新王是 Whisper(2022): 用 68 万小时的多语言语音-文本数据训练并开放了模型——参照物:一个人不眠不休听完 68 万小时要七十七年多;它把会议转写、自动字幕、播客搜索变成了寻常产品15

它的骨架里藏着本章开头那个魔法的一次复用:先把声音变成图像,再交给 Transformer 看16。 一秒 16 千赫兹的音频是 16000 个采样点,直接啃又贵又学不到语义; 标准做法是切成小片、做傅里叶变换(把声音拆成各个频率成分的数学操作), 再按人耳对频率的敏感度重新分组,得到一张「时间 × 频率」的二维图—— 梅尔谱,一张「声音的照片」。接下来的流程你全认识:编码器读图,解码器像语言模型 一样一个字一个字往外吐17

9. 级联语音对话丢掉了什么

语音怎么和语言模型结合?最早也最直接的方案叫级联:语音识别把话转成文字 → 语言模型读字生成回答 → 语音合成把回答念出来。每一步都用最成熟的模型, 早期语音助手和 2023 年的对话产品都是这条管道18

管道很稳,但三段串联的代价写在结构里19:

  1. 延迟高:三段排队,即便各自优化,端到端也容易停在秒级——对话感比真人僵硬;
  2. 语气全丢:转成文字那一刻,语调、情绪、重音、叹息、笑声全部蒸发,AI 回答时只能「中性」;
  3. 不会打断:人类对话会在对方没说完时接话、附和、嗯一声,级联系统做不到。

第二条的根子值得记住:凡是「先翻译成文字再处理」的架构,都会在翻译这一步交掉翻译不掉的信息。

10. 原生语音:把声音也变成词元

近两年的突破是原生语音大模型,核心想法你已经在第 3 节见过了:把语音也切成词元20。 架构三块:音频分词器把波形切成「语音词元」,其中还分两小类—— 语义词元管「说了什么」,声学词元管「音色、语气、韵律、背景」; 语言模型在文字与语音的混合序列上做预测;最后声码器把输出还原成波形21

三件级联做不到的事,书里逐条列了22:低延迟流式——生成一个词元就播一个, 端到端延迟降到几百毫秒,接近真人;保留语气——情绪和笑声进入输入, 回答也能兴奋、安抚、压低声音制造悬念;全双工——「听」和「说」并行建模, 可以一边听一边想、必要时插话。2024 年那次著名的现场演示让大众第一次感到: AI 不再像客服热线那样等你说完才慢悠悠接话,而像一个会接梗的同桌23

11. 视频:多出来的那一维

视频是「图像(空间) + 声音 + 时间」三合一,也因此最复杂。书里的穿帮写照: 一张图错了,最多是一只猫多一条腿;视频错了,这条腿前一秒在左边,后一秒瞬移到右边, 第三秒顺便把桌子穿过去24。视频理解的难点,是让模型理解时间线,而不是把视频当一堆互不相干的截图。

让语言模型看懂视频的默认做法,是在视觉-语言架构上扩四步25: 按固定间隔抽帧(一个 40 分钟的视频抽成 2400 帧)、每帧编码、按时间顺序拼成超长序列 (中间插时间戳——即「[第 15 秒]」这样的标签)、交给语言模型。然后立刻撞上老熟人——上下文长度: 每帧几百个词元,一部电影展开就是上百万词元25。 四条应对各让一步:降帧率或自适应抽帧(有变化的段多抽、静止段少抽); 词元压缩(每帧 256 个压到 32 个);换长上下文模型;层级式处理(先粗看全片,可疑段落再细看)。 书里的比方收得妙:像看监控回放,2 倍速还能看懂,200 倍速就只能祈祷别错过重点了26

12. 视频生成:时空块当词元

生成侧的主角你也在前几章认全了。量级先摆出来:一段 10 秒、每秒 24 帧、1080p 的视频, 全部像素值已在数亿到十亿级——直接在像素上做扩散想都别想27。 于是两件套28:先用 3D 变分自编码器(这里的 3D 指时间加空间)把整段视频压成 低维的隐空间立方体;再把立方体切成一个个时空块,每块当一个词元,过扩散 Transformer 去噪。 Sora 的公开报告明确采用了这条「扩散 + Transformer + 时空块」路线29

生成侧的五道难题,书里列成了清单30:时间一致性(第五条腿问题的生成版)、 物理合理性(水流火焰布料头发)、长度(几秒短片和几小时电影不是同一种工程)、 角色一致(同一人跨场景不变脸)、音画同步(嘴型对不上,观众立刻出戏)。 书里的判断句可以带走:未来的进步不只是「分辨率更高」, 而是时间更稳、物理更可信、角色更一致、控制更精细31

13. 任意到任意:全模态的野心

更激进的终点叫 Any-to-Any:输入和输出都可以是任意模态的组合——图变文、文变视频、 图片配乐、按音乐生画面32。 开源方向有个讲清楚了的代表 AnyGPT(复旦大学相关团队,2024):思路照旧是离散词元, 但做到极致——文字、图像、语音、音乐各配一个分词器切成离散序列, 全部灌进同一个 70 亿参数底座的语言模型做自回归预测,输出再用各自的解码器还原33。 它的意义书里点得准:不只是「能做出来」,而是展示了 「离散词元 + 自回归」这条路线在全模态上的可行性—— 开源大模型也能当多模态统一建模的底座,不再只是大公司的产品想象34

14. 落地:谁已经用上了

技术之外,书里给了一组真实的落地现场,四个场景挑四个瞬间35:

场景已经发生的事
无障碍视障服务应用接入视觉大模型:读药瓶标签、看菜单、检查衣服颜色——「技术在这里没有半点炫技的成分」
教育AI 家教看学生写题的步骤反问引导;研究者早就发现高质量一对一辅导平均能提高约两个标准差(统计差距的量:平均学生跃到前几名),过去贵到无法普及,这是AI 想接下的那道题
创作设计师先用生成工具出几十个方向再挑两个细修;过去需要「编辑 + 设计 + 摄像 + 剪辑」的团队,被压缩到一个人的工作台上
办公会议一结束就有纪要草稿;真正的难点不在转写,在把「谁承诺了什么、什么时候交付」提取准确

医疗那一笔第 23 章专门展开,机器人那一笔属于第 24 章——这里只记书里给的定位: 医疗影像 AI 是辅助筛查、辅助报告,不是看一眼就替医生下结论36

15. 多模态的新麻烦

多一个感官并不只带来准确,也带来新的坑。最要警惕的是跨模态(横跨看与读两种感官)幻觉: 多模态模型也会胡说,而且有时更有欺骗性——它可能看错图里的小字, 却用非常自信的语气解释;也可能顺着你的问题脑补图中不存在的物体; 更麻烦的是,多模态输出看起来「有证据」——一张图摆在那里,用户更容易放松警惕37。 跟上的还有隐私(脸、声纹、家庭环境比纯文字更容易暴露身份) 与来源问题(水印、内容凭证、注定长期的攻防)38

书里给未来助手的警告值得原文收下:一个全感官助手如果没有权限边界, 就不是助手,而是一个住在手机里的八卦邻居39

16. 作者的判断与证据

有证据的部分。 LLaVA 的三模块与两阶段训练、Whisper 的 68 万小时、级联的三条代价、 2400 帧与百万词元的算术、AnyGPT 的架构,都是公开材料可核对的内容。

要分开看的四处:

  1. 闭源前沿的内部结构大多未公开。 书里反复声明:讲的是主流技术路线, 不是某个产品的拆机报告14;把「拼接/原生」当成对具体产品的判词是误读。
  2. 「两个标准差」研究的边界。 那是关于人类一对一辅导的经典教育学结论, AI 家教能否兑现它,书里用的是「希望正在这里」的措辞,不是断言35
  3. 音频词元的两类划分(语义/声学)是主流框架,不同系统的切法细节并不统一。
  4. 应用清单是快照。 产品名与合作关系的保鲜期以月计;任务类型(读图、转写、总结)比产品名耐用。

判断(我们的,不是书里的):多模态这一章最深的启示不是「能力变多」,而是「词元化」——把任何信号切成最小可处理单位——的普适。 文本、图像、声音、视频、动作,只要找到合适的切块方法,就都能挤进同一套已经验证过的 规模化机器——这个模式在扩散模型(时空块)、机器人(动作词元,第 24 章)上一再重演。 找切块方法,成了给任何新信号「接入智能」的标准第一步。 如果错,会错在: 并非所有信号都存在无损又高效的离散化——连续控制、高精度科学数据 可能始终更适合原生连续建模;词元化是当下最强的方法论,不是万物通用的物理定律。

判断(我们的,不是书里的):级联到原生的这一跃,和第 16 章「端到端 vs 流水线」是同一个故事。 级联的每一环都最成熟,合起来却丢语气、高延迟;原生每一环都更难, 却把中间的「翻译税」全部免掉。软件工程的老经验——接口处丢失的信息最多—— 在这里再次应验。以后遇到任何「A 模型接 B 模型接 C 模型」的方案, 先问一句:中间接口上,哪些信息正在被扔掉? 如果错,会错在: 工程上级联并未死——每段独立可换、可控、好排错, 对可靠性要求高的场景它仍是务实选择;「原生赢」更多赢在体验上限,不必然赢在每个场景。

17. 边界与局限

  • 嗅觉、味觉、触觉基本缺席。 书里的多模态以视听为主;触觉那条线留给第 24 章。
  • 原生多模态只有路线没有配方。 数据配比、训练细节,前沿系统一律不公开14
  • 评估没有统一标准。 多模态综合能力怎么打分,书里明说「至今没有标准」40
  • 手语翻译被点名为真正的难题——它有自己的语法和文化,不是「换个手势的英语」41
  • 中文场景的讨论集中在文生图与语音,文档理解、工业质检只给了方向名42

18. 可带走的

  1. 只读文字的模型遇到「苹果」会犹豫;一张照片砍掉一半歧义。 真实世界不是单声道。
  2. 模态 = 数据的形式 = 机器的感官通道。 文字离散、图像连续、音频带时间、视频再加时间。
  3. 拆墙只有一步:把任何信号切成词元。 之后全部交给同一块积木。
  4. 看图三件套:视觉编码器切块、投影器翻译、语言模型推理。 眼镜不写作文,只递线索。
  5. 两阶段训练:先只训投影器(便宜),再解冻学答题(学艺)。
  6. 高分辨率两难:Q-Former 省上下文丢细节,动态切片保细节费词元。
  7. 拼接 = 文字专家配摄影师;原生 = 从小多感官长大。 后者潜力大,前者和稀泥都擅长。
  8. 声音先变成照片:梅尔谱。 68 万小时练出来的 Whisper 是这条线的新王。
  9. 级联丢三样:时间(秒级延迟)、语气(转文字即蒸发)、打断的权利。
  10. 原生语音分两种词元:语义管「说了什么」,声学管「怎么说」。 几百毫秒延迟从此可能。
  11. 40 分钟视频 = 2400 帧 = 上百万词元。 视频理解的战争全在上下文预算上。
  12. 视频生成 = 3D 压缩 + 时空块 + 扩散 Transformer; 最怕第五条腿和瞬移的杯子。
  13. Any-to-Any 的答案是「每模态一个分词器 + 一个统一底座」。
  14. 跨模态幻觉更唬人:它带着「证据」说错话。 全感官助手没有边界,就是八卦邻居。

19. 原文地图

主题原书章原文位置
苹果的歧义第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:77(搜「会犹豫」)· :78(搜「少了一半」)
三层价值第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:79(搜「交互变自然」)· :85(搜「视障人士」)
不是单声道第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:89(搜「模态多」)· :91(搜「单声道」)
模态定义第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:39(搜「数据的一种形式」)· :47(搜「摸到的」)
分工与隔墙第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:49(搜「按模态分工」)· :51(搜「隔墙」)
词元序列大一统第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:137(搜「词元」)· :140(搜「天然是词元序列」)· :143(搜「梅尔谱」)
读得懂画得出聊得起来第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:55(搜「菜单照片」)· :73(搜「坐标」)
LLaVA 三模块第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:196(搜「14×14」)· :197(搜「256」)· :199(搜「投影器」)
眼镜比方第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:205(搜「LLaVA」)· :207(搜「眼镜」)
两阶段训练第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:226(搜「特征对齐」)· :229(搜「视觉指令微调」)
Q-Former第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:234(搜「Q-Former」)· :236(搜「32 个」)
动态切片第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:242(搜「1000×1000」)· :243(搜「动态切片」)
拼接 vs 原生第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:150(搜「拼接多模态」)· :156(搜「原生多模态」)· :161(搜「代价也很明显」)
摄影师与翻译比方第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:162(搜「摄影师和翻译」)
路线非拆机声明第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:165(搜「不等于」)
Whisper 与 68 万小时第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:324(搜「Whisper」)· :325(搜「68 万小时」)
声音的照片第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:330(搜「16000 个采样点」)· :332(搜「时间 × 频率」)· :333(搜「声音的照片」)
级联三段第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:367(搜「级联语音对话」)· :368(搜「读文字生成回答」)
级联三代价第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:374(搜「延迟高」)· :378(搜「丢失非语言信号」)· :380(搜「打断」)
语音词元两类第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:383(搜「音频分词器」)· :384(搜「语义词元」)
原生三能力第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:394(搜「低延迟流式」)· :398(搜「保留语气」)· :401(搜「全双工」)
会接梗的同桌第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:397(搜「接梗」)
视频穿帮写照第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:464(搜「瞬移」)
抽帧与上下文第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:476(搜「2400 帧」)· :483(搜「上百万词元」)
四条应对第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:485(搜「降帧率」)· :486(搜「压缩」)· :489(搜「层级式」)
监控回放比方第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:491(搜「监控回放」)· :492(搜「200 倍速」)
十亿级像素第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:510(搜「1080p」)· :510(搜「数亿」)
3D VAE 与时空块第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:511(搜「3D」)· :516(搜「时空块」)
Sora 路线声明第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:516(搜「spacetime」)
生成五难题第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:558(搜「时间一致性」)· :560(搜「物理合理性」)· :563(搜「音画同步」)
进步的形状第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:566(搜「分辨率更高」)· :567(搜「可信」)
Any-to-Any第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:588(搜「任意到任意」)· :590(搜「配音乐」)
AnyGPT 架构第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:594(搜「离散词元」)· :596(搜「SpeechTokenizer」)· :597(搜「7B」)
开源也能统一建模第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:614(搜「可行性」)· :615(搜「开放社区」)
无障碍落地第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:651(搜「Be My Eyes」)· :654(搜「炫技」)
两个标准差第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:671(搜「Khanmigo」)· :674(搜「两个标准差」)
一人公司第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:704(搜「内容生产个体化」)· :706(搜「一人公司」)
会议纪要的真难第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:749(搜「谁承诺了什么」)
医疗的定位第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:719(搜「辅助筛查」)· :735(搜「辅助」)
跨模态幻觉第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:780(搜「跨模态幻觉」)· :782(搜「放松警惕」)
隐私与水印第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:784(搜「声纹」)· :788(搜「水印」)
八卦邻居第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:240(搜「边界」)· :799(搜「八卦邻居」)
苹果的联合投影第12章 看听说一体:多模态AItext/13-ch12-12-ai.txt:810(搜「统计」)· :811(搜「联合投影」)· :814(搜「什么叫懂」)

Footnotes

  1. 出处:「第12章 看听说一体:多模态AI」第 77 至 78 段 (text/13-ch12-12-ai.txt:77,搜「水果」;:78,搜「少了一半」)。

  2. 出处:「第12章 看听说一体:多模态AI」第 79 至 88 段 (text/13-ch12-12-ai.txt:80,搜「接住」;:82,搜「成品」;:85,搜「药瓶」)。

  3. 出处:「第12章 看听说一体:多模态AI」第 89 至 91 段 (text/13-ch12-12-ai.txt:91,搜「单声道」)。

  4. 出处:「第12章 看听说一体:多模态AI」第 39 至 48 段 (text/13-ch12-12-ai.txt:40,搜「离散的符号序列」;:43,搜「感官通道」)。 2

  5. 出处:「第12章 看听说一体:多模态AI」第 49 至 52 段 (text/13-ch12-12-ai.txt:51,搜「高效」;:52,搜「隔墙」)。

  6. 出处:「第12章 看听说一体:多模态AI」第 137 至 145 段 (text/13-ch12-12-ai.txt:63,搜「词元」;:141,搜「patch」;:143,搜「片段」)。 2

  7. 出处:「第12章 看听说一体:多模态AI」第 55 至 56 与 184 至 185 段 (text/13-ch12-12-ai.txt:55,搜「菜单照片」;:197,搜「256 个」;:199,搜「投影器」)。 走查第 ④ 步的回答是我们为演示编的;流程本身全部来自原文。

  8. 出处:「第12章 看听说一体:多模态AI」第 205 至 209 段 (text/13-ch12-12-ai.txt:205,搜「LLaVA」;:207,搜「眼镜」)。

  9. 出处:「第12章 看听说一体:多模态AI」第 224 至 231 段 (text/13-ch12-12-ai.txt:226,搜「特征对齐」;:229,搜「解冻」;:231,搜「对话模型」)。

  10. 出处:「第12章 看听说一体:多模态AI」第 242 至 244 段 (text/13-ch12-12-ai.txt:242,搜「不够」;:243,搜「动态切片」)。 2

  11. 出处:「第12章 看听说一体:多模态AI」第 234 至 237 段 (text/13-ch12-12-ai.txt:235,搜「查询词元」;:236,搜「32 个」)。

  12. 出处:「第12章 看听说一体:多模态AI」第 150 与 156 至 158 段 (text/13-ch12-12-ai.txt:156,搜「原生多模态」)。

  13. 出处:「第12章 看听说一体:多模态AI」第 161 至 162 段 (text/13-ch12-12-ai.txt:162,搜「摄影师和翻译」)。

  14. 出处:「第12章 看听说一体:多模态AI」第 164 至 165 段 (text/13-ch12-12-ai.txt:165,搜「内部结构」)。 2 3

  15. 出处:「第12章 看听说一体:多模态AI」第 323 至 328 段 (text/13-ch12-12-ai.txt:325,搜「68 万小时」;:326,搜「实时会议转写」)。 七十七年多的换算是我们按 680000 ÷ 24 ÷ 365 计算的,可核对。

  16. 出处:「第12章 看听说一体:多模态AI」第 329 至 330 段 (text/13-ch12-12-ai.txt:329,搜「梅尔谱」;:330,搜「16000 个采样点」)。

  17. 出处:「第12章 看听说一体:多模态AI」第 331 至 336 段 (text/13-ch12-12-ai.txt:332,搜「按人耳对频率」;:333,搜「声音的照片」)。 「傅里叶变换」的一句话解释是补充(不在书里,来自通用知识)

  18. 出处:「第12章 看听说一体:多模态AI」第 366 至 369 段 (text/13-ch12-12-ai.txt:369,搜「ChatGPT 语音模式」)。

  19. 出处:「第12章 看听说一体:多模态AI」第 373 至 381 段 (text/13-ch12-12-ai.txt:374,搜「延迟高」;:378,搜「叹息、笑声」;:380,搜「打断」)。

  20. 出处:「第12章 看听说一体:多模态AI」第 370 至 371 段 (text/13-ch12-12-ai.txt:370,搜「语音也变成词元」)。

  21. 出处:「第12章 看听说一体:多模态AI」第 382 至 390 段 (text/13-ch12-12-ai.txt:384,搜「语义词元」;:390,搜「声码器」)。

  22. 出处:「第12章 看听说一体:多模态AI」第 394 至 402 段 (text/13-ch12-12-ai.txt:395,搜「几百毫秒」;:399,搜「悬念」;:401,搜「全双工」)。

  23. 出处:「第12章 看听说一体:多模态AI」第 395 至 397 段 (text/13-ch12-12-ai.txt:397,搜「接梗」)。

  24. 出处:「第12章 看听说一体:多模态AI」第 463 至 465 段 (text/13-ch12-12-ai.txt:464,搜「瞬移」)。

  25. 出处:「第12章 看听说一体:多模态AI」第 474 至 483 段 (text/13-ch12-12-ai.txt:476,搜「40 分钟的视频抽成 2400 帧」;:480,搜「第 15 秒」;:483,搜「上百万词元」)。 2

  26. 出处:「第12章 看听说一体:多模态AI」第 490 至 492 段 (text/13-ch12-12-ai.txt:492,搜「200 倍速」)。

  27. 出处:「第12章 看听说一体:多模态AI」第 509 至 510 段 (text/13-ch12-12-ai.txt:510,搜「数亿到十亿」)。

  28. 出处:「第12章 看听说一体:多模态AI」第 511 至 518 段 (text/13-ch12-12-ai.txt:511,搜「变分自编码器」;:516,搜「时空块」)。

  29. 出处:「第12章 看听说一体:多模态AI」第 519 段 (text/13-ch12-12-ai.txt:519,搜「spacetime patches」)。

  30. 出处:「第12章 看听说一体:多模态AI」第 556 至 564 段 (text/13-ch12-12-ai.txt:558,搜「第五条腿」;:562,搜「一致的外貌」;:563,搜「音画同步」)。

  31. 出处:「第12章 看听说一体:多模态AI」第 566 至 567 段 (text/13-ch12-12-ai.txt:566,搜「分辨率」)。

  32. 出处:「第12章 看听说一体:多模态AI」第 588 至 591 段 (text/13-ch12-12-ai.txt:588,搜「Any-to-Any」;:590,搜「配音乐」)。

  33. 出处:「第12章 看听说一体:多模态AI」第 592 至 597 段 (text/13-ch12-12-ai.txt:592,搜「AnyGPT」;:595,搜「离散词元」;:596,搜「SpeechTokenizer」)。

  34. 出处:「第12章 看听说一体:多模态AI」第 613 至 616 段 (text/13-ch12-12-ai.txt:614,搜「可行性」;:616,搜「参与探索」)。

  35. 出处:「第12章 看听说一体:多模态AI」第 651 至 656、671 至 676、704 至 706、747 至 749 段 (text/13-ch12-12-ai.txt:654,搜「炫技」;:674,搜「两个标准差」;:706,搜「一人公司」;:749,搜「承诺了什么」)。 2

  36. 出处:「第12章 看听说一体:多模态AI」第 719 至 720 与 735 至 736 段 (text/13-ch12-12-ai.txt:719,搜「辅助筛查」;:736,搜「审批」)。

  37. 出处:「第12章 看听说一体:多模态AI」第 780 至 783 段 (text/13-ch12-12-ai.txt:781,搜「自信的语气」;:782,搜「放松警惕」)。

  38. 出处:「第12章 看听说一体:多模态AI」第 784 至 789 段 (text/13-ch12-12-ai.txt:360,搜「声纹」;:789,搜「长期攻防」)。

  39. 出处:「第12章 看听说一体:多模态AI」第 796 至 799 段 (text/13-ch12-12-ai.txt:799,搜「八卦邻居」)。

  40. 出处:「第12章 看听说一体:多模态AI」第 776 至 779 段 (text/13-ch12-12-ai.txt:777,搜「没有标准」)。

  41. 出处:「第12章 看听说一体:多模态AI」第 657 至 658 段 (text/13-ch12-12-ai.txt:658,搜「语法和文化」)。

  42. 出处:「第12章 看听说一体:多模态AI」第 278 至 280 与 255 至 258 段 (text/13-ch12-12-ai.txt:279,搜「国风素材」;:256,搜「工业质检」)。