跳到主要内容

声音、时间与其他模态 — 同一副骨架能推到多远

这一章讲三件事: 第 18 章那副骨架换成声音、视频、三维和传感器读数之后各变成什么样; 视频为什么在所有模态里位置特殊; 以及多接一个模态会额外带来哪两种别处没有的失效。

它在全书链条里的位置: 这是全书技法部分的最后一章。 它的作用是把第 18 章那副骨架的适用范围划出来—— 哪些地方它直接搬得过去,哪些地方要另配零件,哪些地方它根本不够。

★ 这一章有几处是书自己没有给尾注的综述式陈述, 我们逐处标出来,不把作者的判断写成事实。

1. 先看现象:那句「我做了六周理疗」被转写错了

回到那家保险公司。这次进来的不是文字,是一通理赔电话的录音。

被保人说的:「我做了六周理疗。」
转写出来的:「我做了六周里疗。」

★ 后果:那封拒付信里的「保守治疗周数」这一项,依据的是一份错的记录。

书用一个更狠的例子把这件事讲透了

这个例子必须原样转述,因为它的力量全在那个转折上1:

早期用在法律实务上的模型有一个很不妙的倾向: voir dire(陪审员遴选程序)转写成 war deer(战鹿)。 ★ 这个概念很好笑,可当它没被改正就混进了诉状里,就一点都不好笑了。

而书紧接着给出了这一章第一条硬判断1:

★ 这些失败之所以要紧,是因为一个「95% 准确、却把那 5% 承载最多意义的词搞错」的 转写系统,可能比没有还糟。 在领域内容上做难反例训练,是不可或缺的。

主走查(全章共用): 那通电话录音,加上一段事故现场的视频。 每一节各回答一个问题:该不该训、要多少数据、以及多接一个模态会额外坏在哪。 编造的数每次出现都会标明。

2. 顶层全景:同一副骨架,换不同的前端

┌──────────────┐
│ 声音 │──► 语音编码器 ─┐
├──────────────┤ │
│ 视频 │──► 视频编码器 ─┤
├──────────────┤ ├─► ★ 投影层 ─► 语言模型 ─► 文字
│ 点云 / 深度 │──► 3D 编码器 ─┤ (第 18 章那一块,原样搬过来)
├──────────────┤ │
│ 传感器读数 │──► 时序编码器 ─┘
└──────────────┘

图说:**书说的是——每一种都需要专门的编码器,
但视觉语言模型建立起来的那个通用架构模式,在它们各自的架构里回响。**

★ 这一章的结构就是:§3 声音 · §4 视频 · §5 三维与传感器 ·
§6 多接一个模态额外坏在哪 · §7 为什么这些技能是可迁移的。

3. 机制一:语音 —— 它承载的远不止词

第一件事:语音里的信息比文字多

书开篇就把这一点说清了2:

语音转文字模型从预训练里带来了跨语言、跨口音、跨声学条件的广泛能力, ★ 却规律性地在领域特定的术语上栽跟头。 一个转写日常对话准确率很高的模型,会把医学术语、法律行话、 金融名词或者产品名——那些落在它训练分布之外的东西——搅烂。

数据要多少:这一节最实用的两个数

书给的量级出乎意料地低3:

数据量能拿到什么
几十小时精心转写的领域音频能显著改善领域词汇的识别
几百小时能在领域内容上接近人类的准确率

参照物:对照第 14 章那条继续预训练要「几十亿 token」, 语音这一侧的门槛低得多——因为它要教的不是新知识,是一批新词的读音映射。

但有两条不能商量的前提

书把它们写得很硬3:

① ★ 转写必须完美。
**训练数据里的错,就是模型里的错。**

② ★ 声学条件必须匹配部署。
**在录音棚级的医疗口述上微调出来的模型,
面对嘈杂诊室里的录音,仍然可能吃力。**

除了术语之外,还能训口音、说话风格、以及输出格式要求 (标点风格、大小写约定、说话人分离)3

副语言:情绪可以被训成标注

这是语音相对文字多出来的那一块4:

模型可以被训练成给转写打上情绪标记: 区分沮丧的来电者与满意的、焦虑的病人与平静的。 客服应用用它来恰当地路由与升级;医疗上,它是追踪病人情感的纵向数据。

走查上的落点: 那通理赔电话如果被标出「来电者情绪:沮丧,且在升高」, 系统可以在生成拒付信之前先把这一单转给人工。

★ 但书专门为一件事划了一条伦理线

这一段值得原样转述,因为它是全书少数几处直接谈伦理的地方5:

声音克隆占据的是伦理上更棘手的地带。 ★ 同一项技术,既能为失声者提供个性化的语音合成,也能实现诈骗、冒充和操纵。

技术上它和别的语音模型适配相似,但负责任的部署要主动加装 同意验证、用途限制和滥用监测。 ★ 而监管框架正在出现,但落后于技术。

多语言语音有一个文字没有的难题:语码转换

这一条是这一节最有意思的地方,而且它的机制很清楚6:

★ 书面文字用正字法清清楚楚地划出语言边界。
★ 口语是连续流动的——说话人经常在句中、甚至短语中间就换了语言。

书给的例子:
一位孟买的说话人可能用一种语言开头、技术术语切到英语、再切回来收尾;
一位布鲁塞尔的说话人混着法语和弗拉芒语。

为它微调难在哪6:

需要反映真实多语使用模式的训练数据,而这类数据稀缺且昂贵。 ★ 标注必须切分语言边界,并按各自的正字法正确转写每一段。

低资源语言:靠近亲迁移

书给了一个很具体的例子,而且它的对照很有说服力7:

★ 对那些共享音系与韵律特性的语言,跨语言的相似性会有帮助。

书举的例子:**一个在匈牙利语上训练过的模型,
去适配 Csángó(一种在语音上差异很大的匈牙利方言),
会比一个英语底座去适配容易得多。**

→ 在有限数据上做策略性微调,可以利用这些跨语言相似性,
**以远少于从零所需的数据量,拿到可用的转写质量。**

书还给了一句时代注脚,它对预算判断很有用7:

多年前,我参与过微调当时粗糙的音频模型,让它认出航空航天工程里的一些行业术语; ★ 而今天,即便是轻量的现成模型也能毫不费力地拾起这些术语。

★ 这句话是第 20 章那条「今天要动手才有的本事,明年可能开箱即用」的预演。

4. 机制二:视频 —— 它捕捉了别的数据类型都没有的东西

第一层:时间维度,和逐帧处理的陷阱

书先说清楚视频难在哪8:

视频呈现的是静态图像所缺乏的时间维度:事件在展开,因先于果, 而理解常常要求跨越可能长达数千帧的序列去整合信息。

★ 于是有一个很自然、也很错的做法:逐帧独立处理。 那恰恰丢掉了「让视频区别于幻灯片」的那样东西——帧与帧之间的时间关系。

书列了三种当前的做法及其取舍9:

做法取舍
关键帧采样(按固定间隔挑帧)省算力,但会漏掉两次采样之间发生的事件
时间注意力让模型跨帧关注,从而捕捉帧之间的关系
视频专用编码器直接处理时空块

★ 而选哪一种由一件很实际的事决定9:

监控录像里那些要紧的短暂事件,需要的时间分辨率,远高于教学视频。

走查:那段事故视频在前两种做法下的差别

这一步是这一章主走查的第二个输入。

★ 输入:随理赔一起提交的行车记录仪片段,12 秒,每秒 30 帧 → 共 360 帧。
真正决定责任的那件事发生在**第 7.4 秒到第 7.6 秒之间**:
对方车辆压过中线,**前后一共 6 帧**。
(这里的秒数、帧率、帧数都是为演示编的,不是书里给的数。)

做法① 关键帧采样,每秒取 1 帧 → 这 12 秒里只取到 12 帧
取到的第 7 秒那帧:两车各在自己车道 ← 看着没事
取到的第 8 秒那帧:两车已经贴在一起 ← 看着像事故
★ 压线那 6 帧正好落在两次采样之间,一帧都没取到。
→ 模型说得出「发生了碰撞」,说不出「谁越的线」。
→ 而拒付信要写的恰恰是后一句。

做法② 时间注意力:360 帧全进,让模型跨帧去看
它能把 7.4 秒那一帧和 7.6 秒那一帧连起来,
★ 「越线 → 碰撞」这个先后次序才立得住。
代价:要处理的帧数是做法①的 30 倍(360 对 12)。

图说:书那句「监控录像里那些短暂事件需要的时间分辨率远高于教学视频」,
落到这段视频上就是一句大白话 ——
**一堂网课漏掉两秒钟没关系;这 0.2 秒漏掉,整份责任认定就废了。**

第二层:标注负担大涨

书给的对照很直观10:

一张图可能只需要一句图注; ★ 而一段视频可能需要对动作、它们的持续时长、以及事件之间的因果关系做密集标注。

训练数据必须包含时间上的标注——不只是「视频里发生了什么」, 还有「什么时候发生」以及「事件之间在时间上如何关联」。

★ 第三层:这是这一章最有分量的一段

书说视频在所有模态里位置特殊,理由不是技术上的11:

★ 视频捕捉了别的数据类型都没有捕捉到的东西:物理世界的因果结构。

一张静态图显示的是「一个杯子在桌上」; 而一段视频显示的是这个杯子被放下、滑动、倾倒、摔碎。

书接着给了这件事对训练的含义12:

几个视频生成模型表明:在大量无标注视频上训练出来的模型,隐式地学到了物理—— 物体会落下、液体会流动、碰撞会产生后果,而且这些都合乎物理直觉。

★ 含义是:一个通过视频预训练内化了物理动力学的模型, 可以被微调去做那些需要物理推理的任务(机器人规划、工业过程仿真、外科流程预测), 而这是只在图像和文本上训练过的模型做不到的。

书的收口:视频不只是又一个可以挂到语言模型骨干上的模态, ★ 而是通往「理解世界如何运作,而不只是它看起来如何」的一条路径。

⚠ 声音归属(这是我们加的): 这一整段书里没有给尾注。 它点了三个视频生成模型的名字,但没有为「它们隐式学到了物理」这个说法配任何出处。 所以这一段应当读作作者的综述式陈述,而不是有据的结论。 书自己也加了一句限定:「我们对如何驾驭这些涌现出来的物理表示, 仍然处在早期阶段。」13

5. 机制三:三维与传感器数据 —— 同一副骨架,而瓶颈仍是数据

三维:结构一样,数据难得多

架构模式和第 18 章完全同构14:

3D 编码器 → 投影层 → 语言模型

★ 数据形态:LiDAR 采到的点云、立体相机得到的深度图、医学成像里的体数据。
★ 那一族 3D 编码器,书说它们是视觉版 transformer 的三维对应物。

而数据瓶颈比图文严重得多,书给了三条15:

瓶颈具体
采集要专门的传感器
标注要既能在三维里推理、又能把这种推理用语言讲清楚的标注员
格式分裂3D 数据类型本身就分裂(点云 / 网格 / 体素 / 深度图),进一步切碎可用资源

仿真能补一部分,而书给了一句很有用的判断15:

仿真环境能生成无限的 3D 场景和完美的标注。 ★ 而且仿真与真实之间的差距,在几何结构上通常比在视觉外观上更小。

传感器数据:这一段对企业最有价值

书列的场景全是「企业已经有、但用不上」的东西16:

工业设备的温度读数 · 机器的振动模式 · 医疗监护的电信号 ·
可穿戴的运动数据 · 物联网的遥测流

★ 而这些数据对只训过文本的语言模型基本不可及。

同一套模板延伸过来16:

数据形态用什么编码器
一维时间序列卷积网络
长程依赖的序列循环架构
复杂时间结构transformer 的变体

应用集中在两处,而且书给的例子都很具体17:

预测性维护系统可以用维护人员能据以行动的自然语言, 解释为什么某个传感器模式提示即将发生故障。 临床监护系统可以把数小时的生理数据,总结成可行动的洞见。

★ 而这一段真正的战略含义是: 那个运行着设备、监护着病人、跑着流程的组织, 握有模型提供商拿不到的传感器数据——这正是差异化的机会。

走查上的一步(这一节只占一步): 那家保险公司自己就握着这类数据—— 车载记录仪的加速度与刹车读数、查勘员用手机做的三维扫描。 这两样东西模型提供商一条都拿不到,而它们就在这家公司自己的服务器上。 上面那条战略判断落到这条走查上,就是这一句。

★ 这一条是第 01 章那条「只投别人拿不到的数据」在传感器这一侧的落点, 也是第 20 章那条投资口径的直接依据。

6. 机制四:多接一个模态,额外多出两种失效

这一节是这一章相对第 18 章最有增量的一段。

失效一:跨模态特征漂移

它是灾难性遗忘的多模态版本,但多了一个别处没有的形态18:

随着语言模型的权重在领域训练中更新,视觉与文本特征空间之间的对齐会退化, 导致模型「忘了」怎么把它看到的和它说出的连起来。

★ 这是灾难性遗忘的多模态类比,但多一种失效模式: 模型可能在视觉任务和语言任务上分别都还很强,却丢掉了整合两者的能力。

对策两条18:

对策做什么
用参数高效的方法它靠「在结构上隔离更新」来缓解,避免共享的交叉注意力层里发生破坏性的权重覆盖
监控的对象要换在通用图文对的留出集上监控跨模态一致性,而不只是看领域准确率

★ 后一条是第 10 章那条回归测试在多模态上的具体形态: 只盯领域指标,恰恰看不见你正在丢掉的那样东西。

怎么造「一致性」的训练数据

书给的数据集要含三类,而第二类是关键19:

① 文本描述与图像**正确匹配**的
② ★ 文本与图像**冲突**的
③ 必须综合两个模态才答得出的(任一模态单独都答不出)

★ 训练目标要罚那些「与任一模态中可得证据相矛盾」的回答。

书自己承认这件事说起来容易做起来难19:

把「矛盾」定义成训练流程能操作的形式, 需要仔细想清楚「一致性」对你这个具体应用到底意味着什么。

评估这件事要靠对抗性测试,书给了两个可以直接照问的问题20:

① 模型会不会被文本上下文诱导,去做出与图像内容相反的断言? ② 模型认不认得出文本与视觉信息在冲突,还是它只是简单地偏袒其中一个模态?

走查:同一段视频,配一段和画面对不上的文字

这是那两个问题的具体样子。

★ 输入 = 上面那 12 秒事故视频 + 随案提交的一段文字陈述:
「本车全程在本车道内行驶,系对方车辆突然变道。」
★ 而画面里越线的是**本车**。
(这段陈述是为演示编的,不是书里的例子。)

没训过冲突样本的模型输出:
「对方车辆违规变道,建议按对方全责处理。」
★ 它偏袒了文字那一侧 —— 这正是上面第 ① 问说的
「被文本上下文诱导,去做出与图像内容相反的断言」。

训过冲突样本的模型输出:
「文字陈述与画面记录不一致:第 7.4 秒画面显示越线的是本车。」
★ 它认出了冲突,而不是挑一边站 —— 这是第 ② 问要的那个能力。

图说:两个输出的差别是上面第 ② 类训练数据(文本与图像冲突的)造出来的。
★ 而这个差别在哪个指标上看得见?**不是领域准确率** ——
两个模型在「读得懂事故视频」这件事上可能一样强。
看得见它的是那条**跨模态一致性**。这就是上一段那条对策为什么要换监控对象。

失效二:新模态 = 新攻击面

书给的三种形态,第三种最难防21:

形态长什么样
图像里藏内容图像可以编码有害内容,而配套的文本把它描述得人畜无害
音频里藏操纵音频可以携带转写抓不到的情绪操纵
组合起来单独看都良性的输入,组合起来可能产生有害输出

书给了一个具体到可以直接测的例子21:

★ 一个文本请求会被「用纯文本攻击训出来的安全过滤器」拒掉,
**但把同一个请求嵌进一张图片里,可能就绕过去了**——
如果模型处理「图像中的文字」的路径,与处理「输入文本」的路径不同。

于是红队的要求变了22:

需要跨模态的专长和创造力:团队里要有懂图像处理的、懂音频操纵的、 懂文本对抗攻击的,而且他们要能把这些能力组合起来。 ★ 这更耗时、要求的专长也更杂,但对高风险部署不可省。

7. 机制五:为什么这些技能是可迁移的

企业的多模态需求看着各不相同

书列了四类23:

场景要处理什么
文档理解发票、合同、表单里的文字、表格、标识、签名
制造检验颜色、纹理、形状上的细微偏差
医学影像
客服用户发来的截图和产品照片

但它们要的是同一样东西

书的判断很干脆23:

★ 它们要的是同一样东西:通用模型缺的那种领域特定的多模态理解。

掌握了多模态后训练的人,技能在这片版图上是可迁移的: 技术机制(视觉编码器、投影层、指令微调、对齐)不变, 而数据集构造、评估设计、安全保证的原则,只需适度调整就能迁移。

作者用自己的经历给了佐证24:

我做过跨越文档理解、医学影像和工业检验的项目。 ★ 这些应用看起来很不一样,但底下的工作惊人地相似。

走查上的一步(这一节只占一步): 回头看这一章换过的三样输入—— 那通理赔电话录音、那 12 秒事故视频、车载记录仪的读数。

每换一样,要做的事都是同一串:配一个专门的编码器 → 过投影层 → 造一批带冲突样本的数据集 → 用跨模态一致性去验。 ★ 变的只有编码器那一格,后面三格一字不改——这就是「技能可迁移」在这条走查上的样子。

全章总结的三条

书末尾给了三条,而第一条是全章的核心25:

内容
① 标注成本是核心挑战每个多模态样例都要同时满足感知和语言两个维度的约束,通常使成本翻倍或三倍;而领域多模态标注进一步压缩可用人力。握有领域专家与运营数据的组织,持有难以复制的优势
② 合成数据只能部分缓解多模态的合成生成远不如文本生成成熟——生成有用的图像、可信的音频或连贯的视频,比生成文本难
③ 工具生态已经成熟视觉语言模型的微调不再是大实验室的专属:70 亿参数的模型能在单张消费级显卡上微调

而合成这一侧正在快速变化

书给了视觉合成数据最成熟的那个生态,并给了两个数26:

做法:从三维场景定义渲染照片级图像,配合基于物理的光线追踪
和系统化的「域随机化」(光照、材质、姿态、相机角度、环境参数按程序变化)

★ 关键:**标注(框、分割掩码、深度图、表面法线)随每一帧自动产出,
消除了人工标注的瓶颈。**

★ 经济学后果:三维资产和场景定义一旦存在,
**每张额外训练图的边际成本趋近于零,只受显卡算力而不是标注员工时限制。**

书给的两个数:
完全用这套生成的数据训练的缺陷检测模型,
**从单个 CAD 文件就做到 97% 以上的精确率**;
机器人团队用配套的仿真环境产出**数万张带标注的训练图像,
而没有采集一张真实照片。**

⚠ 声音归属(这是我们加的): 这一整段书没有给任何尾注。 那个「97% 以上」和「数万张」都是无出处的数字。 我们照实转述,但读者不应把它们当作可核查的实验结果。

书对整件事的收口27:

多模态是企业后训练里扩张最快的能力前沿。 它所要求的数据量,此前对多数企业是不可承受的, ★ 而合成图像生成的发展革命性地改变了这个领域的经济学—— 把它从一潭死水变成了前沿。

8. 作者的判断与证据

说法是哪一类说明
那个法律转写的例子作者的举例没有配出处,是他对早期实践的叙述1
「95% 准确却搞错那 5% 可能比没有还糟」作者的判断这是这一章最该记住的一句,但它是论断不是实测1
几十小时 / 几百小时量级示意书没有配调研出处3
转写必须完美、声学要匹配机制的直接后果「训练数据里的错就是模型里的错」可以自己推3
声音克隆那条伦理线作者的立场他明说「监管框架正在出现但落后于技术」5
匈牙利语迁移那个例子作者的举例没有配研究出处7
「今天现成模型毫不费力地拾起那些术语」作者亲历时代注脚,对预算判断有用7
三种视频做法的取舍技术事实各自的代价可以从机制推出9
视频捕捉物理因果结构无尾注的综述式陈述书点了三个模型的名字,但没有为「它们隐式学到了物理」配出处;作者自己也说「我们仍处在早期阶段」111213
三维的数据瓶颈三条作者的分析每一条都给了具体理由15
「仿真与真实的差距在几何上比在外观上小」作者的判断没有配数据,但它是可以被检验的15
握有传感器数据的组织有差异化机会作者的战略判断它是第 20 章那条投资口径的直接依据17
跨模态特征漂移他引研究者的命名那个「分别都强、却丢掉整合能力」的失效形态是它的独特之处18
参数高效方法能缓解漂移机制解释理由是「在结构上隔离更新」18
把请求嵌进图片可能绕过过滤器作者给的攻击示例它给了一个可以直接照做的测试21
「技能在这片版图上可迁移」作者的判断 + 亲历他用自己跨三个领域的项目经历作佐证2324
97% 精确率、数万张图整段无尾注这两个数没有任何出处,我们照实标注26

9. 边界与局限

  1. 这一章书讲得比第 18 章浅。 它对语音、视频、3D、传感器各给一到两节, 没有给任何一条完整的配方——所以这一章交付的是「该不该做、难在哪」,不是「怎么做」。
  2. 具体的模型与工具名我们大多不点。 书点了一批模型和框架的名字, 它们的迭代速度比这本书快;我们只保留那些影响判断的性质。
  3. 视频那一段和视觉合成数据那一段,书都没有给尾注。 我们逐处标出来了。要拿它们做决策的读者,必须自己去核。
  4. 跨模态一致性的训练目标书只给了方向。 它承认「把矛盾定义成训练流程能操作的形式」 需要仔细想清楚,但没有给一个可照做的定义
  5. 多语言与低资源语言那一块,书的立场超出了技术。 它明说这也关乎「通过尊重每个人选择的语言来维护其尊严与身份」的道德承诺—— 这是作者的价值判断,我们照实转述,不当成技术结论。

10. 可带走的

  1. 语音承载的远不止词:说话人身份、情绪状态、强调、不确定;
  2. 通用转写模型规律性地在领域术语上翻车——医学、法律、金融、产品名; 那个把陪审员遴选程序转成「战鹿」的例子混进诉状就一点不好笑了;
  3. ★★ 一个「95% 准确、却把承载最多意义的那 5% 搞错」的系统,可能比没有还糟; 领域内容上的难反例训练不可或缺;
  4. 语音微调的数据门槛低得出人意料:★ 几十小时精心转写的领域音频就能显著改善, 几百小时能接近人类准确率;
  5. 但两条前提不能商量:★ 转写必须完美(数据里的错就是模型里的错); ★ 声学条件必须匹配部署(录音棚训的模型到嘈杂诊室仍会吃力);
  6. 副语言可以被训成标注(区分沮丧与满意的来电者、焦虑与平静的病人), 用于客服路由与升级;
  7. 声音克隆是同一项技术的两面:既能给失声者做个性化合成,也能诈骗、冒充、操纵; 负责任的部署要主动加同意验证与滥用监测,而监管落后于技术;
  8. 口语的独有难题是语码转换:书面文字有正字法划边界,口语没有; 说话人会在句中甚至短语中间换语言;标注要切分语言边界并各按其正字法转写;
  9. 低资源语言靠近亲迁移:在匈牙利语上训过的模型去适配一种音系差异很大的匈牙利方言, 比拿英语底座容易得多;
  10. 一句时代注脚:多年前要微调才认得的航空航天术语,今天轻量的现成模型毫不费力就拾起了;
  11. 视频逐帧独立处理,恰恰丢掉了让视频区别于幻灯片的那样东西——时间关系;
  12. 三种做法的取舍:关键帧采样省算力但漏事件 · 跨帧注意力 · 视频专用编码器; ★ 监控录像要的时间分辨率远高于教学视频;
  13. 标注负担大涨:★ 一张图一句图注,一段视频要密集标注动作、时长与因果关系;
  14. ★★ 视频捕捉了别的数据类型都没有的东西:物理世界的因果结构。 静态图显示杯子在桌上,视频显示它被放下、滑动、倾倒、摔碎; ⚠ 但这一段书没有给尾注,读作作者的综述式陈述;
  15. 三维与传感器共用同一副骨架(专用编码器 → 投影层 → 语言模型); 点云用一族三维编码器、一维时序用卷积、长程依赖用循环、复杂时间结构用 transformer 变体;
  16. 三维的瓶颈比图文严重:采集要专门传感器 · 标注员要能在三维里推理并用语言讲清楚 · 数据类型本身分裂;★ 仿真能补一部分,而且几何上的仿真-真实差距通常比外观上的小;
  17. ★★ 运行设备、监护病人、跑流程的那个组织,握有模型提供商拿不到的传感器数据—— 这正是差异化的机会;
  18. 跨模态特征漂移:微调时视觉与文本的表示会重新错位; 多出的那种失效是——模型两边分别都还很强,却丢掉了整合的能力;
  19. 对策两条:用参数高效的方法(在结构上隔离更新)· ★ 在通用图文对的留出集上 监控一致性,而不只是看领域准确率;
  20. 一致性数据要含三类:正确匹配的 · ★ 互相冲突的 · 必须综合两者才答得出的;
  21. 对抗性测试的两个问题:能不能被文本诱导去说与图相反的话? 它认不认得出两者在冲突,还是只是偏袒某一个模态?
  22. 新模态 = 新攻击面:图里藏内容 · 音频里藏操纵 · 单独良性的输入组合起来产生有害输出; ★ 纯文本会被拒的请求,写进图片里可能绕过去;
  23. 红队因此要跨模态的专长与创造力——更耗时、专长更杂,但对高风险部署不可省;
  24. 企业的多模态需求看着各不相同,要的却是同一样东西: 通用模型缺的那种领域特定的多模态理解;所以这些技能是可迁移的;
  25. ★★ 标注成本是核心挑战;而握有领域专家与运营数据的组织,持有难以复制的优势;
  26. 多模态的合成生成远不如文本生成成熟;
  27. 但视觉这一侧正在变:从三维场景渲染 + 域随机化,标注随每帧自动产出, 边际成本趋近于零、只受算力而非人工限制; ⚠ 那段给的 97% 精确率与「数万张图」没有任何出处

11. 原文地图

主题原书章原文位置
领域术语翻车 · 那个法律例子 · 95% 那句Beyond Text: Speech and Soundtext/158-fm-beyond-text-speech-and-sound.txt:7(搜「war deer」)
数据门槛 · 两条前提Beyond Text: Speech and Soundtext/158-fm-beyond-text-speech-and-sound.txt:9(搜「Tens of hours of carefully transcribed domain audio」)
副语言 · 声音克隆的伦理线Beyond Text: Speech and Soundtext/158-fm-beyond-text-speech-and-sound.txt:17(搜「Emotion-aware transcription」) · :19(搜「more ethically fraught territory」)
语码转换 · 标注要求 · 近亲迁移Beyond Text: Speech and Soundtext/158-fm-beyond-text-speech-and-sound.txt:23(搜「speakers routinely code switch」) · :25(搜「segment language boundaries」) · :27(搜「Csángó」)
前沿在扩张 · 视频的时间维度 · 三种做法The Frontier Beyondtext/159-fm-the-frontier-beyond.txt:3(搜「the frontier of multimodality is ever expanding」) · :7(搜「the temporal dimension that static images lack」) · :9(搜「Frame sampling selects keyframes」)
视频标注负担 · ⚠ 物理因果结构(无尾注)The Frontier Beyondtext/159-fm-the-frontier-beyond.txt:13(搜「The annotation burden increases substantially」) · :15(搜「the causal structure of the physical world」) · :17(搜「implicitly learn physics」) · :19(搜「rather than merely how it」)
三维 · 数据瓶颈 · 仿真The Frontier Beyondtext/159-fm-the-frontier-beyond.txt:23(搜「reason about spatial structure」) · :27(搜「a data bottleneck more severe」)
传感器数据 · 战略含义The Frontier Beyondtext/159-fm-the-frontier-beyond.txt:31(搜「telemetry streams from IoT networks」) · :35(搜「Predictive maintenance systems」)
一致性数据三类 · 对抗测试 · 跨模态特征漂移When Modalities Collidetext/160-fm-when-modalities-collide.txt:7(搜「contradictions must be resolved」) · :9(搜「adversarial testing that probes for failures」) · :11(搜「cross-modal feature drift」)
新攻击面 · 跨模态红队When Modalities Collidetext/160-fm-when-modalities-collide.txt:15(搜「combinations of individually benign inputs」) · :19(搜「expertise that spans modalities」)
四类企业场景 · 技能可迁移When Modalities Collidetext/160-fm-when-modalities-collide.txt:23(搜「Document-understanding processes scan invoices」) · :27(搜「find their skills portable」)
作者的亲历佐证FROM THE TRENCHES: TRANSFERABLE SKILLS ACROSS APPLICATIONStext/161-fm-from-the-trenches-transferable-skills-across-app.txt:3(搜「remarkably similar」)
三条总结 · ⚠ 视觉合成生态(无尾注)What Holds Across Modalitiestext/162-fm-what-holds-across-modalities.txt:5(搜「The central challenge is annotation cost」) · :7(搜「remains less mature than text generation」) · :9(搜「the most mature ecosystem」) · :11(搜「over 97 percent precision」) · :13(搜「no longer the exclusive province」)
合成图像改变了这一块的经济学Summarytext/163-fm-summary.txt:3(搜「the most rapidly expanding frontier」)

Footnotes

  1. 出处:「Beyond Text: Speech and Sound」第 7 段(text/158-fm-beyond-text-speech-and-sound.txt:7,搜「war deer」)。原文那句最重的话是:一个 95% 准确、却把那 5% 承载最多意义的词搞烂的转写系统,可能比没有还糟。 那个法律例子书没有配出处,是作者对早期实践的叙述。 2 3 4

  2. 出处:「Beyond Text: Speech and Sound」第 7 段(text/158-fm-beyond-text-speech-and-sound.txt:7,搜「stumble on domain-specific terminology with predictable regularity」)。原文列的四类是:医学术语、法律行话、金融名词、产品名——都是落在训练分布之外的东西

  3. 出处:「Beyond Text: Speech and Sound」第 9 段(text/158-fm-beyond-text-speech-and-sound.txt:9,搜「Tens of hours of carefully transcribed domain audio」)。那两个数据量级书没有配调研出处。 同段还给了两条前提(转写必须完美、声学条件必须匹配部署)和三类额外可训的东西(口音、说话风格、输出格式要求——标点风格、大小写约定、说话人分离)。 2 3 4 5

  4. 出处:「Beyond Text: Speech and Sound」第 17 段(text/158-fm-beyond-text-speech-and-sound.txt:17,搜「Emotion-aware transcription」)。原文给的两类用途是客服路由与升级,以及医疗上追踪病人情感的纵向数据。

  5. 出处:「Beyond Text: Speech and Sound」第 19 段(text/158-fm-beyond-text-speech-and-sound.txt:19,搜「more ethically fraught territory」)。「监管框架正在出现但落后于技术」是作者的判断。 书要求的三样是:同意验证、用途限制、滥用监测。 2

  6. 出处:「Beyond Text: Speech and Sound」第 23 段(text/158-fm-beyond-text-speech-and-sound.txt:23,搜「speakers routinely code switch」)与第 25 段(text/158-fm-beyond-text-speech-and-sound.txt:25,搜「segment language boundaries」)。那句机制对照(书面文字用正字法清楚划出语言边界,而口语是连续流动的)是这一节的钥匙。 2

  7. 出处:「Beyond Text: Speech and Sound」第 27 段(text/158-fm-beyond-text-speech-and-sound.txt:27,搜「Csángó」)。那个匈牙利语迁移的例子书没有配研究出处。 同段那句时代注脚是作者的亲历:多年前要微调才认得的航空航天术语,今天连轻量的现成模型都能毫不费力地拾起。这一段末尾作者还表明了一个价值立场:这也关乎通过尊重每个人所选择的语言来维护其尊严与身份的道德承诺。 2 3 4

  8. 出处:「The Frontier Beyond」第 7 段(text/159-fm-the-frontier-beyond.txt:7,搜「the temporal dimension that static images lack」)。第 3 段(text/159-fm-the-frontier-beyond.txt:3,搜「the frontier of multimodality is ever expanding」)是那句总纲:每一种新模态都需要专门的编码器,但视觉语言模型建立起来的那个通用架构模式,在它们各自的架构里回响。

  9. 出处:「The Frontier Beyond」第 9 段(text/159-fm-the-frontier-beyond.txt:9,搜「Frame sampling selects keyframes」)。那句关于时间分辨率的对照(监控录像 vs 教学视频)是选做法时最实际的判据。 2 3

  10. 出处:「The Frontier Beyond」第 13 段(text/159-fm-the-frontier-beyond.txt:13,搜「The annotation burden increases substantially」)。第 11 段(text/159-fm-the-frontier-beyond.txt:11,搜「treating sampled frames as ordered image sequences」)说明了当前的实现路径:一些模型已经原生把采样帧当作有序的图像序列处理,不需要单独的视频编码器;书还提到有工作引入带时间戳知识的离散时间 token,能回答「何时发生」「之前之后发生了什么」

  11. 出处:「The Frontier Beyond」第 15 段(text/159-fm-the-frontier-beyond.txt:15,搜「the causal structure of the physical world」)。那个杯子的例子(静态图显示它在桌上,视频显示它被放下、滑动、倾倒、摔碎)是书里的原例。 2

  12. 出处:「The Frontier Beyond」第 17 段(text/159-fm-the-frontier-beyond.txt:17,搜「implicitly learn physics」)与第 19 段(text/159-fm-the-frontier-beyond.txt:19,搜「rather than merely how it」)。⚠ 这两段书都没有给尾注——它点了三个视频生成模型的名字,但没有为「它们隐式学到了物理」这个说法配任何出处。第 19 段那句收口是:视频不只是又一个可以挂到语言模型骨干上的模态,而是通往「理解世界如何运作而不只是它看起来如何」的一条路径。 2

  13. 出处:「The Frontier Beyond」第 19 段(text/159-fm-the-frontier-beyond.txt:19,搜「still in the early stages」)。作者自己给了这条限定,我们把它保留下来当作这一段可信度的标尺。 2

  14. 出处:「The Frontier Beyond」第 23 段(text/159-fm-the-frontier-beyond.txt:23,搜「reason about spatial structure」)。原文列的三种三维数据形态是:LiDAR 采到的点云、立体相机得到的深度图、医学成像里的体数据;并说那一族三维编码器是视觉版 transformer 的三维对应物

  15. 出处:「The Frontier Beyond」第 27 段(text/159-fm-the-frontier-beyond.txt:27,搜「a data bottleneck more severe」)。那句关于仿真的判断(几何结构上的仿真-真实差距通常比视觉外观上的小)是这一段最有用的一条,而书没有为它配数据。 2 3 4

  16. 出处:「The Frontier Beyond」第 31 段(text/159-fm-the-frontier-beyond.txt:31,搜「telemetry streams from IoT networks」)。原文那两句很具体:微妙的振动变化可能预示设备故障,生理信号的移动可能提示病人恶化——而这些对只训过文本的语言模型基本不可及 2

  17. 出处:「The Frontier Beyond」第 35 段(text/159-fm-the-frontier-beyond.txt:35,搜「Predictive maintenance systems」)。那句战略判断(运行设备、监护病人、跑流程的组织握有模型提供商拿不到的传感器数据)是第 20 章那条投资口径的直接依据。 2

  18. 出处:「When Modalities Collide」第 11 段(text/160-fm-when-modalities-collide.txt:11,搜「cross-modal feature drift」)。原文明说这是灾难性遗忘的多模态类比,但多一种失效模式;两条对策(参数高效方法在结构上隔离更新、在通用图文对的留出集上监控一致性)也在这一段。书自己把它指向了它的第 8 章(我们的第 14 章)。 2 3 4

  19. 出处:「When Modalities Collide」第 7 段(text/160-fm-when-modalities-collide.txt:7,搜「contradictions must be resolved」)。那句坦白(把「矛盾」定义成训练流程能操作的形式,需要仔细想清楚一致性对具体应用意味着什么)是这一节唯一的诚实之处,书没有给出可照做的定义。 2

  20. 出处:「When Modalities Collide」第 9 段(text/160-fm-when-modalities-collide.txt:9,搜「adversarial testing that probes for failures」)。那两个问题是书里的原问。

  21. 出处:「When Modalities Collide」第 15 段(text/160-fm-when-modalities-collide.txt:15,搜「combinations of individually benign inputs」)。那个「把请求嵌进图片里可能绕过纯文本过滤器」的例子,给了一个可以直接照做的测试。 2 3

  22. 出处:「When Modalities Collide」第 19 段(text/160-fm-when-modalities-collide.txt:19,搜「expertise that spans modalities」)。原文:这更耗时、要求的专长也更杂,但对高风险部署不可省。

  23. 出处:「When Modalities Collide」第 23 段(text/160-fm-when-modalities-collide.txt:23,搜「Document-understanding processes scan invoices」)与第 27 段(text/160-fm-when-modalities-collide.txt:27,搜「find their skills portable」)。第 27 段那句是这一节的判断:技术机制不变,而数据集构造、评估设计、安全保证的原则只需适度调整就能迁移。 2 3

  24. 出处:「FROM THE TRENCHES: TRANSFERABLE SKILLS ACROSS APPLICATIONS」第 3 段(text/161-fm-from-the-trenches-transferable-skills-across-app.txt:3,搜「remarkably similar」)。这是作者的亲历,覆盖文档理解、医学影像、工业检验三类项目。 2

  25. 出处:「What Holds Across Modalities」第 5 段(text/162-fm-what-holds-across-modalities.txt:5,搜「The central challenge is annotation cost」)、第 7 段(text/162-fm-what-holds-across-modalities.txt:7,搜「remains less mature than text generation」)与第 13 段(text/162-fm-what-holds-across-modalities.txt:13,搜「no longer the exclusive province」)。第 5 段那句「握有领域专家与运营数据的组织持有难以复制的优势」是全章的战略收口。 第 7 段还提到:书在这里把「合成数据那一章」的章号写成了第 10 章,而实际上那是它的第 11 章(我们的第 17 章)。

  26. 出处:「What Holds Across Modalities」第 9 段(text/162-fm-what-holds-across-modalities.txt:9,搜「the most mature ecosystem」)与第 11 段(text/162-fm-what-holds-across-modalities.txt:11,搜「over 97 percent precision」)。⚠ 这两段书没有给任何尾注,那个「97% 以上的精确率」和「数万张带标注图像而没有采集一张真实照片」都是无出处的数字。 我们照实转述并在正文里标明。 2

  27. 出处:「Summary」第 3 段(text/163-fm-summary.txt:3,搜「the most rapidly expanding frontier」)。原文那句是:合成图像生成的发展革命性地改变了这个领域的经济学。