跳到主要内容

多模态与实时交互:从对话框到真实世界

这一章讲三件事: 语音交互的三代范式怎么沿「摆脱轮次猜测」一条轴演进; 「实时响应」与「深度思考」的矛盾有几种解法;同样的延迟问题在电脑操作 (Computer Use)和机器人上长什么样。书里明说:语音是走得最完整的参考系, 另两个场景对照着看。

1. 这一章讲什么

文本世界的 Agent 已经由前几章建成。这一章跨出去:当 Agent 要听懂语音、点对 按钮、控制机械臂,它进入多模态实时交互——同时处理多种信息形式(文字、语音、 图像、动作),并且必须在严格的时间预算内回应。书里先划边界:静态的看图读 PDF 已经融入感知工具,不用专门架构;本章聚焦实时性把问题变难的三个场景—— 语音对话、GUI 操作、机器人控制。它们卡住的地方高度相似:都要同时处理多种 模态,都对延迟极度敏感——语音停顿超过两秒就让人焦躁,机器人毫秒级的抖动 可能导致碰撞1

2. 顶层全景:主走查——延迟瀑布,一笔一笔算

全部延迟区间来自原书;合成一笔总账的方式沿用原书图 9-2。

一个级联式语音 Agent,用户说完一句话到听到回答,中间发生了什么?

VAD 等静音(判断「说完了没有」) 500-800ms
↓ 交棒
ASR 语音转文字 50-200ms
↓ 交棒(此时 LLM 一直闲着,没收到任何信息)
LLM 首字延迟 100-500ms(开思考可达 5-10 秒)
↓ 交棒(传统架构 TTS 要等完整回复)
TTS 合成语音 200-500ms
─────────────────────────────────────
合计:约 0.9-2 秒——还是所有服务空闲、无人排队的理想值

两级压法,书里各给了一半:全链路流式化让 ASR 边听边转、LLM 按句切分、 TTS 句级合成,三级像同时开工的工位,端到端(从输入直做到输出)压到 600-800ms——但 VAD 那段 500-800ms 的静默等待压不掉,因为它是流水线开工的前提;排队效应更糟: 利用率 80% 时,延迟变成空载的 5 倍(排队论:总延迟≈空载×1/(1−利用率))—— 所以服务器不能长期高负载运行2。要到根本性的解法,得换范式,见 3.2。

3. 核心原理

3.1 三代范式:一条「摆脱 VAD」的轴

VAD(语音活动检测:靠静音判断用户何时说完)是前两代范式的命门。书里用 OpenAI 的三分法搭坐标系3:

范式代表局限
级联最早的 ChatGPT Voice上面那道延迟瀑布;模型间传信息丢失
端到端全模态(Omni)高级语音模式、Qwen3-Omni延迟更低、保留情感语调,但仍靠 VAD 判断轮次——用户报数字时略一停顿就被插话
全双工Moshi、GPT-Live边听边说,每秒做多次「该说、该听、该打断」的决策,彻底取消「轮流」

VAD 的三个根本问题值得单列:延迟累积(必须等 500-800ms 静音,因为它无法 预知未来);信息丢失(只输出「有声/无声」,情绪、犹豫、噪声全丢);准确率 下降(音频被切成孤立片段,「john dot smith」被切断后 smith 可能被误识别为 miss)4

流式语音感知是修补路线:让识别器直接从连续音频流输出语义响应,「识别」与 「理解」合一,还继承 LLM 的世界知识(知道「苹果」后面跟「发布会」大概率指 Apple)。书里引了一个作者自己的干净发现:模型在「该不该收话」上摇摆,根源 往往不在模型结构,而在训练标签是用「上帝视角」标的——标注(给音频打「该不该收话」的标准答案)的人用到了决策点 之后才出现的音频,线上模型却看不到未来;把每条标签改成「只用决策当下能拿到的 信息」来标,摇摆消失。又一次:数据比架构关键5

全双工走到逻辑终点:交互性不该靠外挂 VAD 环绕在模型外,而应内建于模型。 Thinking Machines Lab 的「交互模型」以约 200ms 为一段持续「读入 200ms、生成 200ms」(微轮次);GPT-Live 把全双工带向生产规模,遇到难题则委派后台更强的 推理模型——这条「快慢分工」是下一节的主题6

还有一个常被忽略的维度:端到端的优势主要在延迟,在准确率上并不必然占优。 书里的「自级联」对照:同一模型先转写再推理,当答案主要由「说了什么」决定时, 自级联不差甚至更好(弱感知模型上尤甚);答案依赖语调情绪时端到端才占优—— 优劣可按任务性质事先判定,而把中间文本升级为带副语言标记的结构化表示, 端到端的准确率优势还会收窄7

3.2 思考架构:实时响应与深度思考的三种调和

用户要毫秒级回应,复杂问题要秒级思考——三种方案,不是线性迭代,是不同约束 下的取舍8:

方案一:快慢并行。 快思考 500ms 给应付性回答(「让我想想」),慢思考后台 跑 5-10 秒给完整答案。两个失败模式:简单问题过度思考(「今天星期几」,快思考 已答对,慢思考 10 秒后又重复一遍);快慢不一致——快思考基于某假设作答, 慢思考发现假设不成立得出相反结论,用户几秒内听到自相矛盾的回答,信任崩塌9

方案二:快交互、慢提醒。 慢思考不再直接对用户说话,而是通过状态栏给快 思考递建议;GPT-Live 的委派、Pine AI 语音 Agent 都是此路的生产实例。局限: 沟通是间接的(像两人解题只能递纸条,看不到对方草稿纸),且无法边想边说10

方案三:思考内化(Step-Audio R1)。 先诊断病根——文本代理思考:很多 音频模型的「思考」其实是基于文本转录做语义分析,不是真在听声音;反直觉的 现象是思考链越长性能越差,因为 CoT 训练数据由文本模型生成。解法两件套: MGRD 蒸馏(生成多条思考,筛选真在听声音的——「语速比正常快 40%、音量 升高」,而非「歌词提到悲伤」——重训,RL 防偷懒)+ MPS 双脑(构思脑持续 思考、表达脑边收边说,流水线并行)。实测(Spoken-MQA 语音数学):不思考 70.6%,边说边想 92.8%,先想一段再说 93.9%,完整想完再说 93.0%——边想边说 几乎无损失,因为 CoT 开头通常只是复述问题11

产业分野因此分明:前沿产品押方案二(前台交互模型可随时换用最新大脑),方案三 适合追求极致自然度、愿担专门训练成本的场景——「可换的大脑」与「更紧的边想 边说」之间取舍12

快慢之间的接口:慢思考给快思考递话,除文字还能传什么?书里的 Latent Bridge 实验:冻结快慢两个模型,只训中间几千万参数的小「桥」,把慢模型隐层 投影成潜 token 拼进快模型输入,绕开「想法→文字→再理解」的往返;Atari 游戏 上部分提升 26%-82%,每步只多 5ms。诚实的边界:慢思考本来就比快反应强时, 桥才有用(相关性 r≈0.9);纯拼反应速度的任务,再好的桥也无济于事13

3.3 Computer Use:三条定位路线与分辨率陷阱

让 AI 像人一样操作电脑:截图→模型输出思考+动作→执行→再截图。核心设计之一 是视觉定位(在截图里找到目标元素),三条路线14:

路线做法适用
Set-of-Mark分割模型切区域、叠加编号,模型报编号原生桌面、游戏(无 DOM 可用)
结构化元素索引从 DOM/无障碍树枚举(一个个列出来)可交互元素编号Web 首选——「选择题比填空题好答」
纯坐标预测模型直接看图报坐标训练过 GUI 定位的模型(SeeClick、Claude)

坐标路线有个实打实的陷阱:分辨率匹配。Claude 训练用 XGA/WXGA/FWXGA 三档 (如 1024×768、1366×768);真实屏幕 2560×1440(16:9)应映射到宽高比最接近的 FWXGA(1366×768)——模型输出 (683, 384),工具层反向换算成真实坐标 (683×2560/1366, 384×1440/768) ≈ (1280, 720)。硬把 16:9 拉进 4:3, 画面压扁,坐标系统性偏移——「在小地图上量距离直接用到大地图上」15

屏幕动起来怎么办(视频、弹窗、会议人声)?书里的 AOI 观察接口给出一个反直觉 发现:真正起作用的不是「选哪几帧」,而是**「把帧叙述成能长期留存的文字」**—— 文字才是 LLM 最擅长处理的模态;八个模型上免重训提升 17-48 个百分点16

效率是比准确率更硬的瓶颈:OSWorld 上准确率已近人类,但操作步骤明显多于 人类、每步推理延迟随上下文增长——人类几十秒的文档调整,Agent 要磨几分钟。 已跑通的绕行方案还是快慢解耦:快语音 Agent+慢电脑 Agent 并行,靠一份 「纯文本契约」(滚动状态摘要)沟通——语音回应快约 15 倍(中位 0.58 秒 vs 8.64 秒)成功率不降;抽掉契约,成功率塌到 0,因为用户口头给的关键信息传不到 浏览器里。那份契约,本质上就是第 04 章的状态栏17

移动端多一层非技术障碍:生态壁垒——手机厂商集成 AI 操作微信淘宝很快被 平台限制,因为 Agent 绕过了广告与流量的变现链路,这是结构性利益冲突,短期 难调和18

3.4 机器人:硬件不是瓶颈,数据才是

书里用一个有力的反证开场:成本不到 1000 美元的双臂机器人,人类 VR 遥操作下 流畅完成大量家庭任务(遥操作延迟 100-200ms)——现有低成本硬件+人类智能 足以干这类活,瓶颈在算法层。边界也划清:触觉传感与灵巧手仍是硬件短板19

算法侧的两层:双层架构(长程规划管「做什么」,VLA 控制管「怎么做」—— 结构上正是快慢思考的翻版)+ 动作分块。分块的账很直观:传统机器人控制要求 50-1000Hz,VLA 单次推理只有约 1-10Hz,差两个数量级;动作分块让模型一口气生成 未来 0.5-1 秒的动作序列(50Hz 下即 25-50 个动作),控制线程高频回放,模型 后台异步生成下一批——像视频缓冲。代价是拿反应性换平滑性:块越长越连贯, 但这段「看不到」新画面,物体被挪走就越迟钝20

动作表示两条路线:离散 token(RT-2/OpenVLA,像生成文本一样逐个输出动作)、 连续轨迹(π₀ 用流匹配直接生成平滑曲线——「菜单点菜」对「画家勾曲线」)21。 更硬的骨头是训练与泛化:演示数据贵、跨任务泛化弱。Sim2Real(仿真训完 直接上真机)的两个工程环节:随机化范围标定(先实测真实分布,掉点再扩)、 视觉对齐(摄像头位姿+绿幕背景替换);书里的实验只用 RGB、零样本(不做任何额外调整)迁移到真实 机械臂抓取成功22

4. 作者的判断与证据

书里给了证据的: 延迟瀑布与流式化的各区间、实验 9-3 的 800-1100ms 对照、 Step-Audio R1 的四配置对照(70.6/92.8/93.9/93.0)、Latent Bridge 的 r≈0.9、 AOI 的 +17~48 个百分点、快慢解耦的 15 倍、遥操作反证——多为作者团队或标注 来源的实验。

是作者的判断: 「交互性应内建于模型」转引 Thinking Machines Lab 的主张 (书里如实标注);「语音是另外两个场景的参考系」是组织材料的裁决;「硬件不是 瓶颈」被作者主动限定在「以视觉反馈为主的家庭操作任务」内——这是全章自我 设限最诚实的一处。如果错,会错在: 若遥操作演示依赖操作者的高超技巧 (数据质量被高估),「算法才是瓶颈」的结论就要打折扣。

5. 边界与局限

  • 延迟数字依赖部署硬件与模型规格,区间会漂移,数量级稳;
  • Computer Use 的实时性(把截图-思考-点击循环本身变快)尚无系统性解法, 书里明说这是开放问题;
  • 全双工的「交互模型」截至写作仍是研究预览,生产规模最大的是 GPT-Live;
  • 机器人部分作者明说可跳过;触觉与灵巧手不解决,「硬件不是瓶颈」不适用于 力控任务;
  • 三场景的「端到端化」趋势是书里基于当前证据的延伸猜测,五年后的形态书里留给 思考题。

6. 可带走的

  1. 三个实时场景同构:多模态×延迟;语音的演进线可当对照系;
  2. 延迟瀑布:VAD 静默等待是级联架构压不掉的一段——要消它得换范式;
  3. 利用率 80%,延迟 5 倍——排队延迟非线性(越忙涨得越快)飙升;
  4. VAD 的三个病:等静音、丢情绪、切碎上下文;流式感知一次治三个;
  5. 「该不该收话」摇摆,先查训练标签是不是上帝视角标的;
  6. 端到端赢延迟不一定赢准确率:答案靠语义的任务,自级联不差;
  7. 快慢分工已成主流:前台可换、后台最强;两个独立模型并行会「快慢不一致」;
  8. Computer Use 分辨率必须按宽高比匹配,否则坐标系统性偏移;
  9. 把看到的讲成文字留存,比挑哪几帧更重要;
  10. 机器人动作分块=拿反应性换平滑性;块长按任务容忍度定。

7. 原文地图

主题原书章原文位置
章节边界与三场景9 多模态与实时交互text/11-ch09.txt:5(搜「多模态」) · text/11-ch09.txt:9(搜「两秒」)
语音带宽与 whisper coding9 多模态与实时交互text/11-ch09.txt:25(搜「四倍」) · text/11-ch09.txt:27(搜「whisper coding」)
三范式9 多模态与实时交互text/11-ch09.txt:33(搜「三分法」) · text/11-ch09.txt:37(搜「轮流说话」) · text/11-ch09.txt:39(搜「全双工」)
级联延迟瀑布9 多模态与实时交互text/11-ch09.txt:47(搜「接力赛」) · text/11-ch09.txt:53(搜「500-800ms」) · text/11-ch09.txt:59(搜「0.9-2 秒」)
排队论9 多模态与实时交互text/11-ch09.txt:65(搜「利用率」)
全链路流式化9 多模态与实时交互text/11-ch09.txt:93(搜「流式」) · text/11-ch09.txt:101(搜「600-800ms」) · text/11-ch09.txt:103(搜「压不掉」)
VAD 三问题9 多模态与实时交互text/11-ch09.txt:109(搜「延迟累积」) · text/11-ch09.txt:113(搜「john」)
流式感知与上帝视角标签9 多模态与实时交互text/11-ch09.txt:117(搜「流式听觉感知」) · text/11-ch09.txt:121(搜「上帝视角」)
声学事件 token9 多模态与实时交互text/11-ch09.txt:123(搜「声学事件」) · text/11-ch09.txt:141(搜「情绪变化」)
实验 9-3 对照9 多模态与实时交互text/11-ch09.txt:147(搜「800-1100ms」)
Omni 与自级联9 多模态与实时交互text/11-ch09.txt:151(搜「隐空间」) · text/11-ch09.txt:153(搜「自级联」) · text/11-ch09.txt:155(搜「轮流本身」的替换词:轮流)
Thinker-Talker 与 Step-Audio 29 多模态与实时交互text/11-ch09.txt:161(搜「Thinker-Talker」) · text/11-ch09.txt:163(搜「83.09%」)
全双工与交互模型9 多模态与实时交互text/11-ch09.txt:171(搜「Moshi」) · text/11-ch09.txt:173(搜「微轮次」) · text/11-ch09.txt:177(搜「GPT-Live」)
思考架构三方案9 多模态与实时交互text/11-ch09.txt:187(搜「三种方案」) · text/11-ch09.txt:197(搜「快慢不一致」) · text/11-ch09.txt:211(搜「递纸条」)
文本代理思考与 MGRD/MPS9 多模态与实时交互text/11-ch09.txt:221(搜「文本代理思考」) · text/11-ch09.txt:233(搜「构思脑」) · text/11-ch09.txt:235(搜「350ms」)
实验 9-4 数字9 多模态与实时交互text/11-ch09.txt:271(搜「92.8%」)
产业分野9 多模态与实时交互text/11-ch09.txt:273(搜「移动靶子」)
Latent Bridge9 多模态与实时交互text/11-ch09.txt:279(搜「潜空间桥」) · text/11-ch09.txt:281(搜「0.9」)
更像人的 TTS9 多模态与实时交互text/11-ch09.txt:287(搜「填充词」) · text/11-ch09.txt:289(搜「THINKING」)
Computer Use 循环与动作空间9 多模态与实时交互text/11-ch09.txt:311(搜「感知-思考-行动」) · text/11-ch09.txt:331(搜「12ms」)
定位三路线9 多模态与实时交互text/11-ch09.txt:345(搜「选择题」) · text/11-ch09.txt:353(搜「browser-use」) · text/11-ch09.txt:376(搜「SeeClick」)
分辨率匹配9 多模态与实时交互text/11-ch09.txt:378(搜「683」)
AOI 与文字留存9 多模态与实时交互text/11-ch09.txt:394(搜「观察接口」) · text/11-ch09.txt:396(搜「个百分点的提升」)
生态壁垒9 多模态与实时交互text/11-ch09.txt:404(搜「变现」)
实时性与 15 倍9 多模态与实时交互text/11-ch09.txt:412(搜「OSWorld-Human」) · text/11-ch09.txt:416(搜「15 倍」)
遥操作反证9 多模态与实时交互text/11-ch09.txt:426(搜「1000 美元」) · text/11-ch09.txt:428(搜「触觉」)
双层架构与动作分块9 多模态与实时交互text/11-ch09.txt:438(搜「VLA 控制」) · text/11-ch09.txt:442(搜「反应性换平滑性」) · text/11-ch09.txt:446(搜「模仿学习」)
VLA 两路线9 多模态与实时交互text/11-ch09.txt:470(搜「动作分块」) · text/11-ch09.txt:474(搜「flow matching」)
Sim2Real9 多模态与实时交互text/11-ch09.txt:484(搜「随机化范围」) · text/11-ch09.txt:500(搜「三者缺一不可」)
本章小结9 多模态与实时交互text/11-ch09.txt:506(搜「如影随形」)

Footnotes

  1. 出处:「9 多模态与实时交互」第 5-9 段(text/11-ch09.txt:5,搜「多模态」;text/11-ch09.txt:9,搜「两秒」)。

  2. 出处:「9 多模态与实时交互」第 47-65 段(text/11-ch09.txt:53,搜「500-800ms」;text/11-ch09.txt:59,搜「0.9-2 秒」;text/11-ch09.txt:65,搜「利用率」);流式化数字见第 101-103 段(text/11-ch09.txt:101,搜「600-800ms」;text/11-ch09.txt:103,搜「压不掉」)。

  3. 出处:「9 多模态与实时交互」第 33-41 段(text/11-ch09.txt:33,搜「三分法」;text/11-ch09.txt:37,搜「轮流说话」;text/11-ch09.txt:41,搜「长期并存」)。

  4. 出处:「9 多模态与实时交互」第 109-113 段(text/11-ch09.txt:109,搜「延迟累积」;text/11-ch09.txt:111,搜「二值信号」;text/11-ch09.txt:113,搜「john」)。

  5. 出处:「9 多模态与实时交互」第 117-121 段(text/11-ch09.txt:117,搜「流式听觉感知」;text/11-ch09.txt:121,搜「上帝视角」)。

  6. 出处:「9 多模态与实时交互」第 173-179 段(text/11-ch09.txt:173,搜「微轮次」;text/11-ch09.txt:179,搜「解耦」)。

  7. 出处:「9 多模态与实时交互」第 153 段(text/11-ch09.txt:153,搜「自级联」)。

  8. 出处:「9 多模态与实时交互」第 185-187 段(text/11-ch09.txt:187,搜「三种方案」)。

  9. 出处:「9 多模态与实时交互」第 197 段(text/11-ch09.txt:197,搜「快慢不一致」)。

  10. 出处:「9 多模态与实时交互」第 209-213 段(text/11-ch09.txt:211,搜「递纸条」;text/11-ch09.txt:213,搜「边想边说」)。

  11. 出处:「9 多模态与实时交互」第 221-235 段(text/11-ch09.txt:221,搜「文本代理思考」;text/11-ch09.txt:233,搜「构思脑」);实验数字见第 271 段(text/11-ch09.txt:271,搜「92.8%」)。

  12. 出处:「9 多模态与实时交互」第 273 段(text/11-ch09.txt:273,搜「移动靶子」)。

  13. 出处:「9 多模态与实时交互」第 279-281 段(text/11-ch09.txt:279,搜「潜空间桥」;text/11-ch09.txt:281,搜「0.9」)。

  14. 出处:「9 多模态与实时交互」第 345-376 段(text/11-ch09.txt:345,搜「选择题」;text/11-ch09.txt:353,搜「browser-use」;text/11-ch09.txt:376,搜「SeeClick」)。browser-use 的 DOM 感知实现,我们的 frontier 书架有源码级拆解可对照(补充(不在书里,依据我们的 frontier 书架):依据: shelf=ai-frontier-reference/browser-use#02-dom-perception.md 事实=browser-use 从 DOM 树枚举可交互元素并编号,正是书中「结构化元素索引」路线的工程实现)。

  15. 出处:「9 多模态与实时交互」第 378 段(text/11-ch09.txt:378,搜「683」)。

  16. 出处:「9 多模态与实时交互」第 394-396 段(text/11-ch09.txt:394,搜「观察接口」;text/11-ch09.txt:396,搜「个百分点的提升」)。

  17. 出处:「9 多模态与实时交互」第 412-416 段(text/11-ch09.txt:412,搜「OSWorld-Human」;text/11-ch09.txt:416,搜「15 倍」)。

  18. 出处:「9 多模态与实时交互」第 404-406 段(text/11-ch09.txt:404,搜「变现」)。

  19. 出处:「9 多模态与实时交互」第 426-428 段(text/11-ch09.txt:426,搜「1000 美元」;text/11-ch09.txt:428,搜「触觉」)。

  20. 出处:「9 多模态与实时交互」第 438-442 段(text/11-ch09.txt:438,搜「VLA 控制」;text/11-ch09.txt:442,搜「反应性换平滑性」)。

  21. 出处:「9 多模态与实时交互」第 470-474 段(text/11-ch09.txt:470,搜「动作分块」;text/11-ch09.txt:474,搜「flow matching」)。

  22. 出处:「9 多模态与实时交互」第 484-500 段(text/11-ch09.txt:484,搜「随机化范围」;text/11-ch09.txt:500,搜「三者缺一不可」)。