实时语音管线:帧如何在处理器间流动
30 秒导读: 一通语音通话,本质是把用户的声音变成文字、喂给 LLM、再把回答变成声音播回去。Dograh 用 pipecat 把这一串步骤搭成一条处理器流水线:每个环节是一个处理器,数据以「帧(Frame)」的形式从上一个处理器流到下一个。本章只讲语音这一半——管线怎么装、供应商怎么选、以及语音 agent 最难的那件事:判断用户什么时候说完了。
本章聚焦三件事:管线结构、服务选择、回合/打断机制。至于「整通通话怎么被编排起来」留给 04-call-orchestration,「工作流图怎么驱动 LLM」留给 03-pipecat-engine。想先看全景请回 index。
1. 这是什么(零基础也能懂)
一句话定义: 语音管线就是一条单向传送带——用户说的话从一头进来,机器人的回答从另一头出去,中间每个工位(处理器)做一件事。
它要解决的问题: 电话/网页里的实时对话有个硬约束——延迟要低、要能被打断。你不能等用户说完一整段、转成文字、算完答案、合成完语音再一次性播出去,那样机器人会「慢半拍」。所以管线里每个环节都是流式的:边听边转写、边生成边合成、用户一插话就得能停下来。
两种搭法: 同一条传送带,Dograh 提供两种装配方式。
| 形态 |
|---|