8 月 5 日,字节跳动 Seed 团队正式对外推出原生音视频全双工大模型 SeedRealtime,该模型完成在豆包 App 的全量上线,用户更新客户端之后,通过打电话入口开启视频通话,就可以体验全新的实时多模态交互能力。这款模型代表 AI 交互从传统一问一答的回合模式,转向 “边看、边听、边说” 的连续交互形态,也是行业中音视频全双工技术走向规模化落地的一次实践。
过往市面上多数音视频 AI 产品,采用多个模块串联的级联架构。语音识别、视觉解析、语音生成分开运行,信息需要逐层传递,叠加出较高延迟,各个环节还会产生信息损耗。交互逻辑上大多属于半双工模式,需要等用户说完一段话,系统才会开始处理并输出回答,很难还原现实里人与人沟通的状态。
SeedRealtime 采用统一端到端建模框架,把音频、视频、文本三类信息做原生融合。感知、理解、决策、表达几个环节同步开展,不再拆分多个独立模块分步处理。工程层面通过音视频分块输入、流式输出的方案压缩响应耗时,搭配量化与推理优化,支撑持续不间断的多模态信息流处理。
模型落地之后,形成三项核心能力。音视频联合理解层面,它同步接收画面、声音以及时序变化信息,依靠视觉内容消解语音歧义,看懂手势、画面指代,理解用户口中 “这个”“那里” 对应的现实物体,声音和画面信息互相补充,减少理解偏差。
主动交互能力层面,模型可以持续观察镜头前的环境变化。画面出现关键事物时,它可以主动给出提示,还能够调用工具完成协作,不再只是被动等待用户发出提问。博物馆识别展品、观察设备操作流程给出实时提示,都属于该能力可以覆盖的场景。
交互节奏把控上,模型自主判断对话时机,做到适时接话、适时停顿。面对环境杂音、旁人无关交谈可以做到区分过滤,避免出现误触发回复。内部端到端人工评测数据显示,对比传统级联模型,对话节奏相关问题减少一半,被打断、回复滞后、误触发等现象明显下降,完整顺畅完成单次对话的占比得到提升。
现实场景中,这套模型可以适配大量生活化使用场景。对着厨房食材镜头,同步讲解做菜的调整要点;翻看绘本的时候,跟随翻页进度同步解读内容;外出参观时,镜头扫过展品同步输出讲解;多人交流环境,也可以区分不同发言对象,锁定有效对话信息。
全双工音视频交互,一直是大模型领域的技术难点,很多技术方案停留在实验室测试阶段。字节跳动此次直接面向普通用户开放能力,把实验室技术转化为面向大众可用的产品功能。
技术落地同样存在现实约束,交互效果会受到手机硬件、网络状态、环境噪声、镜头画面清晰度等外部条件影响。行业内同类技术的迭代竞争也在持续推进。面向未来,实时音视频全双工模式,会拓展 AI 在生活助手、教育辅助、远程协作等方向的使用边界,持续改变普通人使用人工智能的方式。