跳到正文
Google Research·· 2025-11-19精选AI 评分73

Google 提出实时端到端语音互译技术,实现保留原声与 2 秒低延迟

Real-time speech-to-speech translation

AI 导读

Google 推出基于流式架构的端到端实时语音到语音翻译(S2ST)模型,将传统级联系统的 4–5 秒延迟缩短至 2 秒,并在翻译中保留原说话人的声音特征。该架构基于 AudioLM 与 SpectroStream 编解码技术构建,配合时间同步数据获取管线训练,目前已部署于云端 Google Meet 与 Pixel 10 端侧设备中。

推荐理由

原文解析了流式端到端架构与时间同步对齐管线,读者可以借此了解如何将同传级语音互译延迟压缩至两秒内并保留原声音色。

来源:Google Research · research.google