Hugging Face 推出 Open TTS Leaderboard:多语言与声音克隆语音评测榜单
Hugging Face 推出 Open TTS Leaderboard,采用客观自动化指标对开源文本转语音(TTS)模型进行多语言性能、推理延迟与声音克隆维度的评测。
推荐理由:榜单通过自动化客观指标替代耗时的人工盲测投票,为多语言与声音克隆模型的选型提供了可量化的参考。
Hugging Face 推出 Open TTS Leaderboard,采用客观自动化指标对开源文本转语音(TTS)模型进行多语言性能、推理延迟与声音克隆维度的评测。
推荐理由:榜单通过自动化客观指标替代耗时的人工盲测投票,为多语言与声音克隆模型的选型提供了可量化的参考。
Google DeepMind 宣布在 Gemini Enterprise 中推出 Gemini 3.8 Live with Live Avatar,为实时对话模型引入近实时的视觉形象与流式视频生成能力。该功能支持在对话进行的同时于后台异步调用工具并获取数据,具备跨 97 种语言的口型与表情同步,并允许企业基于参考图像定制专属形象。所有音视频输出均直接嵌入 SynthID 水印以确保内容可检测。
推荐理由:企业级交互通过异步工具调用缓解了生成等待带来的停顿问题,使模型在后台查询数据的同时维持自然对话流。
Google DeepMind 正式推出 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持通过自然语言提示词定制角色声音、30 秒音频克隆以及双角色逐行台词编排。
推荐理由:模型通过自然语言提示词定制角色声音并支持双角色台词编排,为游戏、播客及有声书的长音频生成提供了细粒度表演控制方案。
Google DeepMind 推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时对话模型,主打近实时推理与语音智能体能力。
推荐理由:新模型将并发多步推理融入低延迟语音交互,为开发者构建支持后台工具调用的复杂语音智能体提供了实用基准。
OpenAI 在 API 中推出 GPT-Live-1,提供更自然的全双工语音对话能力。该模型具备更强的指令遵循能力,并支持自定义声音和电话功能接入。
推荐理由:该模型通过全双工对话与电话接入拓展了实时语音能力,便于开发者在 API 中构建定制化语音应用。