跳到正文
9月30日周三
  1. Hugging Face Blog65

    Hugging Face 推出 Open TTS Leaderboard:多语言与声音克隆语音评测榜单

    Hugging Face 推出 Open TTS Leaderboard,采用客观自动化指标对开源文本转语音(TTS)模型进行多语言性能、推理延迟与声音克隆维度的评测。

    推荐理由:榜单通过自动化客观指标替代耗时的人工盲测投票,为多语言与声音克隆模型的选型提供了可量化的参考。

9月25日周五
  1. Google DeepMind78

    Google 推出 Gemini 3.8 Live 实时数字人功能 Live Avatar

    Google DeepMind 宣布在 Gemini Enterprise 中推出 Gemini 3.8 Live with Live Avatar,为实时对话模型引入近实时的视觉形象与流式视频生成能力。该功能支持在对话进行的同时于后台异步调用工具并获取数据,具备跨 97 种语言的口型与表情同步,并允许企业基于参考图像定制专属形象。所有音视频输出均直接嵌入 SynthID 水印以确保内容可检测。

    推荐理由:企业级交互通过异步工具调用缓解了生成等待带来的停顿问题,使模型在后台查询数据的同时维持自然对话流。

9月23日周三
  1. Google DeepMind75

    Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

    Google DeepMind 正式推出 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持通过自然语言提示词定制角色声音、30 秒音频克隆以及双角色逐行台词编排。

    推荐理由:模型通过自然语言提示词定制角色声音并支持双角色台词编排,为游戏、播客及有声书的长音频生成提供了细粒度表演控制方案。

9月16日周三
9月10日周四
  1. OpenAI News70

    OpenAI 在 API 中推出 GPT-Live-1 语音模型

    OpenAI 在 API 中推出 GPT-Live-1,提供更自然的全双工语音对话能力。该模型具备更强的指令遵循能力,并支持自定义声音和电话功能接入。

    推荐理由:该模型通过全双工对话与电话接入拓展了实时语音能力,便于开发者在 API 中构建定制化语音应用。