Google 为 Gemini Live 推出 Guided Vision 功能,支持实时画面语音描述
Google 在兼容的 Android 设备上为 Gemini Live 推出 Guided Vision 功能,可通过摄像头提供周围环境与物体的实时语音描述。该功能主要面向视障及弱视人群,支持朗读细小文字、识别物品并进行追问交互,未入镜时还会提供对准镜头的音频提示。该功能除 Gemini 外也已接入 Google TalkBack,但官方提示其不可用于导航或替代盲杖。
Google 在兼容的 Android 设备上为 Gemini Live 推出 Guided Vision 功能,可通过摄像头提供周围环境与物体的实时语音描述。该功能主要面向视障及弱视人群,支持朗读细小文字、识别物品并进行追问交互,未入镜时还会提供对准镜头的音频提示。该功能除 Gemini 外也已接入 Google TalkBack,但官方提示其不可用于导航或替代盲杖。
Napster 联合创始人 Sean Parker 正推动 Stability AI 转型为面向音乐专业人士的 AI 工具开发商。该公司此前获得索尼、华纳和环球等机构的 7600 万美元投资及曲库训练授权,已上线三款音频模型与 AI 音乐编辑软件,支持通过文本提示生成纯音乐曲目或音频片段。后续更新还将支持用户通过哼唱旋律或节奏口技来引导生成。
AI 音乐生成平台 Suno 推出名为 Speech 的新功能,支持将用户输入的文本和风格描述直接生成包含人声朗读与匹配背景音乐的完整音频轨道。该功能适用于诗歌朗诵、冥想引导和睡前故事等场景,此前已进行为期一个月的内测,目前测试版本仍存在英音混为澳音等缺陷。Suno 未公开该模型的训练数据来源,而该公司目前正面临来自主流唱片公司的版权侵权诉讼。
AI 音乐生成平台 Suno 在 Web 和移动端开启 Speech 功能公测,支持根据文本脚本或提示词生成语音旁白,并能同步搭配背景音乐。该功能最长支持生成约 8 分钟音频,提供 Simple 描述生成与 Advanced 脚本定制两种模式,用户可调节音色性别与风格,也可关闭背景音乐仅保留纯净人声。
Hugging Face 推出 Open TTS Leaderboard,采用客观自动化指标对开源文本转语音(TTS)模型进行多语言性能、推理延迟与声音克隆维度的评测。
推荐理由:榜单通过自动化客观指标替代耗时的人工盲测投票,为多语言与声音克隆模型的选型提供了可量化的参考。
Google DeepMind 宣布在 Gemini Enterprise 中推出 Gemini 3.8 Live with Live Avatar,为实时对话模型引入近实时的视觉形象与流式视频生成能力。该功能支持在对话进行的同时于后台异步调用工具并获取数据,具备跨 97 种语言的口型与表情同步,并允许企业基于参考图像定制专属形象。所有音视频输出均直接嵌入 SynthID 水印以确保内容可检测。
推荐理由:企业级交互通过异步工具调用缓解了生成等待带来的停顿问题,使模型在后台查询数据的同时维持自然对话流。
Google DeepMind 正式推出 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持通过自然语言提示词定制角色声音、30 秒音频克隆以及双角色逐行台词编排。
推荐理由:模型通过自然语言提示词定制角色声音并支持双角色台词编排,为游戏、播客及有声书的长音频生成提供了细粒度表演控制方案。
Ringg 借助 OpenAI 使其 AI 智能体能够解决高达 65% 的客户来电。通过采用 GPT-5.6,Ringg 在语音、聊天、WhatsApp 及网页端驱动多语言智能体,运行成本相比 GPT-4.1 降低了 90%。
Google DeepMind 推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时对话模型,主打近实时推理与语音智能体能力。
推荐理由:新模型将并发多步推理融入低延迟语音交互,为开发者构建支持后台工具调用的复杂语音智能体提供了实用基准。
OpenAI 在 API 中推出 GPT-Live-1,提供更自然的全双工语音对话能力。该模型具备更强的指令遵循能力,并支持自定义声音和电话功能接入。
推荐理由:该模型通过全双工对话与电话接入拓展了实时语音能力,便于开发者在 API 中构建定制化语音应用。