Google DeepMind 发布 Gemini 3.1 Flash Live 语音模型
Google 推出语音模型 Gemini 3.1 Flash Live,主打低延迟与更自然的实时对话交互,即日起在 Google AI Studio、Gemini Live 及 Search Live 上线。
推荐理由:该模型强化了复杂音频任务推理与语调识别,为开发者构建低延迟实时语音智能体提供了落地参考。
公司与模型
Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。
97 条精选近 30 天 10 条共收录 209 条
Google 推出语音模型 Gemini 3.1 Flash Live,主打低延迟与更自然的实时对话交互,即日起在 Google AI Studio、Gemini Live 及 Search Live 上线。
推荐理由:该模型强化了复杂音频任务推理与语调识别,为开发者构建低延迟实时语音智能体提供了落地参考。
Google DeepMind 正式推出音乐生成模型 Lyria 3 Pro,支持生成最长 3 分钟的音频,并能根据提示词分别控制前奏、主歌、副歌与桥段等乐曲结构。
推荐理由:该版本支持生成最长 3 分钟且具备结构控制的完整曲目,并同步接入了多款产品与开发者接口。
Google 推出 Vibe Coding XR 工作流,结合 Gemini 的推理能力与基于 Web 技术的 XR Blocks 框架,可在 60 秒内将自然语言提示词转化为具备物理感知的 Android XR 交互应用。
推荐理由:原文给出了利用大模型长上下文与规范模板生成空间交互代码的具体管线,读者可借鉴其约束空间计算接口调用的设计。
Google Research与英国国家医疗服务体系(NHS)等多家机构合作,在《Nature Cancer》发表了两项关于AI辅助乳腺癌筛查的互补研究。
推荐理由:原文提供了多中心回顾与前瞻性部署的完整对比数据,展示了AI作为第二阅片人如何缓解放射科人力短缺。
Google 与 BIDMC 合作公布了对话诊断 AI 系统 AMIE 在真实初级保健门诊的前瞻性可行性研究结果,在医生实时监督下完成了 100 例患者的就诊前问诊。测试全程未触发任何安全中断,盲测评估显示 AMIE 的鉴别诊断质量与初级保健医生相当,90% 案例的前 7 个候选诊断命中最终确诊结果。但在处置方案的实用性与成本效益方面,医生凭借体检、病历及临床经验仍优于 AI 模型。
推荐理由:研究将医疗对话模型带入真实门诊预诊流程,盲测数据直观呈现了系统在鉴别诊断与临床处置实用性上的能力边界。
Google DeepMind 推出 Gemini 3.1 Flash-Lite 模型,专为大规模高并发工作负载设计,已在 Google AI Studio 与 Vertex AI 开启预览。
推荐理由:官方公布了较低定价与首字延迟优化数据,有助于开发者评估高并发实时任务的推理成本与响应提升。
Google DeepMind 正式推出最新图像生成模型 Nano Banana 2(Gemini 3.1 Flash Image),在 Flash 速度下兼顾 Pro 级别的世界知识、画质与推理能力。
推荐理由:该模型将高阶画质与搜索检索能力下放至轻量架构,让多角色一致性叙事与多分辨率商业出图在低延迟场景中更易落地。
Google DeepMind 正式推出 Gemini 3.1 Pro 预览版,全面升级核心推理能力以处理复杂问题求解任务。在评估新逻辑模式解决能力的 ARC-AGI-2 基准上,该模型取得 77.1% 的验证得分,较 3 Pro 提升超过一倍。
推荐理由:原文给出了基准评测对比与接入渠道,读者可以据此评估新核心模型在复杂逻辑任务中的表现与可用范围。
Google DeepMind 宣布在 Gemini 应用中上线音乐生成模型 Lyria 3 测试版,支持通过文本提示词或上传照片与视频生成 30 秒音乐。生成的音轨包含 Nano Banana 制作的封面图,并嵌入 SynthID 水印以支持 AI 音频真伪核验。该功能已向年满 18 周岁的多语言用户推出,并同步拓展至 YouTube 的 Dream Track 工具。
推荐理由:原文给出了从多模态输入生成音频及水印验证的具体机制,读者可以了解消费级音乐生成与版权保护的落地路径。
Google DeepMind 宣布升级专用推理模式 Gemini 3 Deep Think,重点增强科学、研究与工程领域的复杂问题求解能力。该模型在无工具条件下于 Humanity's Last Exam 取得 48.4%,在 ARC-AGI-2 取得 84.6%,并在 Codeforces 达到 3455 Elo。
推荐理由:材料给出了多项前沿科学评测数据与可用接口,读者可以据此评估该模式在复杂推理与工程建模中的实际能力。
Google DeepMind 发布两篇论文,展示 Gemini Deep Think 模式在数学、物理和计算机科学专业研究中的实际应用。团队基于该模型构建了具备自然语言验证和检索能力的数学研究智能体 Aletheia,已实现无人工干预自主生成可发表水平的算术几何论文,并解出埃尔德什猜想数据库中的 4 个公开问题。
推荐理由:原文展示了模型如何通过验证循环与跨学科工具从竞赛题跨入专业科研,读者可据此了解 AI 参与前沿科学探索的具体模式。
Google DeepMind 面向美国地区的 Google AI Ultra 订阅用户开放实验性研究原型 Project Genie,支持通过文本与图像生成并探索可交互的虚拟世界。该网页原型由 Genie 3、Nano Banana Pro 和 Gemini 驱动,具备世界草绘、实时路径探索以及二次混剪三大核心能力。目前单次生成时长限制在 60 秒内,后续计划逐步扩展至更多地区。
推荐理由:该原型展示了世界模型在交互式环境生成上的实际落地形态,读者可以借此了解实时动态生成与传统三维建模的差异。
Google Research 团队发布智能体系统扩展研究,通过对 180 种配置的对照评测打破了多智能体总是更优的假设,指出其效果高度取决于任务特性。在可并行的任务中,集中式多智能体协调使性能提升 80.9%,但在强顺序推理任务中,多智能体反而导致性能下降 39% 至 70%。研究还发现独立多智能体会将错误放大 17.2 倍,并构建了能以 87% 准确率预测最佳架构的设计模型。
推荐理由:研究量化了多智能体协作在并行与顺序任务中的表现差异,为开发者设计智能体架构提供了可依据的选型规律。
Google 正式发布开源医疗多模态模型 MedGemma 1.5 4B 以及专用医疗语音识别模型 MedASR,两者均在 Hugging Face 和 Vertex AI 免费提供。
推荐理由:模型扩展了对高维 CT、MRI 及全切片病理图像的解析能力,为开发者在轻量级医疗多模态任务上的微调与本地部署提供了参考基准。
Google DeepMind 推出 Veo 3.1 素材生视频(Ingredients to Video)能力更新,显著提升了基于参考图生成视频的表现力以及角色、背景与物体跨场景的一致性。
推荐理由:更新强化了基于参考图生成视频的角色与场景一致性,并补齐原生竖屏和超分辨率规格,便于创作者与移动端管线直接采用。
Google DeepMind 正式推出 Gemini 3 Flash,在保持高速度与低延迟的同时具备前沿推理能力,已作为默认模型上线 Gemini 应用和搜索 AI Mode。
推荐理由:该模型将接近旗舰级的推理能力融入低延迟架构,基准表现超过上代主力模型,适合作为高频开发与智能体落地的成本参考。
Google Research 面向理论计算机科学顶会 STOC 2026 推出实验性论文辅助工具 PAT(Paper Assistant Tool),基于 Gemini 2.5 Deep Think 在提交前为作者提供包含错误排查与定理分析的结构化审查反馈。实验中有超过 80% 的投稿选择接入 PAT,该工具成功识别出变量不一致、计算失误及证明逻辑漏洞,97% 的受访作者认可其反馈价值。
推荐理由:原文展示了如何通过推理扩展方法辅助筛查理论研究中的逻辑漏洞,为学术论文提交前的预审流程提供了参考范式。
Google DeepMind 发布更新版 Gemini 2.5 Flash Native Audio 模型,强化了实时语音智能体的函数调用、指令遵循和多轮对话能力,并带来流式语音双向互译支持。
推荐理由:原生音频模型提升了复杂函数调用与上下文检索能力,使开发者能够在端到端语音交互中直接嵌入实时外部数据。
密苏里大学研究人员借助 AlphaFold 与冷冻电镜技术,成功解析了构成低密度脂蛋白(坏胆固醇)分子支架的关键蛋白 apoB100 的原子级结构。该蛋白困扰科学界长达 50 年,新模型清晰揭示了包裹在 LDL 颗粒外的笼状外壳及带状束带结构。这一结构突破为预防、诊断和精准靶向治疗动脉粥样硬化性心血管疾病提供了全新可能。
推荐理由:研究展现了将蛋白质结构预测与冷冻电镜实验结合攻克超大蛋白的思路,为心血管疾病靶向研发提供了结构基础。
Google DeepMind 宣布支持美国能源部发起的 Genesis 任务,向全美 17 个国家实验室加速开放前沿科学 AI 模型与智能体工具。科研人员即日起可通过 Google Cloud 使用基于 Gemini 的多智能体科研协作系统 AI co-scientist,以加速假说生成与实验验证。
推荐理由:原文展示了前沿科学计算模型向国家级实验室开放的落地细节,读者可以据此了解前沿 AI 融入基础科学研究的推进路径。