跳到正文

公司与模型

Google / Gemini 最新动态

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

97 条精选近 30 天 10 条共收录 209 条

更新

精选归档 · 第 4 页

3月26日周四第 61–80 条
  1. Google DeepMind75

    Google DeepMind 发布音乐生成模型 Lyria 3 Pro

    Google DeepMind 正式推出音乐生成模型 Lyria 3 Pro,支持生成最长 3 分钟的音频,并能根据提示词分别控制前奏、主歌、副歌与桥段等乐曲结构。

    推荐理由:该版本支持生成最长 3 分钟且具备结构控制的完整曲目,并同步接入了多款产品与开发者接口。

3月25日周三
  1. Google Research66

    Google 推出 Vibe Coding XR,结合 Gemini 与 XR Blocks 快速构建空间应用原型

    Google 推出 Vibe Coding XR 工作流,结合 Gemini 的推理能力与基于 Web 技术的 XR Blocks 框架,可在 60 秒内将自然语言提示词转化为具备物理感知的 Android XR 交互应用。

    推荐理由:原文给出了利用大模型长上下文与规范模板生成空间交互代码的具体管线,读者可借鉴其约束空间计算接口调用的设计。

3月18日周三
3月12日周四
  1. Google Research66

    Google 探索 AMIE 对话式诊断 AI 在真实临床中的可行性

    Google 与 BIDMC 合作公布了对话诊断 AI 系统 AMIE 在真实初级保健门诊的前瞻性可行性研究结果,在医生实时监督下完成了 100 例患者的就诊前问诊。测试全程未触发任何安全中断,盲测评估显示 AMIE 的鉴别诊断质量与初级保健医生相当,90% 案例的前 7 个候选诊断命中最终确诊结果。但在处置方案的实用性与成本效益方面,医生凭借体检、病历及临床经验仍优于 AI 模型。

    推荐理由:研究将医疗对话模型带入真实门诊预诊流程,盲测数据直观呈现了系统在鉴别诊断与临床处置实用性上的能力边界。

3月4日周三
2月27日周五
  1. Google DeepMind81

    Google DeepMind 发布图像生成模型 Nano Banana 2

    Google DeepMind 正式推出最新图像生成模型 Nano Banana 2(Gemini 3.1 Flash Image),在 Flash 速度下兼顾 Pro 级别的世界知识、画质与推理能力。

    推荐理由:该模型将高阶画质与搜索检索能力下放至轻量架构,让多角色一致性叙事与多分辨率商业出图在低延迟场景中更易落地。

2月20日周五
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 3.1 Pro 预览版

    Google DeepMind 正式推出 Gemini 3.1 Pro 预览版,全面升级核心推理能力以处理复杂问题求解任务。在评估新逻辑模式解决能力的 ARC-AGI-2 基准上,该模型取得 77.1% 的验证得分,较 3 Pro 提升超过一倍。

    推荐理由:原文给出了基准评测对比与接入渠道,读者可以据此评估新核心模型在复杂逻辑任务中的表现与可用范围。

2月19日周四
  1. Google DeepMind77

    Gemini 上线基于 Lyria 3 的音乐生成功能

    Google DeepMind 宣布在 Gemini 应用中上线音乐生成模型 Lyria 3 测试版,支持通过文本提示词或上传照片与视频生成 30 秒音乐。生成的音轨包含 Nano Banana 制作的封面图,并嵌入 SynthID 水印以支持 AI 音频真伪核验。该功能已向年满 18 周岁的多语言用户推出,并同步拓展至 YouTube 的 Dream Track 工具。

    推荐理由:原文给出了从多模态输入生成音频及水印验证的具体机制,读者可以了解消费级音乐生成与版权保护的落地路径。

2月13日周五
  1. Google DeepMind84

    Google DeepMind 升级 Gemini 3 Deep Think 推理模式并开放 API 申请

    Google DeepMind 宣布升级专用推理模式 Gemini 3 Deep Think,重点增强科学、研究与工程领域的复杂问题求解能力。该模型在无工具条件下于 Humanity's Last Exam 取得 48.4%,在 ARC-AGI-2 取得 84.6%,并在 Codeforces 达到 3455 Elo。

    推荐理由:材料给出了多项前沿科学评测数据与可用接口,读者可以据此评估该模式在复杂推理与工程建模中的实际能力。

2月10日周二
  1. Google DeepMind75

    Google DeepMind 发布 Gemini Deep Think 科研成果:攻克数学与物理专业难题

    Google DeepMind 发布两篇论文,展示 Gemini Deep Think 模式在数学、物理和计算机科学专业研究中的实际应用。团队基于该模型构建了具备自然语言验证和检索能力的数学研究智能体 Aletheia,已实现无人工干预自主生成可发表水平的算术几何论文,并解出埃尔德什猜想数据库中的 4 个公开问题。

    推荐理由:原文展示了模型如何通过验证循环与跨学科工具从竞赛题跨入专业科研,读者可据此了解 AI 参与前沿科学探索的具体模式。

1月30日周五
  1. Google DeepMind72

    Google DeepMind 推出 Project Genie 交互式世界生成原型

    Google DeepMind 面向美国地区的 Google AI Ultra 订阅用户开放实验性研究原型 Project Genie,支持通过文本与图像生成并探索可交互的虚拟世界。该网页原型由 Genie 3、Nano Banana Pro 和 Gemini 驱动,具备世界草绘、实时路径探索以及二次混剪三大核心能力。目前单次生成时长限制在 60 秒内,后续计划逐步扩展至更多地区。

    推荐理由:该原型展示了世界模型在交互式环境生成上的实际落地形态,读者可以借此了解实时动态生成与传统三维建模的差异。

1月28日周三
  1. Google Research74

    Google Research 探索智能体系统扩展规律:多 Agent 系统何时及为何有效

    Google Research 团队发布智能体系统扩展研究,通过对 180 种配置的对照评测打破了多智能体总是更优的假设,指出其效果高度取决于任务特性。在可并行的任务中,集中式多智能体协调使性能提升 80.9%,但在强顺序推理任务中,多智能体反而导致性能下降 39% 至 70%。研究还发现独立多智能体会将错误放大 17.2 倍,并构建了能以 87% 准确率预测最佳架构的设计模型。

    推荐理由:研究量化了多智能体协作在并行与顺序任务中的表现差异,为开发者设计智能体架构提供了可依据的选型规律。

1月14日周三
  1. Google Research70

    Google 发布开源多模态模型 MedGemma 1.5 4B 与医疗语音模型 MedASR

    Google 正式发布开源医疗多模态模型 MedGemma 1.5 4B 以及专用医疗语音识别模型 MedASR,两者均在 Hugging Face 和 Vertex AI 免费提供。

    推荐理由:模型扩展了对高维 CT、MRI 及全切片病理图像的解析能力,为开发者在轻量级医疗多模态任务上的微调与本地部署提供了参考基准。

  2. Google DeepMind75

    Google DeepMind 推出 Veo 3.1 素材生视频更新,增强一致性并原生支持竖屏与 4K

    Google DeepMind 推出 Veo 3.1 素材生视频(Ingredients to Video)能力更新,显著提升了基于参考图生成视频的表现力以及角色、背景与物体跨场景的一致性。

    推荐理由:更新强化了基于参考图生成视频的角色与场景一致性,并补齐原生竖屏和超分辨率规格,便于创作者与移动端管线直接采用。

12月17日周三
  1. Google DeepMind89

    Google DeepMind 发布 Gemini 3 Flash 模型

    Google DeepMind 正式推出 Gemini 3 Flash,在保持高速度与低延迟的同时具备前沿推理能力,已作为默认模型上线 Gemini 应用和搜索 AI Mode。

    推荐理由:该模型将接近旗舰级的推理能力融入低延迟架构,基准表现超过上代主力模型,适合作为高频开发与智能体落地的成本参考。

12月16日周二
  1. Google Research67

    Google 推出基于 Gemini 2.5 Deep Think 的论文辅助工具 PAT,为 STOC 2026 提供自动审查反馈

    Google Research 面向理论计算机科学顶会 STOC 2026 推出实验性论文辅助工具 PAT(Paper Assistant Tool),基于 Gemini 2.5 Deep Think 在提交前为作者提供包含错误排查与定理分析的结构化审查反馈。实验中有超过 80% 的投稿选择接入 PAT,该工具成功识别出变量不一致、计算失误及证明逻辑漏洞,97% 的受访作者认可其反馈价值。

    推荐理由:原文展示了如何通过推理扩展方法辅助筛查理论研究中的逻辑漏洞,为学术论文提交前的预审流程提供了参考范式。

12月13日周六
  1. Google DeepMind78

    Google DeepMind 发布更新版 Gemini 2.5 Flash Native Audio 原生音频模型

    Google DeepMind 发布更新版 Gemini 2.5 Flash Native Audio 模型,强化了实时语音智能体的函数调用、指令遵循和多轮对话能力,并带来流式语音双向互译支持。

    推荐理由:原生音频模型提升了复杂函数调用与上下文检索能力,使开发者能够在端到端语音交互中直接嵌入实时外部数据。

11月25日周二
  1. Google DeepMind69

    科研人员借助 AlphaFold 解析坏胆固醇关键蛋白 apoB100 结构

    密苏里大学研究人员借助 AlphaFold 与冷冻电镜技术,成功解析了构成低密度脂蛋白(坏胆固醇)分子支架的关键蛋白 apoB100 的原子级结构。该蛋白困扰科学界长达 50 年,新模型清晰揭示了包裹在 LDL 颗粒外的笼状外壳及带状束带结构。这一结构突破为预防、诊断和精准靶向治疗动脉粥样硬化性心血管疾病提供了全新可能。

    推荐理由:研究展现了将蛋白质结构预测与冷冻电镜实验结合攻克超大蛋白的思路,为心血管疾病靶向研发提供了结构基础。

11月24日周一
  1. Google DeepMind70

    Google DeepMind 宣布支持美国能源部 Genesis 任务,向 17 个国家实验室开放科学 AI 工具

    Google DeepMind 宣布支持美国能源部发起的 Genesis 任务,向全美 17 个国家实验室加速开放前沿科学 AI 模型与智能体工具。科研人员即日起可通过 Google Cloud 使用基于 Gemini 的多智能体科研协作系统 AI co-scientist,以加速假说生成与实验验证。

    推荐理由:原文展示了前沿科学计算模型向国家级实验室开放的落地细节,读者可以据此了解前沿 AI 融入基础科学研究的推进路径。