跳到正文

公司与模型

Google / Gemini 最新动态

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

97 条精选近 30 天 10 条共收录 209 条

更新

精选归档 · 第 3 页

6月5日周五第 41–60 条
  1. Google Research74

    Google 在 Nature 发表研究:利用智能手机前置镜头被动监测心率与静息心率

    Google Research 联合团队在 Nature 发表被动心率监测系统 PHRM,利用手机前置摄像头在人脸解锁后的数秒内分析面部视频,实现后台被动监测心率和静息心率。

    推荐理由:该研究展示了用手机前置镜头和端侧网络替代穿戴设备监测心率的可行性,读者可参考其在多肤色覆盖上的数据配比与验证设计。

5月20日周三
  1. Google Research68

    Google 在 Nature 发表科研代码系统 ERA 并推出 Computational Discovery 工具

    Google 在《Nature》期刊发表基于 Gemini 的科研代码系统 ERA,可结合文献检索与树搜索自主编写并优化科学计算实验代码。该系统在流行病预测、径流分析和卫星碳浓度监测等跨学科基准中达到专家级表现,Google 正将其与 AlphaEvolve 结合构建 Computational Discovery,并通过 Gemini for Science 逐步向科研人员开放。

    推荐理由:文章展示了利用树搜索与大模型编写并优化科研代码的完整路径,读者可以据此评估 AI 驱动科学计算实验的实际落地效果。

5月19日周二
  1. Google DeepMind62

    Google DeepMind 利用 Co-Scientist 加速发现逆转细胞衰老的基因靶点

    研究人员正在利用 Google DeepMind 的 Co-Scientist 突破细胞抗衰老研究中的假设生成与海量数据分析瓶颈。Co-Scientist 检索数万篇学术文献后提出了 20 多个全新的候选基因因子,实验室测试已成功验证其推荐因子能让细胞恢复年轻状态并改善机能。该系统还将原本需要研究人员耗时多达 6 个月的筛选数据文献关联分析周期大幅缩短至数天。

    推荐理由:展示了 AI 系统在科学文献检索、假设生成与海量筛选数据解读中的落地流程,为计算生物学提供参考。

5月18日周一
  1. Google DeepMind71

    Google DeepMind 将 Project Genie 接入街景图像,支持模拟真实世界地点

    Google DeepMind 宣布在 Project Genie 原型中推出街景对齐新功能,允许用户以美国真实地理位置为起点生成并探索定制风格的虚拟交互世界。

    推荐理由:Project Genie 将世界模型生成能力与谷歌街景图像结合,为智能体导航交互提供了基于真实地理环境的虚拟模拟方案。

  2. Google DeepMind84

    Google DeepMind 推出原生多模态生成模型 Gemini Omni 并上线 Omni Flash

    Google DeepMind 推出新一代全模态模型 Gemini Omni,首发模型 Gemini Omni Flash 支持将文本、图像、音频和视频等任意输入组合生成高画质视频。

    推荐理由:该模型支持文本、图像、音频与视频的任意输入组合并生成视频,为多模态内容创作者提供了基于自然语言的连续视频编辑方案。

5月17日周日
  1. Google DeepMind60

    Google DeepMind 推出 Gemini for Science 科学研究工具与实验套件

    Google DeepMind 推出面向科学研究的工具与实验套件 Gemini for Science,包含 Google Labs 上的三项实验原型及 Google Antigravity 中的 Science Skills 技能包。

    推荐理由:原文展示了将多智能体协作与计算探索嵌入科研流程的工具形态,读者可以借此了解大模型辅助科学发现的落地路径。

  2. Google DeepMind67

    Google 扩展内容溯源与验证工具,SynthID 与 C2PA 接入 Search 和 Gemini

    Google 宣布在 Search、Gemini、Chrome、Pixel 及 Cloud 中扩展内容透明度与验证工具。Gemini、Search 及后续 Chrome 支持基于 SynthID 与 C2PA Content Credentials 检验内容是否为相机实拍或经 AI 修改,Pixel 8、9、10 系列原生相机也将支持视频凭证。

    推荐理由:原文梳理了数字水印与内容凭证在搜索、浏览器和端侧相机的整合方案,读者可以据此了解主流平台的内容溯源落地路径。

5月16日周六
  1. Google DeepMind64

    Google DeepMind 介绍利用 Co-Scientist 加速肝脏疾病机制与药物组合发现

    爱丁堡大学研究团队利用 Google DeepMind 的 Co-Scientist 系统梳理文献并生成新假说,加速了代谢功能障碍相关脂肪性肝炎(MASH)的机制与药物组合探索。针对已获批药物 resmetirom 仅对少数患者有效的难题,该系统提出 NLRP3 炎症小体是连接炎症与代谢的关键分子桥梁。该假说已得到实验验证,为开发靶向双重联合疗法提供了依据。

    推荐理由:原文展示了科研系统在多靶点疾病中缩小药物组合范围并提出假说的过程,读者可以据此评估其辅助机理探索的实用性。

  2. Google DeepMind64

    WeatherNext 如何协助 NHC 更早预测 Melissa 飓风在牙买加登陆

    Google DeepMind 联合 Google Research 开发的 AI 气象模型 WeatherNext 提前 5 天预测出 Melissa 飓风将迅速增强至 5 级并登陆牙买加,协助美国国家飓风中心(NHC)提前发布防灾预警。

    推荐理由:文章结合真实气象预警案例展示了AI模型同时兼顾路径与强度的能力,为极端天气预测落地提供了参考。

5月12日周二
  1. Google DeepMind76

    Google DeepMind 发布科研多智能体系统 Co-Scientist

    Google DeepMind 在 Nature 发表最新研究并推出多智能体系统 Co-Scientist,旨在作为科研合作者迭代生成、辩论与演化科学假说。该系统基于 Gemini 构建,通过生成、虚拟同行评议及 Elo 锦标赛机制筛选研究方向,并可结合 UniProt 数据库与 AlphaFold 等工具。

    推荐理由:原文详述了多智能体系统通过假说生成、辩论锦标赛与演化机制辅助科研的具体流程,并附带了多项生命科学实验验证结果。

5月6日周三
4月30日周四
  1. Google DeepMind66

    Google DeepMind 启动 AI 协同临床医生研究计划

    Google DeepMind 宣布启动 AI 协同临床医生(AI co-clinician)研究计划,探索医生监督下由 AI 智能体协作辅助患者与医生的三元诊疗模式。

    推荐理由:原文展示了医疗多模态智能体在双模块架构下的模拟表现与评估局限,为严肃专业场景落地实时交互系统提供了工程参考。

4月23日周四
  1. Google Research73

    Google Photos 上线 3D 视角重构功能

    Google 宣布在 Google Photos 的 Auto frame 功能中上线全新的 3D 视角重构技术,支持在照片拍摄后自动调整机位和视场角。该方法将处理流程解耦为 3D 场景与相机参数估计以及生成式修图两个阶段,先估算人像与场景的点云地图,再利用潜空间扩散模型补全视角移动后暴露的画面空缺。该功能现已面向包含人物的适用照片推出,用户可在 Auto frame 候选项中直接调用。

    推荐理由:原文详解了将三维场景估计与扩散补全解耦的技术方案,展示了生成式模型修正摄影透视畸变的具体落地路径。

4月22日周三
  1. Google Research60

    Google 提出 ReasoningBank 记忆框架:让 Agent 从成功与失败经验中自主进化

    Google Research 推出 Agent 记忆框架 ReasoningBank,通过从成功与失败经历中同时提炼高阶结构化推理模式,支持智能体在部署测试时自主进化。

    推荐理由:针对传统 Agent 记忆只记录动作或成功经验的缺陷,该研究展示了如何利用失败反思与测试时缩放实现策略演进。

4月16日周四
  1. Google DeepMind73

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 推出文本转语音模型 Gemini 3.1 Flash TTS,支持原生多角色对话与 70 多种语言,并引入音频标签实现对语气、语速及表达风格的细粒度控制。

    推荐理由:模型引入了可直接嵌入文本的音频标签来微调语气和节奏,便于开发者在多角色与多语言场景中构建精准可控的对话体验。

4月13日周一
4月3日周五
  1. Google DeepMind88

    Google DeepMind 发布 Gemma 4 开源模型家族

    Google DeepMind 正式推出 Gemma 4 开源模型家族,采用 Apache 2.0 协议,提供 E2B、E4B、26B MoE 和 31B Dense 四种尺寸。

    推荐理由:全系模型采用宽松开源协议并覆盖端侧至服务器规格,便于开发者在本地或边缘设备低成本落地多模态与智能体工作流。

3月29日周日
  1. Google DeepMind64

    Google DeepMind 推出 AI 指针交互原型:结合 Gemini 重构鼠标光标体验

    Google DeepMind 推出由 Gemini 驱动的 AI 指针实验原型与设计原则,让鼠标光标能够直接理解屏幕指向的视觉与语义语境,替代冗长的提示词交互。该系统通过指代词和语音直接调用模型分析选中内容,将屏幕像素转化为可操作实体,并已开始整合至 Chrome 浏览器与 Googlebook 的 Magic Pointer 功能中。

    推荐理由:文章总结了将传统光标转变为语境感知界面的四项原则,读者可据此理解多模态模型如何重塑桌面人机交互体验。