跳到正文

公司与模型

Google / Gemini 最新动态

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

97 条精选近 30 天 10 条共收录 209 条

更新

精选归档 · 第 5 页

11月20日周四第 81–97 条
  1. Google DeepMind64

    Google 如何将 AI 图像验证功能引入 Gemini 应用

    Google 宣布在 Gemini 应用中上线 AI 图像验证功能,用户直接上传图片并提问即可检测其是否由 Google AI 生成或编辑。该功能基于底层 SynthID 水印技术结合推理提供溯源信息,后续还将扩展至音频、视频和搜索产品。此外,Google 正推进 C2PA 标准落地,本周起在 Gemini 和 Vertex AI 等平台生成的图像中嵌入 C2PA 元数据。

    推荐理由:Google 将数字水印技术直接下放到消费级对话界面,让普通用户能够便捷验证内容来源并防范合成媒体风险。

  2. Google DeepMind81

    Google DeepMind 发布图像模型 Nano Banana Pro

    Google DeepMind 推出基于 Gemini 3 Pro 的图像生成与编辑模型 Nano Banana Pro(Gemini 3 Pro Image),在 Google AI Studio 和 Vertex AI 中开启付费预览。

    推荐理由:Google DeepMind 发布基于 Gemini 3 Pro 的图像生成与编辑模型,支持 4K 分辨率及联网检索以提升专业资产生成精度。

  3. Google DeepMind87

    Google DeepMind 推出图像生成与编辑模型 Nano Banana Pro

    Google DeepMind 正式推出图像生成与编辑模型 Nano Banana Pro(即 Gemini 3 Pro Image),基于 Gemini 3 Pro 构建并具备先进的推理与真实世界知识可视化能力。

    推荐理由:Google发布基于Gemini 3 Pro的图像生成模型,支持多语言长文本渲染与多图一致性融合,已同步接入Gemini及开发者API。

11月19日周三
  1. Google Research73

    Google 提出实时端到端语音互译技术,实现保留原声与 2 秒低延迟

    Google 推出基于流式架构的端到端实时语音到语音翻译(S2ST)模型,将传统级联系统的 4–5 秒延迟缩短至 2 秒,并在翻译中保留原说话人的声音特征。该架构基于 AudioLM 与 SpectroStream 编解码技术构建,配合时间同步数据获取管线训练,目前已部署于云端 Google Meet 与 Pixel 10 端侧设备中。

    推荐理由:原文解析了流式端到端架构与时间同步对齐管线,读者可以借此了解如何将同传级语音互译延迟压缩至两秒内并保留原声音色。

  2. Google Research78

    Google Research 推出 Generative UI 技术,支持按提示词动态生成可交互界面

    Google Research 发布 Generative UI 技术及相关论文,使大模型能够根据任意提示词动态设计并编写网页、工具与小游戏等完整定制的可交互界面。该系统基于 Gemini 3 Pro 配合工具调用、系统提示词与后处理管线实现,人工评测偏好度远超标准文本输出。目前该能力已在 Gemini 应用的动态视图实验以及 Google Search 的 AI Mode 中开启上线。

    推荐理由:该研究展示了大模型按需实时生成可交互界面的系统范式,为传统对话与静态内容展示提供了新的交互演进方向。

11月17日周一
  1. Google DeepMind69

    Google DeepMind 发布气象预测模型 WeatherNext 2

    Google DeepMind 与 Google Research 联合发布气象预测模型 WeatherNext 2,预测生成速度提升 8 倍且分辨率最高达 1 小时。

    推荐理由:该模型采用函数生成网络架构,将复杂气象推演压缩至单张 TPU 一分钟内,体现了生成式模型在大规模科学预测上的工程可行性。

11月14日周五
  1. Google Research62

    Google 联合 DeepMind 发布全球天然林 AI 地图与数据集,精准区分天然林与人工林

    Google Research 联合 Google DeepMind 等机构发布 2020 年全球天然林地图 Natural Forests of the World 2020 及相关数据集,在 Nature Scientific Data 发表并达到 92.2% 的全局验证准确率。

    推荐理由:该研究利用时空视觉模型区分天然林与人工种植林,为企业与监管机构落地零毁林合规提供了可落地的基准数据支持。

11月13日周四
  1. Google DeepMind73

    Google DeepMind 推出 SIMA 2:集成 Gemini 的 3D 虚拟世界具身智能体

    Google DeepMind 推出 SIMA 2 研究预览版,将 Gemini 模型作为智能体核心,实现在 3D 虚拟环境中进行高级目标推理与对话协作。该模型通过人类演示与 Gemini 生成标签混合训练,具备跨未见游戏迁移概念的能力,并可在 Genie 3 生成的全新 3D 模拟世界中自主探索与试错自进化。

    推荐理由:Google DeepMind 将 Gemini 推理核心融入 3D 虚拟世界智能体,展示了结合试错与自反馈实现跨游戏泛化及自进化的路径。

11月11日周二
  1. Google DeepMind61

    Google DeepMind 提出视觉表征对齐方法,让 AI 更接近人类认知方式

    Google DeepMind 在《Nature》发表研究,提出一种通过重构视觉表征将 AI 视觉系统与人类知识层次对齐的三步训练方法。该研究基于认知科学的 THINGS 数据集在 SigLIP-SO400M 上训练教师模型,生成包含上百万张图像判断的 AligNet 数据集并微调学生模型,使其内部表征按人类概念层次重组。

    推荐理由:原文揭示了视觉模型与人类高层概念的表征差异,并提供了通过三步法重构模型内部概念层次的具体对齐方案。

11月5日周三
9月4日周四
  1. Hugging Face Blog70

    Google 发布轻量多语言嵌入模型 EmbeddingGemma

    Google 发布轻量多语言嵌入模型 EmbeddingGemma,参数量为 308M 并配备 2K 上下文窗口,量化后内存占用低于 200 MB。该模型基于 Gemma3 架构改造为双向注意力编码器,支持超过 100 种语言与 MRL 维度截断,已全面集成至 Sentence Transformers、LangChain、LlamaIndex 与 Transformers.js 等生态框架。

    推荐理由:该模型以 308M 参数与双向注意力机制优化了端侧嵌入效率,适合作为移动端 RAG 与轻量检索系统的低成本落地参考。

3月12日周三
2月21日周五
  1. Hugging Face Blog72

    Google 发布多语言视觉语言编码器 SigLIP 2

    Google 发布多语言视觉语言编码器 SigLIP 2,在 SigLIP 的 Sigmoid 损失基础上新增文本解码器辅助任务、全局-局部损失与掩码预测自蒸馏,在所有尺寸上全面超越前代模型。

    推荐理由:SigLIP 2 通过引入解码器辅助任务与自蒸馏提升了密集特征质量,为构建多模态大模型的视觉编码器提供了更强基座。

2月19日周三
  1. Hugging Face Blog68

    Google 发布 PaliGemma 2 Mix 指令微调视觉语言模型

    Google 正式发布 PaliGemma 2 mix 视觉语言模型,基于 SigLIP 与 Gemma 2 在多项学术混合任务上完成指令微调。模型涵盖 3B、10B、28B 三种参数规模及 224x224、448x448 等分辨率,支持开放式提示词处理文档理解、OCR、长短图像描述、目标检测与图像分割。

    推荐理由:原文给出了不同尺寸和分辨率在视觉问答、OCR与定位任务上的实测表现,读者可以据此评估多模态下游微调的选型基准。