跳到正文

公司与模型

Google / Gemini 最新动态

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

110 条精选近 30 天 10 条共收录 227 条

更新

精选归档 · 第 6 页

2月21日周五第 101–110 条
  1. Hugging Face Blog72

    Google 发布多语言视觉语言编码器 SigLIP 2

    Google 发布多语言视觉语言编码器 SigLIP 2,在 SigLIP 的 Sigmoid 损失基础上新增文本解码器辅助任务、全局-局部损失与掩码预测自蒸馏,在所有尺寸上全面超越前代模型。

    推荐理由:SigLIP 2 通过引入解码器辅助任务与自蒸馏提升了密集特征质量,为构建多模态大模型的视觉编码器提供了更强基座。

2月19日周三
  1. Hugging Face Blog68

    Google 发布 PaliGemma 2 Mix 指令微调视觉语言模型

    Google 正式发布 PaliGemma 2 mix 视觉语言模型,基于 SigLIP 与 Gemma 2 在多项学术混合任务上完成指令微调。模型涵盖 3B、10B、28B 三种参数规模及 224x224、448x448 等分辨率,支持开放式提示词处理文档理解、OCR、长短图像描述、目标检测与图像分割。

    推荐理由:原文给出了不同尺寸和分辨率在视觉问答、OCR与定位任务上的实测表现,读者可以据此评估多模态下游微调的选型基准。

7月31日周三
7月9日周二
6月27日周四
5月14日周二
  1. Hugging Face Blog75

    Google 开源视觉语言模型 PaliGemma

    Google 推出开源视觉语言模型 PaliGemma,由 SigLIP-So400m 图像编码器与 Gemma-2B 文本解码器组成,已全面集成至 Hugging Face。该系列包含预训练、多任务混合以及学术微调三类权重,提供三种输入分辨率与多种精度选择。模型适用于图像标注、目标检测与指代分割等任务,支持通过 transformers 进行 4-bit 量化推理与 QLoRA 微调。

    推荐理由:原文详细拆解了模型架构与分辨率机制,并给出了完整的推理及 QLoRA 微调代码,便于开发者低成本适配特定视觉任务。

4月9日周二
2月21日周三
6月13日周二
  1. OpenAI News69

    OpenAI 与 DeepMind 合作提出基于人类偏好学习的新算法

    OpenAI 与 DeepMind 安全团队合作开发了一种新算法,通过让人类在两种候选行为中选择更优方案来推断真实意图。该方法旨在消除人类直接编写目标函数的需要,避免因目标设定偏差导致不符合预期乃至危险的系统行为。

    推荐理由:算法通过让人类在两种行为中二选一的方式推断真实意图,减少了手动编写复杂目标函数带来的安全隐患。

6月21日周二
  1. OpenAI News62

    OpenAI 联合 Google Brain 等机构发布 AI 安全论文《Concrete Problems in AI Safety》

    OpenAI 联合来自 Berkeley、Stanford 以及牵头的 Google Brain 研究人员共同发布了论文《Concrete Problems in AI Safety》。该论文重点探讨了如何确保现代机器学习系统按设计预期运行的多项关键安全课题。

    推荐理由:论文探讨了确保机器学习系统按预期运行的具体安全问题,为人工智能系统控制与安全对齐提供了关键的研究议题。