Google 发布多语言视觉语言编码器 SigLIP 2
Google 发布多语言视觉语言编码器 SigLIP 2,在 SigLIP 的 Sigmoid 损失基础上新增文本解码器辅助任务、全局-局部损失与掩码预测自蒸馏,在所有尺寸上全面超越前代模型。
推荐理由:SigLIP 2 通过引入解码器辅助任务与自蒸馏提升了密集特征质量,为构建多模态大模型的视觉编码器提供了更强基座。
公司与模型
Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。
110 条精选近 30 天 10 条共收录 227 条
Google 发布多语言视觉语言编码器 SigLIP 2,在 SigLIP 的 Sigmoid 损失基础上新增文本解码器辅助任务、全局-局部损失与掩码预测自蒸馏,在所有尺寸上全面超越前代模型。
推荐理由:SigLIP 2 通过引入解码器辅助任务与自蒸馏提升了密集特征质量,为构建多模态大模型的视觉编码器提供了更强基座。
Google 正式发布 PaliGemma 2 mix 视觉语言模型,基于 SigLIP 与 Gemma 2 在多项学术混合任务上完成指令微调。模型涵盖 3B、10B、28B 三种参数规模及 224x224、448x448 等分辨率,支持开放式提示词处理文档理解、OCR、长短图像描述、目标检测与图像分割。
推荐理由:原文给出了不同尺寸和分辨率在视觉问答、OCR与定位任务上的实测表现,读者可以据此评估多模态下游微调的选型基准。
Google 扩展了 Gemma 2 模型家族,正式发布 Gemma 2 2B、安全审核分类器 ShieldGemma 以及机制可解释性套件 Gemma Scope。
推荐理由:Google扩展了Gemma 2系列,带来端侧小模型、安全分类器以及用于机制可解释性研究的稀疏自编码器套件。
Hugging Face 宣布在 Inference Endpoints 和 Spaces 中支持 Google Cloud TPU v5e,开发者可直接借助 Google 自研硬件加速模型推理与 Demo 部署。
推荐理由:平台整合了TPU硬件与Optimum TPU开源库,为开发者在部署主流开源模型时提供了兼顾性能与成本的新硬件选项。
Google 正式发布新一代开源大语言模型 Gemma 2,提供 9B 和 27B 两种参数规模的 Base 与 Instruction 版本,上下文长度为 8K tokens。
推荐理由:原文梳理了交替滑动窗口注意力与在线蒸馏等改动,读者可以借此评估该系列在消费级硬件上的微调与部署成本。
Google 推出开源视觉语言模型 PaliGemma,由 SigLIP-So400m 图像编码器与 Gemma-2B 文本解码器组成,已全面集成至 Hugging Face。该系列包含预训练、多任务混合以及学术微调三类权重,提供三种输入分辨率与多种精度选择。模型适用于图像标注、目标检测与指代分割等任务,支持通过 transformers 进行 4-bit 量化推理与 QLoRA 微调。
推荐理由:原文详细拆解了模型架构与分辨率机制,并给出了完整的推理及 QLoRA 微调代码,便于开发者低成本适配特定视觉任务。
Google 联合 Hugging Face 正式推出开源代码大模型 CodeGemma,包含专精代码补全的 2B 基础版、7B 基础版以及面向对话交互的 7B Instruct 版本。
推荐理由:Google 为代码补全与对话场景开源了轻量模型,读者可以了解其填空机制及在消费级显卡上的部署方案。
Google 推出全新开源大语言模型 Gemma,Hugging Face 发文对其表示欢迎。
OpenAI 与 DeepMind 安全团队合作开发了一种新算法,通过让人类在两种候选行为中选择更优方案来推断真实意图。该方法旨在消除人类直接编写目标函数的需要,避免因目标设定偏差导致不符合预期乃至危险的系统行为。
推荐理由:算法通过让人类在两种行为中二选一的方式推断真实意图,减少了手动编写复杂目标函数带来的安全隐患。
OpenAI 联合来自 Berkeley、Stanford 以及牵头的 Google Brain 研究人员共同发布了论文《Concrete Problems in AI Safety》。该论文重点探讨了如何确保现代机器学习系统按设计预期运行的多项关键安全课题。
推荐理由:论文探讨了确保机器学习系统按预期运行的具体安全问题,为人工智能系统控制与安全对齐提供了关键的研究议题。