Hugging Face Blog·· 2024-05-14精选AI 评分75
Google 开源视觉语言模型 PaliGemma
PaliGemma – Google's Cutting-Edge Open Vision Language Model
AI 导读
Google 推出开源视觉语言模型 PaliGemma,由 SigLIP-So400m 图像编码器与 Gemma-2B 文本解码器组成,已全面集成至 Hugging Face。该系列包含预训练、多任务混合以及学术微调三类权重,提供三种输入分辨率与多种精度选择。模型适用于图像标注、目标检测与指代分割等任务,支持通过 transformers 进行 4-bit 量化推理与 QLoRA 微调。
推荐理由
原文详细拆解了模型架构与分辨率机制,并给出了完整的推理及 QLoRA 微调代码,便于开发者低成本适配特定视觉任务。
来源:Hugging Face Blog · huggingface.co