跳到正文
Hugging Face Blog·· 2025-02-20精选AI 评分76

Hugging Face 发布轻量级视频理解模型 SmolVLM2

SmolVLM2: Bringing Video Understanding to Every Device

AI 导读

Hugging Face 发布轻量级视觉与视频理解模型 SmolVLM2,包含 2.2B、500M 和 256M 三种参数规格,旨在让视频理解能力运行在从手机到服务器的各类设备上。

推荐理由

官方提供了从256M到2.2B的多模态视频模型并原生支持MLX,展示了在手机端本地运行视频理解的可行方案。

来源:Hugging Face Blog · huggingface.co