跳到正文
Hugging Face Blog·· 2025-01-24精选AI 评分72

Hugging Face 开源智能体框架 smolagents 正式支持视觉多模态模型

We now support VLMs in smolagents!

AI 导读

Hugging Face 宣布其开源智能体框架 smolagents 正式支持视觉语言模型(VLM),让智能体能够在执行管线中原生处理图像。框架支持在启动时通过 run 方法直接传入图像列表,也支持通过每步回调函数将网页截图等动态图像写入记忆观察。官方提供了结合 helium 浏览器自动化工具与 Qwen2-VL 等模型构建自主网页浏览 Agent 的完整示例。

推荐理由

原文给出了静态传入与动态回调两种图像输入方案及完整代码,读者可据此为轻量智能体工作流增加多模态感知能力。

来源:Hugging Face Blog · huggingface.co