Hugging Face Blog·· 2025-01-24精选AI 评分72
Hugging Face 开源智能体框架 smolagents 正式支持视觉多模态模型
We now support VLMs in smolagents!
AI 导读
Hugging Face 宣布其开源智能体框架 smolagents 正式支持视觉语言模型(VLM),让智能体能够在执行管线中原生处理图像。框架支持在启动时通过 run 方法直接传入图像列表,也支持通过每步回调函数将网页截图等动态图像写入记忆观察。官方提供了结合 helium 浏览器自动化工具与 Qwen2-VL 等模型构建自主网页浏览 Agent 的完整示例。
推荐理由
原文给出了静态传入与动态回调两种图像输入方案及完整代码,读者可据此为轻量智能体工作流增加多模态感知能力。
来源:Hugging Face Blog · huggingface.co