Hugging Face 发布轻量级视频理解模型 SmolVLM2
Hugging Face 发布轻量级视觉与视频理解模型 SmolVLM2,包含 2.2B、500M 和 256M 三种参数规格,旨在让视频理解能力运行在从手机到服务器的各类设备上。
推荐理由:官方提供了从256M到2.2B的多模态视频模型并原生支持MLX,展示了在手机端本地运行视频理解的可行方案。
技术方向
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
95 条精选近 30 天 7 条共收录 135 条
Hugging Face 发布轻量级视觉与视频理解模型 SmolVLM2,包含 2.2B、500M 和 256M 三种参数规格,旨在让视频理解能力运行在从手机到服务器的各类设备上。
推荐理由:官方提供了从256M到2.2B的多模态视频模型并原生支持MLX,展示了在手机端本地运行视频理解的可行方案。
Google 正式发布 PaliGemma 2 mix 视觉语言模型,基于 SigLIP 与 Gemma 2 在多项学术混合任务上完成指令微调。模型涵盖 3B、10B、28B 三种参数规模及 224x224、448x448 等分辨率,支持开放式提示词处理文档理解、OCR、长短图像描述、目标检测与图像分割。
推荐理由:原文给出了不同尺寸和分辨率在视觉问答、OCR与定位任务上的实测表现,读者可以据此评估多模态下游微调的选型基准。
Hugging Face 宣布其开源智能体框架 smolagents 正式支持视觉语言模型(VLM),让智能体能够在执行管线中原生处理图像。框架支持在启动时通过 run 方法直接传入图像列表,也支持通过每步回调函数将网页截图等动态图像写入记忆观察。官方提供了结合 helium 浏览器自动化工具与 Qwen2-VL 等模型构建自主网页浏览 Agent 的完整示例。
推荐理由:原文给出了静态传入与动态回调两种图像输入方案及完整代码,读者可据此为轻量智能体工作流增加多模态感知能力。
Hugging Face 扩展 SmolVLM 系列,推出 SmolVLM-256M 和 SmolVLM-500M 两个轻量多模态模型,分别包含基础与指令微调共 4 个权重检查点。
推荐理由:官方提供了极小参数量多模态模型的架构权衡与训练优化细节,方便端侧与低成本检索场景参考。
Artificial Analysis 发布音频语言模型推理评测数据集 Big Bench Audio,包含从 Big Bench Hard 改编的 1000 个语音问题。
推荐理由:评测揭示了原生端到端语音与纯文本之间的推理性能鸿沟,为构建高准确率语音智能体提供了架构选型参考。
OpenAI 宣布视频生成模型 Sora 正式在 sora.com 开放使用。该模型支持生成最高 1080p 分辨率、最长 20 秒的视频,并提供宽屏、竖屏和正方形画幅选项。用户不仅可以直接通过文本生成全新内容,还能导入自有素材进行扩展、混剪与融合。
推荐理由:读者可以通过具体的分辨率和时长规格,评估该模型在当前视频制作与素材混剪工作流中的实用性。
OpenAI 宣布在微调 API 中正式引入视觉支持。开发者现可结合图像和文本数据微调 GPT-4o,以针对特定场景提升模型的视觉能力。
推荐理由:开发者可基于自身的图文数据集定制 GPT-4o,有助于优化特定场景下的视觉理解表现。
Hugging Face 宣布迎来 Llama 3.2,该版本模型具备视觉能力并支持在个人设备端运行。目前材料仅提供标题信息,具体技术参数与细节需参考完整官方文档。
TII 正式推出 Falcon 2 系列开源模型,包含 11B 参数的大语言模型 Falcon2-11B 及其视觉语言模型 Falcon2-11B VLM。
推荐理由:原文给出了 11B 语言与多模态模型的分阶段训练参数和基准对比,读者可以据此评估小参数开源模型在多语言和视觉问答中的实用性。
OpenAI 发布视频生成研究报告,其最大模型 Sora 能够生成长达 1 分钟的高保真视频。该方法在不同时长、分辨率和宽高比的视频与图像上联合训练文本条件扩散模型,并采用在潜在编码时空 patch 上运行的 Transformer 架构。OpenAI 指出,扩展视频生成模型是构建通用物理世界模拟器的可行路径。
推荐理由:OpenAI 将视频生成视为物理世界模拟器的技术路径,展示了扩散模型结合时空 Patch 架构在视频生成上的扩展潜力。
OpenAI 宣布 ChatGPT 具备看、听和说的多模态交互能力。该更新让用户可以通过语音对话以及输入图像与 ChatGPT 展开交流。
Hugging Face 正式开源视觉语言模型 IDEFICS,作为 DeepMind 闭源模型 Flamingo 的开放复现版本,支持图文交错序列输入并生成文本。
推荐理由:该项目完全基于公开数据和开源模型复现了闭源 Flamingo 的图文交错多模态能力,为多模态研究提供了透明的数据集与权重参考。
Hugging Face 发布了 AI WebTV 实验性演示项目的技术架构与实现方案,用于展示开源文本生成视频与音乐合成的串联效果。系统通过 ChatGPT 生成分镜提示词,使用两阶段 Zeroscope 模型生成并超分辨率放大视频,再结合 FILM 插帧算法与 MusicGen 音频合成,最终借助 FFmpeg 将切片推流至 RTMP 服务器。
推荐理由:原文拆解了从文本生成视频、超分辨率、插帧到推流的全流程架构,读者可以据此搭建端到端的多模态流媒体管道。
Hugging Face 博客发文梳理文生视频技术发展,分析了该任务在时空一致性与高质量多模态数据集方面的核心挑战。文章回顾了从 GAN、Transformer 到扩散模型的演进路径,并展示了如何通过 Hugging Face Diffusers 管道及 Spaces 运行 ModelScope 和 Text2Video-Zero 等开源模型。
推荐理由:文章系统梳理了文生视频从早期生成对抗网络到扩散架构的技术演进与数据集瓶颈,并提供了可直接复现的开源部署代码。
Hugging Face 发布文档 AI 实操指南,系统梳理了六大典型场景与主流开源模型的应用路径。文章对比了 OCR、版面分析、文档解析及 DocVQA 在 LayoutLM、Donut 与新兴视觉语言模型下的能力演进,并就商用授权风险、图像分辨率权衡及小样本标注提出了落地建议。
推荐理由:原文系统梳理了文档 AI 的核心场景、开源模型选型及商用授权风险,读者可据此搭建端到端文档理解方案。