跳到正文

技术方向

多模态 最新动态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

95 条精选近 30 天 7 条共收录 135 条

更新

精选归档 · 第 5 页

2月20日周四第 81–95 条
  1. Hugging Face Blog76

    Hugging Face 发布轻量级视频理解模型 SmolVLM2

    Hugging Face 发布轻量级视觉与视频理解模型 SmolVLM2,包含 2.2B、500M 和 256M 三种参数规格,旨在让视频理解能力运行在从手机到服务器的各类设备上。

    推荐理由:官方提供了从256M到2.2B的多模态视频模型并原生支持MLX,展示了在手机端本地运行视频理解的可行方案。

2月19日周三
  1. Hugging Face Blog68

    Google 发布 PaliGemma 2 Mix 指令微调视觉语言模型

    Google 正式发布 PaliGemma 2 mix 视觉语言模型,基于 SigLIP 与 Gemma 2 在多项学术混合任务上完成指令微调。模型涵盖 3B、10B、28B 三种参数规模及 224x224、448x448 等分辨率,支持开放式提示词处理文档理解、OCR、长短图像描述、目标检测与图像分割。

    推荐理由:原文给出了不同尺寸和分辨率在视觉问答、OCR与定位任务上的实测表现,读者可以据此评估多模态下游微调的选型基准。

1月24日周五
  1. Hugging Face Blog72

    Hugging Face 开源智能体框架 smolagents 正式支持视觉多模态模型

    Hugging Face 宣布其开源智能体框架 smolagents 正式支持视觉语言模型(VLM),让智能体能够在执行管线中原生处理图像。框架支持在启动时通过 run 方法直接传入图像列表,也支持通过每步回调函数将网页截图等动态图像写入记忆观察。官方提供了结合 helium 浏览器自动化工具与 Qwen2-VL 等模型构建自主网页浏览 Agent 的完整示例。

    推荐理由:原文给出了静态传入与动态回调两种图像输入方案及完整代码,读者可据此为轻量智能体工作流增加多模态感知能力。

1月23日周四
12月20日周五
12月9日周一
  1. OpenAI News89

    OpenAI 视频生成模型 Sora 正式上线 sora.com

    OpenAI 宣布视频生成模型 Sora 正式在 sora.com 开放使用。该模型支持生成最高 1080p 分辨率、最长 20 秒的视频,并提供宽屏、竖屏和正方形画幅选项。用户不仅可以直接通过文本生成全新内容,还能导入自有素材进行扩展、混剪与融合。

    推荐理由:读者可以通过具体的分辨率和时长规格,评估该模型在当前视频制作与素材混剪工作流中的实用性。

10月1日周二
9月25日周三
5月24日周五
2月15日周四
  1. OpenAI News88

    OpenAI 探讨将视频生成模型作为物理世界模拟器并介绍 Sora

    OpenAI 发布视频生成研究报告,其最大模型 Sora 能够生成长达 1 分钟的高保真视频。该方法在不同时长、分辨率和宽高比的视频与图像上联合训练文本条件扩散模型,并采用在潜在编码时空 patch 上运行的 Transformer 架构。OpenAI 指出,扩展视频生成模型是构建通用物理世界模拟器的可行路径。

    推荐理由:OpenAI 将视频生成视为物理世界模拟器的技术路径,展示了扩散模型结合时空 Patch 架构在视频生成上的扩展潜力。

9月25日周一
8月22日周二
  1. Hugging Face Blog74

    Hugging Face 开源视觉语言模型 IDEFICS:复现 Flamingo 并提供 9B 与 80B 版本

    Hugging Face 正式开源视觉语言模型 IDEFICS,作为 DeepMind 闭源模型 Flamingo 的开放复现版本,支持图文交错序列输入并生成文本。

    推荐理由:该项目完全基于公开数据和开源模型复现了闭源 Flamingo 的图文交错多模态能力,为多模态研究提供了透明的数据集与权重参考。

7月17日周一
  1. Hugging Face Blog63

    Hugging Face 发布 AI WebTV 构建指南:基于开源模型实现全自动流媒体

    Hugging Face 发布了 AI WebTV 实验性演示项目的技术架构与实现方案,用于展示开源文本生成视频与音乐合成的串联效果。系统通过 ChatGPT 生成分镜提示词,使用两阶段 Zeroscope 模型生成并超分辨率放大视频,再结合 FILM 插帧算法与 MusicGen 音频合成,最终借助 FFmpeg 将切片推流至 RTMP 服务器。

    推荐理由:原文拆解了从文本生成视频、超分辨率、插帧到推流的全流程架构,读者可以据此搭建端到端的多模态流媒体管道。

5月8日周一
  1. Hugging Face Blog60

    Hugging Face 详解文生视频模型演进与 Diffusers 实践

    Hugging Face 博客发文梳理文生视频技术发展,分析了该任务在时空一致性与高质量多模态数据集方面的核心挑战。文章回顾了从 GAN、Transformer 到扩散模型的演进路径,并展示了如何通过 Hugging Face Diffusers 管道及 Spaces 运行 ModelScope 和 Text2Video-Zero 等开源模型。

    推荐理由:文章系统梳理了文生视频从早期生成对抗网络到扩散架构的技术演进与数据集瓶颈,并提供了可直接复现的开源部署代码。

11月21日周一
  1. Hugging Face Blog66

    Hugging Face 详解文档 AI 落地指南:开源模型选型与实践建议

    Hugging Face 发布文档 AI 实操指南,系统梳理了六大典型场景与主流开源模型的应用路径。文章对比了 OCR、版面分析、文档解析及 DocVQA 在 LayoutLM、Donut 与新兴视觉语言模型下的能力演进,并就商用授权风险、图像分辨率权衡及小样本标注提出了落地建议。

    推荐理由:原文系统梳理了文档 AI 的核心场景、开源模型选型及商用授权风险,读者可据此搭建端到端文档理解方案。