跳到正文

技术方向

多模态 最新动态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

95 条精选近 30 天 7 条共收录 135 条

更新

精选归档 · 第 4 页

10月21日周二第 61–80 条
  1. Hugging Face Blog70

    Hugging Face AI Sheets 增加视觉支持,可在表格中提取、生成与编辑图像

    Hugging Face 为其开源无代码数据工具 AI Sheets 推出更新,新增视觉模型支持。用户可以直接在表格内完成图像信息提取、文生图以及图像编辑等操作,并调用 Qwen2.5-VL、Qwen3-VL 等开源多模态模型处理单据或手写文档。生成的数据集支持导出为 CSV、Parquet 格式或直接上传至 Hugging Face Hub,项目已在 GitHub 开源。

    推荐理由:工具将开源视觉模型封装进无代码表格交互中,为需要批量提取单据信息或生成多模态数据集的流程提供了参考。

9月30日周二
  1. OpenAI News71

    OpenAI 发布视频生成模型 Sora 2

    OpenAI 推出视频生成模型 Sora 2,支持生成同步对白与音效。此外,文中说明原 Sora 产品目前已不再可用。

    推荐理由:原文指出了模型新增的同步对白与音效能力,读者可据此了解视频生成在音画同步方向的演进。

9月23日周二
  1. Hugging Face Blog72

    Hugging Face 开源 Smol2Operator:轻量级 GUI 智能体后训练方案与模型

    Hugging Face 开源了 Smol2Operator,提供将轻量级视觉语言模型后训练为图形界面操作智能体的完整方案、模型权重与工具链。该方法先通过统一动作空间建立基础元素定位能力,再通过引入显式推理的多轮微调增强决策规划,使 SmolVLM2-2.2B 在 ScreenSpot-v2 基准上的准确率提升至 61.71%。项目同步开源了转换后的数据集、动作空间适配工具以及在线交互演示。

    推荐理由:原文完整开源了从异构动作空间归一化到感知与推理两阶段微调的配方,读者可参考其在小参数模型上构建界面操作能力。

8月28日周四
  1. OpenAI News81

    OpenAI 推出 gpt-realtime 模型及 Realtime API 更新

    OpenAI 推出更先进的语音到语音模型 gpt-realtime,并对 Realtime API 进行了功能升级。新版本 API 新增了对 MCP 服务端、图像输入以及 SIP 电话呼叫功能的支持。

    推荐理由:更新为实时语音交互补充了 MCP 工具调用、图像输入与电话通信支持,有助于开发者扩展语音智能体的落地场景。

8月7日周四
  1. OpenAI News87

    OpenAI 发布 GPT-5

    OpenAI 正式推出 GPT-5,称其为迄今最先进且相比以往模型实现显著智能飞跃的 AI 系统。该模型在编程、数学、写作、健康以及视觉感知等多个领域均具备前沿水准的表现。

    推荐理由:官方简要介绍了该系统相比以往模型的智能提升,并列举了在编程、数学与视觉感知等关键能力上的全面升级。

6月6日周五
6月3日周二
5月21日周三
  1. Hugging Face Blog72

    Hugging Face 开源纯 PyTorch 视觉语言模型训练工具 nanoVLM

    Hugging Face 开源了极简视觉语言模型训练工具库 nanoVLM,支持在纯 PyTorch 环境及免费 Colab 上构建并训练多模态模型。该项目受 nanoGPT 启发,默认组合 Google SigLIP 视觉编码器与 SmolLM2-135M 语言基座,通过 Pixel Shuffle 和线性层实现轻量模态对齐。

    推荐理由:项目将视觉语言模型的架构与训练精简至极简代码,为开发者理解多模态投影机制和自建轻量训练管线提供了可直接参考的范本。

5月12日周一
  1. Hugging Face Blog71

    Hugging Face 发布视觉语言模型年度综述:架构演进与多模态趋势盘点

    Hugging Face 官方博客发文全面盘点了过去一年开源视觉语言模型的技术演进与核心趋势。文章系统总结了任意模态互转、长链推理、轻量端侧部署、MoE 解码器以及结合物理环境的 VLA 模型等新架构,并深入探讨了多模态 RAG、GUI 智能体及对齐微调等工程实践的落地现状。

    推荐理由:文章系统梳理了视觉语言模型在任意模态交互、端侧小型化及智能体应用上的演进路径,便于快速把握开源多模态技术版图。

4月29日周二
  1. Hugging Face Blog70

    Meta 发布多模态安全模型 Llama Guard 4 与 Prompt Guard 2,上线 Hugging Face

    Meta 发布了 12B 稠密多模态安全模型 Llama Guard 4 以及两款 Llama Prompt Guard 2 分类模型,开源权重与使用教程已同步上线 Hugging Face Hub。

    推荐理由:原文给出了基于剪枝实现单卡运行的架构细节与基准对比,读者可以据此评估在低算力环境中部署多模态安全审核管线的可行性。

4月9日周三
  1. Hugging Face Blog70

    Hugging Face 联合 Cloudflare 为 FastRTC 提供全球 WebRTC 基础设施支持

    Hugging Face 宣布与 Cloudflare 达成合作,开发者使用 Hugging Face Token 即可直接调用 Cloudflare 覆盖全球超 335 个节点的 TURN 服务器网络。FastRTC 开发者每月可免费获得 10GB 流媒体数据额度且无需信用卡,该集成在 FastRTC 0.0.20 及以上版本中提供,旨在简化实时语音助手和多模态应用的部署维护。

    推荐理由:开发者无需自行搭建 TURN 服务即可通过 Hugging Face 凭证调用全球中继节点,降低了实时语音与视频应用的工程门槛。

4月5日周六
  1. Hugging Face Blog94

    Meta 开源 Llama 4 Maverick 与 Scout,Hugging Face 全面集成并解析架构

    Meta 正式发布原生多模态 MoE 模型 Llama 4 Maverick 与 Scout,Hugging Face 宣布同步上线权重并提供全生态支持。两款模型激活参数均为 17B,分别具备约 400B 和 109B 总参数,基于 40 万亿 token 训练,Instruct 版本分别支持 1M 与 10M 上下文。

    推荐理由:原文解析了 Llama 4 的混合专家架构与长上下文机制,并给出了 Hugging Face 生态的调用代码与量化部署支持。

3月25日周二
  1. OpenAI News80

    OpenAI 推出 GPT-4o 图像生成能力

    OpenAI 宣布在 GPT-4o 中引入原生图像生成能力,包含更强的文本渲染与指令遵循表现。该更新同时提示用户体验 ChatGPT Images 2.5。

    推荐理由:GPT-4o 引入原生图像生成能力,重点改进了文本渲染与指令遵循,便于评估多模态模型的生成质量。

3月18日周二
  1. Hugging Face Blog79

    NVIDIA 在 GTC 2025 发布物理 AI 开源模型与数据集:Cosmos Transfer、GR00T N1 与 15TB 训练数据

    NVIDIA 在 GTC 2025 推出面向物理 AI 开发的开源资源套件,包括 7B 参数的多控制世界模型 Cosmos Transfer、通用人形机器人基础模型 Isaac GR00T-N1-2B,以及包含超 32 万条轨迹的 15TB 物理 AI 数据集。

    推荐理由:提供了从世界生成模型、通用人形本体控制到大规模仿真数据的完整开源方案,有助于具身智能开发者直接复用并微调下游任务。

3月12日周三
3月11日周二
3月4日周二
  1. Hugging Face Blog69

    Aya Vision 深度解析:推进 23 种语言的多语言多模态模型前沿

    Cohere For AI 正式开源 Aya Vision 8B 与 32B 多语言视觉语言模型,覆盖 23 种语言并在 AyaVisionBench 等评测中展现出超越同尺寸甚至更大模型的表现。

    推荐理由:文章公开了合成标注扩充多语言数据与多模态模型融合的技术配方,为中小参数视觉语言模型在跨语言场景下的优化提供了可迁移方案。

2月25日周二
  1. Hugging Face Blog76

    Hugging Face 推出 FastRTC 实时音视频通信库

    Hugging Face 推出 FastRTC,这是一个专为 Python 设计的实时音视频通信库,旨在降低实时 AI 应用的开发门槛。该库内置自动语音活动检测与轮流发言控制,支持 WebRTC 与 WebSocket,可自动生成 Gradio 交互界面或单行挂载至生产级 FastAPI 服务。

    推荐理由:该库简化了 Python 实时音视频应用的开发流程,开发者可以直接复用其内置的语音检测与传输能力构建交互应用。

2月21日周五
  1. Hugging Face Blog72

    Google 发布多语言视觉语言编码器 SigLIP 2

    Google 发布多语言视觉语言编码器 SigLIP 2,在 SigLIP 的 Sigmoid 损失基础上新增文本解码器辅助任务、全局-局部损失与掩码预测自蒸馏,在所有尺寸上全面超越前代模型。

    推荐理由:SigLIP 2 通过引入解码器辅助任务与自蒸馏提升了密集特征质量,为构建多模态大模型的视觉编码器提供了更强基座。