ChatGPT 现已支持视觉与语音交互
OpenAI 宣布 ChatGPT 具备看、听和说的多模态交互能力。该更新让用户可以通过语音对话以及输入图像与 ChatGPT 展开交流。
技术方向
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
110 条精选近 30 天 7 条共收录 158 条
OpenAI 宣布 ChatGPT 具备看、听和说的多模态交互能力。该更新让用户可以通过语音对话以及输入图像与 ChatGPT 展开交流。
Hugging Face 正式开源视觉语言模型 IDEFICS,作为 DeepMind 闭源模型 Flamingo 的开放复现版本,支持图文交错序列输入并生成文本。
推荐理由:该项目完全基于公开数据和开源模型复现了闭源 Flamingo 的图文交错多模态能力,为多模态研究提供了透明的数据集与权重参考。
Hugging Face 发布了 AI WebTV 实验性演示项目的技术架构与实现方案,用于展示开源文本生成视频与音乐合成的串联效果。系统通过 ChatGPT 生成分镜提示词,使用两阶段 Zeroscope 模型生成并超分辨率放大视频,再结合 FILM 插帧算法与 MusicGen 音频合成,最终借助 FFmpeg 将切片推流至 RTMP 服务器。
推荐理由:原文拆解了从文本生成视频、超分辨率、插帧到推流的全流程架构,读者可以据此搭建端到端的多模态流媒体管道。
Hugging Face 博客发文梳理文生视频技术发展,分析了该任务在时空一致性与高质量多模态数据集方面的核心挑战。文章回顾了从 GAN、Transformer 到扩散模型的演进路径,并展示了如何通过 Hugging Face Diffusers 管道及 Spaces 运行 ModelScope 和 Text2Video-Zero 等开源模型。
推荐理由:文章系统梳理了文生视频从早期生成对抗网络到扩散架构的技术演进与数据集瓶颈,并提供了可直接复现的开源部署代码。
OpenAI 正式发布大型多模态模型 GPT-4,支持图像和文本输入并生成文本输出。官方表示该模型虽然在许多现实场景中仍逊于人类,但在多项专业和学术基准测试中展现出了人类水平的表现。
推荐理由:官方说明了模型支持图像与文本双模态输入,读者可以据此了解其能力形态和基准测试定位。
Hugging Face 发布文档 AI 实操指南,系统梳理了六大典型场景与主流开源模型的应用路径。文章对比了 OCR、版面分析、文档解析及 DocVQA 在 LayoutLM、Donut 与新兴视觉语言模型下的能力演进,并就商用授权风险、图像分辨率权衡及小样本标注提出了落地建议。
推荐理由:原文系统梳理了文档 AI 的核心场景、开源模型选型及商用授权风险,读者可据此搭建端到端文档理解方案。
OpenAI 在 CLIP 模型中发现了多模态神经元,无论概念以字面、符号还是抽象形式呈现,这些神经元都会对同一概念做出响应。该发现解释了 CLIP 对非常规视觉呈现分类的准确性,也是理解 CLIP 及类似模型所学关联与偏见的重要一步。
推荐理由:该研究展示了模型内部概念表征的神经元机制,为理解跨模态关联与偏见形成提供了可解释性切入点。
OpenAI 推出神经网络 CLIP,可通过自然语言监督高效学习视觉概念。该模型只需提供待识别视觉类别的名称即可应用于任何视觉分类基准,具备类似于 GPT-2 和 GPT-3 的零样本能力。
推荐理由:原文介绍了利用自然语言监督学习视觉概念的机制,展示了将语言模型零样本能力拓展至视觉分类的方法。
OpenAI 训练了名为 DALL·E 的神经网络,可根据自然语言文本描述生成对应图像。该模型支持生成涵盖广泛自然语言概念的图像内容。
OpenAI 推出音乐生成神经网络 Jukebox,能够直接以原始音频形式生成包含多种流派、艺术家风格以及初步歌声的音乐。官方已同步开源该模型的权重与代码,并提供了用于试听和浏览生成音频样本的工具。
推荐理由:OpenAI开源了可直接生成原始音频与歌声的音乐生成模型及代码,为音频多模态生成研究提供了可复现的参考实现。