OpenAI 在 API 中推出最新图像生成模型 gpt-image-1
OpenAI 宣布其最新图像生成模型已通过 gpt-image-1 正式上线 API。开发者和企业可以直接将其集成到自有工具与平台中,构建专业级且可定制的视觉内容。
推荐理由:OpenAI 将最新图像生成模型以 gpt-image-1 接入 API,方便开发者和企业直接在自有平台中集成定制化视觉生成能力。
内容形态
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
132 条精选近 30 天 15 条共收录 163 条
OpenAI 宣布其最新图像生成模型已通过 gpt-image-1 正式上线 API。开发者和企业可以直接将其集成到自有工具与平台中,构建专业级且可定制的视觉内容。
推荐理由:OpenAI 将最新图像生成模型以 gpt-image-1 接入 API,方便开发者和企业直接在自有平台中集成定制化视觉生成能力。
OpenAI 正式推出 o3 与 o4-mini 模型。官方称其为迄今最智能且能力最强的模型,并具备完整的工具调用支持。
OpenAI 宣布在 API 中上线 GPT-4.1 系列模型,即日起面向全球开发者开放。该系列在编码、指令遵循与长上下文理解能力上均有提升,并同步推出了首款 nano 模型。
推荐理由:开发者可以了解 GPT-4.1 在编程与长上下文等方面的能力升级,并评估 nano 模型在轻量场景的调用成本。
Meta 正式发布原生多模态 MoE 模型 Llama 4 Maverick 与 Scout,Hugging Face 宣布同步上线权重并提供全生态支持。两款模型激活参数均为 17B,分别具备约 400B 和 109B 总参数,基于 40 万亿 token 训练,Instruct 版本分别支持 1M 与 10M 上下文。
推荐理由:原文解析了 Llama 4 的混合专家架构与长上下文机制,并给出了 Hugging Face 生态的调用代码与量化部署支持。
Hugging Face 发布 Open R1 项目第 4 期更新,系统解读了静默上线 Hub 的 DeepSeek-V3 0324 模型特性。该版本改用 MIT 许可协议,在 AIME(从 39.6 升至 59.4)和 GPQA 等基准测试中大幅提升,并优化了前端代码与中文写作。
推荐理由:原文整理了新版 DeepSeek-V3 的基准提升幅度与协议变更,并给出从 API 到本地量化部署的具体运行方案。
OpenAI 宣布在 GPT-4o 中引入原生图像生成能力,包含更强的文本渲染与指令遵循表现。该更新同时提示用户体验 ChatGPT Images 2.5。
推荐理由:GPT-4o 引入原生图像生成能力,重点改进了文本渲染与指令遵循,便于评估多模态模型的生成质量。
OpenAI 在 API 中推出新一代音频模型。开发者可以首次指示文本转语音模型以特定风格发音,例如要求其像富有同理心的客服人员一样说话,从而为语音智能体带来更高自由度的个性化定制能力。
推荐理由:开发者可以通过自然语言指令直接控制语音模型的语调与风格,为语音智能体交互带来更灵活的定制空间。
NVIDIA 在 GTC 2025 推出面向物理 AI 开发的开源资源套件,包括 7B 参数的多控制世界模型 Cosmos Transfer、通用人形机器人基础模型 Isaac GR00T-N1-2B,以及包含超 32 万条轨迹的 15TB 物理 AI 数据集。
推荐理由:提供了从世界生成模型、通用人形本体控制到大规模仿真数据的完整开源方案,有助于具身智能开发者直接复用并微调下游任务。
Google 正式发布新一代开源大模型 Gemma 3,涵盖 1B、4B、12B 与 27B 四种尺寸,其中 4B 及以上版本支持多模态图文输入与 128k 上下文窗口。
推荐理由:Gemma 3 将轻量开源模型拓展至多模态与 128k 上下文,并允许按需跳过视觉模块以节约显存。
Cohere For AI 正式开源 Aya Vision 8B 与 32B 多语言视觉语言模型,覆盖 23 种语言并在 AyaVisionBench 等评测中展现出超越同尺寸甚至更大模型的表现。
推荐理由:文章公开了合成标注扩充多语言数据与多模态模型融合的技术配方,为中小参数视觉语言模型在跨语言场景下的优化提供了可迁移方案。
OpenAI 宣布推出 GPT-4.5 的研究预览版(Research Preview)。官方将其定位为迄今为止规模最大且知识储备最丰富的模型。
Google 发布多语言视觉语言编码器 SigLIP 2,在 SigLIP 的 Sigmoid 损失基础上新增文本解码器辅助任务、全局-局部损失与掩码预测自蒸馏,在所有尺寸上全面超越前代模型。
推荐理由:SigLIP 2 通过引入解码器辅助任务与自蒸馏提升了密集特征质量,为构建多模态大模型的视觉编码器提供了更强基座。
Hugging Face 发布轻量级视觉与视频理解模型 SmolVLM2,包含 2.2B、500M 和 256M 三种参数规格,旨在让视频理解能力运行在从手机到服务器的各类设备上。
推荐理由:官方提供了从256M到2.2B的多模态视频模型并原生支持MLX,展示了在手机端本地运行视频理解的可行方案。
Google 正式发布 PaliGemma 2 mix 视觉语言模型,基于 SigLIP 与 Gemma 2 在多项学术混合任务上完成指令微调。模型涵盖 3B、10B、28B 三种参数规模及 224x224、448x448 等分辨率,支持开放式提示词处理文档理解、OCR、长短图像描述、目标检测与图像分割。
推荐理由:原文给出了不同尺寸和分辨率在视觉问答、OCR与定位任务上的实测表现,读者可以据此评估多模态下游微调的选型基准。
Hugging Face 扩展 SmolVLM 系列,推出 SmolVLM-256M 和 SmolVLM-500M 两个轻量多模态模型,分别包含基础与指令微调共 4 个权重检查点。
推荐理由:官方提供了极小参数量多模态模型的架构权衡与训练优化细节,方便端侧与低成本检索场景参考。
Hugging Face 推出了一种基于 Sentence Transformers 的静态嵌入模型训练方法,并发布了面向英文检索的 static-retrieval-mrl-en-v1 和面向多语言相似度的 static-similarity-mrl-multilingual-v1 两个模型。
推荐理由:针对端侧和低功耗检索场景,本文公开了低延迟静态嵌入模型的完整对比数据与训练配置。
OpenAI 正式推出 o1 模型,并面向开发者发布 Realtime API 改进、全新微调方法等多项更新。
Hugging Face 宣布迎来 Llama 3.2,该版本模型具备视觉能力并支持在个人设备端运行。目前材料仅提供标题信息,具体技术参数与细节需参考完整官方文档。
OpenAI 宣布推出 OpenAI o1 模型。当前抓取材料仅包含发布标题,未提供详细技术说明与正文内容。
OpenAI 推出 o1-mini 模型,主打推进具备高成本效益的推理能力。