跳到正文

内容形态

模型发布 最新动态

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

132 条精选近 30 天 15 条共收录 163 条

更新

精选归档 · 第 6 页

4月23日周三第 101–120 条
  1. OpenAI News71

    OpenAI 在 API 中推出最新图像生成模型 gpt-image-1

    OpenAI 宣布其最新图像生成模型已通过 gpt-image-1 正式上线 API。开发者和企业可以直接将其集成到自有工具与平台中,构建专业级且可定制的视觉内容。

    推荐理由:OpenAI 将最新图像生成模型以 gpt-image-1 接入 API,方便开发者和企业直接在自有平台中集成定制化视觉生成能力。

4月16日周三
4月14日周一
  1. OpenAI News81

    OpenAI 在 API 中上线 GPT-4.1 系列模型

    OpenAI 宣布在 API 中上线 GPT-4.1 系列模型,即日起面向全球开发者开放。该系列在编码、指令遵循与长上下文理解能力上均有提升,并同步推出了首款 nano 模型。

    推荐理由:开发者可以了解 GPT-4.1 在编程与长上下文等方面的能力升级,并评估 nano 模型在轻量场景的调用成本。

4月5日周六
  1. Hugging Face Blog94

    Meta 开源 Llama 4 Maverick 与 Scout,Hugging Face 全面集成并解析架构

    Meta 正式发布原生多模态 MoE 模型 Llama 4 Maverick 与 Scout,Hugging Face 宣布同步上线权重并提供全生态支持。两款模型激活参数均为 17B,分别具备约 400B 和 109B 总参数,基于 40 万亿 token 训练,Instruct 版本分别支持 1M 与 10M 上下文。

    推荐理由:原文解析了 Llama 4 的混合专家架构与长上下文机制,并给出了 Hugging Face 生态的调用代码与量化部署支持。

3月27日周四
  1. Hugging Face Blog82

    Hugging Face Open R1 第 4 期更新:DeepSeek-V3 0324 解析与部署指南

    Hugging Face 发布 Open R1 项目第 4 期更新,系统解读了静默上线 Hub 的 DeepSeek-V3 0324 模型特性。该版本改用 MIT 许可协议,在 AIME(从 39.6 升至 59.4)和 GPQA 等基准测试中大幅提升,并优化了前端代码与中文写作。

    推荐理由:原文整理了新版 DeepSeek-V3 的基准提升幅度与协议变更,并给出从 API 到本地量化部署的具体运行方案。

3月25日周二
  1. OpenAI News80

    OpenAI 推出 GPT-4o 图像生成能力

    OpenAI 宣布在 GPT-4o 中引入原生图像生成能力,包含更强的文本渲染与指令遵循表现。该更新同时提示用户体验 ChatGPT Images 2.5。

    推荐理由:GPT-4o 引入原生图像生成能力,重点改进了文本渲染与指令遵循,便于评估多模态模型的生成质量。

3月20日周四
  1. OpenAI News71

    OpenAI 在 API 中推出新一代音频模型

    OpenAI 在 API 中推出新一代音频模型。开发者可以首次指示文本转语音模型以特定风格发音,例如要求其像富有同理心的客服人员一样说话,从而为语音智能体带来更高自由度的个性化定制能力。

    推荐理由:开发者可以通过自然语言指令直接控制语音模型的语调与风格,为语音智能体交互带来更灵活的定制空间。

3月18日周二
  1. Hugging Face Blog79

    NVIDIA 在 GTC 2025 发布物理 AI 开源模型与数据集:Cosmos Transfer、GR00T N1 与 15TB 训练数据

    NVIDIA 在 GTC 2025 推出面向物理 AI 开发的开源资源套件,包括 7B 参数的多控制世界模型 Cosmos Transfer、通用人形机器人基础模型 Isaac GR00T-N1-2B,以及包含超 32 万条轨迹的 15TB 物理 AI 数据集。

    推荐理由:提供了从世界生成模型、通用人形本体控制到大规模仿真数据的完整开源方案,有助于具身智能开发者直接复用并微调下游任务。

3月12日周三
3月4日周二
  1. Hugging Face Blog69

    Aya Vision 深度解析:推进 23 种语言的多语言多模态模型前沿

    Cohere For AI 正式开源 Aya Vision 8B 与 32B 多语言视觉语言模型,覆盖 23 种语言并在 AyaVisionBench 等评测中展现出超越同尺寸甚至更大模型的表现。

    推荐理由:文章公开了合成标注扩充多语言数据与多模态模型融合的技术配方,为中小参数视觉语言模型在跨语言场景下的优化提供了可迁移方案。

2月27日周四
2月21日周五
  1. Hugging Face Blog72

    Google 发布多语言视觉语言编码器 SigLIP 2

    Google 发布多语言视觉语言编码器 SigLIP 2,在 SigLIP 的 Sigmoid 损失基础上新增文本解码器辅助任务、全局-局部损失与掩码预测自蒸馏,在所有尺寸上全面超越前代模型。

    推荐理由:SigLIP 2 通过引入解码器辅助任务与自蒸馏提升了密集特征质量,为构建多模态大模型的视觉编码器提供了更强基座。

2月20日周四
  1. Hugging Face Blog76

    Hugging Face 发布轻量级视频理解模型 SmolVLM2

    Hugging Face 发布轻量级视觉与视频理解模型 SmolVLM2,包含 2.2B、500M 和 256M 三种参数规格,旨在让视频理解能力运行在从手机到服务器的各类设备上。

    推荐理由:官方提供了从256M到2.2B的多模态视频模型并原生支持MLX,展示了在手机端本地运行视频理解的可行方案。

2月19日周三
  1. Hugging Face Blog68

    Google 发布 PaliGemma 2 Mix 指令微调视觉语言模型

    Google 正式发布 PaliGemma 2 mix 视觉语言模型,基于 SigLIP 与 Gemma 2 在多项学术混合任务上完成指令微调。模型涵盖 3B、10B、28B 三种参数规模及 224x224、448x448 等分辨率,支持开放式提示词处理文档理解、OCR、长短图像描述、目标检测与图像分割。

    推荐理由:原文给出了不同尺寸和分辨率在视觉问答、OCR与定位任务上的实测表现,读者可以据此评估多模态下游微调的选型基准。

1月23日周四
1月15日周三
  1. Hugging Face Blog71

    Hugging Face 发布高速静态嵌入模型并开源训练方案

    Hugging Face 推出了一种基于 Sentence Transformers 的静态嵌入模型训练方法,并发布了面向英文检索的 static-retrieval-mrl-en-v1 和面向多语言相似度的 static-similarity-mrl-multilingual-v1 两个模型。

    推荐理由:针对端侧和低功耗检索场景,本文公开了低延迟静态嵌入模型的完整对比数据与训练配置。

12月17日周二
9月25日周三
9月12日周四