Google 发布 Gemma 3 开源模型:涵盖 1B 至 27B 尺寸并支持多模态与 128k 上下文
Google 正式发布新一代开源大模型 Gemma 3,涵盖 1B、4B、12B 与 27B 四种尺寸,其中 4B 及以上版本支持多模态图文输入与 128k 上下文窗口。
推荐理由:Gemma 3 将轻量开源模型拓展至多模态与 128k 上下文,并允许按需跳过视觉模块以节约显存。
内容形态
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
47 条精选近 30 天 12 条共收录 58 条
Google 正式发布新一代开源大模型 Gemma 3,涵盖 1B、4B、12B 与 27B 四种尺寸,其中 4B 及以上版本支持多模态图文输入与 128k 上下文窗口。
推荐理由:Gemma 3 将轻量开源模型拓展至多模态与 128k 上下文,并允许按需跳过视觉模块以节约显存。
Cohere For AI 正式开源 Aya Vision 8B 与 32B 多语言视觉语言模型,覆盖 23 种语言并在 AyaVisionBench 等评测中展现出超越同尺寸甚至更大模型的表现。
推荐理由:文章公开了合成标注扩充多语言数据与多模态模型融合的技术配方,为中小参数视觉语言模型在跨语言场景下的优化提供了可迁移方案。
OpenAI 宣布推出 GPT-4.5 的研究预览版(Research Preview)。官方将其定位为迄今为止规模最大且知识储备最丰富的模型。
OpenAI 宣布推出 OpenAI o1 模型。当前抓取材料仅包含发布标题,未提供详细技术说明与正文内容。
OpenAI 推出 o1-mini 模型,主打推进具备高成本效益的推理能力。
OpenAI 发布视频生成研究报告,其最大模型 Sora 能够生成长达 1 分钟的高保真视频。该方法在不同时长、分辨率和宽高比的视频与图像上联合训练文本条件扩散模型,并采用在潜在编码时空 patch 上运行的 Transformer 架构。OpenAI 指出,扩展视频生成模型是构建通用物理世界模拟器的可行路径。
推荐理由:OpenAI 将视频生成视为物理世界模拟器的技术路径,展示了扩散模型结合时空 Patch 架构在视频生成上的扩展潜力。
OpenAI 训练并推出了对话模型 ChatGPT,该模型采用对话形式与用户交互。对话格式使其能够回答后续追问、承认自身错误、质疑不正确的前提,并拒绝不合理的请求。
推荐理由:官方介绍了对话交互机制的核心特性,读者可以了解模型在处理追问、承认错误与拒绝不当请求上的交互设计。