TII 发布开源 Falcon 2 系列:包含 11B 语言模型与多模态 VLM
TII 正式推出 Falcon 2 系列开源模型,包含 11B 参数的大语言模型 Falcon2-11B 及其视觉语言模型 Falcon2-11B VLM。
推荐理由:原文给出了 11B 语言与多模态模型的分阶段训练参数和基准对比,读者可以据此评估小参数开源模型在多语言和视觉问答中的实用性。
内容形态
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
132 条精选近 30 天 15 条共收录 163 条
TII 正式推出 Falcon 2 系列开源模型,包含 11B 参数的大语言模型 Falcon2-11B 及其视觉语言模型 Falcon2-11B VLM。
推荐理由:原文给出了 11B 语言与多模态模型的分阶段训练参数和基准对比,读者可以据此评估小参数开源模型在多语言和视觉问答中的实用性。
OpenAI 发布视频生成研究报告,其最大模型 Sora 能够生成长达 1 分钟的高保真视频。该方法在不同时长、分辨率和宽高比的视频与图像上联合训练文本条件扩散模型,并采用在潜在编码时空 patch 上运行的 Transformer 架构。OpenAI 指出,扩展视频生成模型是构建通用物理世界模拟器的可行路径。
推荐理由:OpenAI 将视频生成视为物理世界模拟器的技术路径,展示了扩散模型结合时空 Patch 架构在视频生成上的扩展潜力。
文生图扩散模型 Würstchen 正式发布并集成至 Diffusers,通过两阶段压缩技术实现 42x 空间压缩率。其文本条件先验模型在高度压缩的潜在空间运行,相较于 SDXL 显著提升了生成速度并降低显存占用,Würstchen v1 的训练成本较 SD1.4 降低约 16 倍。
推荐理由:该模型通过两阶段压缩实现 42 倍空间压缩率,为大幅降低文生图训练算力与推理显存提供了可行方案。
TII 正式发布 1800 亿参数的大语言模型 Falcon 180B,并在 Hugging Face Hub 同步上线基础模型与对话模型。该模型基于 RefinedWeb 数据集在 3.5 万亿 token 上完成预训练,多项基准测试表现超越 Llama 2 70B 并逼近 PaLM-2 Large。
推荐理由:原文梳理了该开源大模型的训练规模与基准表现,并提供了涵盖微调与量化推理的具体硬件配置参考。
Hugging Face 正式开源视觉语言模型 IDEFICS,作为 DeepMind 闭源模型 Flamingo 的开放复现版本,支持图文交错序列输入并生成文本。
推荐理由:该项目完全基于公开数据和开源模型复现了闭源 Flamingo 的图文交错多模态能力,为多模态研究提供了透明的数据集与权重参考。
Meta 正式开源 Llama 2 大语言模型系列,Hugging Face 同步上线模型权重并提供生态集成支持。该系列涵盖 7B、13B 和 70B 参数规格,允许商用,预训练 token 增加 40%,上下文窗口扩展至 4k tokens。平台同步提供了 Transformers 推理示例、Text Generation Inference 部署方案以及单卡 QLoRA 微调脚本。
推荐理由:文章梳理了该系列模型相比前代在上下文与训练量上的变化,并提供了在消费级显卡上微调与部署的工程配置。
Hugging Face 与 ServiceNow 联合主导的 BigCode 项目正式开源 15B 参数代码大语言模型 StarCoder 与 StarCoderBase。
推荐理由:该模型通过开源权重与宽松授权打破了闭源编程模型的垄断,为开发者提供了具备长上下文的代码补全基座。
OpenAI 训练并推出了对话模型 ChatGPT,该模型采用对话形式与用户交互。对话格式使其能够回答后续追问、承认自身错误、质疑不正确的前提,并拒绝不合理的请求。
推荐理由:官方介绍了对话交互机制的核心特性,读者可以了解模型在处理追问、承认错误与拒绝不当请求上的交互设计。
rinna 发布针对日语文化微调的文生图模型 Japanese Stable Diffusion,支持直接输入日语提示词生成符合日本本土文化意象的图像。该模型基于约 1 亿张带有日语标注的图像进行训练,采用两阶段方法先训练专属日语文本编码器再与潜在扩散模型联合微调,相关权重和代码已在 Hugging Face 与 GitHub 开源。
推荐理由:原文详细拆解了在小规模语料下将英文扩散模型迁移至本土语言的两阶段微调方案,为特定语种文生图适配提供了可复用的工程参考。
BigScience 正式发布 176B 参数的开源多语言大语言模型 BLOOM,能够生成 46 种自然语言与 13 种编程语言的文本。该模型由来自 70 多个国家的研究人员历时 117 天在法国 Jean Zay 超级计算机上训练完成,并同步开源了训练中间检查点和优化器状态。
推荐理由:该模型完整公开了训练检查点与优化器状态,为学术界深入研究百亿级以上多语言模型的内部机理提供了开放样本。
OpenAI 正式发布 GPT-2 分阶段发布计划中的最大版本(1.5B 参数),并同步公开代码与模型权重以协助检测生成内容。尽管此前已有更大规模语言模型推出,官方仍按原计划完成分阶段发布流程,旨在为未来大模型开发者提供负责任发布的实践测试范例。
推荐理由:OpenAI 完成了 GPT-2 的分阶段发布并公开完整权重与检测代码,为后续大模型的负责任发布流程提供了实践参考。
OpenAI 正式发布 774M 参数的 GPT-2 语言模型,这是继 2 月发布 124M 和 5 月发布 355M 模型后的分阶段发布更新。此外,OpenAI 还发布了一份开源法律协议以促进机构间的模型共享合作,并公布了关于 AI 研究社区发布规范协调经验的技术报告。
推荐理由:OpenAI 推进了分阶段发布策略并公开更大规模模型,为研究大模型滥用风险与合作共享机制提供了实证参考。