OpenAI DALL·E:根据文本描述生成图像
OpenAI 训练了名为 DALL·E 的神经网络,可根据自然语言文本描述生成对应图像。该模型支持生成涵盖广泛自然语言概念的图像内容。
内容形态
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
169 条精选近 30 天 13 条共收录 208 条
OpenAI 训练了名为 DALL·E 的神经网络,可根据自然语言文本描述生成对应图像。该模型支持生成涵盖广泛自然语言概念的图像内容。
OpenAI 推出音乐生成神经网络 Jukebox,能够直接以原始音频形式生成包含多种流派、艺术家风格以及初步歌声的音乐。官方已同步开源该模型的权重与代码,并提供了用于试听和浏览生成音频样本的工具。
推荐理由:OpenAI开源了可直接生成原始音频与歌声的音乐生成模型及代码,为音频多模态生成研究提供了可复现的参考实现。
OpenAI 正式发布 GPT-2 分阶段发布计划中的最大版本(1.5B 参数),并同步公开代码与模型权重以协助检测生成内容。尽管此前已有更大规模语言模型推出,官方仍按原计划完成分阶段发布流程,旨在为未来大模型开发者提供负责任发布的实践测试范例。
推荐理由:OpenAI 完成了 GPT-2 的分阶段发布并公开完整权重与检测代码,为后续大模型的负责任发布流程提供了实践参考。
OpenAI 正式发布 774M 参数的 GPT-2 语言模型,这是继 2 月发布 124M 和 5 月发布 355M 模型后的分阶段发布更新。此外,OpenAI 还发布了一份开源法律协议以促进机构间的模型共享合作,并公布了关于 AI 研究社区发布规范协调经验的技术报告。
推荐理由:OpenAI 推进了分阶段发布策略并公开更大规模模型,为研究大模型滥用风险与合作共享机制提供了实证参考。
OpenAI 推出深度神经网络 MuseNet,能够使用 10 种不同乐器生成长达 4 分钟的音乐作品,并可融合从乡村音乐到莫扎特、披头士等多种风格。该模型采用与 GPT-2 相同的通用无监督 Transformer 架构,通过预测数十万个 MIDI 文件中的下一个 token 自主学习和声与节奏规律,无需显式编写音乐规则。
推荐理由:该成果展示了将自回归 Transformer 架构和 token 预测方法从文本扩展到 MIDI 符号音乐生成的可行路径。
OpenAI 训练了一个大规模无监督语言模型,能够在无需针对特定任务训练的情况下生成连贯的文本段落。该模型在多项语言建模基准上达到了 SOTA 表现,并展现出初步的阅读理解、机器翻译、问答及文本摘要能力。
推荐理由:原文呈现了无监督预训练模型在无需特定任务训练的情况下,直接展现阅读理解与问答等泛化能力的早期范式。
OpenAI 推出基于可逆 1x1 卷积的可逆生成模型 Glow,并开源了代码与在线可视化工具。该模型扩展并简化了既有的可逆生成模型架构,能高效采样生成逼真的高分辨率图像,同时可发现并操纵数据的属性特征。
推荐理由:该模型通过引入可逆 1x1 卷积简化了生成架构,便于读者了解基于流的生成模型在图像属性操纵上的表现。
OpenAI 推出一种可扩展且任务通用的语言理解系统并对外发布,在多项多样化语言任务中取得了 SOTA 成绩。该方法结合了 Transformer 架构与无监督预训练,展示了监督学习与无监督预训练结合的有效性,为未来在更大规模数据集上的研究提供了参考。
推荐理由:原文展现了无监督预训练与 Transformer 架构的结合潜力,为在更大规模数据集上迁移该方法提供了参考。
OpenAI 打造了一款在标准比赛规则下于 Dota 2 1v1 对战中击败世界顶级职业选手的机器人。该机器人完全通过自我对弈从零开始学习游戏策略,没有使用模仿学习或树搜索。这一进展旨在探索 AI 系统在涉及人类真实互动的复杂环境中完成明确目标的能力。
推荐理由:原文展示了仅靠自我对弈训练的强化学习智能体,在不依赖模仿学习或树搜索的情况下应对复杂竞技博弈的可行路径。