OpenAI 研究发现多智能体交互中涌现出复杂工具使用能力
OpenAI 观察到多智能体在模拟捉迷藏游戏中能自发发现并使用越来越复杂的工具。智能体通过自监督训练构建了 6 种截然不同的策略与反制策略,其中部分策略甚至超出了研究团队对环境支持能力的既有认知。研究表明,简单环境下的多智能体协同适应未来可能演化出极度复杂的智能行为。
推荐理由:多智能体在简单博弈环境中自发演化出多阶段攻防策略,为利用多智能体协同适应探索复杂智能行为提供了实验参考。
公司与模型
OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。
324 条精选近 30 天 16 条共收录 1,203 条
OpenAI 观察到多智能体在模拟捉迷藏游戏中能自发发现并使用越来越复杂的工具。智能体通过自监督训练构建了 6 种截然不同的策略与反制策略,其中部分策略甚至超出了研究团队对环境支持能力的既有认知。研究表明,简单环境下的多智能体协同适应未来可能演化出极度复杂的智能行为。
推荐理由:多智能体在简单博弈环境中自发演化出多阶段攻防策略,为利用多智能体协同适应探索复杂智能行为提供了实验参考。
OpenAI 正式发布 774M 参数的 GPT-2 语言模型,这是继 2 月发布 124M 和 5 月发布 355M 模型后的分阶段发布更新。此外,OpenAI 还发布了一份开源法律协议以促进机构间的模型共享合作,并公布了关于 AI 研究社区发布规范协调经验的技术报告。
推荐理由:OpenAI 推进了分阶段发布策略并公开更大规模模型,为研究大模型滥用风险与合作共享机制提供了实证参考。
微软向 OpenAI 投资 10 亿美元并达成战略合作,共同推进通用人工智能(AGI)研发。双方将在 Microsoft Azure 平台内联合开发面向 AGI 扩展的软硬件与 AI 超级计算技术,微软同时成为 OpenAI 的独家云服务提供商。
推荐理由:微软注资并成为独家云服务提供商,确立了双方在超算算力平台与底层工程层面的深度绑定。
OpenAI 推出深度神经网络 MuseNet,能够使用 10 种不同乐器生成长达 4 分钟的音乐作品,并可融合从乡村音乐到莫扎特、披头士等多种风格。该模型采用与 GPT-2 相同的通用无监督 Transformer 架构,通过预测数十万个 MIDI 文件中的下一个 token 自主学习和声与节奏规律,无需显式编写音乐规则。
推荐理由:该成果展示了将自回归 Transformer 架构和 token 预测方法从文本扩展到 MIDI 符号音乐生成的可行路径。
OpenAI Five 在周末的比赛中连胜两局击败 Dota 2 世界冠军战队 OG,成为首个在电竞比赛中击败世界冠军的 AI。此前 OpenAI Five 与 DeepMind 的 AlphaStar 虽曾在线下私下战胜过职业选手,但在公开直播比赛中均告负,这也是 AI 第一次在现场直播中战胜电竞职业选手。
推荐理由:OpenAI 记录了系统在复杂电子竞技实机对战中击败职业战队的过程,展现了强化学习在长周期即时博弈中的能力边界。
OpenAI 宣布成立名为 OpenAI LP 的利润上限(capped-profit)公司。该结构旨在快速增加对算力和人才的投资,同时保留制衡机制以实现其使命。
推荐理由:原文披露了设立利润上限公司的架构调整,便于了解其在加速算力与人才投资时兼顾使命的设想。
OpenAI 训练了一个大规模无监督语言模型,能够在无需针对特定任务训练的情况下生成连贯的文本段落。该模型在多项语言建模基准上达到了 SOTA 表现,并展现出初步的阅读理解、机器翻译、问答及文本摘要能力。
推荐理由:原文呈现了无监督预训练模型在无需特定任务训练的情况下,直接展现阅读理解与问答等泛化能力的早期范式。
OpenAI 推出深度强化学习教育资源 Spinning Up in Deep RL,旨在帮助任何人掌握深度强化学习技能并成为实践者。该项目包含清晰的强化学习代码示例、配套练习、参考文档以及系统教程。
推荐理由:该项目整理了规范的强化学习代码示例与配套习题文档,为想要掌握深度强化学习的开发者提供了实践路径。
OpenAI Five 在温哥华举行的 The International 赛事中对阵顶尖 Dota 2 选手,两场比赛均告负。在两局比赛的前 20 至 35 分钟内,OpenAI Five 均保持着良好的取胜机会。
推荐理由:比赛结果记录了强化学习模型在复杂长线博弈中的实际对抗表现,为评估智能体决策能力提供了参考。
OpenAI Five 在三局两胜制的基准赛中击败了由排名前 99.95% 的 Dota 玩家组成的队伍。人类战队成员包括 Blitz、Cap、Fogged、Merlini 和 MoonMeander,其中四位曾为职业选手。比赛在现场观众以及 100,000 名并发直播观众的见证下完成。
推荐理由:原文展示了强化学习系统在基准赛中击败顶尖人类选手的赛果,为观察多智能体在复杂即时博弈环境中的能力边界提供了参考。
OpenAI 推出基于可逆 1x1 卷积的可逆生成模型 Glow,并开源了代码与在线可视化工具。该模型扩展并简化了既有的可逆生成模型架构,能高效采样生成逼真的高分辨率图像,同时可发现并操纵数据的属性特征。
推荐理由:该模型通过引入可逆 1x1 卷积简化了生成架构,便于读者了解基于流的生成模型在图像属性操纵上的表现。
OpenAI 训练的智能体仅凭借单次人类演示就在游戏《蒙特祖玛的复仇》中取得 74,500 分的高分,优于此前已发表的所有结果。该方法让智能体从演示中精心挑选的状态序列开始游玩,并采用与 OpenAI Five 相同的 PPO 强化学习算法优化游戏得分。
推荐理由:研究展示了从单个人类演示状态序列切入并结合 PPO 训练的思路,为稀疏奖励任务提供了极简的学习范式。
OpenAI 宣布其由五个神经网络组成的 AI 团队 OpenAI Five 已开始在 Dota 2 比赛中击败业余人类战队。
OpenAI 推出一种可扩展且任务通用的语言理解系统并对外发布,在多项多样化语言任务中取得了 SOTA 成绩。该方法结合了 Transformer 架构与无监督预训练,展示了监督学习与无监督预训练结合的有效性,为未来在更大规模数据集上的研究提供了参考。
推荐理由:原文展现了无监督预训练与 Transformer 架构的结合潜力,为在更大规模数据集上迁移该方法提供了参考。
OpenAI 发布用于游戏强化学习研究的 Gym Retro 完整版,并同步推出向平台添加新游戏的集成工具。新版本将公开支持的游戏数量从约 70 款 Atari 游戏和 30 款 Sega 游戏大幅扩充至跨多种模拟器的 1,000 多款游戏。
推荐理由:原文明确了游戏支持量从约百款扩展到千款以上并开放集成工具,读者可以据此评估其对强化学习研究环境的扩充价值。
OpenAI 发布关于 AI 与算力的分析指出,自 2012 年以来最大 AI 训练运行所使用的算力呈指数级增长,翻倍周期约为 3.4 个月。相比摩尔定律 2 年的翻倍周期,该指标自 2012 年起已增长超过 300,000 倍,而 2 年翻倍仅能带来 7 倍增幅。OpenAI 表示算力提升是 AI 进步的关键动力,行业需为能力远超当前水平的系统做好准备。
推荐理由:该分析量化了训练算力以 3.4 个月为周期的翻倍速度,为理解前沿模型演进提供了基准参照。
OpenAI 提出一种 AI 安全技术,通过训练多个智能体围绕特定主题相互辩论,并由人类作为裁判判定胜负,以此辅助安全监督与对齐。
OpenAI 发文阐释其 Dota 2 系统成果,指出在充足算力支持下,自对弈机制可推动机器学习系统从远低于人类水平跃升至超越顶级职业选手。该系统在一个月内便实现从勉强匹配高分玩家到击败职业顶尖选手的跨越,并保持持续提升。不同于受制于固定数据集的监督深度学习,自对弈系统的可用训练数据会随智能体能力的增强而自动优化。
推荐理由:原文在充足算力下对比了监督学习与自对弈机制的数据自迭代差异,有助于理解强化学习系统的能力跃升路径。
OpenAI 打造了一款在标准比赛规则下于 Dota 2 1v1 对战中击败世界顶级职业选手的机器人。该机器人完全通过自我对弈从零开始学习游戏策略,没有使用模仿学习或树搜索。这一进展旨在探索 AI 系统在涉及人类真实互动的复杂环境中完成明确目标的能力。
推荐理由:原文展示了仅靠自我对弈训练的强化学习智能体,在不依赖模仿学习或树搜索的情况下应对复杂竞技博弈的可行路径。
OpenAI 生成了在多种尺度和视角下均能可靠欺骗神经网络分类器的图像。这一成果直接挑战了上周关于自动驾驶汽车因能从多个尺度、角度和视角采集图像而难以被恶意欺骗的观点。
推荐理由:研究表明对抗样本在多尺度和多视角下仍可生效,直接反驳了自动驾驶系统不易受此类攻击的假设。