OpenAI 研究发现多智能体交互中涌现出复杂工具使用能力
OpenAI 观察到多智能体在模拟捉迷藏游戏中能自发发现并使用越来越复杂的工具。智能体通过自监督训练构建了 6 种截然不同的策略与反制策略,其中部分策略甚至超出了研究团队对环境支持能力的既有认知。研究表明,简单环境下的多智能体协同适应未来可能演化出极度复杂的智能行为。
推荐理由:多智能体在简单博弈环境中自发演化出多阶段攻防策略,为利用多智能体协同适应探索复杂智能行为提供了实验参考。
内容形态
值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。
87 条精选近 30 天 6 条共收录 251 条
OpenAI 观察到多智能体在模拟捉迷藏游戏中能自发发现并使用越来越复杂的工具。智能体通过自监督训练构建了 6 种截然不同的策略与反制策略,其中部分策略甚至超出了研究团队对环境支持能力的既有认知。研究表明,简单环境下的多智能体协同适应未来可能演化出极度复杂的智能行为。
推荐理由:多智能体在简单博弈环境中自发演化出多阶段攻防策略,为利用多智能体协同适应探索复杂智能行为提供了实验参考。
OpenAI 宣布其由五个神经网络组成的 AI 团队 OpenAI Five 已开始在 Dota 2 比赛中击败业余人类战队。
OpenAI 发布关于 AI 与算力的分析指出,自 2012 年以来最大 AI 训练运行所使用的算力呈指数级增长,翻倍周期约为 3.4 个月。相比摩尔定律 2 年的翻倍周期,该指标自 2012 年起已增长超过 300,000 倍,而 2 年翻倍仅能带来 7 倍增幅。OpenAI 表示算力提升是 AI 进步的关键动力,行业需为能力远超当前水平的系统做好准备。
推荐理由:该分析量化了训练算力以 3.4 个月为周期的翻倍速度,为理解前沿模型演进提供了基准参照。
OpenAI 发文阐释其 Dota 2 系统成果,指出在充足算力支持下,自对弈机制可推动机器学习系统从远低于人类水平跃升至超越顶级职业选手。该系统在一个月内便实现从勉强匹配高分玩家到击败职业顶尖选手的跨越,并保持持续提升。不同于受制于固定数据集的监督深度学习,自对弈系统的可用训练数据会随智能体能力的增强而自动优化。
推荐理由:原文在充足算力下对比了监督学习与自对弈机制的数据自迭代差异,有助于理解强化学习系统的能力跃升路径。
OpenAI 生成了在多种尺度和视角下均能可靠欺骗神经网络分类器的图像。这一成果直接挑战了上周关于自动驾驶汽车因能从多个尺度、角度和视角采集图像而难以被恶意欺骗的观点。
推荐理由:研究表明对抗样本在多尺度和多视角下仍可生效,直接反驳了自动驾驶系统不易受此类攻击的假设。
OpenAI 与 DeepMind 安全团队合作开发了一种新算法,通过让人类在两种候选行为中选择更优方案来推断真实意图。该方法旨在消除人类直接编写目标函数的需要,避免因目标设定偏差导致不符合预期乃至危险的系统行为。
推荐理由:算法通过让人类在两种行为中二选一的方式推断真实意图,减少了手动编写复杂目标函数带来的安全隐患。
OpenAI 联合来自 Berkeley、Stanford 以及牵头的 Google Brain 研究人员共同发布了论文《Concrete Problems in AI Safety》。该论文重点探讨了如何确保现代机器学习系统按设计预期运行的多项关键安全课题。
推荐理由:论文探讨了确保机器学习系统按预期运行的具体安全问题,为人工智能系统控制与安全对齐提供了关键的研究议题。