OpenAI 基于人类偏好微调 GPT-2 语言模型
OpenAI 使用人类反馈微调了 774M 参数的 GPT-2 语言模型,成功契合了外部人类标注者的偏好。在文本摘要任务中,因标注者偏好准确性而倾向选择原句,模型最终学会直接复制原文,该任务共使用了 60k 条人类标注,而文本风格续写任务仅需 5k 条。此项研究旨在推进面向人机交互通用任务的安全技术,以更好地提取人类价值偏好。
推荐理由:这项研究展示了利用人类反馈微调模型的早期实验,揭示了标注者偏好偏差对模型生成行为的直接影响。
公司与模型
OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。
258 条精选近 30 天 18 条共收录 963 条
OpenAI 使用人类反馈微调了 774M 参数的 GPT-2 语言模型,成功契合了外部人类标注者的偏好。在文本摘要任务中,因标注者偏好准确性而倾向选择原句,模型最终学会直接复制原文,该任务共使用了 60k 条人类标注,而文本风格续写任务仅需 5k 条。此项研究旨在推进面向人机交互通用任务的安全技术,以更好地提取人类价值偏好。
推荐理由:这项研究展示了利用人类反馈微调模型的早期实验,揭示了标注者偏好偏差对模型生成行为的直接影响。
OpenAI 观察到多智能体在模拟捉迷藏游戏中能自发发现并使用越来越复杂的工具。智能体通过自监督训练构建了 6 种截然不同的策略与反制策略,其中部分策略甚至超出了研究团队对环境支持能力的既有认知。研究表明,简单环境下的多智能体协同适应未来可能演化出极度复杂的智能行为。
推荐理由:多智能体在简单博弈环境中自发演化出多阶段攻防策略,为利用多智能体协同适应探索复杂智能行为提供了实验参考。
OpenAI 正式发布 774M 参数的 GPT-2 语言模型,这是继 2 月发布 124M 和 5 月发布 355M 模型后的分阶段发布更新。此外,OpenAI 还发布了一份开源法律协议以促进机构间的模型共享合作,并公布了关于 AI 研究社区发布规范协调经验的技术报告。
推荐理由:OpenAI 推进了分阶段发布策略并公开更大规模模型,为研究大模型滥用风险与合作共享机制提供了实证参考。
微软向 OpenAI 投资 10 亿美元并达成战略合作,共同推进通用人工智能(AGI)研发。双方将在 Microsoft Azure 平台内联合开发面向 AGI 扩展的软硬件与 AI 超级计算技术,微软同时成为 OpenAI 的独家云服务提供商。
推荐理由:微软注资并成为独家云服务提供商,确立了双方在超算算力平台与底层工程层面的深度绑定。
OpenAI 推出深度神经网络 MuseNet,能够使用 10 种不同乐器生成长达 4 分钟的音乐作品,并可融合从乡村音乐到莫扎特、披头士等多种风格。该模型采用与 GPT-2 相同的通用无监督 Transformer 架构,通过预测数十万个 MIDI 文件中的下一个 token 自主学习和声与节奏规律,无需显式编写音乐规则。
推荐理由:该成果展示了将自回归 Transformer 架构和 token 预测方法从文本扩展到 MIDI 符号音乐生成的可行路径。
OpenAI Five 在周末的比赛中连胜两局击败 Dota 2 世界冠军战队 OG,成为首个在电竞比赛中击败世界冠军的 AI。此前 OpenAI Five 与 DeepMind 的 AlphaStar 虽曾在线下私下战胜过职业选手,但在公开直播比赛中均告负,这也是 AI 第一次在现场直播中战胜电竞职业选手。
推荐理由:OpenAI 记录了系统在复杂电子竞技实机对战中击败职业战队的过程,展现了强化学习在长周期即时博弈中的能力边界。
OpenAI 宣布成立名为 OpenAI LP 的利润上限(capped-profit)公司。该结构旨在快速增加对算力和人才的投资,同时保留制衡机制以实现其使命。
推荐理由:原文披露了设立利润上限公司的架构调整,便于了解其在加速算力与人才投资时兼顾使命的设想。
OpenAI 训练了一个大规模无监督语言模型,能够在无需针对特定任务训练的情况下生成连贯的文本段落。该模型在多项语言建模基准上达到了 SOTA 表现,并展现出初步的阅读理解、机器翻译、问答及文本摘要能力。
推荐理由:原文呈现了无监督预训练模型在无需特定任务训练的情况下,直接展现阅读理解与问答等泛化能力的早期范式。
OpenAI 推出深度强化学习教育资源 Spinning Up in Deep RL,旨在帮助任何人掌握深度强化学习技能并成为实践者。该项目包含清晰的强化学习代码示例、配套练习、参考文档以及系统教程。
推荐理由:该项目整理了规范的强化学习代码示例与配套习题文档,为想要掌握深度强化学习的开发者提供了实践路径。
OpenAI 宣布其由五个神经网络组成的 AI 团队 OpenAI Five 已开始在 Dota 2 比赛中击败业余人类战队。
OpenAI 发布关于 AI 与算力的分析指出,自 2012 年以来最大 AI 训练运行所使用的算力呈指数级增长,翻倍周期约为 3.4 个月。相比摩尔定律 2 年的翻倍周期,该指标自 2012 年起已增长超过 300,000 倍,而 2 年翻倍仅能带来 7 倍增幅。OpenAI 表示算力提升是 AI 进步的关键动力,行业需为能力远超当前水平的系统做好准备。
推荐理由:该分析量化了训练算力以 3.4 个月为周期的翻倍速度,为理解前沿模型演进提供了基准参照。
OpenAI 发文阐释其 Dota 2 系统成果,指出在充足算力支持下,自对弈机制可推动机器学习系统从远低于人类水平跃升至超越顶级职业选手。该系统在一个月内便实现从勉强匹配高分玩家到击败职业顶尖选手的跨越,并保持持续提升。不同于受制于固定数据集的监督深度学习,自对弈系统的可用训练数据会随智能体能力的增强而自动优化。
推荐理由:原文在充足算力下对比了监督学习与自对弈机制的数据自迭代差异,有助于理解强化学习系统的能力跃升路径。
OpenAI 打造了一款在标准比赛规则下于 Dota 2 1v1 对战中击败世界顶级职业选手的机器人。该机器人完全通过自我对弈从零开始学习游戏策略,没有使用模仿学习或树搜索。这一进展旨在探索 AI 系统在涉及人类真实互动的复杂环境中完成明确目标的能力。
推荐理由:原文展示了仅靠自我对弈训练的强化学习智能体,在不依赖模仿学习或树搜索的情况下应对复杂竞技博弈的可行路径。
OpenAI 生成了在多种尺度和视角下均能可靠欺骗神经网络分类器的图像。这一成果直接挑战了上周关于自动驾驶汽车因能从多个尺度、角度和视角采集图像而难以被恶意欺骗的观点。
推荐理由:研究表明对抗样本在多尺度和多视角下仍可生效,直接反驳了自动驾驶系统不易受此类攻击的假设。
OpenAI 与 DeepMind 安全团队合作开发了一种新算法,通过让人类在两种候选行为中选择更优方案来推断真实意图。该方法旨在消除人类直接编写目标函数的需要,避免因目标设定偏差导致不符合预期乃至危险的系统行为。
推荐理由:算法通过让人类在两种行为中二选一的方式推断真实意图,减少了手动编写复杂目标函数带来的安全隐患。
OpenAI 联合来自 Berkeley、Stanford 以及牵头的 Google Brain 研究人员共同发布了论文《Concrete Problems in AI Safety》。该论文重点探讨了如何确保现代机器学习系统按设计预期运行的多项关键安全课题。
推荐理由:论文探讨了确保机器学习系统按预期运行的具体安全问题,为人工智能系统控制与安全对齐提供了关键的研究议题。
OpenAI 宣布公测 OpenAI Gym,这是一个用于开发和对比强化学习(RL)算法的工具包。该套件包含从仿真机器人到 Atari 游戏等持续扩充的环境集合,并提供用于对比和复现算法结果的网站。
推荐理由:OpenAI 推出标准化强化学习算法开发与对比工具包,为仿真机器人到 Atari 游戏等环境提供了可复现的评测支持。
OpenAI 宣布作为一家非营利人工智能研究机构成立,其核心目标是在不受财务回报约束的前提下推进数字智能,从而造福全人类。该机构表示,摆脱财务义务能让其研究团队更专注于对人类产生积极影响。
推荐理由:原文说明了机构创立初期的非营利属性,有助于读者了解其摆脱财务约束以专注人类福祉的背景设定。