跳到正文
OpenAI News·· 2017-06-13精选AI 评分69

OpenAI 与 DeepMind 合作提出基于人类偏好学习的新算法

Learning from human preferences

AI 导读

OpenAI 与 DeepMind 安全团队合作开发了一种新算法,通过让人类在两种候选行为中选择更优方案来推断真实意图。该方法旨在消除人类直接编写目标函数的需要,避免因目标设定偏差导致不符合预期乃至危险的系统行为。

推荐理由

算法通过让人类在两种行为中二选一的方式推断真实意图,减少了手动编写复杂目标函数带来的安全隐患。

来源:OpenAI News · openai.com