跳到正文
OpenAI News·· 2018-07-04精选AI 评分61

OpenAI 仅凭单次人类演示在《蒙特祖玛的复仇》中取得 74500 分

Learning Montezuma’s Revenge from a single demonstration

AI 导读

OpenAI 训练的智能体仅凭借单次人类演示就在游戏《蒙特祖玛的复仇》中取得 74,500 分的高分,优于此前已发表的所有结果。该方法让智能体从演示中精心挑选的状态序列开始游玩,并采用与 OpenAI Five 相同的 PPO 强化学习算法优化游戏得分。

推荐理由

研究展示了从单个人类演示状态序列切入并结合 PPO 训练的思路,为稀疏奖励任务提供了极简的学习范式。

来源:OpenAI News · openai.com