OpenAI News·· 2018-07-04精选AI 评分61
OpenAI 仅凭单次人类演示在《蒙特祖玛的复仇》中取得 74500 分
Learning Montezuma’s Revenge from a single demonstration
AI 导读
OpenAI 训练的智能体仅凭借单次人类演示就在游戏《蒙特祖玛的复仇》中取得 74,500 分的高分,优于此前已发表的所有结果。该方法让智能体从演示中精心挑选的状态序列开始游玩,并采用与 OpenAI Five 相同的 PPO 强化学习算法优化游戏得分。
推荐理由
研究展示了从单个人类演示状态序列切入并结合 PPO 训练的思路,为稀疏奖励任务提供了极简的学习范式。
来源:OpenAI News · openai.com