OpenAI:官网动态·· 2018-07-04精选AI 评分66
OpenAI 用单条人类演示训练智能体在 Montezuma's Revenge 上达到 74500 分
Learning Montezuma’s Revenge from a single demonstration
AI 导读
OpenAI 训练的智能体仅从单条人类演示出发,在 Montezuma's Revenge 上取得 74500 分的高分,超过此前已发表的最好结果。算法做法是从演示中精心挑选的状态开始连续游戏,使用 PPO 优化游戏得分进行学习,PPO 也是支撑 OpenAI Five 的同一强化学习算法。
推荐理由
原文说明从单条人类演示中选取起始状态再用 PPO 优化得分的算法思路,读者可以理解这一强化学习方法的可迁移做法。
来源:OpenAI:官网动态 · openai.com