跳到正文
北京时间
原文
OpenAI:官网动态·· 2017-07-20精选AI 评分73

OpenAI 发布强化学习算法 Proximal Policy Optimization (PPO)

Proximal Policy Optimization

AI 导读

OpenAI 发布一类新的强化学习算法 Proximal Policy Optimization(PPO),性能与当时最先进方法相当或更好,同时实现和调参更简单。因易用且表现良好,PPO 已成为 OpenAI 内部默认的强化学习算法。

推荐理由

OpenAI 官方宣布 PPO 算法开源,并说明其成为内部默认强化学习算法的原因,可帮助读者了解该方法的定位。

来源:OpenAI:官网动态 · openai.com