ホーム / ディープラーニングの応用例 / 深層強化学習 / PPO

388

PPO

ディープラーニングの応用例深層強化学習

PPO とは、方策を一度に大きく変えすぎないよう更新幅に制限をかけることで、安定した学習を実現する手法です。

強化学習では方策を更新しすぎると性能が急に崩れることがあります。前回の方策から離れすぎた更新を抑えることで、この崩壊を防ぎます。

実装が比較的簡単で幅広い問題に使えるため、現在の方策勾配法の標準的な選択肢になっています。