ホーム / 機械学習の概要 / 強化学習 / 方策勾配法

148

方策勾配法

機械学習の概要強化学習

方策勾配法とは、価値関数を経由せず、行動の選び方(方策)そのものを直接最適化する強化学習の手法です。

方策をパラメータ付きの関数で表現し、得られる報酬が増える方向にパラメータを少しずつ更新していきます。連続的な行動を扱うのが得意です。

ロボット制御や複雑なゲーム AI など、Q 学習が苦手な領域で活躍する重要なアプローチです。