ホーム / ディープラーニングの応用例 / 深層強化学習 / 連続値制御

397

連続値制御

ディープラーニングの応用例深層強化学習

連続値制御とは、選ぶ行動が「上・下・左・右」のような離散的な選択肢ではなく、角度や速度といった連続した値になる制御問題のことです。

ロボットの関節を何度動かすか、車のハンドルをどれだけ切るかといった指示が該当します。選択肢が無限にあるため、価値を一つずつ比べる方法が使えません。

方策そのものを直接学ぶ方策勾配法や、PPO のような手法が使われます。