ホーム / ディープラーニングの応用例 / 深層強化学習 / 連続値制御
397
連続値制御
ディープラーニングの応用例深層強化学習
連続値制御とは、選ぶ行動が「上・下・左・右」のような離散的な選択肢ではなく、角度や速度といった連続した値になる制御問題のことです。
ロボットの関節を何度動かすか、車のハンドルをどれだけ切るかといった指示が該当します。選択肢が無限にあるため、価値を一つずつ比べる方法が使えません。
方策そのものを直接学ぶ方策勾配法や、PPO のような手法が使われます。
ホーム / ディープラーニングの応用例 / 深層強化学習 / 連続値制御
連続値制御とは、選ぶ行動が「上・下・左・右」のような離散的な選択肢ではなく、角度や速度といった連続した値になる制御問題のことです。
ロボットの関節を何度動かすか、車のハンドルをどれだけ切るかといった指示が該当します。選択肢が無限にあるため、価値を一つずつ比べる方法が使えません。
方策そのものを直接学ぶ方策勾配法や、PPO のような手法が使われます。