ホーム / ディープラーニングの応用例 / 深層強化学習 / ダブルDQN
381
ダブルDQN
ディープラーニングの応用例深層強化学習
ダブル DQN とは、DQN が行動の価値を実際より高く見積もってしまう問題を抑えた改良版です。
最も良い行動を選ぶ役割と、その価値を評価する役割を別のネットワークに分けます。同じネットワークで両方を行うと、たまたま高く出た値を選び続けて過大評価が積み重なるためです。
単純な変更ながら効果が大きく、以降の改良の土台になりました。
ホーム / ディープラーニングの応用例 / 深層強化学習 / ダブルDQN
ダブル DQN とは、DQN が行動の価値を実際より高く見積もってしまう問題を抑えた改良版です。
最も良い行動を選ぶ役割と、その価値を評価する役割を別のネットワークに分けます。同じネットワークで両方を行うと、たまたま高く出た値を選び続けて過大評価が積み重なるためです。
単純な変更ながら効果が大きく、以降の改良の土台になりました。