ホーム / 機械学習の概要 / 強化学習 / Q学習

144

Q学習

機械学習の概要強化学習

Q 学習とは、Q 値(行動価値)を試行錯誤しながら更新し、最適な行動方策を学ぶ強化学習の代表的なアルゴリズムです。

実際に行動して得た報酬と、次の状態の最大 Q 値をもとに、現在の Q 値を少しずつ正しい方向へ修正していきます。これを繰り返すことで、最適な戦略にたどり着きます。

ゲーム AI(DQN など)の基礎となるアルゴリズムで、強化学習を学ぶときに必ず登場する手法です。