ホーム / 機械学習の概要 / 強化学習 / Q学習144Q学習機械学習の概要強化学習Q 学習とは、Q 値(行動価値)を試行錯誤しながら更新し、最適な行動方策を学ぶ強化学習の代表的なアルゴリズムです。実際に行動して得た報酬と、次の状態の最大 Q 値をもとに、現在の Q 値を少しずつ正しい方向へ修正していきます。これを繰り返すことで、最適な戦略にたどり着きます。ゲーム AI(DQN など)の基礎となるアルゴリズムで、強化学習を学ぶときに必ず登場する手法です。