ホーム / 機械学習の概要 / 強化学習 / 行動価値関数141行動価値関数機械学習の概要強化学習行動価値関数とは、ある状態で特定の行動を選んだときの価値(期待報酬)を表す関数です。状態価値関数が「状態」全体の良さを表すのに対し、こちらは「この状態でこの手を打つ価値」を具体的に表します。最も価値の高い行動を選ぶことで賢く動けます。Q 学習などのアルゴリズムが直接学ぼうとする関数です。