ホーム / 機械学習の概要 / 強化学習 / 価値関数139価値関数機械学習の概要強化学習価値関数とは、ある状態や行動が「将来どれくらい報酬につながるか」の期待値を表す関数です。強化学習では、目先の報酬だけでなく、長期的に得られる報酬の合計を最大化したいので、「この状態にいるとどれだけ得か」を価値関数として推定します。強化学習のアルゴリズムは、この価値関数をいかに正しく推定するかが中心テーマになります。