ホーム / 機械学習の概要 / 強化学習 / 状態価値関数

140

状態価値関数

機械学習の概要強化学習

状態価値関数とは、ある状態にいることの「価値(将来得られる期待報酬)」を表す関数です。

たとえば将棋で「この局面はどれくらい有利か」を数値で表したものに相当します。状態だけで決まり、具体的な行動は問いません。

方策の良さを評価する基本指標として、強化学習の理論の中心に位置する関数です。