ホーム / 機械学習の概要 / 強化学習 / Q値

142

Q値

機械学習の概要強化学習

Q 値とは、行動価値関数が返す値のことで、「ある状態で、ある行動を取ったときの将来得られる期待報酬」を表します。

強化学習では「Q(状態, 行動) = 値」という形で表され、エージェントはこの Q 値が最大になる行動を選びます。

強化学習アルゴリズムの中心的な概念で、Q 学習の名前の由来でもあります。