ホーム / 機械学習の概要 / 強化学習 / UCB方策147UCB方策機械学習の概要強化学習UCB(Upper Confidence Bound)方策とは、各行動について「期待報酬の見積もり+不確実性ボーナス」が最大の行動を選ぶ方策です。まだ十分試していない行動には大きなボーナスが加算されるため、自然と未知の選択肢が優先されます。試行回数が増えるとボーナスは小さくなり、確かな選択肢に収束していきます。ε-greedy より理論的に優れた性能を持つ、バンディット問題の代表的なアルゴリズムです。