ホーム / 機械学習の概要 / 強化学習 / ε-greedy 方策
146
ε-greedy 方策
機械学習の概要強化学習
ε-greedy 方策とは、一定の確率 ε でランダムに新しい行動を試し、残りの確率では現時点で最善とわかっている行動を選ぶ、シンプルな探索方法です。
たとえば ε = 0.1 なら、10%の確率で冒険し、90%は今の最善を取ります。常に最善だけを選ぶと未発見の良い選択肢を見逃すため、わざと一定割合で探索します。
探索と活用のバランスを取る最も基本的な方策で、強化学習の入門でよく登場します。