ホーム / 機械学習の概要 / 強化学習 / ε-greedy 方策

146

ε-greedy 方策

機械学習の概要強化学習

ε-greedy 方策とは、一定の確率 ε でランダムに新しい行動を試し、残りの確率では現時点で最善とわかっている行動を選ぶ、シンプルな探索方法です。

たとえば ε = 0.1 なら、10%の確率で冒険し、90%は今の最善を取ります。常に最善だけを選ぶと未発見の良い選択肢を見逃すため、わざと一定割合で探索します。

探索と活用のバランスを取る最も基本的な方策で、強化学習の入門でよく登場します。