ホーム / ディープラーニングの応用例 / 深層強化学習 / 報酬成形
398
報酬成形
ディープラーニングの応用例深層強化学習
報酬成形とは、学習が進みやすくなるように、報酬の与え方を人が設計・調整することです。
ゴールしたときだけ報酬を与えると、偶然たどり着くまで何も学べません。ゴールに近づくたびに少しずつ報酬を与えれば、進むべき方向が伝わりやすくなります。
ただし設計を誤ると、報酬だけを稼いで本来の目的を達成しない抜け道を学んでしまう点に注意が必要です。
ホーム / ディープラーニングの応用例 / 深層強化学習 / 報酬成形
報酬成形とは、学習が進みやすくなるように、報酬の与え方を人が設計・調整することです。
ゴールしたときだけ報酬を与えると、偶然たどり着くまで何も学べません。ゴールに近づくたびに少しずつ報酬を与えれば、進むべき方向が伝わりやすくなります。
ただし設計を誤ると、報酬だけを稼いで本来の目的を達成しない抜け道を学んでしまう点に注意が必要です。