ホーム / 機械学習の概要 / 強化学習 / マルコフ決定過程モデル138マルコフ決定過程モデル機械学習の概要強化学習マルコフ決定過程モデル(MDP)とは、マルコフ性を仮定し、エージェントが行動を選びながら状態を遷移させていく状況を表す枠組みです。「状態・行動・報酬・遷移確率」の4つで世界を表現します。エージェントは状態を見て行動を選び、報酬を得つつ次の状態へ移ります。強化学習の理論的な土台となる、基本中の基本の枠組みです。