ホーム / 機械学習の概要 / 強化学習 / Actor-Critic
150
Actor-Critic
機械学習の概要強化学習
Actor-Critic とは、行動を決める「Actor(方策)」と、その行動を評価する「Critic(価値関数)」を組み合わせた強化学習の手法です。
Actor は行動を選び、Critic はその選択を価値関数で評価して Actor に学習信号を返します。方策勾配法の不安定さを価値関数で補う形になっています。
A3C や PPO など、現代の強化学習の主流アルゴリズムの土台となる重要な枠組みです。