ホーム / ディープラーニングの応用例 / 深層強化学習 / A3C

385

A3C

ディープラーニングの応用例深層強化学習

A3C とは、複数のエージェントを並列に動かし、それぞれが得た経験を非同期に共有しながら学習する手法です。

多数のエージェントが別々の状況を同時に経験するため、集まる経験に偏りが出にくく、学習が安定します。経験を貯めておく仕組みも不要になります。

方策と価値の両方を同時に学ぶ設計で、CPU だけでも効率よく学習できる点が注目されました。