ホーム / ディープラーニングの応用例 / 深層強化学習 / A3C
385
A3C
ディープラーニングの応用例深層強化学習
A3C とは、複数のエージェントを並列に動かし、それぞれが得た経験を非同期に共有しながら学習する手法です。
多数のエージェントが別々の状況を同時に経験するため、集まる経験に偏りが出にくく、学習が安定します。経験を貯めておく仕組みも不要になります。
方策と価値の両方を同時に学ぶ設計で、CPU だけでも効率よく学習できる点が注目されました。
ホーム / ディープラーニングの応用例 / 深層強化学習 / A3C
A3C とは、複数のエージェントを並列に動かし、それぞれが得た経験を非同期に共有しながら学習する手法です。
多数のエージェントが別々の状況を同時に経験するため、集まる経験に偏りが出にくく、学習が安定します。経験を貯めておく仕組みも不要になります。
方策と価値の両方を同時に学ぶ設計で、CPU だけでも効率よく学習できる点が注目されました。