ホーム / ディープラーニングの要素技術 / Attention / Transformer

275

Transformer

ディープラーニングの要素技術Attention

Transformer とは、RNN や畳み込みを使わず Attention だけで構成されたモデルの構造です。2017 年に発表されました。

系列を順番に処理する必要がないため GPU で一気に並列計算でき、学習を大規模化できます。離れた語どうしの関係も直接とらえられます。

GPT や BERT をはじめ現在の大規模言語モデルはほぼすべてこの構造を土台にしており、画像や音声にも応用が広がっています。