ホーム / ディープラーニングの応用例 / 画像認識 / Vision Transformer

310

Vision Transformer

ディープラーニングの応用例画像認識

Vision Transformer とは、画像を小さなパッチに切り分けて単語のように並べ、Transformer で処理する画像認識モデルです。

畳み込みを使わず Self-Attention だけで画像を扱うという、それまでの常識を覆す設計です。画像の離れた部分どうしの関係も直接とらえられます。

大量のデータで学習させると CNN を上回る精度が出ることが示され、画像分野の主流のひとつになりました。