ホーム / ディープラーニングの応用例 / 画像認識 / Vision Transformer
310
Vision Transformer
ディープラーニングの応用例画像認識
Vision Transformer とは、画像を小さなパッチに切り分けて単語のように並べ、Transformer で処理する画像認識モデルです。
畳み込みを使わず Self-Attention だけで画像を扱うという、それまでの常識を覆す設計です。画像の離れた部分どうしの関係も直接とらえられます。
大量のデータで学習させると CNN を上回る精度が出ることが示され、画像分野の主流のひとつになりました。