ホーム / ディープラーニングの応用例 / マルチモーダル / Image Captioning

425

Image Captioning

ディープラーニングの応用例マルチモーダル

Image Captioning とは、画像を見てその内容を説明する文章を生成するタスクです。

「公園でフリスビーを追いかける犬」のように、写っているものだけでなく、その関係や動作まで言葉にする必要があります。画像認識と文章生成の両方が求められます。

視覚に障害のある人へ画像の内容を伝える用途や、大量の画像に説明を付けて検索可能にする用途があります。