ホーム / ディープラーニングの応用例 / マルチモーダル / Visual Question Answering
426
Visual Question Answering
ディープラーニングの応用例マルチモーダル
Visual Question Answering とは、画像とその画像についての質問を受け取り、答えを返すタスクです。
「テーブルの上に何個コップがありますか」という質問に「3 個」と答えるには、画像を見るだけでなく、質問の意図を理解し数を数える必要があります。
画像と言語の両方の理解に加えて推論も要するため、マルチモーダルの難易度の高い課題とされています。