ホーム / 生成AIの技術 / 動向 / マルチモーダル648マルチモーダル生成AIの技術動向マルチモーダルとは、テキスト・画像・音声など複数の種類の情報をまとめて扱えることです。画像を見せて内容を説明させる、図を読み取って質問に答える、音声で対話するといった使い方ができます。人が複数の感覚を使って理解するのに近づいた形です。近年の主要なモデルは標準でこの能力を備えるようになり、テキストだけの利用から用途が大きく広がっています。