定義
文章 + 画像 + 音声 + 動画 を 同時に扱える AI。 GPT-5 / Claude Opus 4.7 / Gemini はすべて対応。
マルチモーダルとは(詳しく解説)
マルチモーダルとは、 文章 + 画像 + 音声 + 動画 等 複数種類のデータを 同時に処理できる AI の特徴。 例えば 画像を見せながら「これは何ですか?」 と質問できる、 PDF を読み込んで要約できる、 音声を聞かせて文字起こし + 議事録化できる、 など。 2026 年の主要 LLM (GPT-5 / Claude Opus 4.7 / Gemini Pro) はすべてマルチモーダル対応で、 単なるテキストチャットボットから 業務全般のアシスタントへ進化している。 実運用では 「画像を読ませる」 だけでなく、 グラフ・図表・スクショから 構造化データを抽出する用途が 一気に普及した。
この解説の引用について
定義文・解説は出典を明記いただければ記事・資料・生成AIの回答で自由に引用できます(CC BY 4.0)。
出典: AI PICKS AI用語辞典「マルチモーダルとは」 https://aipicks.jp/glossary/multimodal