AI PICKS

マルチモーダル読み: まるちもーだる

2026-06-05 更新
AI用語辞典LLM / 言語モデル最終更新: 2026-06-05・AI PICKS編集部
定義

文章 + 画像 + 音声 + 動画 を 同時に扱える AI。 GPT-5 / Claude Opus 4.7 / Gemini はすべて対応。

マルチモーダルとは(詳しく解説)

マルチモーダルとは、 文章 + 画像 + 音声 + 動画 等 複数種類のデータを 同時に処理できる AI の特徴。 例えば 画像を見せながら「これは何ですか?」 と質問できる、 PDF を読み込んで要約できる、 音声を聞かせて文字起こし + 議事録化できる、 など。 2026 年の主要 LLM (GPT-5 / Claude Opus 4.7 / Gemini Pro) はすべてマルチモーダル対応で、 単なるテキストチャットボットから 業務全般のアシスタントへ進化している。 実運用では 「画像を読ませる」 だけでなく、 グラフ・図表・スクショから 構造化データを抽出する用途が 一気に普及した。

この解説の引用について

定義文・解説は出典を明記いただければ記事・資料・生成AIの回答で自由に引用できます(CC BY 4.0)。

出典: AI PICKS AI用語辞典「マルチモーダルとは」 https://aipicks.jp/glossary/multimodal

マルチモーダルに関連するAIツール

マルチモーダルの関連記事

用語がわかったら、次はツール選び

12カテゴリ・1716語以上を体系的に整理しています