定義
CLIPスコアとは、生成画像とテキスト説明の意味的な一致度を数値化した評価指標のこと。
CLIPスコア (画像テキスト整合)とは(詳しく解説)
CLIPスコアとは、 OpenAI の CLIP モデルが持つ画像エンコーダとテキストエンコーダで それぞれの埋め込みベクトルを算出し、 コサイン類似度で 画像とプロンプトの意味的整合性を数値化する評価指標のこと。 画像生成 AI のベンチマークで 業界標準の自動評価手法として広く採用されており、 人手評価より低コストかつ再現性が高い点が利点とされる。 一方で 2026 年時点の実運用では、 構図や質感の破綻を検知できない、 スコアが高くても日本語プロンプトの細かいニュアンス (人数・服装・背景指定など) を取りこぼすケースがある、 といった落とし穴が指摘されている。 現場では CLIP スコア単体で合否判定せず、 FID など他指標や 目視チェックと併用するのが定石で、 相場感としては オープンソース実装を使えば追加コストはほぼ発生しない。
この解説の引用について
定義文・解説は出典を明記いただければ記事・資料・生成AIの回答で自由に引用できます(CC BY 4.0)。
出典: AI PICKS AI用語辞典「CLIPスコア (画像テキスト整合)とは」 https://aipicks.jp/glossary/clip-score
CLIPスコア (画像テキスト整合)の使用例
- 「赤いドレスを着た女性が公園を歩いている」→ 生成画像との CLIP スコアで整合度を確認
- 複数の画像生成モデルを同一プロンプトで比較し、 CLIP スコア上位案を採用