定義
HyDE(仮説的文書埋め込み)とは、LLMにクエリへの仮説的な回答文書を生成させ、その埋め込みベクトルでRAG検索の精度を高める手法のこと。
HyDE (仮説的文書埋め込み)とは(詳しく解説)
HyDE(Hypothetical Document Embeddings)は、Gao et al.(2022)が提案したRAG拡張手法。通常のRAGではユーザーの短いクエリをそのまま埋め込んでベクトル検索するが、クエリと実文書の表現ギャップが検索精度を下げる問題がある。HyDEはこれを解決するため、まずLLMに「このクエリに答えるとしたらどんな文書か」を生成させ、その仮説文書の埋め込みを検索クエリとして使う。仮説文書は実文書に近いスタイルと語彙を持つため、ベクトル空間上での類似度計算が精度よく機能する。 2026年の現場では、社内文書RAGやカスタマーサポートボットへの採用が増えている。実運用での落とし穴は主に3点:①LLM呼び出しが1回増えるため応答レイテンシが300〜800ms増加する、②LLMが誤った仮説文書を生成するとハルシネーション連鎖で検索が的外れになる、③仮説生成プロンプトのチューニング初期工数として2〜5日が相場感。選択の目安は、クエリが短文・口語的な場合や専門ドメインで精度改善が急務な場合に有効。単純なキーワード検索で十分な用途では導入コスト対効果が薄い。
この解説の引用について
定義文・解説は出典を明記いただければ記事・資料・生成AIの回答で自由に引用できます(CC BY 4.0)。
出典: AI PICKS AI用語辞典「HyDE (仮説的文書埋め込み)とは」 https://aipicks.jp/glossary/hyde
HyDE (仮説的文書埋め込み)の使用例
- 社内規定RAGにHyDEを適用したところ、直接クエリ検索と比べTop-3精度が約20%向上した実運用事例が2026年に複数報告されている。
- 「返品条件は?」というクエリにLLMが仮説文書を生成→その埋め込みで検索→関連ポリシー文書を正確に取得するフローが典型的な使い方。