定義
親ドキュメント検索とは、RAGで小さなチャンクで検索精度を高めながら、LLMへの入力時には元の大きな親ドキュメントを渡すことで回答品質を両立させる手法のこと。
親ドキュメント検索 (Parent-Document Retrieval)とは(詳しく解説)
親ドキュメント検索(Parent-Document Retrieval)は、RAGパイプラインにおける「検索精度」と「文脈充足」のトレードオフを解消するアーキテクチャ手法だ。通常のRAGでは小さなチャンク(200〜500トークン)でベクトル検索すると意味的な類似度は上がるが、LLMが回答生成に必要な文脈が断片化してしまう問題がある。本手法ではインデックス時に「子チャンク」と「親ドキュメント」の2層で保存し、検索は子チャンクで行いながら取得後に親ドキュメントをLLMへ渡す設計をとる。 2026年の実運用で最も多い落とし穴は親ドキュメントのサイズ設定ミス。大きすぎるとコンテキストウィンドウを圧迫して回答品質がむしろ低下し、現場では2,000〜4,000トークンが相場感として定着しつつある。文書構造が明確な法律・医療・技術マニュアルで効果が高く、コードベースや非構造化ログには不向きなケースも多い。LangChainのParentDocumentRetrieverやLlamaIndexで実装が容易なため、AI PICKSが追う社内知識検索ツールでも2026年に入り採用事例が急増している。
この解説の引用について
定義文・解説は出典を明記いただければ記事・資料・生成AIの回答で自由に引用できます(CC BY 4.0)。
出典: AI PICKS AI用語辞典「親ドキュメント検索 (Parent-Document Retrieval)とは」 https://aipicks.jp/glossary/parent-document-retrieval
親ドキュメント検索 (Parent-Document Retrieval)の使用例
- 法律文書を段落単位でインデックスし、検索ヒットした子チャンクの親セクション全体をLLMに渡してコンプライアンス質問に回答させる活用例。
- 製品マニュアル全1,000ページをチャンク化し、類似チャンクの親ドキュメントを取得してサポートボットの回答品質を向上させた事例。