定義
セマンティックチャンキングとは、文書を固定長ではなく意味のまとまり単位で分割し、RAGの検索精度を高める前処理手法のこと。
セマンティックチャンキング (Semantic Chunking)とは(詳しく解説)
セマンティックチャンキングは、RAG(検索拡張生成)においてドキュメントを検索・埋め込みに適した単位に分割する前処理技術で、文字数や改行位置で機械的に区切る固定長チャンキングとは異なり、文の意味的なまとまりや話題の切れ目を基準に分割する点が特徴とされる。埋め込みモデルで隣接文の類似度を計算し、意味的な連続性が途切れる箇所を境界とする手法が広く使われている。定義自体は理解しやすいが、2026年時点の実運用では境界判定に追加の埋め込み計算コストがかかり、文書量が多いほどインデックス構築の時間とAPI利用料が増える点が課題になりやすい。また業界や文書形式によって最適なチャンクサイズや粒度は異なり、契約書のような構造化文書と会話ログのような非構造化文書では同じ設定が通用しないとされる。現場での選び方としては、まず固定長チャンキングで検索精度のベースラインを確認し、それでも回答の文脈欠落が目立つ場合にセマンティックチャンキングへ切り替える段階的な導入が現実的とされる。コスト感を含めた費用対効果の見極めが、導入判断の分かれ目になる。
この解説の引用について
定義文・解説は出典を明記いただければ記事・資料・生成AIの回答で自由に引用できます(CC BY 4.0)。
出典: AI PICKS AI用語辞典「セマンティックチャンキング (Semantic Chunking)とは」 https://aipicks.jp/glossary/semantic-chunking
セマンティックチャンキング (Semantic Chunking)の使用例
- 契約書100件をRAGに投入する前に、条項単位でセマンティックチャンキングし検索漏れを防ぐ
- FAQデータベースを固定長分割からセマンティックチャンキングに変更し、質問と回答の対応精度を検証する