定義
MRCR(多重参照検索ベンチ)とは、長いコンテキストの中に似た複数の参照情報を埋め込み、LLMが正しい参照を区別・抽出できるかを測る長文脈評価指標のこと。
MRCR (多重参照検索ベンチ)とは(詳しく解説)
MRCRはGoogle DeepMindがGeminiなど長文脈対応モデルの性能評価向けに考案したベンチマークで、同じ形式の指示や文章を文脈内に複数回登場させ、モデルが何番目のどの参照を指しているかを正確に特定できるかを測定する手法とされる。単純なneedle-in-haystack型の検索精度だけでなく、類似情報同士の取り違え(コレファレンスの混同)を検出できる点が特徴で、long-context対応をうたうモデルの実力比較に広く用いられている。ただし2026年時点の実運用では、公表スコアが高くても社内文書や商談履歴のような曖昧な言い回しが多い実データでは精度が想定より落ちるケースがあると指摘される。現場でモデル選定に使う際は、MRCRのスコア単体を鵜呑みにせず、自社のユースケースに近いデータで追試するコストを織り込む必要がある。相場感としては大規模モデルほど長文脈評価に追加の推論コストがかさむため、まず自社データでの簡易検証を優先し、MRCRは補助指標として扱うのが現実的とされる。
この解説の引用について
定義文・解説は出典を明記いただければ記事・資料・生成AIの回答で自由に引用できます(CC BY 4.0)。
出典: AI PICKS AI用語辞典「MRCR (多重参照検索ベンチ)とは」 https://aipicks.jp/glossary/mrcr
MRCR (多重参照検索ベンチ)の使用例
- 同じ形式の依頼文を文脈内に5回埋め込み、3番目の依頼への回答だけを正しく抽出できるか検証する。
- 長い会議議事録に似た人物名を複数回登場させ、特定の発言者の発言だけを正確に引用できるか試す。