定義
BrowseCompとは、AIエージェントが自力でWeb検索・閲覧を重ねて発見しづらい事実情報を見つけ出す能力を測定するベンチマークのこと。
BrowseComp (ブラウジング能力ベンチ)とは(詳しく解説)
BrowseCompは、OpenAIが公開したベンチマークで、AIエージェントがWeb検索・閲覧を繰り返しながら、単純な検索では見つからない事実情報を突き止められるかを測る指標とされる。単発の検索一致では正解にたどり着けない、複数ページを横断した推論を要する問題設計が特徴とされ、GPT系やClaude系などのエージェント型モデルの評価に使われている。2026年時点の実運用では、スコアの高さがそのままブラウジング機能の実用性を保証するわけではなく、検索対象サイトの構造変化やレート制限、有料APIのコスト増によってベンチマーク時と現場での挙動が乖離しやすい点が落とし穴として挙げられる。エージェント選定の現場では、BrowseComp単体のスコアよりも、実際に使う想定のドメインでの検索精度や、API呼び出し回数に伴うコスト・相場感を合わせて確認する運用が望ましいとされる。
この解説の引用について
定義文・解説は出典を明記いただければ記事・資料・生成AIの回答で自由に引用できます(CC BY 4.0)。
出典: AI PICKS AI用語辞典「BrowseComp (ブラウジング能力ベンチ)とは」 https://aipicks.jp/glossary/browsecomp
BrowseComp (ブラウジング能力ベンチ)の使用例
- 「2019年に創業し2023年に社名変更した某スタートアップの創業者は誰か」のように複数手がかりの突合が必要な設問。
- 単純なキーワード検索1回では正答できず、複数サイトを横断して裏取りしないと正解に到達しない問題形式。