定義
統計的有意性とは、AIモデルやA/Bテストの評価結果の差が偶然のばらつきではないと言えるかどうかを示す統計的な基準のことで、信頼区間の幅などで判定される。
統計的有意性 (評価の信頼区間)とは(詳しく解説)
統計的有意性は、比較対象間に観測された差が偶然によるものである確率(p値)がある基準(一般にp<0.05)を下回るかどうかで判定される、統計学における標準的な概念である。AIモデルの評価やA/Bテストでは、精度やCTRなどの指標差が有意かどうかを、信頼区間(多くは95%信頼区間)の幅で確認する運用が広く採用されている。2026年時点の実運用では、サンプル数が少ないままp値だけを見て「効果あり」と判断し、後で再現しないという落とし穴が指摘されている。特にLLM評価はコストが高く、十分なサンプル数を確保する前に打ち切られるケースが多いとされる。現場での選び方としては、p値単体ではなく信頼区間の幅と効果量を併記し、ビジネス上意味のある差(実務的有意性)かどうかも合わせて判断することが推奨される。評価基盤の構築・運用コストを考慮し、継続的な少数サンプル評価より、一定期間ごとにまとまったサンプルで有意性を検証する設計が現場では選ばれやすい。
この解説の引用について
定義文・解説は出典を明記いただければ記事・資料・生成AIの回答で自由に引用できます(CC BY 4.0)。
出典: AI PICKS AI用語辞典「統計的有意性 (評価の信頼区間)とは」 https://aipicks.jp/glossary/statistical-significance
統計的有意性 (評価の信頼区間)の使用例
- A/Bテストで導入前後のCTR差を比較し、p値が0.05を下回れば統計的有意性ありと判断する。
- プロンプト例:「この結果の差はp<0.05で統計的に有意か、信頼区間を含めて評価して」