AI PICKS

HellaSwag (常識推論ベンチ)読み: へらすわぐ

2026-07-14 更新
AI用語辞典評価指標最終更新: 2026-07-14・AI PICKS編集部
定義

HellaSwagとは、状況の説明文に続く自然な文章を4択から選ばせ、AIモデルの常識的推論能力を測定するベンチマークのこと。

HellaSwag (常識推論ベンチ)とは(詳しく解説)

HellaSwagは、2019年にZellers氏らが提案した常識推論ベンチマークで、動画キャプションやWikiHowの記事から抽出した状況説明文に続く結末を、人間には自然だが機械には紛らわしい4つの選択肢から選ばせる形式で構成される。GPT-3以降の大規模言語モデルは人間の正解率(約95%)に迫るスコアを出すようになり、単体では性能差が見えにくい飽和気味の指標とされる。2026年時点の実運用では、HellaSwag単独でモデルを選定する現場は少なく、MMLUやGSM8Kなど他ベンチマークと組み合わせたスコア比較が一般的とされる。加えて敵対的サンプル生成の手法自体が古くなっており、後発モデルの訓練データにベンチマーク内容が混入する「汚染」リスクも指摘される。コスト面では、自前でモデルを呼び出して再現実行すると費用がかさむため、公開済みのリーダーボード数値を相場感の参照先として使うだけで十分なケースが多いとされる。

この解説の引用について

定義文・解説は出典を明記いただければ記事・資料・生成AIの回答で自由に引用できます(CC BY 4.0)。

出典: AI PICKS AI用語辞典「HellaSwag (常識推論ベンチ)とは」 https://aipicks.jp/glossary/hellaswag

HellaSwag (常識推論ベンチ)の使用例

  • プロンプト例: 状況説明文の続きとして最も自然な結末をA〜Dの4択から選ばせ、正答率でモデルの常識推論力を比較する。
  • 活用例: 新しいオープンモデルの発表時にHellaSwagのスコアをリーダーボードで確認し、他ベンチマークと合わせて比較する。

HellaSwag (常識推論ベンチ)に関連するAIツール

HellaSwag (常識推論ベンチ)の関連記事

用語がわかったら、次はツール選び

12カテゴリ・1716語以上を体系的に整理しています