定義
データの壁とは、大規模言語モデルの事前学習に使える高品質なテキストデータの供給が有限で、いずれ枯渇するとされる制約のこと。
データの壁 (Data Wall)とは(詳しく解説)
データの壁とは、大規模言語モデルの事前学習に使える高品質なテキストデータ(書籍・論文・良質なウェブ記事など)の総量が有限であり、モデルの巨大化に学習データの供給が追いつかなくなる現象を指す。2026年時点では、インターネット上の高品質テキストの多くがすでに学習済みとされ、追加データの多くは合成データ(AIが生成したテキスト)や動画・音声などのマルチモーダルデータ、有償ライセンスデータで補われる方向にシフトしている。実運用では、合成データへの依存度が高いモデルほど品質のばらつきが出やすく、事実確認や重複除去などのデータクレンジング工程にかかるコストが無視できない。現場でモデルやAPIを選ぶ際は、学習データの出所やライセンス方針を公開しているベンダーを優先し、著作権リスクや出典の透明性を相場感とあわせて確認するのが実務的な選び方とされる。
この解説の引用について
定義文・解説は出典を明記いただければ記事・資料・生成AIの回答で自由に引用できます(CC BY 4.0)。
出典: AI PICKS AI用語辞典「データの壁 (Data Wall)とは」 https://aipicks.jp/glossary/data-wall
データの壁 (Data Wall)の使用例
- 「モデルの性能向上が頭打ちなのはデータの壁が一因では」といった議論で使われる表現。
- 合成データや動画データの活用は、データの壁への対応策の一つとして語られる。