定義
空間知能とは、AIが2D画像や映像から物体の奥行き・配置・物理的な関係性を3Dとして理解し、動きや変化を予測する能力のこと。
空間知能 (3D空間理解)とは(詳しく解説)
空間知能とは、生成AIが平面的な画像・動画データから、物体同士の奥行き・大きさ・配置関係、さらには重力や衝突といった物理法則を推論し、時間軸上での変化を予測・生成する能力を指す。従来の動画生成モデルが「見た目のもっともらしさ」を優先していたのに対し、空間知能を備えたモデルは物体の一貫性(フレームをまたいでも形状や位置関係が崩れない)を重視する点が業界標準の定義とされる。2026年時点の実運用では、長尺・複数カット動画で背景や小物の位置がフレームごとに微妙にズレる、いわゆる時空間的な不整合が依然として発生しやすく、現場では生成後の目視チェック工程を省略できないのが実態とされる。コスト面では空間知能対応モデルは通常の動画生成より計算負荷が高く、生成単価・処理時間ともに割高になる傾向があるため、相場感を把握したうえで「短尺の広告カットには軽量モデル、長尺のプロダクト紹介には空間知能対応モデル」といった使い分けが現場での選び方として広がっている。
この解説の引用について
定義文・解説は出典を明記いただければ記事・資料・生成AIの回答で自由に引用できます(CC BY 4.0)。
出典: AI PICKS AI用語辞典「空間知能 (3D空間理解)とは」 https://aipicks.jp/glossary/spatial-intelligence
空間知能 (3D空間理解)の使用例
- 「机の上のコップを倒さずにペンだけ動かして」のように物理的な制約を守った動画生成を指示する
- 複数カットにまたがるプロダクト紹介動画で、背景の家具位置を一貫させたまま撮影角度を変える