定義
DiT(拡散トランスフォーマー)とは、画像・動画生成モデルの内部構造でU-Netの代わりにTransformerを用いる拡散モデルのアーキテクチャのこと。
DiT (拡散トランスフォーマー)とは(詳しく解説)
DiTは拡散モデルのノイズ除去処理をTransformerで行う設計で、OpenAIのSoraやStable Diffusion 3系列など高品質な動画・画像生成モデルの基盤として広く採用されているとされる。従来のU-Net型拡散モデルと比べて大規模データとの相性がよく、スケール則に従って性能が伸びやすい点が特徴とされる。一方で2026年時点の実運用では、学習・推論に必要な計算コストがU-Net型より高くなりやすく、長尺・高解像度の動画生成では推論時間とGPUコストが跳ね上がりやすい点が現場での課題として挙げられる。API経由でDiTベースのモデルを使う場合は生成秒数やレンダリング枚数に応じた従量課金が一般的で、相場感としては短尺プレビューは安価でも本番品質の書き出しになるとコストが急増しやすい。ツール選定の現場では、アーキテクチャの新旧よりも実際の生成物の一貫性・制御性・料金体系を比較して選ぶのが現実的とされる。
この解説の引用について
定義文・解説は出典を明記いただければ記事・資料・生成AIの回答で自由に引用できます(CC BY 4.0)。
出典: AI PICKS AI用語辞典「DiT (拡散トランスフォーマー)とは」 https://aipicks.jp/glossary/dit
DiT (拡散トランスフォーマー)の使用例
- SoraやRunway Gen-3など、DiTベースの動画生成モデルで数十秒のクリップを生成する用途で使われる。
- 「DiTベースのモデルは高解像度になるほど推論コストが上がる」といった技術解説の文脈で登場する用語。