これは何?
AI動画生成は、テキストや画像を動く映像に変える。3年間で、悪夢のような2秒クリップから、ネイティブ音声・一貫したキャラクター・カメラ制御を備えた分単位のシーンへと進化した。広告、映画のプリビズ、SNSを塗り替えつつあり、ディープフェイク論争にも火を注いでいる。
主要ツールとプレイヤー
- Sora (OpenAI) — テキストから動画へ、そしてそれを軸にしたソーシャルアプリ
- Veo (Google DeepMind) — ネイティブ音声付きの生成
- Runway — 映像制作者向けスイート、制御重視
- Kling (快手) — 中国最強、世界でも広く使われる
- Pika、Luma、Hailuo — 速くて手軽な選択肢
節目
- 2023 — Runway Gen-2とPika:初の実用的なテキスト動画生成
- 2024年2月 — Soraの発表が業界に衝撃:分単位の一貫したシーン
- 2024 — KlingとVeoが追随;物理の リアリティが急速に向上
- 2025 — Veo 3が音付き動画を生成;Soraがソーシャルアプリとして登場;AI広告がテレビ放映
- 2026 — キャラクターの一貫性とマルチショットの物語りが新たなフロンティアに
- 2026年7月 — MiniMax H3:声・効果音・音楽を映像と同時にネイティブステレオで生成する2Kクリップ;重みの公開を予告
- 2026年8月 — H3が約束を果たす:ウェイト公開、主要動画ランキング首位に立つ初のオープンモデルに
- 2026年8月 — FLUX 3 Videoが一般提供に:台詞・効果音・環境音を一度に生成する20秒クリップ、十数言語のリップシンク対応
- 2026年8月 — アリババのWan 3.0がパブリックベータに:単一の統合モデルが文書・スライド・ウェブページを音声付き30秒動画に変換
ミニ用語集
- 拡散(ディフュージョン):ノイズを段階的に除去して画像・動画を生成する技術
- 世界モデル:物体や物理がどう振る舞うかについてのAIの内的な感覚
- ネイティブ音声:後付けではなく、動画と一緒に生成される音