これは何?
AI動画生成は、テキストや画像を動く映像に変える。3年間で、悪夢のような2秒クリップから、ネイティブ音声・一貫したキャラクター・カメラ制御を備えた分単位のシーンへと進化した。広告、映画のプリビズ、SNSを塗り替えつつある。ディープフェイク論争にも火を注いでいる。
主要ツールとプレイヤー
- FLUX 3 Video (Black Forest Labs) — 台詞と効果音を一度に生成する20秒クリップ
- Veo (Google DeepMind) — ネイティブ音声付きの生成
- Runway — 映像制作者向けスイート、制御重視
- Kling (快手) — 中国最強、世界でも広く使われる
- Pika、Luma、Hailuo — 速くて手軽な選択肢
節目
- 2023 — Runway Gen-2とPika:初の実用的なテキスト動画生成
- 2024年2月 — Soraの発表が業界に衝撃:分単位の一貫したシーン
- 2024 — KlingとVeoが追随;物理の リアリティが急速に向上
- 2025 — Veo 3が音付き動画を生成;Soraがソーシャルアプリとして登場;AI広告がテレビ放映
- 2026 — キャラクターの一貫性とマルチショットの物語りが新たなフロンティアに
- 2026年7-8月 — MiniMax H3は声・効果音・音楽をネイティブステレオで生成し、その後ウェイトを公開して主要動画ランキング首位に立った
- 2026年8月 — FLUX 3 Videoが一般提供に:台詞・効果音・環境音を一度に生成する20秒クリップ
- 2026年8月 — アリババのWan 3.0がパブリックベータに:単一モデルが文書とウェブページを音声付き30秒動画に変換
- 2026年9月 — OpenAIがSoraを終了:アプリは4月、APIは9月24日に停止し、代替は示されなかった(当誌報道)
- 2026年10月 — Tavus Griffinがリアルタイムの動画対話を実現し、54人の半数が人間だと誤認した(当誌報道)
ミニ用語集
- 拡散(ディフュージョン):ノイズを段階的に除去して画像・動画を生成する技術
- 世界モデル:物体や物理がどう振る舞うかについてのAIの内的な感覚
- ネイティブ音声:後付けではなく、動画と一緒に生成される音