Qu'est-ce que c'est ?
La génération vidéo par IA transforme du texte ou des images en images animées. En trois ans, elle est passée de clips de 2 secondes à des scènes d'une minute avec son natif et personnages cohérents. Elle refaçonne la publicité, la prévisualisation de films et les réseaux sociaux. Elle attise aussi le débat sur les deepfakes.
Outils et acteurs clés
- FLUX 3 Video (Black Forest Labs) — clips de 20 secondes avec dialogues et effets en une passe
- Veo (Google DeepMind) — génération avec audio natif
- Runway — la suite du cinéaste, axée sur le contrôle
- Kling (Kuaishou) — le plus fort de Chine, très utilisé dans le monde
- Pika, Luma, Hailuo — alternatives rapides et accessibles
Jalons
- 2023 — Runway Gen-2 et Pika : premier texte-vers-vidéo utilisable
- Fév 2024 — La révélation de Sora sidère le secteur : scènes cohérentes d'une minute
- 2024 — Kling et Veo répliquent ; la physique réaliste progresse vite
- 2025 — Veo 3 génère de la vidéo sonorisée ; Sora devient une app sociale ; des pubs IA passent à la TV
- 2026 — Cohérence des personnages et récit multi-plans deviennent la frontière
- Juil-Août 2026 — MiniMax H3 génère voix, bruitages et musique en stéréo native, puis ouvre ses poids et domine un grand classement vidéo
- Août 2026 — FLUX 3 Video passe en disponibilité générale : clips de 20 secondes avec dialogues, effets et ambiance en une seule passe
- Août 2026 — la bêta publique de Wan 3.0 d'Alibaba transforme documents et pages web en vidéos sonores de 30 secondes
- Sep 2026 — OpenAI retire Sora : l'app a fermé en avril, l'API le 24 septembre, sans remplaçant recommandé (nos articles)
- Oct 2026 — Tavus Griffin tient des conversations vidéo en direct et trompe la moitié de 54 testeurs (nos articles)
Mini glossaire
- Diffusion : technique générant images/vidéo en affinant du bruit étape par étape
- Modèle de monde : l'intuition interne d'une IA sur le comportement des objets et de la physique
- Audio natif : son généré en même temps que la vidéo, non ajouté après coup