Qu'est-ce que c'est ?
La génération vidéo par IA transforme du texte ou des images en images animées. En trois ans, elle est passée de cauchemardesques clips de 2 secondes à des scènes d'une minute avec son natif, personnages cohérents et contrôle de caméra. Elle refaçonne la publicité, la prévisualisation de films et les réseaux sociaux — tout en attisant le débat sur les deepfakes.
Outils et acteurs clés
- Sora (OpenAI) — texte vers vidéo et une app sociale bâtie autour
- Veo (Google DeepMind) — génération avec audio natif
- Runway — la suite du cinéaste, axée sur le contrôle
- Kling (Kuaishou) — le plus fort de Chine, très utilisé dans le monde
- Pika, Luma, Hailuo — alternatives rapides et accessibles
Jalons
- 2023 — Runway Gen-2 et Pika : premier texte-vers-vidéo utilisable
- Fév 2024 — La révélation de Sora sidère le secteur : scènes cohérentes d'une minute
- 2024 — Kling et Veo répliquent ; la physique réaliste progresse vite
- 2025 — Veo 3 génère de la vidéo sonorisée ; Sora devient une app sociale ; des pubs IA passent à la TV
- 2026 — Cohérence des personnages et récit multi-plans deviennent la frontière
- Juil 2026 — MiniMax H3 : clips 2K avec voix, bruitages et musique générés ensemble en stéréo native ; poids ouverts promis
- Août 2026 — H3 tient promesse : poids publiés — premier modèle ouvert en tête d'un grand classement vidéo
- Août 2026 — FLUX 3 Video passe en disponibilité générale : clips de 20 secondes avec dialogues, effets et ambiance en une seule passe, synchronisation labiale dans une douzaine de langues
- Août 2026 — Wan 3.0 d'Alibaba ouvre sa bêta publique : un modèle unifié transforme documents, diapositives et pages web en vidéos de 30 secondes avec le son
Mini glossaire
- Diffusion : technique générant images/vidéo en affinant du bruit étape par étape
- Modèle de monde : l'intuition interne d'une IA sur le comportement des objets et de la physique
- Audio natif : son généré en même temps que la vidéo, non ajouté après coup