¿Qué es esto?
La generación de vídeo con IA convierte texto o imágenes en imágenes en movimiento. En tres años pasó de pesadillescos clips de 2 segundos a escenas de un minuto con sonido nativo, personajes consistentes y control de cámara. Está transformando la publicidad, la previsualización cinematográfica y las redes sociales — y alimentando el debate sobre los deepfakes.
Herramientas y actores clave
- Sora (OpenAI) — texto a vídeo y una app social construida a su alrededor
- Veo (Google DeepMind) — generación con audio nativo
- Runway — la suite del cineasta, centrada en el control
- Kling (Kuaishou) — el más fuerte de China, muy usado globalmente
- Pika, Luma, Hailuo — alternativas rápidas y accesibles
Hitos
- 2023 — Runway Gen-2 y Pika: el primer texto-a-vídeo utilizable
- Feb 2024 — La presentación de Sora asombra al sector: escenas coherentes de un minuto
- 2024 — Kling y Veo responden; la física realista mejora rápidamente
- 2025 — Veo 3 genera vídeo con sonido; Sora se lanza como app social; anuncios hechos con IA llegan a la TV
- 2026 — La consistencia de personajes y la narración multi-toma se vuelven la frontera
- Jul 2026 — MiniMax H3: clips en 2K con voz, efectos y música generados juntos como estéreo nativo; pesos abiertos prometidos
- Ago 2026 — H3 cumple: pesos publicados — primer modelo abierto en liderar un ranking importante de vídeo
- Ago 2026 — FLUX 3 Video pasa a disponibilidad general: clips de 20 segundos con diálogo, efectos y ambiente en una sola pasada, sincronía labial en una docena de idiomas
- Ago 2026 — Wan 3.0 de Alibaba abre su beta pública: un único modelo unificado convierte documentos, diapositivas y webs en vídeos de 30 segundos con sonido
Mini glosario
- Difusión: técnica que genera imágenes/vídeo refinando ruido paso a paso
- Modelo de mundo: la intuición interna de una IA sobre cómo se comportan los objetos y la física
- Audio nativo: sonido generado junto con el vídeo, no añadido después