Was ist das?
KI-Videogenerierung verwandelt Text oder Bilder in bewegte Bilder. In drei Jahren ging es von albtraumhaften 2-Sekunden-Clips zu minutenlangen Szenen mit nativem Ton, konsistenten Figuren und Kamerakontrolle. Sie verändert Werbung, Film-Previsualisierung und soziale Medien — und befeuert die Deepfake-Debatte.
Wichtige Werkzeuge und Akteure
- Sora (OpenAI) — Text zu Video und eine soziale App darum herum
- Veo (Google DeepMind) — Generierung mit nativem Audio
- Runway — die Suite für Filmemacher, kontrollorientiert
- Kling (Kuaishou) — Chinas stärkstes, weltweit verbreitet
- Pika, Luma, Hailuo — schnelle, zugängliche Alternativen
Meilensteine
- 2023 — Runway Gen-2 und Pika: erstes brauchbares Text-zu-Video
- Feb 2024 — Soras Vorstellung verblüfft die Branche: minutenlange kohärente Szenen
- 2024 — Kling und Veo antworten; realistische Physik verbessert sich rasant
- 2025 — Veo 3 erzeugt Video mit Ton; Sora startet als soziale App; KI-Werbespots laufen im TV
- 2026 — Charakterkonsistenz und Multi-Shot-Erzählen werden zur neuen Grenze
- Jul 2026 — MiniMax H3: 2K-Clips, bei denen Stimme, Effekte und Musik gemeinsam als natives Stereo entstehen; offene Gewichte angekündigt
- Aug 2026 — H3 liefert: Gewichte veröffentlicht — erstes offenes Modell an der Spitze eines großen Video-Rankings
- Aug 2026 — FLUX 3 Video allgemein verfügbar: 20-Sekunden-Clips mit Dialog, Effekten und Umgebungston in einem Durchgang, lippensynchron in einem Dutzend Sprachen
- Aug 2026 — Alibabas Wan 3.0 startet in die Public Beta: ein einheitliches Modell macht aus Dokumenten, Folien und Webseiten 30-Sekunden-Videos mit Ton
Mini-Glossar
- Diffusion: Technik, die Bilder/Videos durch schrittweises Verfeinern von Rauschen erzeugt
- Weltmodell: das innere Gespür einer KI dafür, wie sich Objekte und Physik verhalten
- Natives Audio: Ton, der zusammen mit dem Video erzeugt und nicht nachträglich hinzugefügt wird