Что это?
ИИ-генерация видео превращает текст или изображения в движущиеся картинки. За три года она прошла путь от кошмарных 2-секундных роликов до минутных сцен с нативным звуком, последовательными персонажами и управлением камерой. Она меняет рекламу, превизуализацию кино и соцсети — и подогревает споры о дипфейках.
Ключевые инструменты и игроки
- Sora (OpenAI) — текст в видео и социальное приложение вокруг него
- Veo (Google DeepMind) — генерация с нативным звуком
- Runway — набор кинематографиста, ориентирован на контроль
- Kling (Kuaishou) — сильнейший в Китае, широко используется в мире
- Pika, Luma, Hailuo — быстрые и доступные альтернативы
Вехи
- 2023 — Runway Gen-2 и Pika: первый пригодный текст-в-видео
- Фев 2024 — презентация Sora ошеломила отрасль: минутные связные сцены
- 2024 — Kling и Veo дали ответ; реалистичность физики быстро растёт
- 2025 — Veo 3 генерирует видео со звуком; Sora выходит как соцприложение; ИИ-реклама попадает на ТВ
- 2026 — последовательность персонажей и многокадровое повествование становятся передним краем
- Июл 2026 — MiniMax H3: 2K-ролики, где голос, эффекты и музыка генерируются вместе с картинкой как нативное стерео; обещаны открытые веса
- Авг 2026 — H3 сдержала слово: веса опубликованы — первая открытая модель во главе крупного видео-рейтинга
- Авг 2026 — FLUX 3 Video стал общедоступным: 20-секундные ролики с диалогами, эффектами и фоном за один проход, синхронизация губ на дюжине языков
- Авг 2026 — Wan 3.0 от Alibaba выходит в открытую бету: единая модель превращает документы, слайды и веб-страницы в 30-секундные видео со звуком
Мини-словарь
- Диффузия: техника генерации изображений/видео путём пошаговой очистки шума
- Модель мира: внутреннее представление ИИ о том, как ведут себя объекты и физика
- Нативный звук: звук, создаваемый вместе с видео, а не добавляемый потом