Что это?
ИИ-генерация видео превращает текст или изображения в движущиеся картинки. За три года она прошла путь от кошмарных 2-секундных роликов до минутных сцен с нативным звуком, последовательными персонажами и управлением камерой. Она меняет рекламу, превизуализацию кино и соцсети. Она также подогревает споры о дипфейках.
Ключевые инструменты и игроки
- FLUX 3 Video (Black Forest Labs) — 20-секундные ролики с диалогами и эффектами за один проход
- Veo (Google DeepMind) — генерация с нативным звуком
- Runway — набор кинематографиста, ориентирован на контроль
- Kling (Kuaishou) — сильнейший в Китае, широко используется в мире
- Pika, Luma, Hailuo — быстрые и доступные альтернативы
Вехи
- 2023 — Runway Gen-2 и Pika: первый пригодный текст-в-видео
- Фев 2024 — презентация Sora ошеломила отрасль: минутные связные сцены
- 2024 — Kling и Veo дали ответ; реалистичность физики быстро растёт
- 2025 — Veo 3 генерирует видео со звуком; Sora выходит как соцприложение; ИИ-реклама попадает на ТВ
- 2026 — последовательность персонажей и многокадровое повествование становятся передним краем
- Июл-Авг 2026 — MiniMax H3 генерирует голос, эффекты и музыку как нативное стерео, затем открывает веса и возглавляет крупный видео-рейтинг
- Авг 2026 — FLUX 3 Video стал общедоступным: 20-секундные ролики с диалогами, эффектами и фоном за один проход
- Авг 2026 — Wan 3.0 от Alibaba выходит в открытую бету: модель превращает документы и веб-страницы в 30-секундные видео со звуком
- Сен 2026 — OpenAI закрывает Sora: приложение ушло в апреле, API 24 сентября, замены не названо (наш материал)
- Окт 2026 — Tavus Griffin ведёт живые видеоразговоры и обманул половину из 54 испытуемых (наш материал)
Мини-словарь
- Диффузия: техника генерации изображений/видео путём пошаговой очистки шума
- Модель мира: внутреннее представление ИИ о том, как ведут себя объекты и физика
- Нативный звук: звук, создаваемый вместе с видео, а не добавляемый потом