这是什么?
AI视频生成把文字或图片变成动态影像。三年间,它从噩梦般的2秒片段进化到带原生音频、角色一致、可控运镜的分钟级场景。它正在重塑广告、电影预演和社交媒体。它也加剧了深度伪造之争。
关键工具与玩家
- FLUX 3 Video (Black Forest Labs) — 一次生成带对话与音效的20秒片段
- Veo (Google DeepMind) — 自带原生音频的视频生成
- Runway — 电影人的套件,以精准控制见长
- Kling 可灵 (快手) — 中国最强,全球广泛使用
- Pika、Luma、Hailuo海螺 — 快速易用的替代选择
里程碑
- 2023 — Runway Gen-2和Pika:首批可用的文生视频
- 2024年2月 — Sora亮相震撼行业:分钟级连贯场景
- 2024 — Kling与Veo跟进;物理真实感快速提升
- 2025 — Veo 3生成带声音的视频;Sora作为社交应用上线;AI广告登上电视
- 2026 — 角色一致性与多镜头叙事成为新前沿
- 2026年7-8月 — MiniMax H3以原生立体声同时生成人声、音效与音乐,随后开放权重并领跑主流视频排行榜
- 2026年8月 — FLUX 3 Video 全面开放:20秒片段,对话、音效与环境声一次生成
- 2026年8月 — 阿里万相Wan 3.0开启公测:单一模型把文档和网页变成30秒带声视频
- 2026年9月 — OpenAI 彻底关停 Sora:应用四月下线,接口9月24日停用,且未给出替代方案(我们的报道)
- 2026年10月 — Tavus Griffin实现实时视频对话,54名受试者中有一半误以为对面是真人(我们的报道)
小词典
- 扩散(Diffusion):通过逐步去噪来生成图像/视频的技术
- 世界模型:AI对物体与物理规律如何运作的内在理解
- 原生音频:与视频同步生成、而非事后添加的声音