这是什么?
AI视频生成把文字或图片变成动态影像。三年间,它从噩梦般的2秒片段进化到带原生音频、角色一致、可控运镜的分钟级场景。它正在重塑广告、电影预演和社交媒体——同时也加剧了深度伪造之争。
关键工具与玩家
- Sora (OpenAI) — 文生视频及围绕它构建的社交应用
- Veo (Google DeepMind) — 自带原生音频的视频生成
- Runway — 电影人的套件,以精准控制见长
- Kling 可灵 (快手) — 中国最强,全球广泛使用
- Pika、Luma、Hailuo海螺 — 快速易用的替代选择
里程碑
- 2023 — Runway Gen-2和Pika:首批可用的文生视频
- 2024年2月 — Sora亮相震撼行业:分钟级连贯场景
- 2024 — Kling与Veo跟进;物理真实感快速提升
- 2025 — Veo 3生成带声音的视频;Sora作为社交应用上线;AI广告登上电视
- 2026 — 角色一致性与多镜头叙事成为新前沿
- 2026年7月 — MiniMax H3:人声、音效与音乐随画面一同生成原生立体声的2K片段;承诺开放权重
- 2026年8月 — H3兑现承诺:权重发布,成为首个领跑主流视频排行榜的开放模型
- 2026年8月 — FLUX 3 Video 全面开放:20秒片段,对话、音效与环境声一次生成,十余种语言唇形同步
- 2026年8月 — 阿里万相Wan 3.0开启公测:单一统一模型把文档、PPT和网页变成30秒带声视频
小词典
- 扩散(Diffusion):通过逐步去噪来生成图像/视频的技术
- 世界模型:AI对物体与物理规律如何运作的内在理解
- 原生音频:与视频同步生成、而非事后添加的声音