AI 视频生成
AI 视频生成是生成式 AI 最前沿的模态——Sora 证明了用 DiT(Diffusion Transformer)架构可以生成长达一分钟、物理合理的连贯视频。它属于 生成式 AI 概览 中视频模态的分支,是 扩散模型 从图像(2D 空间)向时空(3D)扩展的产物。
视频 = 一系列连贯的图像帧 + 时间维度的运动。 文生视频的核心挑战是时间一致性(temporal consistency):人物不能在相邻帧间变形(上一秒穿红衣,下一秒变蓝衣),物体不能凭空消失或出现。
理解关键概念:
- 空间 patch:把图像切成小块(patch)输入 Transformer——这是 Vision Transformer(ViT)的经典做法。每个 patch 可以理解为图像的一个局部”感知单元”,类似 LLM 中的一个 token。Sora 的创新在于扩展为时空 patch——在帧序列上切 3D 块(例如 2×2 像素 × 4 帧),让模型同时处理空间和时间两个维度。这种”视频 token 化”使得 Transformer 能像处理文本一样处理视频。
- DiT(Diffusion Transformer):用 Transformer 替换 U-Net 作为扩散模型的骨架。U-Net 是图像扩散模型(如 Stable Diffusion)的传统选择,其卷积结构难以高效 scaling;而 Transformer 具有更好的 scaling law(参数越多、数据越多,效果越好),当模型参数从 1B 扩展到 30B+ 时,视频的逼真度和连贯性显著提升。
- 自回归 vs 扩散:扩散模型(如 Sora、Wan2.1、HunyuanVideo)从随机噪声逐步去噪,一次性生成整段视频(所有帧同时存在),天然具备全局时间一致性;自回归模型(如 VideoPoet、Sora 2 的部分能力)逐帧或逐 token 生成,每帧依赖前一帧,灵活但容易累积误差。2025 年的趋势是两种范式融合——用自回归方式生成关键帧或高层语义,再用扩散模型填充帧间细节。
- 潜空间(Latent Space):直接在像素空间做视频扩散计算量巨大(一段 5 秒 720p 视频有约 100 万个像素值)。因此先用 VAE(变分自编码器)将视频压缩到低维潜空间,在潜空间中执行扩散去噪,最后解码回像素。3D VAE 将视频在时间维度压缩 4 倍、空间维度压缩 8 倍、通道维度压缩 16 倍,显著降低计算开销。
视频生成技术谱系
Section titled “视频生成技术谱系”从 GAN 到扩散再到 DiT,视频质量与时长不断突破:
Sora 架构概念
Section titled “Sora 架构概念”Sora 将视频压缩为时空 patch token,再用 DiT 逐步去噪生成:
Sora 的关键洞见:把视频当作时空中的 patch 序列,与 LLM 把文本当作 token 序列异曲同工——统一的 token 化让模型能受益于 Transformer 的 scaling law(参数越多、数据越多,效果越好)。
现代 DiT 视频模型完整流水线(2025 范式)
Section titled “现代 DiT 视频模型完整流水线(2025 范式)”以 Wan2.1 / HunyuanVideo 为代表的开源模型已建立了一套成熟的流水线:
这一流水线的每个组件都值得深入理解:
1. 文本编码器
Section titled “1. 文本编码器”早期模型(如 Stable Diffusion)使用 CLIP(Contrastive Language-Image Pre-training)——一个将图像和文本映射到同一向量空间的模型,通过对比学习训练。CLIP 的文本理解能力有限(77 token 限制)。
现代视频模型普遍转向 T5-XXL(Text-to-Text Transfer Transformer,谷歌开发的通用文本编码器),它能处理长文本、理解复杂语义。Wan2.1 使用多语言版 umt5-xxl,支持中英文混合提示。HunyuanVideo 进一步创新性地使用 MLLM(多模态大语言模型,如 LLaVA)作为文本编码器,优势在于:经过视觉指令微调的 MLLM 天然具有更好的图文对齐能力;同时可通过系统提示做 zero-shot 指令引导,让文本特征更聚焦于关键信息。不过 MLLM 采用因果注意力(causal attention,只看前面 token),所以 HunyuanVideo 额外加入了双向 token refiner 来增强文本引导效果。
2. 3D 因果 VAE(Causal 3D VAE)
Section titled “2. 3D 因果 VAE(Causal 3D VAE)”VAE(变分自编码器) 是一种将高维数据压缩到低维”潜空间”的编码-解码网络。视频专用的 3D VAE 在空间(H, W)和时间(T)三个维度上同时压缩。
因果(Causal) 的含义:VAE 解码时第 t 帧的重建只依赖于第 0 到 t 帧的信息,而不”偷看”未来帧。这模拟了因果推理的物理约束,同时使得模型可以处理任意长度的视频(不会因为长度变化而丢失历史时序信息)。Wan2.1 的 Wan-VAE 可以编码和解码任意长度的 1080P 视频,压缩比设置为时间 ×4、空间 ×8、通道 ×16。
3. DiT 主干网络与 Flow Matching
Section titled “3. DiT 主干网络与 Flow Matching”Flow Matching 是 2024-2025 年逐渐取代传统 DDPM/DDIM 的训练框架。传统扩散模型定义前向加噪和反向去噪为马尔可夫链;Flow Matching 将其推广为连续的概率流(probability flow)——学习一个向量场将简单分布(高斯噪声)“搬运”到复杂分布(真实视频潜变量)。数学上,它最小化神经网络预测的向量场与最优传输路径之间的差距。好处是训练更稳定、采样步数更少、轨迹更直。
DiT 的具体结构有两种主流设计:
-
交叉注意力(Cross-Attention)型(Wan2.1 采用):每个 Transformer block 中,视频 token 做自注意力(self-attention),文本条件通过交叉注意力注入。每个 block 还有一个共享 MLP(多层感知机)处理时间步嵌入,预测 6 个调制参数(如 adaLN-Zero 的 scale 和 shift),对视频 token 做 adaptive layer normalization(自适应层归一化——根据条件动态调整每层的归一化参数)。
-
双流到单流(Dual-stream to Single-stream)型(HunyuanVideo 采用):先让视频 token 和文本 token 分别通过若干”双流”block 独立处理(各模态学习自己的调制机制,互不干扰),然后将两者拼接后送入”单流”block 做深度融合。这种设计能更好地捕获视觉和语义之间的复杂交互。
4. 训练流程与数据
Section titled “4. 训练流程与数据”现代视频 DiT 的训练通常分多个阶段:
- 图像预训练:先用海量图像数据训练图像生成能力(如 LAION-5B 级别数据集),建立视觉基础。
- 视频微调:加入带文本标注的视频数据(如 WebVid-10M、Panda-70M、HDVILA-100M),学习时序动态。
- 联合训练:图像和视频数据混合训练,确保模型同时保持图像质量和视频动态。
- 高质量数据精调:用经人工筛选的高质量、高分辨率视频做最后阶段微调。
数据清洗是关键瓶颈。Wan2.1 设计了四步清洗流水线:基础维度过滤(分辨率、时长)→ 视觉质量过滤(美学评分、清晰度)→ 运动质量过滤(光流一致性、运动幅度)→ 去重。HunyuanVideo 也强调数据 curration 对最终质量的决定性影响。
Prompt Rewrite(提示重写) 是一项重要的工程技巧:用户提示风格各异、长短不一,模型先用一个 LLM(如 Qwen 或 Hunyuan-Large)将用户提示重写为模型偏好的标准格式(补充构图、光照、镜头运动的描述),再输入视频模型。Wan2.1 和 HunyuanVideo 都内置了这一功能。
调用视频生成 API(概念伪代码)
Section titled “调用视频生成 API(概念伪代码)”import requests # 导入 HTTP 库
# 以 Runway Gen-3 / Pika 等视频生成 API 为例(概念演示)API_URL = "https://api.example.com/v1/video/generate"headers = {"Authorization": "Bearer YOUR_API_KEY"}
# 文本提示词描述想要的视频画面payload = { "prompt": "一只柯基在夕阳下的沙滩上奔跑,慢动作,电影质感", "duration": 5, # 生成 5 秒 "resolution": "1080p",}
response = requests.post(API_URL, json=payload, headers=headers)print("视频下载链接:", response.json()["video_url"])⚠️ 上述为概念伪代码,各平台 API 格式不同。本地部署可用 HuggingFace Diffusers 的
StableVideoDiffusionPipeline或 AnimateDiff 生成短视频。
使用 Wan2.1 通过 Diffusers 生成视频(2025 实战代码)
Section titled “使用 Wan2.1 通过 Diffusers 生成视频(2025 实战代码)”Wan2.1 是阿里巴巴在 2025 年 2 月开源的视频基础模型,1.3B 版本仅需 8.19 GB 显存即可在消费级 GPU(如 RTX 4090)上运行,生成 5 秒 480P 视频约需 4 分钟:
import torchfrom diffusers.utils import export_to_videofrom diffusers import AutoencoderKLWan, WanPipelinefrom diffusers.schedulers.scheduling_unipc_multistep import UniPCMultistepScheduler
# 加载 Wan2.1 文生视频模型(14B 版本)model_id = "Wan-AI/Wan2.1-T2V-14B-Diffusers"vae = AutoencoderKLWan.from_pretrained(model_id, subfolder="vae", torch_dtype=torch.float32)
# Flow Matching 调度器:720P 用 flow_shift=5.0,480P 用 3.0flow_shift = 5.0scheduler = UniPCMultistepScheduler( prediction_type='flow_prediction', use_flow_sigmas=True, num_train_timesteps=1000, flow_shift=flow_shift)pipe = WanPipeline.from_pretrained(model_id, vae=vae, torch_dtype=torch.bfloat16)pipe.scheduler = schedulerpipe.to("cuda")
prompt = "一只柯基在夕阳下的沙滩上奔跑,慢动作,电影质感,金色光线"negative_prompt = "色调过亮,过曝,静止,模糊,字幕,低质量,畸形"
output = pipe( prompt=prompt, negative_prompt=negative_prompt, height=720, width=1280, num_frames=81, # 约 5 秒 @ 16fps guidance_scale=5.0,).frames[0]export_to_video(output, "corgi_sunset.mp4", fps=16)💡 Wan2.1 支持 Text-to-Video、Image-to-Video、First-Last-Frame-to-Video 以及 VACE(视频创建与编辑统一模型),覆盖了视频生成的主要任务。其 prompt extension 功能可用 Qwen 模型自动扩写用户提示,丰富视频细节。
- 提示词工程:描述镜头运动(“镜头缓慢推近”)、光照(“金色夕阳逆光”)、风格(“电影级、浅景深”)、主体动作细节。负面提示词排除”静止、模糊、畸形”。模型偏好详细的英文或中文描述。
- 分辨率与帧数的权衡:更高分辨率(1080P vs 480P)和更多帧数(129 帧 vs 81 帧)显著增加显存和推理时间。Wan2.1 的 14B 模型生成 720P×129 帧需约 60 GB 显存;1.3B 模型配合 CPU offload 可在 24 GB 显存的 RTX 4090 上运行。
- 推理加速:社区发展了大量加速技术——TeaCache(缓存中间 step 的注意力结果,约 2 倍加速)、FP8 量化(节省约 10 GB 显存)、多 GPU 并行(如 xDiT 的 Unified Sequence Parallelism,8 卡可 5.6 倍加速)、一致性蒸馏(减少采样步数)。
- 显存不足时的策略:启用
--offload_model将模型部分卸载到 CPU;使用--t5_cpu让文本编码器在 CPU 运行;使用 1.3B 小模型替代 14B;降低分辨率到 480P。 - 长视频生成:生成超过模型原生时长(通常 5-10 秒)的视频需要特殊策略——分块生成 + 帧重叠拼接(overlap-and-blend)、自回归续帧(用已生成帧作为条件继续生成下一片段)、或 RIFLEx(位置编码外推,无需重新训练即可延长视频)。
- 版权与伦理:视频生成模型可能被用于制作 deepfake 虚假视频。2026 年 Seedance 2.0 引发的 Brad Pitt vs Tom Cruise 打斗视频病毒传播事件,促使 MPA(美国电影协会)公开谴责版权侵权问题。生产环境中应加入水印、内容审核和来源标注。
- Sora / Sora 2(OpenAI):一句话生成长达 60 秒的电影级视频,物理合理、镜头连贯。2025 年 Sora 2 在视频质量和物理模拟方面进一步提升,颠覆影视预览流程。
- Google Veo 3(2025 年 5 月):首次将高质量音频生成原生集成到视频模型中——同步生成环境音、配音和背景音乐,解决了以往视频模型”无声”的长期短板。
- Runway Gen-4(2025 年 3 月):突破性的角色跨镜头一致性——同一角色在不同场景中保持外观一致,解决了 AI 视频最大的实际痛点之一。
- Wan2.1(阿里巴巴,2025 年 2 月):开源 SOTA 视频基础模型,支持文生视频、图生视频、首尾帧生视频、视频编辑(VACE),1.3B 版本可在消费级 GPU 上运行。Apache 2.0 许可证,社区生态极其活跃。
- HunyuanVideo(腾讯,2024 年 12 月):130 亿参数的开源视频模型,采用”双流到单流”架构和 MLLM 文本编码器,人工评测超越 Runway Gen-3、Luma 1.6 等闭源模型。2025 年 11 月更新至 1.5 版本。
- 可灵 Kling(快手)/ Vidu(生数科技)/ MiniMax:国产视频生成模型,中文提示理解强,支持长视频和高分辨率。Kling 已向国际用户开放。
- Seedance 2.0 / 2.5(字节跳动,2026 年):2026 年 2 月发布的 Seedance 2.0 以逼真的运动和镜头控制引发关注;7 月发布的 2.5 版本支持原生 30 秒 4K 视频生成、50 个多模态参考输入、局部编辑(只修改特定区域而不重新生成整个片段),以及 beta 模式下长达 3 分钟的长视频。
- LTX Video / LTX-2(Lightricks,2025 年):开源模型,支持生成最长 60 秒的视频。LTX-2 在 2025 年 10 月发布,内置音频生成能力。
- 广告 / 影视特效预览:广告公司用 AI 快速生成创意视频分镜,导演用 AI 可视化拍摄方案,大幅缩短前期制作周期。2025-2026 年出现了首部完全由 AI 生成视觉的电视剧(印度神话剧《Mahabharat: Ek Dharmayudh》,100 集)和电影。
- 世界模型(World Models):视频生成模型被视为理解物理世界规律的潜在路径。基于 Wan2.1 的 DriVerse 等项目已探索将视频模型用于自动驾驶场景预测,标志着视频生成从”好看”走向”理解世界”。
典型类库与工具
Section titled “典型类库与工具”| 类库 | 语言 | 说明 |
|---|---|---|
| Wan2.1 | Python | 阿里巴巴开源视频基础模型,Apache 2.0,支持 T2V/I2V/VACE,1.3B 版本兼容消费级 GPU |
| HunyuanVideo | Python | 腾讯开源 13B 视频模型,“双流到单流”架构,已集成 Diffusers |
| Stable Video Diffusion | Python | Stability AI 开源的图生视频扩散模型,基于 Diffusers 调用 |
| AnimateDiff | Python | 为现有文生图模型添加运动模块,生成短视频动画 |
| CogVideoX | Python | 智谱 AI 开源的视频生成模型,支持中英双语提示 |
| LTX Video | Python | Lightricks 开源视频模型,支持 60 秒长视频和音频生成 |
| xDiT | Python | 多 GPU 并行推理引擎,支持 Wan2.1、HunyuanVideo 等模型的序列并行加速 |
| Diffusers | Python | HuggingFace 扩散模型库,提供 Wan2.1、SVD、AnimateDiff 等 video pipeline |
| Runway Python SDK | Python | Runway 官方 API 封装,程序化调用 Gen-3/Gen-4 视频生成 |
| 术语 | 英文 | 解释 |
|---|---|---|
| 时间一致性 | Temporal Consistency | 视频中同一物体在不同帧间保持外观一致,是视频生成的核心挑战 |
| 运动矢量 | Motion Vector | 描述帧间像素位移的向量场,传统视频编码的核心概念 |
| 帧间一致性 | Inter-frame Coherence | 相邻帧之间画面平滑过渡,无突变或闪烁 |
| 时空 patch | Spatiotemporal Patch | 在空间(H×W)和时间(T)三个维度上切分视频得到的 3D 块,是 DiT 视频模型的基本输入单元 |
| DiT | Diffusion Transformer | 用 Transformer 替换 U-Net 作为扩散模型骨架的架构,Sora / Wan2.1 / HunyuanVideo 的核心 |
| Flow Matching | Flow Matching | 用连续概率流训练生成模型的框架,学习向量场将噪声分布搬运到数据分布,比传统 DDPM 训练更稳定、采样更快 |
| 视频扩散 | Video Diffusion | 将扩散模型从图像扩展到视频,在时空维度上逐步去噪 |
| 3D 因果 VAE | Causal 3D VAE | 在时间、空间、通道三维度压缩视频的变分自编码器,“因果”指解码时只依赖历史帧,支持任意长度视频处理 |
| 双流到单流 | Dual-stream to Single-stream | HunyuanVideo 的架构设计:视频和文本 token 先各自独立处理,再拼接融合,提升多模态交互质量 |
| 自适应层归一化 | Adaptive Layer Normalization (adaLN) | 根据条件(如时间步、文本)动态生成归一化的 scale/shift 参数的机制,是 DiT 的标准组件 |
| 帧率 | FPS (Frames Per Second) | 每秒显示的帧数,常见 24/30/60fps |
| 长视频生成 | Long Video Generation | 生成数十秒到分钟的连贯视频,核心难点在于保持全程一致性 |
| 摄像机控制 | Camera Control | 精确控制生成视频中的镜头运动(推拉摇移),是视频生成的前沿方向 |
| 提示重写 | Prompt Rewrite | 用 LLM 将用户提示改写为模型偏好的标准格式,补充构图、光照、运动细节的工程技巧 |
| 世界模型 | World Model | 能够模拟物理世界动态规律的生成模型,视频生成被视为实现世界模型的潜在路径 |
- Sora 技术报告:Brooks, T. et al. (2024). Video Generation Models as World Simulators. OpenAI 技术报告。 —— 提出 DiT + 时空 Patch 架构,展示了视频模型理解物理世界的潜力。
- Wan2.1 技术报告:Wan Team (2025). Wan: Open and Advanced Large-Scale Video Generative Models. arXiv:2503.20314. —— 2025 年最具影响力的开源视频模型,系统阐述了 3D 因果 VAE、Flow Matching DiT 和大规模数据工程。
- HunyuanVideo:Kong, W. et al. (2024). HunyuanVideo: A Systematic Framework for Large Video Generative Models. arXiv:2412.03603. —— 13B 开源模型,提出”双流到单流”混合架构和 MLLM 文本编码器。
- Stable Video Diffusion:Blattmann, A. et al. (2023). Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets. Stability AI. —— 开源的高质量图生视频模型,社区二次开发的基础。
- AnimateDiff:Guo, Y. et al. (2023). AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning. —— 为个性化 T2I 模型添加运动模块的通用方案。
- Make-A-Video:Singer, U. et al. (2022). Make-A-Video: Text-to-Video Generation without Text-Matched Videos. Meta AI. —— 早期文生视频扩散模型的代表。
- Flow Matching:Lipman, Y. et al. (2023). Flow Matching for Generative Modeling. arXiv:2210.02747. —— Flow Matching 理论框架的奠基论文,已成为现代视频扩散模型的主流训练范式。
- 延伸路线:视频生成建立在 扩散模型 的理论基础上;同属音频/视频模态的还有 AI 音乐生成。