Stable Video Diffusion
Stable Video Diffusion(SVD)是 Stability AI 于 2023 年底开源的图生视频模型,它把成熟的 Stable Diffusion 图像模型扩展为视频生成器,通过在 U-Net 中注入时间注意力层(temporal attention)实现帧间一致性。与 AnimateDiff 的”插件式运动模块”不同,SVD 是从头专门训练的视频模型,质量更高但灵活性更低。2024 年 Stability AI 又推出了 SVD 1.1(一致性增强版)和 Stable Video 4D(SV4D,多视角视频生成),2025 年进一步发布了 SV4D 2.0 和 Stable Virtual Camera(可控 3D 相机视频生成),持续拓展视频生成边界。前置阅读:扩散模型、AI 视频生成、Stable Diffusion 架构。
想象你在做一本翻页动画(flipbook)——
- 第一步:画好第一帧。SVD 先复用 Stable Diffusion 学到的图像生成能力,把输入图片当作”第一帧”的锚点。这一帧的质量决定了整段视频的画面基础——人物长相、色彩风格、构图都在这里锁定。具体来说,输入图片先经过 VAE 编码器(Variational Autoencoder,变分自编码器——一种将高维图像压缩到低维”潜空间”表示的神经网络)压缩成潜空间表示(latent representation),模型在潜空间而非像素空间做去噪,大幅降低计算量。
- 第二步:每翻一页只做微调。从第二帧开始,模型不再从零画图,而是在前一帧的基础上做微小调整——手臂抬高了 5 度、头发飘动了 2 厘米。这个”微调”由 temporal attention 层负责,它让每一帧都”看着”相邻帧,确保同一个物体不会突变。
- 第三步:帧间对齐。temporal attention 就像动画师的”定位钉”(registration peg)——把每一页纸的同一个位置对齐,让猫的耳朵在第 3 帧和第 4 帧出现在同一个坐标,而不是乱跳。
一句话总结:SVD = 图像模型画第一帧 + temporal attention 负责帧间对齐。 图像模型保证单帧质量,temporal attention 保证帧间连贯——两者分工合作,产出流畅视频。
架构基础:从图像扩散到视频扩散
Section titled “架构基础:从图像扩散到视频扩散”SVD 的骨架是 Stable Diffusion 的 U-Net(详见 U-Net 架构和 Stable Diffusion 架构)。原始 SD 的 U-Net 只处理单张图像——在空间维度(height × width)上做去噪。SVD 要处理的是一段视频——shape 为 (frames, channels, height, width) 的四维张量,多了”帧”这个时间维度。
潜空间扩散(Latent Diffusion)回顾:SD/SVD 不是直接在像素空间做扩散,而是在潜空间操作。VAE 编码器把一张 512×512×3 的图像压缩成 64×64×4 的潜空间张量(空间维度缩小 8 倍,通道从 3 扩到 4),在这个紧凑表示上做扩散去噪,最后再用 VAE 解码器还原成像素。潜空间(latent space)是模型内部的一种低维特征表示——可以理解为图像的”压缩编码”,保留了语义信息但去掉了高频冗余。这样做的好处是计算量降低了约 64 倍(8×8 的空间压缩),让扩散模型能在消费级 GPU 上运行。SVD 同样在潜空间工作,视频的潜空间张量 shape 为 (frames × 4 × H/8 × W/8),例如 25 帧、1024×576 分辨率对应 25×4×72×128。
核心问题:如何让原本只懂”空间”的模型理解”时间”? SVD 的答案是时间层注入(temporal layer injection)——不改动原有的空间层,而是在关键位置插入新的时间层。这种设计的巧妙之处在于:图像模型已学到的丰富空间知识(纹理、光照、物体结构)原封不动地保留,新插入的时间层从零开始学习”运动”概念——相当于在一位技艺精湛的画师身上,额外装一个”动画师的眼睛”。
时间层注入:在 spatial self-attention 之后插 temporal attention
Section titled “时间层注入:在 spatial self-attention 之后插 temporal attention”SD 的 U-Net 中每个 ResBlock 后面跟着 Spatial Self-Attention(空间自注意力),负责建模一张图内像素之间的关系(详见 注意力机制)。**自注意力(Self-Attention)**的核心思想是:对于序列中的每个元素,计算它与所有其他元素的关联权重(attention weight),然后加权求和——本质上是”谁和谁相关”。在图像中,“元素”是空间位置(像素或 patch),模型通过注意力学习”画面里哪个区域该和哪个区域配合”。
SVD 的做法是:在每个 spatial self-attention 之后,插入一个 temporal attention 层。 这些 temporal attention 层的结构与标准 attention 层完全相同——都由 Q(Query)、K(Key)、V(Value)三个线性投影 + multi-head softmax attention 组成——唯一区别是它们沿时间轴操作。训练时,temporal attention 的权重从近恒等映射(near-identity initialization)初始化——即初始状态下它们几乎不改变输入,让模型在训练初期表现得和纯图像模型一样,随着训练逐渐学会利用时间信息。这种初始化策略确保了注入的时间层不会破坏已学好的图像知识。
具体的数据流如下:
- 输入特征图 reshape 为 (batch, frames, channels, height, width)。
- Spatial attention:对每一帧独立做自注意力——第 t 帧内部像素之间交互。这一步和原始 SD 完全一样,输出仍是对单帧的特征增强。具体来说,把 (channels, height, width) 展平为 (height × width, channels) 的序列,做标准 self-attention 后恢复原 shape。
- Temporal attention:把特征图转置——交换 frames 维和空间维,使得每个空间位置 (h, w) 变成一个长度为 frames 的序列。然后沿 frames 维度做自注意力——对于每个空间位置 (h, w),模型同时看到第 1 帧、第 2 帧…第 N 帧的同一位置特征。这一步让帧与帧之间”对话”,学习运动模式。注意 temporal attention 操作的序列长度等于帧数(如 14 或 25),远小于空间 attention 的序列长度(如 72×128 = 9216),因此计算开销相对较小。
- 两个 attention 的输出相加,送入下一层。temporal attention 的输出通过**残差连接(residual connection)**加回输入——即
output = input + temporal_attention(input),这种跳跃连接让梯度更容易回传,是深度网络稳定训练的关键技巧。
用伪数学描述:设某层的输入特征为 z(shape 为 frames × channels × height × width),则
temporal attention 的关键在于:它让第 t 帧位置 (h, w) 的特征”看到”第 t-1 和 t+1 帧位置 (h, w) 的特征——从而知道”这个像素点在上一帧是什么样、下一帧应该变成什么样”。这就是帧间一致性的来源。
架构参数概览:SVD 的 U-Net 约有 15 亿参数,其中 temporal attention 层约占 10-15%。U-Net 包含 4 个下采样阶段(down blocks)和 4 个上采样阶段(up blocks),每个阶段中 spatial attention 和 temporal attention 交替出现。模型支持 576×1024(竖屏)和 1024×576(横屏)两种宽高比,帧数为 14(SVD base)或 25(SVD-XT)。
图像条件机制:如何让模型”看着第一帧”
Section titled “图像条件机制:如何让模型”看着第一帧””SVD 是图生视频(image-to-video)模型,关键问题是如何把输入图片的信息传递给去噪 U-Net。SVD 采用**条件帧拼接(condition frame concatenation)**策略:
- 输入图片经过 VAE 编码器得到潜空间表示 z_cond(shape: 4 × H/8 × W/8)。
- 待生成的视频帧初始化为随机噪声 z_noisy(shape: frames × 4 × H/8 × W/8)。
- 将条件帧 z_cond 沿通道维度拼接到噪声帧的每一帧上——即 z_input 的通道数从 4 变为 8(4 通道噪声 + 4 通道条件)。
- U-Net 的第一层(输入卷积)相应调整为接受 8 通道输入。条件帧的信息通过通道拼接传遍整个网络,每一层都能”看到”起始图。
此外,SVD 还使用 CLIP 图像嵌入(CLIP image embedding)作为辅助条件。CLIP(Contrastive Language-Image Pre-training)是 OpenAI 提出的图文对齐模型,能把图像编码成一个语义向量。SVD 提取输入图片的 CLIP 嵌入,通过 cross-attention(交叉注意力——让一组序列去”查询”另一组序列的信息)注入 U-Net,提供高层语义信号(如”这是一个人在跳舞”),与通道拼接的低层像素信息互补。
微条件参数(micro-conditioning):SVD 还引入了两个标量条件——FPS(帧率)和 motion bucket id(运动幅度桶)。它们通过类似时间嵌入(time embedding)的 sinusoidal 编码(正弦余弦位置编码)转化为向量,加到 U-Net 的每个 ResBlock 中。这让用户可以控制视频的播放速度和运动剧烈程度——这两个参数在推理时可调,是 SVD 与原始 SD 最显著的区别之一。
帧间一致性:为什么物体不会突变
Section titled “帧间一致性:为什么物体不会突变”如果没有 temporal attention,模型对每一帧独立去噪,结果就是 AnimateDiff 核心直觉里描述的”闪烁翻页书”——猫在第 3 帧突然变色,人物在第 7 帧变形。temporal attention 解决这个问题的机制是:强制相邻帧的同一空间位置共享信息。
举个具体例子:假设第 5 帧位置 (100, 200) 是人物的左眼。temporal attention 会让这个位置的特征同时”看到”第 4 帧和第 6 帧的 (100, 200) 位置。如果第 4 帧和第 6 帧这里都是眼睛,那么第 5 帧也被约束为眼睛——不会突变变成背景。这种跨帧的注意力绑定,就是帧间一致性的数学根源。
从信息论角度理解:temporal attention 在帧之间建立了信息通道,每帧的去噪过程不再是独立的,而是受到全局时间上下文的约束。这本质上是一种先验约束——“同一个空间位置在短时间内大概率是同一个物体”,模型利用这个先验来减少帧间的不合理变化。
训练流程三阶段
Section titled “训练流程三阶段”SVD 的训练遵循”从粗到精”的 curriculum(课程学习——先学简单/通用任务,再逐步过渡到难/特定任务),共三个阶段。训练使用的核心损失函数是标准的去噪扩散损失:给定一个加噪的潜空间视频 z_t(在原始潜空间表示上添加了 t 步高斯噪声),模型预测添加的噪声 ,损失为 ——即预测噪声与真实噪声的均方误差(MSE)。优化器使用 AdamW(带权重衰减的 Adam,是深度学习中最常用的自适应学习率优化器),配合 cosine learning rate schedule(余弦退火学习率调度)。
阶段一:预训练大规模视频数据。 首先收集海量视频。Stability AI 构建了 LVD(Large Video Dataset),包含约 10 亿视频片段的初始池,经过严格筛选去重后得到约 6 亿高质量样本。筛选管线包括:用光流(optical flow——估计相邻帧之间像素运动方向和速度的经典计算机视觉技术)计算运动密度,剔除静止画面和运动过于剧烈的片段;用 CLIP 计算文本-视频对齐度,过滤低质量标注;用美学评分模型筛选视觉精美片段;用检测器去除含水印、文字、低分辨率的样本。在此大规模数据上预训练 latent video diffusion 模型,让模型学会通用的运动规律——物体怎么移动、镜头怎么运动、光影怎么变化。这个阶段的目标是”广度”——覆盖尽可能多的场景和运动类型。
阶段二:高质量短视频微调。 从大规模数据中筛选出高质量子集(高分辨率、运动平滑、美学评分高),对模型做微调。这个阶段提升画面精美度和运动自然度,将视频长度固定为约 14 帧(576×1024 分辨率,约 4 秒短视频)。此阶段还引入了 CFG(Classifier-Free Guidance,无分类器引导) 训练——以一定概率随机丢弃条件(condition dropout),让模型同时学习有条件和无条件生成,推理时通过放大条件方向来提升生成质量与条件遵循度。
阶段三:特定任务微调(图生视频)。 在前两阶段的 base model 基础上,针对 image-to-video 任务做最后微调。训练时给定一张静态图作为条件帧(condition frame),模型学习如何从这一帧”生长”出后续运动帧。这一步让 SVD 专门擅长图生视频——给它一张照片,它能让照片里的场景动起来。SVD-XT(Extended)版本在此阶段进一步将帧数从 14 扩展到 25 帧(1024×576 分辨率),通过渐进式帧数扩展训练实现。
注意:SVD 是图生视频(image-to-video)模型,不是文生视频(text-to-video)模型。用户需要先提供一张起始图片,模型基于这张图生成约 4 秒的动态视频。这与 AnimateDiff 可以直接文生动画不同。
SVD 1.1:一致性增强版
Section titled “SVD 1.1:一致性增强版”2024 年 7 月,Stability AI 发布了 SVD 1.1(stable-video-diffusion-img2vid-xt-1-1)。这个版本在 SVD-XT(25 帧)基础上做了一轮针对性微调,核心改进是:固定推理条件为 6 FPS + Motion Bucket Id 127,让模型在这个”最佳工作点”上输出更加稳定一致的结果。此前 SVD 1.0 在不同 FPS 和 motion bucket 参数组合下输出质量波动较大,用户需要反复调参;SVD 1.1 通过在固定条件下做大量训练,使默认参数就能产出高质量视频,降低了使用门槛。这些条件参数仍然可调(没有被移除),只是在非默认组合下表现可能与 1.0 有差异。
与 Sora 的技术路线对比
Section titled “与 Sora 的技术路线对比”SVD 和 Sora 代表了视频生成的两条主流技术路线(详见 AI 视频生成):
| 维度 | SVD | Sora |
|---|---|---|
| 骨干架构 | U-Net + temporal attention | DiT(Diffusion Transformer) |
| 时间建模 | 在 self-attention 后插入 temporal attention 层 | 时空 patch 化,空间和时间统一处理 |
| 可扩展性 | U-Net 架构扩展性有限,参数增大收益递减 | Transformer 天然契合 scaling law,越大越强 |
| 成熟度 | 基于 SD 成熟生态,开源可用,社区工具丰富 | 闭源,技术报告为主,生态尚未开放 |
| 视频长度 | 约 4 秒(14-25 帧),可扩展但质量下降 | 最长 60 秒,物理理解强 |
| 输入模态 | 图生视频(需要起始图) | 文生视频(直接文本到视频) |
核心差异在架构选择:Sora 用 DiT 架构做时空 patch 化(详见 DiT 架构),把视频切成 3D 的时空 token 输入 Transformer,空间和时间被统一处理,天然受益于 scaling law——模型越大效果越好。SVD 用 U-Net + temporal attention,是在成熟图像模型上”打补丁”——空间和时间分两步处理,架构更复杂但基于 SD 的工程积累更深厚。
一句话:Sora 更易扩展,SVD 更成熟可用。 Sora 代表未来方向(scaling law 驱动),SVD 代表当下可落地的方案(开源、可部署、社区支持)。
2025 行业趋势更新:进入 2025 年后,视频生成领域的天平已明显向 DiT 架构倾斜。除了 OpenAI 的 Sora 之外,可灵(Kling)、Vidu、Pika 2.0、Google Veo 2/3 等新一代视频模型几乎全部采用 DiT 或 DiT+自回归混合架构,原生支持文生视频、长时长(10-60 秒)和高分辨率(1080p)。相比之下,SVD 的 U-Net + temporal attention 路线在 scaling 上遇到瓶颈,Stability AI 自身也在将重心转向基于 SD3/MMDiT 架构的下一代系统。SVD 的价值在于它是最成熟的开源图生视频基座,社区工具链(ComfyUI 节点、diffusers 封装、ControlNet 扩展)最完善,在本地部署、研究复现、定制微调场景中仍有不可替代的地位。
与 AnimateDiff 的对比
Section titled “与 AnimateDiff 的对比”SVD 和 AnimateDiff 都基于 Stable Diffusion,但设计哲学截然不同(详见 AnimateDiff):
- AnimateDiff = 轻量适配器:在 base SD 模型上插入 motion module(运动模块),不动原模型。优势是轻量灵活——任何 SD 1.5 模型、任何 LoRA、任何画风都能直接加动画,零额外训练。劣势是运动幅度和物理理解有限,帧数通常 16-32 帧。
- SVD = 专门训练的视频模型:从头在视频数据上训练 temporal attention 层,深度耦合图像模型。优势是质量高、运动自然、帧间一致性强。劣势是不灵活——只能做图生视频,不能随意换画风或叠加 LoRA。
打个比方:AnimateDiff 像给手机加装”防抖云台”——什么手机都能装,轻便灵活;SVD 像专门制造的”电影摄影机”——画质顶级但只能用指定镜头。
SVD 时间层注入架构
Section titled “SVD 时间层注入架构”Temporal Attention 如何实现帧间一致性
Section titled “Temporal Attention 如何实现帧间一致性”SVD 训练三阶段
Section titled “SVD 训练三阶段”SVD vs Sora vs AnimateDiff 路线对比
Section titled “SVD vs Sora vs AnimateDiff 路线对比”用 diffusers 运行 Stable Video Diffusion(图生视频)
Section titled “用 diffusers 运行 Stable Video Diffusion(图生视频)”import torch # PyTorch 深度学习框架from diffusers import StableVideoDiffusionPipeline, load_image # 扩散模型库from diffusers.utils import export_to_video # 视频导出工具
# 加载 SVD 1.1 模型(一致性增强版,25 帧,1024x576 分辨率)pipe = StableVideoDiffusionPipeline.from_pretrained( "stabilityai/stable-video-diffusion-img2vid-xt-1-1", torch_dtype=torch.float16, variant="fp16").to("cuda")
# 读取一张静态起始图片(作为视频第一帧的条件)image = load_image("https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/diffusers/svd/rocket.png")image = image.resize((1024, 576)) # 调整到模型所需分辨率
# 图生视频:从静态图生成 25 帧(约 4 秒)动态视频# motion_bucket_id 控制运动幅度(默认 127),noise_aug_strength 给起始图加少量噪声防僵硬frames = pipe( image, decode_chunk_size=8, motion_bucket_id=127, noise_aug_strength=0.02).frames[0]
# 导出为 mp4 视频文件export_to_video(frames, "svd_output.mp4", fps=7)print("视频生成完成: svd_output.mp4 (25帧, 约4秒)")# → 视频生成完成: svd_output.mp4 (25帧, 约4秒)参数说明:
motion_bucket_id控制运动幅度(值越大动作越剧烈,范围 0-255,默认 127);noise_aug_strength给起始图加少量噪声,防止模型过拟合第一帧导致画面僵硬——这个技巧背后的直觉是:如果模型完美复制第一帧,后续帧就没有”演化”空间;加入微量噪声相当于给模型一点”自由度”,让它敢做微小变化。decode_chunk_size控制 VAE 解码时的分块大小,值越小越省显存但越慢。显存不足时用enable_model_cpu_offload()和enable_vae_slicing()。
- 起始图质量决定视频质量:SVD 是图生视频模型,第一帧的构图、清晰度、美学质量直接决定输出。建议先用 Stable Diffusion 或 Midjourney 生成高质量起始图,再喂给 SVD。
- 运动幅度可控:
motion_bucket_id是最关键参数——值太小视频几乎静止(像 Ken Burns 效果),值太大画面抖动变形。建议从默认 127 开始,逐步调整。SVD 1.1 已针对 127 做了优化训练,建议优先使用默认值。 - 分辨率与帧数权衡:SVD 默认 1024×576 分辨率、25 帧(SVD-XT),约需 12GB+ 显存。显存不够可降到 576×1024、14 帧(SVD base 版本),或使用
enable_vae_slicing()减少 VAE 解码的峰值显存。 - FPS 参数的影响:
fps参数控制输出视频的帧率,SVD 1.1 在 6 FPS 下训练,推理时使用 6-8 FPS 效果最佳。设置过高 FPS(如 14)会导致画面”加速”且质量下降。 - 多次生成取最优:SVD 每次结果有随机性(因为初始噪声不同),同一张图多跑几次,挑最满意的视频。可以设置不同的随机种子(
generator=torch.Generator().manual_seed(42))来系统性地探索。 - 不要期待长视频:SVD 原生只生成约 4 秒。需要更长视频要用”最后一帧作为下一片段起始帧”的拼接策略,但累积误差会导致后期质量下降——通常 2-3 次拼接后就会出现明显的画面漂移和模糊。
- 配合 ControlNet 做精确控制:社区有 SVD + ControlNet 的扩展版本,可以用姿态、深度图精确控制视频中的运动轨迹。详见 ControlNet 与可控生成。
- 商用注意协议:SVD 采用 Stability AI 的社区许可协议(Community License):年收入 100 万美元以下的组织和个人可免费商用(含研究、非商用),超过此线需申请企业授权。部署前务必确认许可条款。
- 结合 ComfyUI 工作流:ComfyUI 有完善的 SVD 节点支持,可以串联图生图、放大、视频生成等节点做端到端工作流。
- 2025 年的新选择:如果需要更长时长或文生视频能力,可评估 Kling、Pika 2.0、Veo 等新一代 DiT 架构模型(大多通过 API 提供)。SVD 在需要本地部署、完全可控、数据不出本地的场景中仍是首选。
- 社交媒体短视频:用 SVD 把 AI 生成的精美插画变成 4 秒动态视频,发到抖音/B站/小红书,是 AI 绘画创作者的标配工作流。
- 产品广告动态化:电商把产品静帧图转为动态展示视频——服装模特微动、食品冒热气、汽车缓缓驶过,提升广告转化率。
- 影视分镜动态预览:导演用 AI 生成分镜图后,用 SVD 让分镜动起来,快速可视化镜头效果,辅助前期制作决策。
- Stability AI 官方 API:Stability AI 提供 SVD 的官方 API 服务,开发者无需自建 GPU 服务器即可调用图生视频能力。
- ComfyUI / Diffusers 本地部署:开发者和创作者在本地 GPU 上部署 SVD,配合 LoRA 微调实现特定风格的动态视频。
- 数字人与虚拟主播:用 SVD 给 AI 生成的虚拟形象添加微动效果(呼吸、眨眼、头发飘动),用于直播和短视频内容生产。
- Stable Video 4D(SV4D)——多视角 4D 重建:2024 年发布的 SV4D 基于 SVD + SV3D(Stable Video 3D),输入单视角物体视频即可生成多视角新视角视频(4D 图像矩阵),输出 40 帧(5 帧 × 8 个相机视角)的 576×576 分辨率结果。广泛用于 3D/4D 资产生成、游戏道具制作、电商产品 360 度展示。2025 年 5 月发布的 SV4D 2.0 在真实世界视频上进一步提升了输出质量,成为动态 4D 资产生成的主流开源方案。
- Stable Virtual Camera——可控 3D 相机视频:2025 年 3 月发布的 Stable Virtual Camera(研究预览版)是 SVD 技术线的最新延伸——一个多视角扩散模型,能把 2D 图片转化为带真实景深和透视的沉浸式 3D 视频,并支持 3D 相机轨迹控制(用户可指定相机运动路径),无需复杂的 3D 重建或场景级优化。
典型类库与工具
Section titled “典型类库与工具”| 类库 | 语言 | 说明 |
|---|---|---|
| StableVideoDiffusionPipeline (diffusers) | Python | HuggingFace diffusers 官方封装,一行代码调用 SVD / SVD 1.1 |
| ComfyUI-SVD 节点 | Python | ComfyUI 中运行 SVD 的工作流节点,支持串联其他节点 |
| stability-sdk | Python | Stability AI 官方 SDK,调用官方 API 服务 |
| Stable Video Diffusion 模型权重 | - | HuggingFace 托管的 SVD / SVD-XT / SVD 1.1 权重(fp16 版本) |
| SV4D 模型权重 | - | HuggingFace 上的 Stable Video 4D 权重,支持多视角视频生成 |
| AnimateDiff (diffusers) | Python | 替代方案——轻量动画生成,详见 AnimateDiff |
| 术语 | 英文 | 解释 |
|---|---|---|
| 时间层注入 | Temporal Layer Injection | 在 U-Net 的 spatial attention 后插入 temporal attention 层的技术 |
| 时间注意力 | Temporal Attention | 沿帧维度做 Self-Attention,让帧间同一位置特征交互 |
| 空间注意力 | Spatial Attention | 在单帧内像素间做注意力,SD 原有能力 |
| 帧间一致性 | Inter-frame Consistency | 连续帧的同一物体保持外观不变,不突变不闪烁 |
| 图生视频 | Image-to-Video (I2V) | 给定一张静态图作为起始帧,生成后续动态视频帧 |
| 运动桶 ID | Motion Bucket ID | SVD 中控制运动幅度的微条件参数,值越大动作越剧烈 |
| 噪声增强 | Noise Augmentation | 给起始图加少量噪声,防止模型过拟合第一帧 |
| 潜空间 | Latent Space | VAE 编码后的低维特征表示空间,扩散在此进行而非像素空间 |
| VAE | Variational Autoencoder | 变分自编码器,将图像压缩到潜空间并解码还原的神经网络 |
| CLIP | Contrastive Language-Image Pre-training | OpenAI 的图文对齐模型,将图像/文本编码为可比较的语义向量 |
| 残差连接 | Residual Connection | 将输入直接加到输出上(output = input + f(input)),帮助深层网络训练 |
| CFG | Classifier-Free Guidance | 无分类器引导——通过放大条件方向提升生成质量与条件遵循度 |
| 光流 | Optical Flow | 估计相邻帧间像素运动方向和速度的经典计算机视觉技术 |
| DiT | Diffusion Transformer | 用 Transformer 替代 U-Net 的扩散架构,Sora 采用,详见 DiT 架构 |
- Blattmann et al.,「Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets」(arXiv 2311.15127, 2023):SVD 原始论文,详细描述时间层注入架构、三阶段训练流程(大规模预训练 + 高质量微调 + 图生视频微调)、LVD 数据集的构建与筛选策略(光流过滤、CLIP 评分、美学过滤),以及”curated dataset > raw scale”的核心发现。
- Stability AI,「SVD 1.1 Model Card」(2024):SVD 1.1 的模型卡片,描述了固定 6 FPS + Motion Bucket 127 条件下的微调改进。模型权重位于
stabilityai/stable-video-diffusion-img2vid-xt-1-1。 - Stability AI,「Stable Video 4D Technical Report」(arXiv 2407.17470, 2024):SV4D 技术报告,基于 SVD + SV3D 实现单视角视频到多视角 4D 视频矩阵的生成,项目主页 sv4d.github.io。
- Stability AI,「Stable Video 4D 2.0」(2025):SV4D 2.0 升级版,在真实世界视频上实现更高质量的多视角与 4D 生成。
- Stability AI,「Stable Virtual Camera」(2025):多视角扩散模型,从 2D 图片生成可控 3D 相机轨迹的沉浸式视频,研究预览阶段。
- Brooks et al.,「Video Generation Models as World Simulators」(OpenAI 技术报告, 2024):Sora 技术报告,提出 DiT + 时空 patch 架构,与 SVD 的 U-Net + temporal attention 路线形成鲜明对比。详见 DiT 架构。
- Guo et al.,「AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning」(arXiv 2307.04725, 2023):AnimateDiff 论文,提出可插拔 motion module,与 SVD 的专门训练路线对比。详见 AnimateDiff。
- Ho et al.,「Video Diffusion Models」(arXiv 2204.03458, 2022):Google 的早期视频扩散论文,首次提出在空间-时间联合维度上做扩散的思想,是 SVD 的理论前身。
- Singer et al.,「Make-A-Video: Text-to-Video Generation without Text-Matched Videos」(arXiv 2209.14792, 2022):Meta 的文生视频模型,用时空 patch + 解码器架构,是 video diffusion 的里程碑工作。
- 延伸路线:SVD 建立在 扩散模型 的理论基础上,使用 U-Net 架构 和 Stable Diffusion 的图像能力,可与 ControlNet 结合做可控视频生成。视频生成全景见 AI 视频生成。