Skip to content

Stable Video Diffusion

Stable Video Diffusion(SVD)是 Stability AI 于 2023 年底开源的图生视频模型,它把成熟的 Stable Diffusion 图像模型扩展为视频生成器,通过在 U-Net 中注入时间注意力层(temporal attention)实现帧间一致性。与 AnimateDiff 的”插件式运动模块”不同,SVD 是从头专门训练的视频模型,质量更高但灵活性更低。2024 年 Stability AI 又推出了 SVD 1.1(一致性增强版)和 Stable Video 4D(SV4D,多视角视频生成),2025 年进一步发布了 SV4D 2.0 和 Stable Virtual Camera(可控 3D 相机视频生成),持续拓展视频生成边界。前置阅读:扩散模型、AI 视频生成、Stable Diffusion 架构。

想象你在做一本翻页动画(flipbook)——

  • 第一步:画好第一帧。SVD 先复用 Stable Diffusion 学到的图像生成能力,把输入图片当作”第一帧”的锚点。这一帧的质量决定了整段视频的画面基础——人物长相、色彩风格、构图都在这里锁定。具体来说,输入图片先经过 VAE 编码器(Variational Autoencoder,变分自编码器——一种将高维图像压缩到低维”潜空间”表示的神经网络)压缩成潜空间表示(latent representation),模型在潜空间而非像素空间做去噪,大幅降低计算量。
  • 第二步:每翻一页只做微调。从第二帧开始,模型不再从零画图,而是在前一帧的基础上做微小调整——手臂抬高了 5 度、头发飘动了 2 厘米。这个”微调”由 temporal attention 层负责,它让每一帧都”看着”相邻帧,确保同一个物体不会突变。
  • 第三步:帧间对齐。temporal attention 就像动画师的”定位钉”(registration peg)——把每一页纸的同一个位置对齐,让猫的耳朵在第 3 帧和第 4 帧出现在同一个坐标,而不是乱跳。

一句话总结:SVD = 图像模型画第一帧 + temporal attention 负责帧间对齐。 图像模型保证单帧质量,temporal attention 保证帧间连贯——两者分工合作,产出流畅视频。

架构基础:从图像扩散到视频扩散

Section titled “架构基础:从图像扩散到视频扩散”

SVD 的骨架是 Stable Diffusion 的 U-Net(详见 U-Net 架构和 Stable Diffusion 架构)。原始 SD 的 U-Net 只处理单张图像——在空间维度(height × width)上做去噪。SVD 要处理的是一段视频——shape 为 (frames, channels, height, width) 的四维张量,多了”帧”这个时间维度。

潜空间扩散(Latent Diffusion)回顾:SD/SVD 不是直接在像素空间做扩散,而是在潜空间操作。VAE 编码器把一张 512×512×3 的图像压缩成 64×64×4 的潜空间张量(空间维度缩小 8 倍,通道从 3 扩到 4),在这个紧凑表示上做扩散去噪,最后再用 VAE 解码器还原成像素。潜空间(latent space)是模型内部的一种低维特征表示——可以理解为图像的”压缩编码”,保留了语义信息但去掉了高频冗余。这样做的好处是计算量降低了约 64 倍(8×8 的空间压缩),让扩散模型能在消费级 GPU 上运行。SVD 同样在潜空间工作,视频的潜空间张量 shape 为 (frames × 4 × H/8 × W/8),例如 25 帧、1024×576 分辨率对应 25×4×72×128。

核心问题:如何让原本只懂”空间”的模型理解”时间”? SVD 的答案是时间层注入(temporal layer injection)——不改动原有的空间层,而是在关键位置插入新的时间层。这种设计的巧妙之处在于:图像模型已学到的丰富空间知识(纹理、光照、物体结构)原封不动地保留,新插入的时间层从零开始学习”运动”概念——相当于在一位技艺精湛的画师身上,额外装一个”动画师的眼睛”。

时间层注入:在 spatial self-attention 之后插 temporal attention

Section titled “时间层注入:在 spatial self-attention 之后插 temporal attention”

SD 的 U-Net 中每个 ResBlock 后面跟着 Spatial Self-Attention(空间自注意力),负责建模一张图内像素之间的关系(详见 注意力机制)。**自注意力(Self-Attention)**的核心思想是:对于序列中的每个元素,计算它与所有其他元素的关联权重(attention weight),然后加权求和——本质上是”谁和谁相关”。在图像中,“元素”是空间位置(像素或 patch),模型通过注意力学习”画面里哪个区域该和哪个区域配合”。

SVD 的做法是:在每个 spatial self-attention 之后,插入一个 temporal attention 层。 这些 temporal attention 层的结构与标准 attention 层完全相同——都由 Q(Query)、K(Key)、V(Value)三个线性投影 + multi-head softmax attention 组成——唯一区别是它们沿时间轴操作。训练时,temporal attention 的权重从近恒等映射(near-identity initialization)初始化——即初始状态下它们几乎不改变输入,让模型在训练初期表现得和纯图像模型一样,随着训练逐渐学会利用时间信息。这种初始化策略确保了注入的时间层不会破坏已学好的图像知识。

具体的数据流如下:

  1. 输入特征图 reshape 为 (batch, frames, channels, height, width)。
  2. Spatial attention:对每一帧独立做自注意力——第 t 帧内部像素之间交互。这一步和原始 SD 完全一样,输出仍是对单帧的特征增强。具体来说,把 (channels, height, width) 展平为 (height × width, channels) 的序列,做标准 self-attention 后恢复原 shape。
  3. Temporal attention:把特征图转置——交换 frames 维和空间维,使得每个空间位置 (h, w) 变成一个长度为 frames 的序列。然后沿 frames 维度做自注意力——对于每个空间位置 (h, w),模型同时看到第 1 帧、第 2 帧…第 N 帧的同一位置特征。这一步让帧与帧之间”对话”,学习运动模式。注意 temporal attention 操作的序列长度等于帧数(如 14 或 25),远小于空间 attention 的序列长度(如 72×128 = 9216),因此计算开销相对较小。
  4. 两个 attention 的输出相加,送入下一层。temporal attention 的输出通过**残差连接(residual connection)**加回输入——即 output = input + temporal_attention(input),这种跳跃连接让梯度更容易回传,是深度网络稳定训练的关键技巧。

用伪数学描述:设某层的输入特征为 z(shape 为 frames × channels × height × width),则

zspatial=SpatialAttention(z)z_{\text{spatial}} = \text{SpatialAttention}(z) ztemporal=TemporalAttention(zspatial)z_{\text{temporal}} = \text{TemporalAttention}(z_{\text{spatial}}) zout=z+zspatial+ztemporalz_{\text{out}} = z + z_{\text{spatial}} + z_{\text{temporal}}

temporal attention 的关键在于:它让第 t 帧位置 (h, w) 的特征”看到”第 t-1 和 t+1 帧位置 (h, w) 的特征——从而知道”这个像素点在上一帧是什么样、下一帧应该变成什么样”。这就是帧间一致性的来源。

架构参数概览:SVD 的 U-Net 约有 15 亿参数,其中 temporal attention 层约占 10-15%。U-Net 包含 4 个下采样阶段(down blocks)和 4 个上采样阶段(up blocks),每个阶段中 spatial attention 和 temporal attention 交替出现。模型支持 576×1024(竖屏)和 1024×576(横屏)两种宽高比,帧数为 14(SVD base)或 25(SVD-XT)。

图像条件机制:如何让模型”看着第一帧”

Section titled “图像条件机制:如何让模型”看着第一帧””

SVD 是图生视频(image-to-video)模型,关键问题是如何把输入图片的信息传递给去噪 U-Net。SVD 采用**条件帧拼接(condition frame concatenation)**策略:

  1. 输入图片经过 VAE 编码器得到潜空间表示 z_cond(shape: 4 × H/8 × W/8)。
  2. 待生成的视频帧初始化为随机噪声 z_noisy(shape: frames × 4 × H/8 × W/8)。
  3. 将条件帧 z_cond 沿通道维度拼接到噪声帧的每一帧上——即 z_input 的通道数从 4 变为 8(4 通道噪声 + 4 通道条件)。
  4. U-Net 的第一层(输入卷积)相应调整为接受 8 通道输入。条件帧的信息通过通道拼接传遍整个网络,每一层都能”看到”起始图。

此外,SVD 还使用 CLIP 图像嵌入(CLIP image embedding)作为辅助条件。CLIP(Contrastive Language-Image Pre-training)是 OpenAI 提出的图文对齐模型,能把图像编码成一个语义向量。SVD 提取输入图片的 CLIP 嵌入,通过 cross-attention(交叉注意力——让一组序列去”查询”另一组序列的信息)注入 U-Net,提供高层语义信号(如”这是一个人在跳舞”),与通道拼接的低层像素信息互补。

微条件参数(micro-conditioning):SVD 还引入了两个标量条件——FPS(帧率)和 motion bucket id(运动幅度桶)。它们通过类似时间嵌入(time embedding)的 sinusoidal 编码(正弦余弦位置编码)转化为向量,加到 U-Net 的每个 ResBlock 中。这让用户可以控制视频的播放速度和运动剧烈程度——这两个参数在推理时可调,是 SVD 与原始 SD 最显著的区别之一。

帧间一致性:为什么物体不会突变

Section titled “帧间一致性:为什么物体不会突变”

如果没有 temporal attention,模型对每一帧独立去噪,结果就是 AnimateDiff 核心直觉里描述的”闪烁翻页书”——猫在第 3 帧突然变色,人物在第 7 帧变形。temporal attention 解决这个问题的机制是:强制相邻帧的同一空间位置共享信息。

举个具体例子:假设第 5 帧位置 (100, 200) 是人物的左眼。temporal attention 会让这个位置的特征同时”看到”第 4 帧和第 6 帧的 (100, 200) 位置。如果第 4 帧和第 6 帧这里都是眼睛,那么第 5 帧也被约束为眼睛——不会突变变成背景。这种跨帧的注意力绑定,就是帧间一致性的数学根源。

从信息论角度理解:temporal attention 在帧之间建立了信息通道,每帧的去噪过程不再是独立的,而是受到全局时间上下文的约束。这本质上是一种先验约束——“同一个空间位置在短时间内大概率是同一个物体”,模型利用这个先验来减少帧间的不合理变化。

SVD 的训练遵循”从粗到精”的 curriculum(课程学习——先学简单/通用任务,再逐步过渡到难/特定任务),共三个阶段。训练使用的核心损失函数是标准的去噪扩散损失:给定一个加噪的潜空间视频 z_t(在原始潜空间表示上添加了 t 步高斯噪声),模型预测添加的噪声 ϵ\epsilon,损失为 L=∥ϵ−ϵθ(zt,t,conditions)∥2L = \|\epsilon - \epsilon_\theta(z_t, t, \text{conditions})\|^2——即预测噪声与真实噪声的均方误差(MSE)。优化器使用 AdamW(带权重衰减的 Adam,是深度学习中最常用的自适应学习率优化器),配合 cosine learning rate schedule(余弦退火学习率调度)。

阶段一:预训练大规模视频数据。 首先收集海量视频。Stability AI 构建了 LVD(Large Video Dataset),包含约 10 亿视频片段的初始池,经过严格筛选去重后得到约 6 亿高质量样本。筛选管线包括:用光流(optical flow——估计相邻帧之间像素运动方向和速度的经典计算机视觉技术)计算运动密度,剔除静止画面和运动过于剧烈的片段;用 CLIP 计算文本-视频对齐度,过滤低质量标注;用美学评分模型筛选视觉精美片段;用检测器去除含水印、文字、低分辨率的样本。在此大规模数据上预训练 latent video diffusion 模型,让模型学会通用的运动规律——物体怎么移动、镜头怎么运动、光影怎么变化。这个阶段的目标是”广度”——覆盖尽可能多的场景和运动类型。

阶段二:高质量短视频微调。 从大规模数据中筛选出高质量子集(高分辨率、运动平滑、美学评分高),对模型做微调。这个阶段提升画面精美度和运动自然度,将视频长度固定为约 14 帧(576×1024 分辨率,约 4 秒短视频)。此阶段还引入了 CFG(Classifier-Free Guidance,无分类器引导) 训练——以一定概率随机丢弃条件(condition dropout),让模型同时学习有条件和无条件生成,推理时通过放大条件方向来提升生成质量与条件遵循度。

阶段三:特定任务微调(图生视频)。 在前两阶段的 base model 基础上,针对 image-to-video 任务做最后微调。训练时给定一张静态图作为条件帧(condition frame),模型学习如何从这一帧”生长”出后续运动帧。这一步让 SVD 专门擅长图生视频——给它一张照片,它能让照片里的场景动起来。SVD-XT(Extended)版本在此阶段进一步将帧数从 14 扩展到 25 帧(1024×576 分辨率),通过渐进式帧数扩展训练实现。

注意:SVD 是图生视频(image-to-video)模型,不是文生视频(text-to-video)模型。用户需要先提供一张起始图片,模型基于这张图生成约 4 秒的动态视频。这与 AnimateDiff 可以直接文生动画不同。

2024 年 7 月,Stability AI 发布了 SVD 1.1(stable-video-diffusion-img2vid-xt-1-1)。这个版本在 SVD-XT(25 帧)基础上做了一轮针对性微调,核心改进是:固定推理条件为 6 FPS + Motion Bucket Id 127,让模型在这个”最佳工作点”上输出更加稳定一致的结果。此前 SVD 1.0 在不同 FPS 和 motion bucket 参数组合下输出质量波动较大,用户需要反复调参;SVD 1.1 通过在固定条件下做大量训练,使默认参数就能产出高质量视频,降低了使用门槛。这些条件参数仍然可调(没有被移除),只是在非默认组合下表现可能与 1.0 有差异。

SVD 和 Sora 代表了视频生成的两条主流技术路线(详见 AI 视频生成):

维度SVDSora
骨干架构U-Net + temporal attentionDiT(Diffusion Transformer)
时间建模在 self-attention 后插入 temporal attention 层时空 patch 化,空间和时间统一处理
可扩展性U-Net 架构扩展性有限,参数增大收益递减Transformer 天然契合 scaling law,越大越强
成熟度基于 SD 成熟生态,开源可用,社区工具丰富闭源,技术报告为主,生态尚未开放
视频长度约 4 秒(14-25 帧),可扩展但质量下降最长 60 秒,物理理解强
输入模态图生视频(需要起始图)文生视频(直接文本到视频)

核心差异在架构选择:Sora 用 DiT 架构做时空 patch 化(详见 DiT 架构),把视频切成 3D 的时空 token 输入 Transformer,空间和时间被统一处理,天然受益于 scaling law——模型越大效果越好。SVD 用 U-Net + temporal attention,是在成熟图像模型上”打补丁”——空间和时间分两步处理,架构更复杂但基于 SD 的工程积累更深厚。

一句话:Sora 更易扩展,SVD 更成熟可用。 Sora 代表未来方向(scaling law 驱动),SVD 代表当下可落地的方案(开源、可部署、社区支持)。

2025 行业趋势更新:进入 2025 年后,视频生成领域的天平已明显向 DiT 架构倾斜。除了 OpenAI 的 Sora 之外,可灵(Kling)、Vidu、Pika 2.0、Google Veo 2/3 等新一代视频模型几乎全部采用 DiT 或 DiT+自回归混合架构,原生支持文生视频、长时长(10-60 秒)和高分辨率(1080p)。相比之下,SVD 的 U-Net + temporal attention 路线在 scaling 上遇到瓶颈,Stability AI 自身也在将重心转向基于 SD3/MMDiT 架构的下一代系统。SVD 的价值在于它是最成熟的开源图生视频基座,社区工具链(ComfyUI 节点、diffusers 封装、ControlNet 扩展)最完善,在本地部署、研究复现、定制微调场景中仍有不可替代的地位。

SVD 和 AnimateDiff 都基于 Stable Diffusion,但设计哲学截然不同(详见 AnimateDiff):

  • AnimateDiff = 轻量适配器:在 base SD 模型上插入 motion module(运动模块),不动原模型。优势是轻量灵活——任何 SD 1.5 模型、任何 LoRA、任何画风都能直接加动画,零额外训练。劣势是运动幅度和物理理解有限,帧数通常 16-32 帧。
  • SVD = 专门训练的视频模型:从头在视频数据上训练 temporal attention 层,深度耦合图像模型。优势是质量高、运动自然、帧间一致性强。劣势是不灵活——只能做图生视频,不能随意换画风或叠加 LoRA。

打个比方:AnimateDiff 像给手机加装”防抖云台”——什么手机都能装,轻便灵活;SVD 像专门制造的”电影摄影机”——画质顶级但只能用指定镜头。

Temporal Attention 如何实现帧间一致性

Section titled “Temporal Attention 如何实现帧间一致性”

用 diffusers 运行 Stable Video Diffusion(图生视频)

Section titled “用 diffusers 运行 Stable Video Diffusion(图生视频)”
import torch # PyTorch 深度学习框架
from diffusers import StableVideoDiffusionPipeline, load_image # 扩散模型库
from diffusers.utils import export_to_video # 视频导出工具
# 加载 SVD 1.1 模型(一致性增强版,25 帧,1024x576 分辨率)
pipe = StableVideoDiffusionPipeline.from_pretrained(
"stabilityai/stable-video-diffusion-img2vid-xt-1-1",
torch_dtype=torch.float16, variant="fp16"
).to("cuda")
# 读取一张静态起始图片(作为视频第一帧的条件)
image = load_image("https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/diffusers/svd/rocket.png")
image = image.resize((1024, 576)) # 调整到模型所需分辨率
# 图生视频:从静态图生成 25 帧(约 4 秒)动态视频
# motion_bucket_id 控制运动幅度(默认 127),noise_aug_strength 给起始图加少量噪声防僵硬
frames = pipe(
image, decode_chunk_size=8, motion_bucket_id=127, noise_aug_strength=0.02
).frames[0]
# 导出为 mp4 视频文件
export_to_video(frames, "svd_output.mp4", fps=7)
print("视频生成完成: svd_output.mp4 (25帧, 约4秒)")
# → 视频生成完成: svd_output.mp4 (25帧, 约4秒)

参数说明:motion_bucket_id 控制运动幅度(值越大动作越剧烈,范围 0-255,默认 127);noise_aug_strength 给起始图加少量噪声,防止模型过拟合第一帧导致画面僵硬——这个技巧背后的直觉是:如果模型完美复制第一帧,后续帧就没有”演化”空间;加入微量噪声相当于给模型一点”自由度”,让它敢做微小变化。decode_chunk_size 控制 VAE 解码时的分块大小,值越小越省显存但越慢。显存不足时用 enable_model_cpu_offload() 和 enable_vae_slicing()。

  • 起始图质量决定视频质量:SVD 是图生视频模型,第一帧的构图、清晰度、美学质量直接决定输出。建议先用 Stable Diffusion 或 Midjourney 生成高质量起始图,再喂给 SVD。
  • 运动幅度可控:motion_bucket_id 是最关键参数——值太小视频几乎静止(像 Ken Burns 效果),值太大画面抖动变形。建议从默认 127 开始,逐步调整。SVD 1.1 已针对 127 做了优化训练,建议优先使用默认值。
  • 分辨率与帧数权衡:SVD 默认 1024×576 分辨率、25 帧(SVD-XT),约需 12GB+ 显存。显存不够可降到 576×1024、14 帧(SVD base 版本),或使用 enable_vae_slicing() 减少 VAE 解码的峰值显存。
  • FPS 参数的影响:fps 参数控制输出视频的帧率,SVD 1.1 在 6 FPS 下训练,推理时使用 6-8 FPS 效果最佳。设置过高 FPS(如 14)会导致画面”加速”且质量下降。
  • 多次生成取最优:SVD 每次结果有随机性(因为初始噪声不同),同一张图多跑几次,挑最满意的视频。可以设置不同的随机种子(generator=torch.Generator().manual_seed(42))来系统性地探索。
  • 不要期待长视频:SVD 原生只生成约 4 秒。需要更长视频要用”最后一帧作为下一片段起始帧”的拼接策略,但累积误差会导致后期质量下降——通常 2-3 次拼接后就会出现明显的画面漂移和模糊。
  • 配合 ControlNet 做精确控制:社区有 SVD + ControlNet 的扩展版本,可以用姿态、深度图精确控制视频中的运动轨迹。详见 ControlNet 与可控生成。
  • 商用注意协议:SVD 采用 Stability AI 的社区许可协议(Community License):年收入 100 万美元以下的组织和个人可免费商用(含研究、非商用),超过此线需申请企业授权。部署前务必确认许可条款。
  • 结合 ComfyUI 工作流:ComfyUI 有完善的 SVD 节点支持,可以串联图生图、放大、视频生成等节点做端到端工作流。
  • 2025 年的新选择:如果需要更长时长或文生视频能力,可评估 Kling、Pika 2.0、Veo 等新一代 DiT 架构模型(大多通过 API 提供)。SVD 在需要本地部署、完全可控、数据不出本地的场景中仍是首选。
  • 社交媒体短视频:用 SVD 把 AI 生成的精美插画变成 4 秒动态视频,发到抖音/B站/小红书,是 AI 绘画创作者的标配工作流。
  • 产品广告动态化:电商把产品静帧图转为动态展示视频——服装模特微动、食品冒热气、汽车缓缓驶过,提升广告转化率。
  • 影视分镜动态预览:导演用 AI 生成分镜图后,用 SVD 让分镜动起来,快速可视化镜头效果,辅助前期制作决策。
  • Stability AI 官方 API:Stability AI 提供 SVD 的官方 API 服务,开发者无需自建 GPU 服务器即可调用图生视频能力。
  • ComfyUI / Diffusers 本地部署:开发者和创作者在本地 GPU 上部署 SVD,配合 LoRA 微调实现特定风格的动态视频。
  • 数字人与虚拟主播:用 SVD 给 AI 生成的虚拟形象添加微动效果(呼吸、眨眼、头发飘动),用于直播和短视频内容生产。
  • Stable Video 4D(SV4D)——多视角 4D 重建:2024 年发布的 SV4D 基于 SVD + SV3D(Stable Video 3D),输入单视角物体视频即可生成多视角新视角视频(4D 图像矩阵),输出 40 帧(5 帧 × 8 个相机视角)的 576×576 分辨率结果。广泛用于 3D/4D 资产生成、游戏道具制作、电商产品 360 度展示。2025 年 5 月发布的 SV4D 2.0 在真实世界视频上进一步提升了输出质量,成为动态 4D 资产生成的主流开源方案。
  • Stable Virtual Camera——可控 3D 相机视频:2025 年 3 月发布的 Stable Virtual Camera(研究预览版)是 SVD 技术线的最新延伸——一个多视角扩散模型,能把 2D 图片转化为带真实景深和透视的沉浸式 3D 视频,并支持 3D 相机轨迹控制(用户可指定相机运动路径),无需复杂的 3D 重建或场景级优化。
类库语言说明
StableVideoDiffusionPipeline (diffusers)PythonHuggingFace diffusers 官方封装,一行代码调用 SVD / SVD 1.1
ComfyUI-SVD 节点PythonComfyUI 中运行 SVD 的工作流节点,支持串联其他节点
stability-sdkPythonStability AI 官方 SDK,调用官方 API 服务
Stable Video Diffusion 模型权重-HuggingFace 托管的 SVD / SVD-XT / SVD 1.1 权重(fp16 版本)
SV4D 模型权重-HuggingFace 上的 Stable Video 4D 权重,支持多视角视频生成
AnimateDiff (diffusers)Python替代方案——轻量动画生成,详见 AnimateDiff
术语英文解释
时间层注入Temporal Layer Injection在 U-Net 的 spatial attention 后插入 temporal attention 层的技术
时间注意力Temporal Attention沿帧维度做 Self-Attention,让帧间同一位置特征交互
空间注意力Spatial Attention在单帧内像素间做注意力,SD 原有能力
帧间一致性Inter-frame Consistency连续帧的同一物体保持外观不变,不突变不闪烁
图生视频Image-to-Video (I2V)给定一张静态图作为起始帧,生成后续动态视频帧
运动桶 IDMotion Bucket IDSVD 中控制运动幅度的微条件参数,值越大动作越剧烈
噪声增强Noise Augmentation给起始图加少量噪声,防止模型过拟合第一帧
潜空间Latent SpaceVAE 编码后的低维特征表示空间,扩散在此进行而非像素空间
VAEVariational Autoencoder变分自编码器,将图像压缩到潜空间并解码还原的神经网络
CLIPContrastive Language-Image Pre-trainingOpenAI 的图文对齐模型,将图像/文本编码为可比较的语义向量
残差连接Residual Connection将输入直接加到输出上(output = input + f(input)),帮助深层网络训练
CFGClassifier-Free Guidance无分类器引导——通过放大条件方向提升生成质量与条件遵循度
光流Optical Flow估计相邻帧间像素运动方向和速度的经典计算机视觉技术
DiTDiffusion Transformer用 Transformer 替代 U-Net 的扩散架构,Sora 采用,详见 DiT 架构
  • Blattmann et al.,「Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets」(arXiv 2311.15127, 2023):SVD 原始论文,详细描述时间层注入架构、三阶段训练流程(大规模预训练 + 高质量微调 + 图生视频微调)、LVD 数据集的构建与筛选策略(光流过滤、CLIP 评分、美学过滤),以及”curated dataset > raw scale”的核心发现。
  • Stability AI,「SVD 1.1 Model Card」(2024):SVD 1.1 的模型卡片,描述了固定 6 FPS + Motion Bucket 127 条件下的微调改进。模型权重位于 stabilityai/stable-video-diffusion-img2vid-xt-1-1。
  • Stability AI,「Stable Video 4D Technical Report」(arXiv 2407.17470, 2024):SV4D 技术报告,基于 SVD + SV3D 实现单视角视频到多视角 4D 视频矩阵的生成,项目主页 sv4d.github.io。
  • Stability AI,「Stable Video 4D 2.0」(2025):SV4D 2.0 升级版,在真实世界视频上实现更高质量的多视角与 4D 生成。
  • Stability AI,「Stable Virtual Camera」(2025):多视角扩散模型,从 2D 图片生成可控 3D 相机轨迹的沉浸式视频,研究预览阶段。
  • Brooks et al.,「Video Generation Models as World Simulators」(OpenAI 技术报告, 2024):Sora 技术报告,提出 DiT + 时空 patch 架构,与 SVD 的 U-Net + temporal attention 路线形成鲜明对比。详见 DiT 架构。
  • Guo et al.,「AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning」(arXiv 2307.04725, 2023):AnimateDiff 论文,提出可插拔 motion module,与 SVD 的专门训练路线对比。详见 AnimateDiff。
  • Ho et al.,「Video Diffusion Models」(arXiv 2204.03458, 2022):Google 的早期视频扩散论文,首次提出在空间-时间联合维度上做扩散的思想,是 SVD 的理论前身。
  • Singer et al.,「Make-A-Video: Text-to-Video Generation without Text-Matched Videos」(arXiv 2209.14792, 2022):Meta 的文生视频模型,用时空 patch + 解码器架构,是 video diffusion 的里程碑工作。
  • 延伸路线:SVD 建立在 扩散模型 的理论基础上,使用 U-Net 架构 和 Stable Diffusion 的图像能力,可与 ControlNet 结合做可控视频生成。视频生成全景见 AI 视频生成。