Skip to content

Sora 与 AI 视频生成

AI 视频生成是生成式 AI 的下一个主战场——从文本/图片直接生成视频,甚至同步生成配音与音效。本页对比 Sora、Runway、Google Veo、Pika、可灵、Hedra 等代表产品,拆解 DiT 架构与时空一致性等核心技术,并覆盖 2025-2026 年的最新竞争格局。前置阅读:视频生成、扩散模型。

AI 视频生成产品的核心能力是 “文字/图片 → 视频”,但各家侧重不同。2025 年后,这条赛道已经从”谁的画面更好看”进化为”谁能生成带同步音频的长视频、谁能融入专业影视工作流”。

  • Sora(OpenAI):2024 年 2 月 demo 震撼全行业,首次公开 DiT(Diffusion Transformer,用 Transformer 替代 U-Net 做扩散去噪的架构)。2024 年 12 月正式开放,2025 年 9 月发布 Sora 2(集成社交功能、带动态水印)。但运营成本高昂(据估算每天约 100 万美元),用户从峰值约 100 万跌至不足 50 万。2026 年 3 月 OpenAI 宣布关停 Sora——App 于 2026 年 4 月 26 日下线,API 计划于 2026 年 9 月 24 日停服。Sora 的兴衰是 AI 视频生成领域最戏剧性的案例。
  • Runway Gen-4.5(Runway AI):商用最成熟的 AI 视频工具。从 Gen-1(视频编辑)到 Gen-4.5(文生视频 + 角色一致性),支持文本/图片到视频、风格化、运动笔刷。2025 年 4 月完成 3.08 亿美元融资(General Atlantic 领投),估值超 30 亿美元。与 Lionsgate、AMC Networks 等好莱坞制片厂达成合作,创作者生态最完善,按信用点计费。
  • Google Veo 3(Google DeepMind):2025 年 5 月发布的 Veo 3 是里程碑——首次实现视频 + 同步音频一体化生成(对白、音效、环境音),被 DeepMind CEO Demis Hassabis 称为”AI 视频走出了默片时代”。2025 年 10 月更新至 Veo 3.1,配套 Google Flow 视频编辑工具。
  • Pika:主打短视频与特效(爆炸、变形、局部重绘),10 秒以内片段生成快,操作简单。适合社交媒体内容创作。
  • 可灵(快手):国产最强视频生成模型,支持文生视频、图生视频,最长可达数分钟。2025 年发布的可灵 3.0 在 Artificial Analysis 视频模型排行榜上超越 Sora 2 Pro,国内免费试用门槛低,物理一致性表现优秀。
  • Hedra:专注数字人口播——上传一张人脸照片 + 一段音频/文字,生成对口型的说话视频。唇形同步(音频与嘴型动作对齐)与表情自然度高。
  • 字节 Seedance:字节跳动旗下视频模型,Seedance 2.0 在 2025-2026 年的第三方评测中排名靠前,部分指标超越 Sora 2。

AI 视频生成的通用架构——核心难题是让扩散模型(Diffusion Model,一种通过逐步去噪从随机噪声生成数据的生成模型)同时处理”空间(画面)“和”时间(帧间连贯)“两个维度:

核心技术拆解:

  1. 时空潜空间:视频帧太多,直接在像素空间计算不可行。先用 VAE(Variational Autoencoder,变分自编码器,一种将高维数据压缩到低维潜空间的编码-解码网络)把每帧压缩到潜空间(如 4x 降维),再在潜空间做扩散,最后解码回像素。SD 视频模型沿用这套思路。可以类比为”先把视频压缩成精简编码,在精简编码上做创作,再解压回高清视频”——这样做计算量能减少一个数量级。
  2. DiT(Diffusion Transformer):用 Transformer(基于自注意力机制的神经网络架构,详见 Transformer)替代传统 U-Net 做去噪骨干。关键在于时空注意力——既要让同一帧内各位置互相关注(空间一致性),又要让不同帧之间互相关注(时间一致性)。这是 Sora 的核心创新,现已成为行业标配。
  3. 文本条件注入:用大文本编码器(T5、CLIP——OpenAI 开发的对比学习图文匹配模型)把提示词编码为条件向量,引导视频内容与语义对齐。编码器越强,对复杂提示词的理解越精准。
  4. 摄像机控制:高端模型支持显式摄像机参数(平移、旋转、缩放),通过运动条件注入实现可控运镜。Google Veo 3 和 Runway Gen-4.5 都实现了较为精细的运镜控制。
  5. 音频同步生成(Veo 3 创新):Veo 3 突破性地将音频生成(对白、音效、环境音)与视频生成耦合在一起,这是从”哑片”到”有声片”的关键跃迁。技术细节未完全公开,但推测是在 DiT 框架中增加了音频模态的时空对齐机制。

Sora 技术报告的最大贡献是验证了 “Diffusion + Transformer” 优于传统 “Diffusion + U-Net”。DiT 的核心设计:

  • 把视频(或潜变量序列)切成 时空 patch(spacetime patch),类似 ViT(Vision Transformer)把图像切成 patch。
  • 每个 patch 作为一个 token,送入 Transformer 做自注意力(Self-Attention,让序列中每个元素与所有其他元素计算关联度的机制)。
  • 时空联合注意力让模型自动学习”这一帧的这个物体,和下一帧的同一个物体”的对应关系——这是物理一致性的来源。

相比 U-Net,Transformer 架构更容易 scale(堆参数和数据就能持续变强),这也是 Sora 效果惊艳的根因。详见视频生成与Transformer。

给初学者的类比:想象你要画一部动画短片。U-Net 的做法是”先画一个大致轮廓,再逐层细化细节”(编码器-解码器 + 跳跃连接);DiT 的做法是”把每一帧画面切成小格子,让所有格子互相’对话’,最终一起决定画面长什么样”。后者的优势是格子之间的沟通没有层级限制,信息流动更自由,因此更容易学习复杂的时空关系。

视频生成的头号难题:相邻帧之间的物体不能”闪烁、变形、凭空消失”。解决思路:

  • 时间注意力:让每帧都”看到”前后帧,保证物体跨帧连贯。
  • 大运动数据训练:用大量自然视频训练,让模型学到物理运动规律(重力、碰撞、形变)。
  • 长上下文窗口:处理更多帧,模型能看到更长的时间跨度。
  • 角色一致性(Character Consistency):Runway Gen-4.5 和 Google Veo 3 引入了”角色参考”功能——上传一张角色照片,模型在多个镜头中保持同一角色的外貌不变。这是 2025 年视频生成的重要突破,解决了”切换镜头后人物变样”的痛点。

早期模型(2023 年)只能生成 2-4 秒、明显抖动的视频;2025 年的顶级模型能生成 8-10 秒、物理合理、角色一致的视频,差距主要就在时间注意力规模、角色一致性机制和训练数据量上。

Runway Gen-4.5、可灵、Google Veo 支持”摄像机运动”控制——平移、推拉、环绕。技术上是在条件中额外注入摄像机轨迹参数,或通过运动笔刷(Motion Brush,在画面指定区域设定运动方向的工具)实现。Pika 则擅长局部运动特效(让指定区域爆炸、流动)。

Google Veo 3(2025 年 5 月)是首个在视频生成中同步产出对白、音效和环境音的模型。这意味着用户不再需要后期配音或用其他工具叠加音轨——一条提示词即可得到带声有色的完整视频。不过 Veo 3 的音频质量仍有局限(如重复同一个笑话、音画偶尔不同步),后续的 Veo 3.1(2025 年 10 月)有所改善。

Hedra 这类产品的技术链路:人脸照片 + 音频 → 音频驱动的人脸动画生成。核心是音频到面部运动(唇形、表情)的映射模型,常用 GAN(Generative Adversarial Network,生成对抗网络,由生成器和判别器对抗训练的模型)或扩散模型实现。关键指标是唇形同步精度(lip-sync accuracy)和表情自然度。

AI 视频生成的商业模式在 2025 年快速分化,形成了几条不同的路径:

产品计费方式大致费用适合人群
Runway Gen-4.5信用点制 + 订阅$15-95/月起,按生成量消耗专业创作者、工作室
Google Veo 3Google AI 订阅 + AI 积分需 Gemini Advanced / Google AI Pro开发者、内容创作者
可灵订阅 + 免费额度国内免费试用,海外 $10-20/月国内用户、短视频创作者
Pika订阅 + 免费基础免费,Pro $10-35/月社交媒体创作者
Sora(已关停)ChatGPT Plus/Pro 包含$20-200/月曾面向大众用户
Hedra订阅基础免费,Pro 约 $10/月数字人/口播场景

Sora 的商业历程是 AI 视频生成领域最有警示意义的案例:

  • 2024 年 2 月:demo 震撼业界,确立 DiT 范式。
  • 2024 年 12 月:正式开放给 ChatGPT Plus/Pro 用户。
  • 2025 年 2 月:计划整合进 ChatGPT。
  • 2025 年 9 月:Sora 2 发布,搭载 iOS/Android App,加入 TikTok 式社交功能(信息流、点赞、分享)。
  • 2025 年 12 月:Disney 宣布 10 亿美元投资 OpenAI,授权 200+ 角色用于 Sora 2。
  • 2026 年 3 月:OpenAI 宣布关停 Sora,App 4 月下线、API 9 月停服。Disney 交易随之搁浅。

关停原因据多方报道指向:算力短缺、运营成本(每天约 100 万美元)远超收入、以及 OpenAI 向核心企业产品的战略转移。Sora 用户从峰值约 100 万跌至不足 50 万,而 Artificial Analysis 的排行榜显示 Sora 2 Pro 的视频质量已被 Seedance 2.0、Runway 4.5、Kling 3.0 超越。Sora 的故事说明:技术领先 ≠ 商业成功,高昂的推理成本(inference cost,模型部署后每次生成消耗的计算成本)是 AI 视频产品可持续性的最大挑战。

与 Sora 的大众化路线不同,Runway 走的是专业影视 B2B路线:

  • 与 Lionsgate(2024 年 9 月)合作,训练定制模型(基于 2 万+ 影视库),仅限 Lionsgate 旗下电影人使用。
  • 与 AMC Networks(2025 年 6 月)合作,用于营销物料生成和前期可视化。
  • 与 Tribeca Film Festival 合作展映 AI 影片。
  • 年度 AI Film Festival(AIFF):2023 年 300 部投稿,2025 年超 6000 部。
  • 产品线扩展:Gen-4.5(视频生成)、Aleph 2.0(基础模型)、Act-Two(表演捕捉)、Edit Studio(编辑)、Runway Dev(开发者工具)。

这条路线的核心是:不追求 C 端爆款,而是嵌入专业创作工作流,让影视公司离不开它。

2025 年,开源视频模型快速追赶商业产品,大幅降低了技术门槛:

  • HunyuanVideo(腾讯):腾讯开源的大规模视频生成模型,参数量大、质量优秀。
  • Wan 2.1 / 2.2(阿里巴巴):通义万相系列,支持文生视频和图生视频。
  • CogVideoX(智谱 AI):智谱开源的视频生成模型,可自部署。
  • Open-Sora:社区驱动的 Sora 复现项目。
  • Latte:另一个开源 DiT 视频模型。

AI 视频产品的交互设计正在快速演进,主要趋势:

  • 从”输入提示词等待”到”实时交互”:早期产品需要等待数分钟,2025 年的产品普遍优化了生成速度(流式推理,即模型边生成边输出结果,用户无需等全部完成即可预览片段)。
  • 多模态输入:用户可以用文本 + 图片 + 参考视频组合控制生成,而非纯文字描述。Runway 的运动笔刷和角色参考就是典型。
  • 社交化整合:Sora 2 尝试的 TikTok 式社交信息流(用户发布作品、互相关注、刷推荐流)是一种激进的产品实验,但因产品关停未能持续。
  • 项目管理与连续性:Google Flow 让用户在同一个项目中保持角色和场景一致,可以”导演”多镜头短片,而非只能生成孤立片段。
  • 负面提示与安全控制:随着 deepfake(深度伪造,用 AI 制作逼真假视频)争议加剧,产品普遍加强了内容安全过滤。Sora 2 因默认可生成版权角色、已故名人的 deepfake 而引发巨大争议。

不同场景应该选什么工具?以下是 2025-2026 年的实用建议:

使用场景推荐产品理由
专业影视 / 广告制作Runway Gen-4.5角色一致性、工作流成熟、好莱坞合作背书
需要同步音频的视频Google Veo 3唯一成熟的”视频+音频”一体化方案
国内短视频 / 低成本可灵 3.0国产最强、免费额度充足、物理一致性好
社交媒体特效 / 快速出片Pika短视频特效强、操作简单、出片快
数字人 / 口播视频Hedra垂直场景最优、唇形同步精度高
大批量低成本生成Seedance 2.0字节系产品,部分指标超越 Sora 2
学习与二次开发CogVideoX / HunyuanVideo / Open-Sora开源可自部署、社区活跃

优缺点对比要点:

  • Runway:优点是专业度高、生态完善;缺点是价格较贵、学习曲线存在。
  • Veo 3:优点是音频同步独一无二、Google 基础设施稳定;缺点是每段限制 8 秒、提示词理解有时偏弱。
  • 可灵:优点是性价比高、中文提示词友好;缺点是海外访问受限、部分高级功能需付费。
  • 开源模型:优点是免费可控、可定制(如用 LoRA 微调——LoRA 即 Low-Rank Adaptation,一种用少量参数高效微调大模型的方法);缺点是效果仍落后于顶级商业模型、需要较高算力(如量化部署,即将模型参数从高精度压缩到低精度以降低显存需求的技术)。

用开源模型(如 ModelScope 文生视频)从零生成一段短视频,这是脱离商业 API、用代码跑视频生成的基础:

import torch
from diffusers import DiffusionPipeline
from diffusers.utils import export_to_video
# 加载文生视频模型(首次自动下载,约需 10GB 显存)
pipe = DiffusionPipeline.from_pretrained(
"ali-vilab/text-to-video-ms-1.7b",
torch_dtype=torch.float16, variant="fp16").to("cuda")
prompt = "a panda eating bamboo in a misty forest, cinematic"
# 生成 16 帧(约 2 秒),每帧 256x256
video = pipe(prompt, num_frames=16).frames[0]
# 导出为 mp4(fps 控制播放速度)
export_to_video(video, "output.mp4", fps=8)
print("视频已生成: output.mp4")

这段代码用 ModelScope 的 1.7B 视频模型,参数小、门槛低,适合学习。商业级效果(Runway Gen-4.5 / Veo 3 / 可灵 3.0)需要数十倍参数和海量视频数据训练,个人无法复现,但理解了这套流程就理解了视频生成的内核。

想尝试更强大的开源模型,可以将模型替换为 CogVideoX-5b(智谱)或 tencent/HunyuanVideo(腾讯),显存需求更高(16-40GB),但生成质量显著提升。

  • 合理控制时长预期:开源模型多生成 2-5 秒;商业 API(Runway / 可灵 / Veo 3)5-10 秒。时长越长,一致性越难、费用越高。
  • 图生视频比文生视频更可控:先出一张好图(用 SD / Midjourney),再让视频模型”动起来”,构图和风格更好控制。
  • 提示词要描述运动:视频提示词要包含动作描述(“缓慢推进”、“奔跑”、“风吹动”),纯静态描述出不来好的运动效果。
  • 后处理很重要:AI 生成的原始视频常有轻微抖动,用插帧(RIFE——Real-Time Intermediate Flow Estimation,实时视频插帧算法)+ 超分(Real-ESRGAN,图像超分辨率模型)后处理能显著提升观感。
  • 成本意识:视频生成按秒计费。先在小分辨率/短时长上调试提示词,满意后再升规格。Sora 的关停也提醒我们:即使是大公司的产品也可能随时停服,不要把整个工作流绑定在单一 API 上。
  • 关注版权与合规:Sora 2 的版权争议、Veo 3 的种族歧视内容事件都说明,AI 视频的合规风险很高。商业使用前务必确认素材版权、平台政策,并做内容审核。
产品生成时长画质一致性音频可用性费用
Sora 2(已关停)最长 60s顶级优秀无已于 2026 年关停曾较贵
Runway Gen-4.55-10s优秀优秀(角色一致)无商用成熟,创作者首选按信用点
Google Veo 3.1最长 8s/段顶级优秀同步音频Gemini / Flow 可用订阅制
可灵 3.0最长数分钟优秀优秀部分国内免费试用门槛低免费/低价
Seedance 2.05-10s优秀优秀无排行榜领先需订阅
Pika3-10s良好良好无适合短视频特效部分免费
Hedra口播视频良好唇形同步好对口型数字人垂直场景部分免费

结论:商用首选 Runway,需要音频选 Veo 3,国产首选可灵,特效用 Pika,口播用 Hedra。开源模型(CogVideoX、HunyuanVideo、ModelScope)适合学习与二次开发,但效果与顶级商业产品仍有差距。Sora 的关停意味着 AI 视频生成进入”拼可持续运营”的新阶段,单纯技术领先已不足以保证产品存活。

工具类型说明
Sora商业产品OpenAI 视频生成,DiT 架构首创,2026 年已关停
Runway Gen-4.5商业产品商用最成熟,创作者生态完善,角色一致性强
Google Veo 3.1商业产品视频+音频一体化生成,Google Flow 视频编辑工具
可灵 3.0商业产品快手出品,国产最强视频生成
Seedance 2.0商业产品字节跳动视频模型,排行榜领先
Pika商业产品短视频与特效,操作简单
Hedra商业产品数字人口播,唇形同步
CogVideoX开源模型智谱开源的视频生成模型,可自部署
HunyuanVideo开源模型腾讯开源的大规模视频生成模型
Wan 2.2开源模型阿里通义万相系列,文/图生视频
Open-Sora开源模型社区驱动的 Sora 复现项目
ModelScope T2V开源模型阿里达摩院文生视频模型,门槛低
  • 音频同步成为新标准:Veo 3 开创的视频+音频一体化生成正在成为行业追赶目标。
  • 角色一致性突破:Runway Gen-4.5、Veo 3 的角色参考功能让”跨镜头同一角色”成为可能,大幅提升了叙事能力。
  • Sora 关停震动行业:证明了推理成本和运营可持续性比技术 demo 更重要。大公司的产品也会失败。
  • 开源快速追赶:HunyuanVideo、CogVideoX、Wan 等开源模型缩小了与商业模型的差距。
  • B2B > C2C:Runway 的好莱坞合作路线比 Sora 的大众社交路线更可持续。
  • 合规与版权收紧:Sora 2 的版权争议、各国出版商的抗议(日本 CODA、MPA 等)推动行业建立更严格的版权管控机制。
术语英文解释
视频生成Video Generation从文本/图片生成视频的技术
DiTDiffusion Transformer用 Transformer 做扩散去噪骨干的架构
扩散模型Diffusion Model通过逐步去噪从随机噪声生成数据的生成模型
时空注意力Spatiotemporal Attention同时建模空间(帧内)和时间(帧间)的注意力机制
自注意力Self-Attention让序列中每个元素与所有其他元素计算关联度的机制
时间一致性Temporal Consistency视频帧间物体不闪烁、不变形的特性
时空 patchSpacetime Patch把视频切成小块作为 Transformer token 的方法
唇形同步Lip Sync音频与嘴型动作对齐的技术
VAEVariational Autoencoder变分自编码器,将高维数据压缩到低维潜空间的编码-解码网络
推理成本Inference Cost模型部署后每次生成消耗的计算成本
流式推理Streaming Inference模型边生成边输出结果,用户无需等全部完成即可预览
LoRALow-Rank Adaptation用少量参数高效微调大模型的方法
量化部署Quantization将模型参数从高精度压缩到低精度以降低显存需求的技术
DeepfakeDeepfake用 AI 制作逼真假视频的深度伪造技术
插帧Frame Interpolation在已有帧之间生成中间帧以提升视频流畅度的技术
  • 技术基础:视频生成完整技术谱系见视频生成,扩散模型见扩散模型,Transformer 见 Transformer,多模态见多模态模型。
  • Sora 的意义与终结:Sora 技术报告(2024.2)虽未开源代码,但公开的 DiT 思路直接推动了开源社区(CogVideoX、Open-Sora、Latte、HunyuanVideo 等)的快速跟进,是视频生成领域的”范式确立”事件。然而 2026 年的关停也证明,AI 视频生成不只是技术问题,更是成本与商业模式的挑战。
  • 国产进展:可灵 3.0、CogVideoX(智谱)、HunyuanVideo(腾讯)、Wan(阿里)、Seedance(字节)等国产模型在 2025 年快速追赶,部分指标已在第三方排行榜上超越 Sora 2,开源版本显著降低了视频生成的技术门槛。
  • 竞争格局参考:Artificial Analysis 维护的视频模型排行榜是追踪各模型质量对比的权威参考,2026 年初的前列模型包括 Seedance 2.0、Runway 4.5、Kling 3.0。