Skip to content

主流图像生成模型对比

图像生成模型在 2022 年 Stable Diffusion 开源后迎来爆发。到 2025-2026 年,整个领域已经经历了两次范式迁移——从像素空间扩散到潜在扩散(Latent Diffusion),再从 U-Net 去噪骨干转向基于 Rectified Flow(修正流)的 Transformer 架构——同时开源与闭源生态并行发展,竞争格局远比 2022 年复杂。本页梳理主流模型的能力定位、技术差异与选型建议。前置阅读:扩散模型。

想象你面前有一排画师,各有特长——

  • Stable Diffusion 1.5 = 入门级画师。基本功扎实、工具链最全(LoRA / ControlNet / 插件生态最丰富),但画面精细度中等。优点是什么都有的改——社区资源多到溢出。
  • SDXL / SD3 / SD3.5 = 同一个画室的进阶画师。SDXL 分辨率更高、细节更丰富;SD3 / SD3.5 更换了”画笔”(从 U-Net 换成 MMDiT Transformer),文字渲染和提示遵循大幅提升。
  • Flux.1 = 新晋天才画师。2024 年横空出世,画面质量和文字渲染能力惊艳,是当前开源标杆。2025 年又推出了 Flux.1 Kontext(图像编辑)等后续版本。
  • Midjourney v7 / v8 = 商业画师。风格化能力极强、出图即成品,但闭源——你只能通过它的平台用,不能本地部署、不能自由微调。2025 年 v7 发布后画质再次跃升。
  • GPT-Image(OpenAI) = 听话的画师。2025 年 3 月起取代 DALL-E 3,内嵌于 ChatGPT / GPT-4o 中,采用自回归(Autoregressive)而非扩散路线,提示词理解力极强,还支持多轮对话式编辑。
  • Google Imagen 4 = 学院派出身的精致画师。2025 年 5 月 Google I/O 发布,走级联扩散(Cascaded Diffusion)路线,写实风格突出。
  • 国产模型(通义万相 / 可灵 / 即梦 / Seedream) = 本土化画师。中文场景理解好、接入国内产品生态方便。字节跳动的 Seedream 3.0 在 2025 年开源后引发关注。

在深入各模型之前,先统一理解图像生成模型的三种核心范式,它们决定了每个模型”怎么画”:

  1. 扩散模型(Diffusion):先往一张纯噪声图上反复加噪(前向过程),训练模型学会”去噪”(反向过程)。生成时从纯噪声出发,一步步去噪还原出清晰图像。Stable Diffusion、SDXL、SD3、Flux、Midjourney 都属于这一脉。
  2. 流匹配 / 修正流(Rectified Flow):扩散模型的一般化。不再走加噪-去噪的弯路,而是直接学一条从噪声分布到图像分布的”直线路径”(常微分方程 ODE),路径更短、采样更高效。SD3 和 Flux 都采用此范式,训练效率与生成质量均优于传统扩散。
  3. 自回归(Autoregressive):把图像切成一系列”视觉 token”(类似文本中的词),像语言模型一样逐个预测下一个 token。GPT-Image(即 GPT-4o 的图像生成能力)走的就是这条路线——它本质是一个被扩展到视觉领域的语言模型。

Stable Diffusion 谱系(Stability AI 开源)

Section titled “Stable Diffusion 谱系(Stability AI 开源)”

Stable Diffusion 是图像生成开源生态的基石。它采用潜在扩散(Latent Diffusion)架构——在 VAE(Variational Autoencoder,变分自编码器)压缩的潜空间(Latent Space,即图像被编码后所在的低维连续向量空间)中做扩散,而非直接在像素空间操作,从而将计算量降低约 64 倍(详见扩散模型)。

一个完整的 Stable Diffusion 模型由三大组件串联而成:

  1. VAE 编码器 / 解码器:编码器把 512×512×3 的像素图像压缩为 64×64×4 的潜空间张量(压缩比 8² × 3/4 = 48 倍体积缩减);解码器反过来把潜空间张量还原为像素图像。VAE 是一个轻量网络(数十 MB),不参与扩散训练,但它的重建质量直接决定最终图像的细节天花板。
  2. 文本编码器(CLIP Text Encoder):将用户的文本提示编码为一组条件向量。CLIP(Contrastive Language-Image Pre-training)是 OpenAI 提出的对比学习模型,通过”让匹配的图文对向量靠近、不匹配的远离”来训练,因此能把文本映射到与图像同构的语义空间。文本编码器越强,模型对提示词的理解力越好。
  3. 去噪网络(U-Net 或 Transformer):这是真正学习”去噪”的核心网络。它以带噪的潜空间张量为输入,以文本条件向量为引导,预测当前步应去除的噪声。U-Net 因其”先下采样再上采样”的 U 形对称结构而得名,能在不同分辨率上同时捕捉全局构图和局部细节。

具体到各版本:

  • SD 1.5(2022-10):基于 Latent Diffusion,U-Net 骨干(约 8.6 亿参数),单文本编码器(CLIP ViT-L/14),512×512 原生分辨率。训练数据为 LAION-5B 的子集(约 23 亿图文对),最终在 LAION-Aesthetics v2 5+(约 6 亿张高分美学图像)上精调。训练成本约 150,000 A100 GPU 小时(约 60 万美元)。虽然分辨率不高,但因为开源最早,社区积累了最多的 LoRA(Low-Rank Adaptation,低秩适配——冻结原模型,只训练注入的低秩矩阵,从而用极小的训练成本植入新风格 / 角色)、ControlNet(在去噪网络旁挂一个”可训练副本”,用零卷积初始化,使其能在不破坏原模型的前提下接受线稿 / 深度图 / 人体姿态等额外条件约束)、插件和微调模型——生态最完善、资源最丰富。
  • SDXL(2023-07):更大的 U-Net(参数量增至约 35 亿,是 SD 1.5 的 3.5 倍),原生 1024×1024。架构上的关键改进:使用双文本编码器(CLIP ViT-L + OpenCLIP ViT-bigG)拼接,文本理解力翻倍;U-Net 中加入了更多 Transformer 注意力块(Attention 机制让模型在生成每个区域时”关注”到文本提示中相关的词,从而实现局部可控);同时在多种长宽比上训练(而非仅正方形)。社区生态快速追赶中。
  • SD3 / SD3.5(2024-06 / 2024-10):这是 Stable Diffusion 系列最大的一次架构革命。训练范式从传统扩散切换为 Rectified Flow(修正流 / 流匹配)——模型不再学”加噪-去噪”的随机过程,而是学一条从噪声到图像的确定性直线路径(ODE),路径更短、推理步数更少、训练效率更高。骨干网络从 U-Net 换为 MMDiT(Multimodal Diffusion Transformer,多模态扩散 Transformer)——不再用卷积分层下采样,而是把潜空间切成 token 序列,用 Transformer 统一处理图像 token 和文本 token,并且在每个 block 内部让图像和文本的表示双向交互(之前的 DiT 只允许文本影响图像,不允许反向)。SD3.5 提供三档:Large(80 亿参数)、Large Turbo(蒸馏版,4 步出图)、Medium(25 亿参数)。文字渲染能力大幅改善(能在图中生成可读文字),提示词遵循度更高。

Flux.1 由 Stability AI 前核心团队(Latent Diffusion / Stable Diffusion / SDXL 的原作者 Robin Rombach、Andreas Blattmann、Patrick Esser 等)离职后创立的 Black Forest Labs 于 2024 年 8 月发布,迅速成为开源图像生成的新标杆。

  • 架构:同样采用 Rectified Flow + 纯 Transformer 骨干(Flow Matching),但做了两项关键工程改进:一是引入旋转位置编码(Rotary Positional Embedding, RoPE)——通过旋转矩阵编码 token 的相对位置,使模型对图像中物体的空间关系更敏感、且天然支持不同分辨率和长宽比;二是使用并行注意力层(Parallel Attention)——将自注意力和前馈网络并行而非串行执行,在保持表达能力的同时提升硬件利用率。参数量约 12B,远超 SD3.5 Large 的 8B。
  • 三个版本:Flux.1-pro(闭源商用 API)、Flux.1-dev(开源非商用、由 pro 版蒸馏而来、质量接近 pro)、Flux.1-schnell(开源可商用、Apache 2.0、极速版仅需 1-4 步即可出图)。
  • 优势:画面质量、文字渲染、人体结构、提示词遵循全面超越 SDXL,社区 ControlNet / LoRA 生态快速跟进中。
  • 2025 年后续:Black Forest Labs 在 2025 年推出了 Flux.1 Kontext——一个专为图像编辑(而非从零生成)设计的模型,支持通过自然语言指令对已有图片做局部修改、风格迁移、角色一致性编辑。官网已预告下一代 FLUX 3 将是统一的多模态模型,覆盖图像、视频、音频和动作预测。

Midjourney v7 / v8(闭源商用标杆)

Section titled “Midjourney v7 / v8(闭源商用标杆)”

Midjourney 是闭源图像生成的标杆,以极强的艺术风格化和美学品质著称。它的技术细节未公开,但从公开信息和效果推断,同样基于扩散 / 流匹配路线,且在美学数据的筛选和精调上做了大量工程投入。

版本演进时间线:

  • v6(2023-12 alpha):从零重新训练(历时 9 个月),大幅提升写实能力和文字渲染,提示词解读更”字面化”。
  • v6.1(2024-07):画质、连贯性和细节的迭代增强。
  • v7(2025-04 alpha):时隔近一年的首个新大版本,底层架构疑似更换,整体画质、一致性、皮肤纹理有显著提升;同步推出 Niji 7(二次元专用分支,2026-01 发布)。
  • v8(2026-03 alpha)/ v8.1(2026-04):进一步强化写实能力和提示词遵循。

通过 Discord / Web 界面使用,不支持本地部署,按月订阅付费。商业许可明确(付费用户生成的图像可商用)。2024 年 8 月起上线了独立的 Web 编辑器,集成了局部重绘(Vary Region)、缩放、平移、风格参考(Style Reference)和角色参考(Character Reference)等功能。需要注意的是,2025 年 6 月迪士尼 / 环球影业、9 月华纳兄弟先后对 Midjourney 提起版权侵权诉讼,指控其未经授权使用影视角色训练模型——这些案件可能深刻影响闭源图像生成模型的未来合规走向。

GPT-Image / DALL-E 3 → GPT-Image(OpenAI)

Section titled “GPT-Image / DALL-E 3 → GPT-Image(OpenAI)”

OpenAI 在图像生成上的策略与其他厂商截然不同,核心优势是提示词理解力和多轮对话式编辑。

  • DALL-E 3(2023-10):通过与 ChatGPT 深度集成,用户用自然语言描述需求,ChatGPT 自动优化(重写、扩展)提示词后调用 DALL-E 3 生成。不追求极致画质或风格多样性,而是追求”你描述什么就画什么”的指令遵循。基于扩散模型,技术细节未公开。
  • GPT-Image(2025-03):2025 年 3 月起,DALL-E 3 被 GPT-Image(也称 GPT-Image-1)取代,内嵌于 ChatGPT / GPT-4o。这标志着 OpenAI 从扩散路线转向自回归(Autoregressive)路线——图像被编码为离散视觉 token 后,用与文本生成相同的”预测下一个 token”方式逐个生成。这种统一架构的优势在于:图像生成天然继承了语言模型对文本的深度理解,多轮对话式编辑(“把背景换成夕阳”、“给她戴一顶帽子”)变得极其自然。文字渲染能力也是所有闭源模型中最强的之一。缺点是推理计算量大(需要逐 token 串行解码),单张图像生成耗时较长。

Google 的 Imagen 系列走的是**级联扩散(Cascaded Diffusion)**路线——用 T5 等大语言模型编码文本,然后通过多级扩散模型从低分辨率逐步超分到高分辨率(64×64 → 256×256 → 1024×1024 → 2K)。Imagen 4 于 2025 年 5 月 Google I/O 发布,写实风格和光照表现突出,通过 Gemini、ImageFX、Vertex AI 提供服务。

国产图像模型在 2025 年快速迭代,在中文场景理解、写实人像和合规性上有本地化优势:

  • 通义万相(阿里):阿里通义实验室的图像生成模型,支持文生图、图生图、涂鸦生图,中文场景理解优秀,集成于通义千问产品线。2025 年持续迭代,加入多分辨率输出和更精细的风格控制。
  • 可灵(快手):快手的 AI 创作平台,在图像和视频生成上表现突出,物理世界理解能力强。2025 年在视频生成方向持续发力。
  • 即梦(字节跳动):字节的 AI 创作工具,集成文生图、图生图、视频生成,接入抖音 / 剪映生态。
  • Seedream(字节跳动):字节跳动的图像生成基础模型,Seedream 3.0 于 2025 年开源,在写实人像和中文文字渲染上表现亮眼,是国产开源图像模型的新生力量。
模型开源原生分辨率范式风格特长商用许可推荐场景
SD 1.5完全开源512x512潜在扩散通用,生态最丰富开源协议可商用学习入门、LoRA/ControlNet 实验、低显存部署
SDXL开源权重1024x1024潜在扩散通用,细节更丰富开源协议可商用高质量文生图、本地部署、社区微调基础
SD3 / SD3.5开源权重1024x1024修正流 + MMDiT文字渲染强、提示遵循好社区许可(营收>$1M 需企业许可)图中文字、海报设计、精确提示遵循
Flux.1 Dev开源(非商用)最高 2K+修正流 + Transformer画质最强开源模型仅非商用研究个人创作、研究、画质对标闭源
Flux.1 Schnell开源(可商用)最高 2K+修正流 + Transformer极速(1-4 步)Apache 2.0 可商用商用产品、快速生成、API 服务
Midjourney v7/v8闭源最高 2K扩散/流匹配(未公开)艺术风格化、美学品质付费订阅可商用商业插画、品牌设计、概念艺术
GPT-Image闭源最高 2K自回归提示词遵循、对话式编辑、文字渲染API 付费可商用快速出图、多轮编辑、ChatGPT 集成
Imagen 4API最高 2K级联扩散写实、光照质感API 付费可商用写实场景、Google 生态集成
通义万相API最高 2K扩散中文场景、本土化API 付费可商用国内商用项目、中文场景生成
可灵API/平台最高 2K扩散写实、视频生成平台协议短视频创作、电商内容
即梦API/平台最高 2K扩散综合创作、接入抖音生态平台协议抖音/剪映内容创作链路

Diffusers:加载不同模型的概念代码

Section titled “Diffusers:加载不同模型的概念代码”
import torch
from diffusers import StableDiffusionPipeline, StableDiffusionXLPipeline, FluxPipeline
# SD 1.5 —— 轻量经典,低显存首选
pipe_sd15 = StableDiffusionPipeline.from_pretrained(
"runwayml/stable-diffusion-v1-5", torch_dtype=torch.float16
).to("cuda")
# SDXL —— 高清原生,细节更丰富
pipe_sdxl = StableDiffusionXLPipeline.from_pretrained(
"stabilityai/stable-diffusion-xl-base-1.0", torch_dtype=torch.float16
).to("cuda")
# Flux.1 Schnell —— 当前开源画质天花板,4 步极速出图
pipe_flux = FluxPipeline.from_pretrained(
"black-forest-labs/FLUX.1-schnell", torch_dtype=torch.bfloat16
).to("cuda")
prompt = "a cyberpunk city street at night, neon lights, rain"
# 不同模型生成同一个 prompt,对比画质差异
image = pipe_flux(prompt, num_inference_steps=4, guidance_scale=0.0).images[0]
image.save("flux_result.png")

理解各模型的训练流程,有助于在微调时做正确选择:

  • SD 1.5 / SDXL 的训练目标:去噪扩散概率模型(DDPM)的变分下界——给定带噪潜变量 ztz_t 和时间步 tt,让 U-Net 预测加入的噪声 ϵ\epsilon,损失函数为均方误差 ∥ϵ−ϵθ(zt,t,c)∥2\|\epsilon - \epsilon_\theta(z_t, t, c)\|^2(cc 为文本条件向量)。Classifier-Free Guidance(CFG)是一种推理时技巧:同时做一次有条件和一次无条件(空文本)的前向传播,然后放大两者之差 ϵ~=ϵcond+w⋅(ϵcond−ϵuncond)\tilde{\epsilon} = \epsilon_{\text{cond}} + w \cdot (\epsilon_{\text{cond}} - \epsilon_{\text{uncond}}),ww 越大画面越贴合提示但多样性越低。
  • SD3 / Flux 的训练目标:流匹配(Flow Matching)——学习一个速度场 vθ(zt,t)v_\theta(z_t, t),使其在时间步 tt 处指向从噪声到图像的直线方向。损失函数为 ∥vθ(zt,t)−(z1−z0)∥2\|v_\theta(z_t, t) - (z_1 - z_0)\|^2,其中 z0z_0 是噪声、z1z_1 是干净图像。相比 DDPM,流匹配的路径更直、训练更稳定、推理步数更少。
  • GPT-Image 的训练目标:标准语言模型的自回归交叉熵损失——给定前 kk 个视觉 token,预测第 k+1k+1 个 token 的概率分布。训练数据为海量图文对,图像通过离散 VAE 编码为 token 序列。
  • 数据需求:底模训练需要数十亿级图文对(SD 系列使用 LAION-5B 子集,估计训练成本在数十万美元到数百万美元 GPU 小时量级);微调(LoRA / DreamBooth)只需数十到数百张特定主题图片,个人 GPU 即可完成。
  • 选模型先看需求:要本地部署 + 可商用 → Flux.1 Schnell / SDXL;要极致画质不在意闭源 → Midjourney v7+;要快速验证想法或多轮编辑 → GPT-Image(ChatGPT 里直接用);要玩 LoRA / ControlNet → SD 1.5 / SDXL 生态最全。
  • 显存决定模型选择:SD 1.5 需 4GB+,SDXL 需 8GB+,Flux.1 Dev 需 24GB+(或用量化版降到 12GB)。显存不够就选小模型或用量化(fp16 / nf4 / GGUF)。量化(Quantization)是指把模型权重从 16 位浮点压缩到 8 位或 4 位整数,代价是微小的精度损失,换来大幅的显存节省。
  • 底模与微调模型的区别:底模(base model)是大规模预训练的通用模型;微调模型(fine-tuned model)是在底模上用特定风格 / 主题数据继续训练的变体——如二次元、写实摄影、水彩风格等。底模选好后,微调模型决定画风。
  • VAE 和 CLIP 的影响常被忽略:换一个好的 VAE 能提升色彩和细节(如 SDXL VAE 或 Flux VAE);换一个更强的 CLIP 文本编码器能提升提示词理解力。SDXL 使用双编码器(CLIP ViT-L + OpenCLIP ViT-bigG)拼接就是这个道理。
  • 关注许可协议:SD 系列和 Flux Schnell 允许商用,但 Flux Dev 仅供非商用研究,SD3.5 对年收入超过 100 万美元的企业要求购买企业许可。Midjourney 付费订阅即包含商用许可。务必确认再用于商业项目。
  • 2025 年的新趋势——统一多模态:越来越多厂商倾向于把图像生成整合进多模态大模型(GPT-4o 的原生图像生成、FLUX 3 的图像 + 视频 + 音频统一模型)。如果你在做产品选型,需权衡”独立生成模型(更灵活、可本地部署)“与”统一多模态模型(交互更自然、但闭源)“两条路线。
  • AI 插画与数字艺术:Midjourney 用于高质量概念艺术和商业插画;Flux / SDXL 用于本地部署的个性化创作。2025 年 Flux.1 Kontext 的出现让”用自然语言编辑已有图像”在开源生态中也成为现实。
  • 广告与营销设计:快速生成广告 banner、社交媒体配图、产品宣传图——GPT-Image + ChatGPT 的自然语言交互和多轮编辑能力,让非设计师也能通过对话不断调整画面,大幅降低使用门槛。
  • 电商商品图:用图生图将简陋的产品照片渲染为专业场景图(详见AI 图像编辑),降低拍摄成本。
  • 游戏资产:批量生成角色设定、场景概念图、纹理贴图,加速游戏美术管线(详见扩散模型)。
  • 自媒体内容创作:公众号封面、视频缩略图、文章配图——用国产模型(通义万相 / 即梦 / Seedream)便捷接入国内内容平台,且中文文字渲染能力在 2025 年显著提升。
  • 建筑与室内设计:文生图快速生成效果图方案,ControlNet + SDXL 实现线稿到渲染图的自动化(详见ControlNet 与可控生成)。
类库语言说明
DiffusersPython统一接口加载 SD/SDXL/SD3/Flux 等所有主流开源模型
ComfyUIPython/JS节点式工作流,原生支持所有开源模型 + 自定义节点扩展
Midjourney APIAPI官方闭源 API(通过 Discord/Web),艺术风格化标杆
OpenAI GPT-Image APIAPI自回归图像生成、对话式编辑、文字渲染最强
Google Imagen APIAPI级联扩散、写实风格、Vertex AI 集成
通义万相 APIAPI阿里图像生成 API,中文场景优化
AUTOMATIC1111 WebUIPython表单式 SD/SDXL 界面,生态丰富、上手简单
Forge / reForgePythonA1111 的高性能分支,对 SDXL/Flux 优化更好
术语英文解释
检查点Checkpoint保存的训练模型权重文件,可加载用于生成
底模Base Model大规模预训练的通用图像生成模型,是微调的起点
微调模型Fine-tuned Model在底模上用特定数据继续训练的风格 / 主题变体
VAEVariational Autoencoder变分自编码器,在潜空间和像素空间之间转换(详见VAE)
潜空间Latent Space图像被 VAE 编码后所在的低维连续向量空间,在此操作比像素空间高效得多
文本编码器CLIP Text Encoder将文本提示编码为条件向量的模型,影响提示词理解力
注意力机制Attention让模型在处理某个位置时”关注”到输入中所有相关位置,是 Transformer 的核心运算
自回归Autoregressive逐个 token 预测下一个 token 的生成方式,GPT 系语言模型和 GPT-Image 采用此范式
Rectified FlowRectified Flow流匹配训练范式,学习从噪声到图像的直线路径(ODE),SD3 / Flux 采用
归一化Normalization将激活值缩放到稳定范围的技术(如 Layer Norm),防止训练中梯度爆炸或消失
MMDiTMultimodal Diffusion TransformerSD3 的骨干网络,在 Transformer block 内部让图像和文本 token 双向交互
Classifier-Free GuidanceCFG推理时放大有条件和无条件输出之差以增强提示遵循度的技巧
量化Quantization将模型权重从高精度浮点压缩为低位整数,以牺牲微小精度换取显存大幅节省
潜在扩散Latent Diffusion在 VAE 压缩后的潜空间中做扩散(SD 的核心技术)
  • Rombach et al. “High-Resolution Image Synthesis with Latent Diffusion Models” (CVPR 2022):Latent Diffusion / Stable Diffusion 的基础论文,潜空间扩散的奠基工作。
  • Esser et al. “Scaling Rectified Flow Transformers for High-Resolution Image Synthesis”(SD3 论文, 2024):Stable Diffusion 3 论文,引入 Rectified Flow 和 MMDiT 架构。
  • Black Forest Labs “FLUX.1”(2024):Flux 系列模型发布,前 SD 核心团队的新作品,开源图像生成的新标杆;12B 参数,混合多模态 + 并行扩散 Transformer 块 + RoPE 位置编码。
  • OpenAI “GPT-Image”(2025):标志着从扩散到自回归图像生成的范式迁移,将图像生成统一进多模态大模型。
  • Midjourney 官方文档:了解 v7 / v8 的使用方式、参数配置和商业许可条款。
  • Google DeepMind “Imagen 4”(2025, Google I/O):级联扩散路线的最新进展,写实风格和光照表现突出。