主流图像生成模型对比
图像生成模型在 2022 年 Stable Diffusion 开源后迎来爆发。到 2025-2026 年,整个领域已经经历了两次范式迁移——从像素空间扩散到潜在扩散(Latent Diffusion),再从 U-Net 去噪骨干转向基于 Rectified Flow(修正流)的 Transformer 架构——同时开源与闭源生态并行发展,竞争格局远比 2022 年复杂。本页梳理主流模型的能力定位、技术差异与选型建议。前置阅读:扩散模型。
想象你面前有一排画师,各有特长——
- Stable Diffusion 1.5 = 入门级画师。基本功扎实、工具链最全(LoRA / ControlNet / 插件生态最丰富),但画面精细度中等。优点是什么都有的改——社区资源多到溢出。
- SDXL / SD3 / SD3.5 = 同一个画室的进阶画师。SDXL 分辨率更高、细节更丰富;SD3 / SD3.5 更换了”画笔”(从 U-Net 换成 MMDiT Transformer),文字渲染和提示遵循大幅提升。
- Flux.1 = 新晋天才画师。2024 年横空出世,画面质量和文字渲染能力惊艳,是当前开源标杆。2025 年又推出了 Flux.1 Kontext(图像编辑)等后续版本。
- Midjourney v7 / v8 = 商业画师。风格化能力极强、出图即成品,但闭源——你只能通过它的平台用,不能本地部署、不能自由微调。2025 年 v7 发布后画质再次跃升。
- GPT-Image(OpenAI) = 听话的画师。2025 年 3 月起取代 DALL-E 3,内嵌于 ChatGPT / GPT-4o 中,采用自回归(Autoregressive)而非扩散路线,提示词理解力极强,还支持多轮对话式编辑。
- Google Imagen 4 = 学院派出身的精致画师。2025 年 5 月 Google I/O 发布,走级联扩散(Cascaded Diffusion)路线,写实风格突出。
- 国产模型(通义万相 / 可灵 / 即梦 / Seedream) = 本土化画师。中文场景理解好、接入国内产品生态方便。字节跳动的 Seedream 3.0 在 2025 年开源后引发关注。
在深入各模型之前,先统一理解图像生成模型的三种核心范式,它们决定了每个模型”怎么画”:
- 扩散模型(Diffusion):先往一张纯噪声图上反复加噪(前向过程),训练模型学会”去噪”(反向过程)。生成时从纯噪声出发,一步步去噪还原出清晰图像。Stable Diffusion、SDXL、SD3、Flux、Midjourney 都属于这一脉。
- 流匹配 / 修正流(Rectified Flow):扩散模型的一般化。不再走加噪-去噪的弯路,而是直接学一条从噪声分布到图像分布的”直线路径”(常微分方程 ODE),路径更短、采样更高效。SD3 和 Flux 都采用此范式,训练效率与生成质量均优于传统扩散。
- 自回归(Autoregressive):把图像切成一系列”视觉 token”(类似文本中的词),像语言模型一样逐个预测下一个 token。GPT-Image(即 GPT-4o 的图像生成能力)走的就是这条路线——它本质是一个被扩展到视觉领域的语言模型。
Stable Diffusion 谱系(Stability AI 开源)
Section titled “Stable Diffusion 谱系(Stability AI 开源)”Stable Diffusion 是图像生成开源生态的基石。它采用潜在扩散(Latent Diffusion)架构——在 VAE(Variational Autoencoder,变分自编码器)压缩的潜空间(Latent Space,即图像被编码后所在的低维连续向量空间)中做扩散,而非直接在像素空间操作,从而将计算量降低约 64 倍(详见扩散模型)。
一个完整的 Stable Diffusion 模型由三大组件串联而成:
- VAE 编码器 / 解码器:编码器把 512×512×3 的像素图像压缩为 64×64×4 的潜空间张量(压缩比 8² × 3/4 = 48 倍体积缩减);解码器反过来把潜空间张量还原为像素图像。VAE 是一个轻量网络(数十 MB),不参与扩散训练,但它的重建质量直接决定最终图像的细节天花板。
- 文本编码器(CLIP Text Encoder):将用户的文本提示编码为一组条件向量。CLIP(Contrastive Language-Image Pre-training)是 OpenAI 提出的对比学习模型,通过”让匹配的图文对向量靠近、不匹配的远离”来训练,因此能把文本映射到与图像同构的语义空间。文本编码器越强,模型对提示词的理解力越好。
- 去噪网络(U-Net 或 Transformer):这是真正学习”去噪”的核心网络。它以带噪的潜空间张量为输入,以文本条件向量为引导,预测当前步应去除的噪声。U-Net 因其”先下采样再上采样”的 U 形对称结构而得名,能在不同分辨率上同时捕捉全局构图和局部细节。
具体到各版本:
- SD 1.5(2022-10):基于 Latent Diffusion,U-Net 骨干(约 8.6 亿参数),单文本编码器(CLIP ViT-L/14),512×512 原生分辨率。训练数据为 LAION-5B 的子集(约 23 亿图文对),最终在 LAION-Aesthetics v2 5+(约 6 亿张高分美学图像)上精调。训练成本约 150,000 A100 GPU 小时(约 60 万美元)。虽然分辨率不高,但因为开源最早,社区积累了最多的 LoRA(Low-Rank Adaptation,低秩适配——冻结原模型,只训练注入的低秩矩阵,从而用极小的训练成本植入新风格 / 角色)、ControlNet(在去噪网络旁挂一个”可训练副本”,用零卷积初始化,使其能在不破坏原模型的前提下接受线稿 / 深度图 / 人体姿态等额外条件约束)、插件和微调模型——生态最完善、资源最丰富。
- SDXL(2023-07):更大的 U-Net(参数量增至约 35 亿,是 SD 1.5 的 3.5 倍),原生 1024×1024。架构上的关键改进:使用双文本编码器(CLIP ViT-L + OpenCLIP ViT-bigG)拼接,文本理解力翻倍;U-Net 中加入了更多 Transformer 注意力块(Attention 机制让模型在生成每个区域时”关注”到文本提示中相关的词,从而实现局部可控);同时在多种长宽比上训练(而非仅正方形)。社区生态快速追赶中。
- SD3 / SD3.5(2024-06 / 2024-10):这是 Stable Diffusion 系列最大的一次架构革命。训练范式从传统扩散切换为 Rectified Flow(修正流 / 流匹配)——模型不再学”加噪-去噪”的随机过程,而是学一条从噪声到图像的确定性直线路径(ODE),路径更短、推理步数更少、训练效率更高。骨干网络从 U-Net 换为 MMDiT(Multimodal Diffusion Transformer,多模态扩散 Transformer)——不再用卷积分层下采样,而是把潜空间切成 token 序列,用 Transformer 统一处理图像 token 和文本 token,并且在每个 block 内部让图像和文本的表示双向交互(之前的 DiT 只允许文本影响图像,不允许反向)。SD3.5 提供三档:Large(80 亿参数)、Large Turbo(蒸馏版,4 步出图)、Medium(25 亿参数)。文字渲染能力大幅改善(能在图中生成可读文字),提示词遵循度更高。
Flux.1(Black Forest Labs)
Section titled “Flux.1(Black Forest Labs)”Flux.1 由 Stability AI 前核心团队(Latent Diffusion / Stable Diffusion / SDXL 的原作者 Robin Rombach、Andreas Blattmann、Patrick Esser 等)离职后创立的 Black Forest Labs 于 2024 年 8 月发布,迅速成为开源图像生成的新标杆。
- 架构:同样采用 Rectified Flow + 纯 Transformer 骨干(Flow Matching),但做了两项关键工程改进:一是引入旋转位置编码(Rotary Positional Embedding, RoPE)——通过旋转矩阵编码 token 的相对位置,使模型对图像中物体的空间关系更敏感、且天然支持不同分辨率和长宽比;二是使用并行注意力层(Parallel Attention)——将自注意力和前馈网络并行而非串行执行,在保持表达能力的同时提升硬件利用率。参数量约 12B,远超 SD3.5 Large 的 8B。
- 三个版本:Flux.1-pro(闭源商用 API)、Flux.1-dev(开源非商用、由 pro 版蒸馏而来、质量接近 pro)、Flux.1-schnell(开源可商用、Apache 2.0、极速版仅需 1-4 步即可出图)。
- 优势:画面质量、文字渲染、人体结构、提示词遵循全面超越 SDXL,社区 ControlNet / LoRA 生态快速跟进中。
- 2025 年后续:Black Forest Labs 在 2025 年推出了 Flux.1 Kontext——一个专为图像编辑(而非从零生成)设计的模型,支持通过自然语言指令对已有图片做局部修改、风格迁移、角色一致性编辑。官网已预告下一代 FLUX 3 将是统一的多模态模型,覆盖图像、视频、音频和动作预测。
Midjourney v7 / v8(闭源商用标杆)
Section titled “Midjourney v7 / v8(闭源商用标杆)”Midjourney 是闭源图像生成的标杆,以极强的艺术风格化和美学品质著称。它的技术细节未公开,但从公开信息和效果推断,同样基于扩散 / 流匹配路线,且在美学数据的筛选和精调上做了大量工程投入。
版本演进时间线:
- v6(2023-12 alpha):从零重新训练(历时 9 个月),大幅提升写实能力和文字渲染,提示词解读更”字面化”。
- v6.1(2024-07):画质、连贯性和细节的迭代增强。
- v7(2025-04 alpha):时隔近一年的首个新大版本,底层架构疑似更换,整体画质、一致性、皮肤纹理有显著提升;同步推出 Niji 7(二次元专用分支,2026-01 发布)。
- v8(2026-03 alpha)/ v8.1(2026-04):进一步强化写实能力和提示词遵循。
通过 Discord / Web 界面使用,不支持本地部署,按月订阅付费。商业许可明确(付费用户生成的图像可商用)。2024 年 8 月起上线了独立的 Web 编辑器,集成了局部重绘(Vary Region)、缩放、平移、风格参考(Style Reference)和角色参考(Character Reference)等功能。需要注意的是,2025 年 6 月迪士尼 / 环球影业、9 月华纳兄弟先后对 Midjourney 提起版权侵权诉讼,指控其未经授权使用影视角色训练模型——这些案件可能深刻影响闭源图像生成模型的未来合规走向。
GPT-Image / DALL-E 3 → GPT-Image(OpenAI)
Section titled “GPT-Image / DALL-E 3 → GPT-Image(OpenAI)”OpenAI 在图像生成上的策略与其他厂商截然不同,核心优势是提示词理解力和多轮对话式编辑。
- DALL-E 3(2023-10):通过与 ChatGPT 深度集成,用户用自然语言描述需求,ChatGPT 自动优化(重写、扩展)提示词后调用 DALL-E 3 生成。不追求极致画质或风格多样性,而是追求”你描述什么就画什么”的指令遵循。基于扩散模型,技术细节未公开。
- GPT-Image(2025-03):2025 年 3 月起,DALL-E 3 被 GPT-Image(也称 GPT-Image-1)取代,内嵌于 ChatGPT / GPT-4o。这标志着 OpenAI 从扩散路线转向自回归(Autoregressive)路线——图像被编码为离散视觉 token 后,用与文本生成相同的”预测下一个 token”方式逐个生成。这种统一架构的优势在于:图像生成天然继承了语言模型对文本的深度理解,多轮对话式编辑(“把背景换成夕阳”、“给她戴一顶帽子”)变得极其自然。文字渲染能力也是所有闭源模型中最强的之一。缺点是推理计算量大(需要逐 token 串行解码),单张图像生成耗时较长。
Google Imagen 4
Section titled “Google Imagen 4”Google 的 Imagen 系列走的是**级联扩散(Cascaded Diffusion)**路线——用 T5 等大语言模型编码文本,然后通过多级扩散模型从低分辨率逐步超分到高分辨率(64×64 → 256×256 → 1024×1024 → 2K)。Imagen 4 于 2025 年 5 月 Google I/O 发布,写实风格和光照表现突出,通过 Gemini、ImageFX、Vertex AI 提供服务。
国产图像模型在 2025 年快速迭代,在中文场景理解、写实人像和合规性上有本地化优势:
- 通义万相(阿里):阿里通义实验室的图像生成模型,支持文生图、图生图、涂鸦生图,中文场景理解优秀,集成于通义千问产品线。2025 年持续迭代,加入多分辨率输出和更精细的风格控制。
- 可灵(快手):快手的 AI 创作平台,在图像和视频生成上表现突出,物理世界理解能力强。2025 年在视频生成方向持续发力。
- 即梦(字节跳动):字节的 AI 创作工具,集成文生图、图生图、视频生成,接入抖音 / 剪映生态。
- Seedream(字节跳动):字节跳动的图像生成基础模型,Seedream 3.0 于 2025 年开源,在写实人像和中文文字渲染上表现亮眼,是国产开源图像模型的新生力量。
模型定位:开源程度 vs 质量
Section titled “模型定位:开源程度 vs 质量”三大生成范式对比
Section titled “三大生成范式对比”主流模型对比表
Section titled “主流模型对比表”| 模型 | 开源 | 原生分辨率 | 范式 | 风格特长 | 商用许可 | 推荐场景 |
|---|---|---|---|---|---|---|
| SD 1.5 | 完全开源 | 512x512 | 潜在扩散 | 通用,生态最丰富 | 开源协议可商用 | 学习入门、LoRA/ControlNet 实验、低显存部署 |
| SDXL | 开源权重 | 1024x1024 | 潜在扩散 | 通用,细节更丰富 | 开源协议可商用 | 高质量文生图、本地部署、社区微调基础 |
| SD3 / SD3.5 | 开源权重 | 1024x1024 | 修正流 + MMDiT | 文字渲染强、提示遵循好 | 社区许可(营收>$1M 需企业许可) | 图中文字、海报设计、精确提示遵循 |
| Flux.1 Dev | 开源(非商用) | 最高 2K+ | 修正流 + Transformer | 画质最强开源模型 | 仅非商用研究 | 个人创作、研究、画质对标闭源 |
| Flux.1 Schnell | 开源(可商用) | 最高 2K+ | 修正流 + Transformer | 极速(1-4 步) | Apache 2.0 可商用 | 商用产品、快速生成、API 服务 |
| Midjourney v7/v8 | 闭源 | 最高 2K | 扩散/流匹配(未公开) | 艺术风格化、美学品质 | 付费订阅可商用 | 商业插画、品牌设计、概念艺术 |
| GPT-Image | 闭源 | 最高 2K | 自回归 | 提示词遵循、对话式编辑、文字渲染 | API 付费可商用 | 快速出图、多轮编辑、ChatGPT 集成 |
| Imagen 4 | API | 最高 2K | 级联扩散 | 写实、光照质感 | API 付费可商用 | 写实场景、Google 生态集成 |
| 通义万相 | API | 最高 2K | 扩散 | 中文场景、本土化 | API 付费可商用 | 国内商用项目、中文场景生成 |
| 可灵 | API/平台 | 最高 2K | 扩散 | 写实、视频生成 | 平台协议 | 短视频创作、电商内容 |
| 即梦 | API/平台 | 最高 2K | 扩散 | 综合创作、接入抖音生态 | 平台协议 | 抖音/剪映内容创作链路 |
Diffusers:加载不同模型的概念代码
Section titled “Diffusers:加载不同模型的概念代码”import torchfrom diffusers import StableDiffusionPipeline, StableDiffusionXLPipeline, FluxPipeline
# SD 1.5 —— 轻量经典,低显存首选pipe_sd15 = StableDiffusionPipeline.from_pretrained( "runwayml/stable-diffusion-v1-5", torch_dtype=torch.float16).to("cuda")
# SDXL —— 高清原生,细节更丰富pipe_sdxl = StableDiffusionXLPipeline.from_pretrained( "stabilityai/stable-diffusion-xl-base-1.0", torch_dtype=torch.float16).to("cuda")
# Flux.1 Schnell —— 当前开源画质天花板,4 步极速出图pipe_flux = FluxPipeline.from_pretrained( "black-forest-labs/FLUX.1-schnell", torch_dtype=torch.bfloat16).to("cuda")
prompt = "a cyberpunk city street at night, neon lights, rain"# 不同模型生成同一个 prompt,对比画质差异image = pipe_flux(prompt, num_inference_steps=4, guidance_scale=0.0).images[0]image.save("flux_result.png")训练方法对比
Section titled “训练方法对比”理解各模型的训练流程,有助于在微调时做正确选择:
- SD 1.5 / SDXL 的训练目标:去噪扩散概率模型(DDPM)的变分下界——给定带噪潜变量 和时间步 ,让 U-Net 预测加入的噪声 ,损失函数为均方误差 ( 为文本条件向量)。Classifier-Free Guidance(CFG)是一种推理时技巧:同时做一次有条件和一次无条件(空文本)的前向传播,然后放大两者之差 , 越大画面越贴合提示但多样性越低。
- SD3 / Flux 的训练目标:流匹配(Flow Matching)——学习一个速度场 ,使其在时间步 处指向从噪声到图像的直线方向。损失函数为 ,其中 是噪声、 是干净图像。相比 DDPM,流匹配的路径更直、训练更稳定、推理步数更少。
- GPT-Image 的训练目标:标准语言模型的自回归交叉熵损失——给定前 个视觉 token,预测第 个 token 的概率分布。训练数据为海量图文对,图像通过离散 VAE 编码为 token 序列。
- 数据需求:底模训练需要数十亿级图文对(SD 系列使用 LAION-5B 子集,估计训练成本在数十万美元到数百万美元 GPU 小时量级);微调(LoRA / DreamBooth)只需数十到数百张特定主题图片,个人 GPU 即可完成。
- 选模型先看需求:要本地部署 + 可商用 → Flux.1 Schnell / SDXL;要极致画质不在意闭源 → Midjourney v7+;要快速验证想法或多轮编辑 → GPT-Image(ChatGPT 里直接用);要玩 LoRA / ControlNet → SD 1.5 / SDXL 生态最全。
- 显存决定模型选择:SD 1.5 需 4GB+,SDXL 需 8GB+,Flux.1 Dev 需 24GB+(或用量化版降到 12GB)。显存不够就选小模型或用量化(fp16 / nf4 / GGUF)。量化(Quantization)是指把模型权重从 16 位浮点压缩到 8 位或 4 位整数,代价是微小的精度损失,换来大幅的显存节省。
- 底模与微调模型的区别:底模(base model)是大规模预训练的通用模型;微调模型(fine-tuned model)是在底模上用特定风格 / 主题数据继续训练的变体——如二次元、写实摄影、水彩风格等。底模选好后,微调模型决定画风。
- VAE 和 CLIP 的影响常被忽略:换一个好的 VAE 能提升色彩和细节(如 SDXL VAE 或 Flux VAE);换一个更强的 CLIP 文本编码器能提升提示词理解力。SDXL 使用双编码器(CLIP ViT-L + OpenCLIP ViT-bigG)拼接就是这个道理。
- 关注许可协议:SD 系列和 Flux Schnell 允许商用,但 Flux Dev 仅供非商用研究,SD3.5 对年收入超过 100 万美元的企业要求购买企业许可。Midjourney 付费订阅即包含商用许可。务必确认再用于商业项目。
- 2025 年的新趋势——统一多模态:越来越多厂商倾向于把图像生成整合进多模态大模型(GPT-4o 的原生图像生成、FLUX 3 的图像 + 视频 + 音频统一模型)。如果你在做产品选型,需权衡”独立生成模型(更灵活、可本地部署)“与”统一多模态模型(交互更自然、但闭源)“两条路线。
- AI 插画与数字艺术:Midjourney 用于高质量概念艺术和商业插画;Flux / SDXL 用于本地部署的个性化创作。2025 年 Flux.1 Kontext 的出现让”用自然语言编辑已有图像”在开源生态中也成为现实。
- 广告与营销设计:快速生成广告 banner、社交媒体配图、产品宣传图——GPT-Image + ChatGPT 的自然语言交互和多轮编辑能力,让非设计师也能通过对话不断调整画面,大幅降低使用门槛。
- 电商商品图:用图生图将简陋的产品照片渲染为专业场景图(详见AI 图像编辑),降低拍摄成本。
- 游戏资产:批量生成角色设定、场景概念图、纹理贴图,加速游戏美术管线(详见扩散模型)。
- 自媒体内容创作:公众号封面、视频缩略图、文章配图——用国产模型(通义万相 / 即梦 / Seedream)便捷接入国内内容平台,且中文文字渲染能力在 2025 年显著提升。
- 建筑与室内设计:文生图快速生成效果图方案,ControlNet + SDXL 实现线稿到渲染图的自动化(详见ControlNet 与可控生成)。
典型类库与工具
Section titled “典型类库与工具”| 类库 | 语言 | 说明 |
|---|---|---|
| Diffusers | Python | 统一接口加载 SD/SDXL/SD3/Flux 等所有主流开源模型 |
| ComfyUI | Python/JS | 节点式工作流,原生支持所有开源模型 + 自定义节点扩展 |
| Midjourney API | API | 官方闭源 API(通过 Discord/Web),艺术风格化标杆 |
| OpenAI GPT-Image API | API | 自回归图像生成、对话式编辑、文字渲染最强 |
| Google Imagen API | API | 级联扩散、写实风格、Vertex AI 集成 |
| 通义万相 API | API | 阿里图像生成 API,中文场景优化 |
| AUTOMATIC1111 WebUI | Python | 表单式 SD/SDXL 界面,生态丰富、上手简单 |
| Forge / reForge | Python | A1111 的高性能分支,对 SDXL/Flux 优化更好 |
| 术语 | 英文 | 解释 |
|---|---|---|
| 检查点 | Checkpoint | 保存的训练模型权重文件,可加载用于生成 |
| 底模 | Base Model | 大规模预训练的通用图像生成模型,是微调的起点 |
| 微调模型 | Fine-tuned Model | 在底模上用特定数据继续训练的风格 / 主题变体 |
| VAE | Variational Autoencoder | 变分自编码器,在潜空间和像素空间之间转换(详见VAE) |
| 潜空间 | Latent Space | 图像被 VAE 编码后所在的低维连续向量空间,在此操作比像素空间高效得多 |
| 文本编码器 | CLIP Text Encoder | 将文本提示编码为条件向量的模型,影响提示词理解力 |
| 注意力机制 | Attention | 让模型在处理某个位置时”关注”到输入中所有相关位置,是 Transformer 的核心运算 |
| 自回归 | Autoregressive | 逐个 token 预测下一个 token 的生成方式,GPT 系语言模型和 GPT-Image 采用此范式 |
| Rectified Flow | Rectified Flow | 流匹配训练范式,学习从噪声到图像的直线路径(ODE),SD3 / Flux 采用 |
| 归一化 | Normalization | 将激活值缩放到稳定范围的技术(如 Layer Norm),防止训练中梯度爆炸或消失 |
| MMDiT | Multimodal Diffusion Transformer | SD3 的骨干网络,在 Transformer block 内部让图像和文本 token 双向交互 |
| Classifier-Free Guidance | CFG | 推理时放大有条件和无条件输出之差以增强提示遵循度的技巧 |
| 量化 | Quantization | 将模型权重从高精度浮点压缩为低位整数,以牺牲微小精度换取显存大幅节省 |
| 潜在扩散 | Latent Diffusion | 在 VAE 压缩后的潜空间中做扩散(SD 的核心技术) |
- Rombach et al. “High-Resolution Image Synthesis with Latent Diffusion Models” (CVPR 2022):Latent Diffusion / Stable Diffusion 的基础论文,潜空间扩散的奠基工作。
- Esser et al. “Scaling Rectified Flow Transformers for High-Resolution Image Synthesis”(SD3 论文, 2024):Stable Diffusion 3 论文,引入 Rectified Flow 和 MMDiT 架构。
- Black Forest Labs “FLUX.1”(2024):Flux 系列模型发布,前 SD 核心团队的新作品,开源图像生成的新标杆;12B 参数,混合多模态 + 并行扩散 Transformer 块 + RoPE 位置编码。
- OpenAI “GPT-Image”(2025):标志着从扩散到自回归图像生成的范式迁移,将图像生成统一进多模态大模型。
- Midjourney 官方文档:了解 v7 / v8 的使用方式、参数配置和商业许可条款。
- Google DeepMind “Imagen 4”(2025, Google I/O):级联扩散路线的最新进展,写实风格和光照表现突出。