Skip to content

Stable Diffusion 生态指南

Stable Diffusion(SD)是开源图像生成的绝对主力——它催生了 A1111、ComfyUI、CivitAI 等庞大生态。本页是从零到能出图的完整入门指南:模型怎么选、前端怎么挑、LoRA/ControlNet 怎么配,以及 2025-2026 年生态的最新格局变化。前置阅读:扩散模型。

Stable Diffusion 不是单一产品,而是一整个 “模型 + 前端 + 插件 + 社区”的生态。要理解它,首先要分清三层结构:

  • 模型层:SD1.5、SDXL、SD3.5、Flux 等基础模型(Checkpoint),决定出图的画质上限。所谓 Checkpoint,就是训练完成后保存下来的完整神经网络权重——你可以把它理解为一个”画家的大脑”,不同的脑子擅长不同画风。
  • 前端层:A1111(最经典)、ComfyUI(节点式,当前进阶主流)、Fooocus(傻瓜化)、InvokeAI(画布式),决定你怎么操作模型。
  • 增强层:LoRA(风格/人物微调)、ControlNet(姿态/构图控制)、Embedding(概念注入)、Upscaler(放大),决定出图的精细度和可控性。

社区核心阵地是 CivitAI(模型分享社区,用户上传微调模型并互相交流)和 HuggingFace(官方模型仓库,类似”AI 模型的 GitHub”)。

2025-2026 格局变化:Stable Diffusion 的原创团队核心成员出走后成立了 Black Forest Labs,推出了 Flux 系列模型,已成为当前画质天花板;Stability AI 本身则在企业化和商业化方向转型(与 EA、Amazon、WPP 等建立合作)。前端方面,ComfyUI 已全面超越 A1111 成为生态中心。

一次完整的 SD 出图流程,串联起生态中所有组件:

每一环都对应生态中的一个可替换组件——这正是 SD 生态最强大的设计理念:模块化组合。就像积木一样,你可以随意替换每一层组件来获得不同效果。

底层技术原理:Diffusion Model 是怎么画图的

Section titled “底层技术原理:Diffusion Model 是怎么画图的”

Diffusion Model(扩散模型)的核心思想可以一句话概括:先学加噪声,再学去噪声。训练时,模型反复把一张清晰图片逐步加上随机噪声直到完全变成”雪花屏”,然后学习逆向过程——从纯噪声一步步还原出清晰图像。推理(生成)时,模型从一张随机噪声开始,执行几十步去噪,最终”雕刻”出一张符合提示词的图片。这个去噪过程的每一步由**采样器(Sampler)**决定算法和速度。

文本如何控制图像内容?SD 使用 CLIP(OpenAI 提出的图文对齐模型)或 T5 等文本编码器,把你的提示词编码成向量,在去噪过程中通过**交叉注意力(Cross-Attention)**机制注入到图像生成网络中,引导画面朝你描述的方向收敛。SD3 和 Flux 进一步采用了 DiT(Diffusion Transformer)架构——把传统 U-Net 换成 Transformer(就是 GPT 同款架构),提升了模型容量和对复杂提示词的理解能力。

基础模型决定一切,当前主流选择:

  • SD 1.5:2022 年发布,最经典的模型。生态最成熟(LoRA/ControlNet 支持最全)、显存要求最低(6GB 即可)、速度快。画质有上限但够用。新手首选入门模型,至今仍有大量社区围绕它产出内容。
  • SDXL:2023 年发布,原生 1024×1024,画质大幅提升。显存需 8GB+。生态已完全成熟,是当前性价比最高的通用选择。
  • SD3 / SD3.5:2024 年发布,采用多模态 DiT 架构(把 U-Net 换成 Transformer,模型容量更大),文字渲染与提示词理解更强。但发布初期生态跟不上,社区接受度一般。2025 年 6 月,Stability AI 与 NVIDIA 合作推出了基于 TensorRT 优化的 SD3.5,实现了 2 倍速度提升和 40% 显存节省(来源);同年 8 月又发布了 SD3.5 NIM 微服务,简化企业部署。
  • Flux(Black Forest Labs,SD 原班人马创立):2024 年首发,当前开源画质天花板,提示词遵循能力(即严格按照你的文字描述生成画面)极强。2025 年已迭代到 Flux 2,ComfyUI 已原生支持。分多个版本:
    • Flux Dev:开源非商用,适合个人研究和学习。
    • Flux Schnell:极速版,4 步即可出图,适合快速预览。
    • Flux Pro / API:闭源商业版,通过 API 调用,画质最佳。
    • 显存要求高(12GB+),但社区已推出多种量化版本(即将模型精度从 16 位压缩到 8 位甚至 4 位,牺牲少量画质换取大幅降低显存占用)来降低门槛。
  • FLUX 3(即将发布):Black Forest Labs 官网已预告,将是一个多模态统一模型,覆盖图像、视频、音频、甚至动作预测(Action-Prediction)——这意味着 Flux 正从纯图像模型向全能生成引擎进化(来源)。

新手建议:从 SD1.5 上手熟悉流程,出图稳定后升级 SDXL,追求极致画质再上 Flux。详见图像生成模型。

模型下载渠道:CivitAI(社区微调模型海量)、HuggingFace(官方原版)。

前端是你和模型之间的交互界面。选择哪个前端,决定了你的工作流方式和效率:

  • A1111(Automatic1111 WebUI):最经典、教程最多的前端。标签式输入,适合新手。插件生态最丰富,几乎兼容所有功能。缺点是架构已显老迈——截至 2025 年仍停留在 v1.0.0-pre 预览版,要求 Python 3.10.6(较旧),对新模型(如 Flux)的支持不如 ComfyUI 及时。适合不想折腾、只想快速出图的用户。

  • ComfyUI:节点式界面(类似 Blender 的节点编辑器或 Unreal Engine 的蓝图),把出图流程拆成可视化的节点连线图。每个节点是一个功能模块(加载模型、编码文本、采样、解码 VAE 等),用线连接它们的数据流。灵活性极强,适合复杂工作流(多 LoRA 叠加、ControlNet 组合、高清修复链)。学习曲线陡,但它是当前进阶玩家和 Flux 的绝对主流前端。

    2025 年 ComfyUI 发生了重大变化:项目由官方公司 Comfy-Org 接管运营,推出了:

    • 桌面应用(Windows & macOS),一键安装,不再需要折腾 Python 环境。
    • 新前端(基于 Vue/TypeScript 重写),界面更现代。
    • App Mode:把复杂节点工作流封装成简单 UI 暴露给最终用户,让不会节点的新手也能用。
    • API Nodes:可直接在 ComfyUI 里调用闭源商业模型(如 Nano Banana、Seedance 等),无需切换工具。
    • Comfy Cloud:官方付费云服务,显存不够的用户可在云端跑工作流。
    • 智能显存管理:最低 1GB 显存也能跑大模型(通过自动 offload 将模型在 GPU 和 CPU 内存之间智能调度)。
    • 支持范围大幅扩展:除图像外,还支持视频(Stable Video Diffusion、LTX-Video、Hunyuan Video、Wan 2.2 等)、3D(Hunyuan3D)、音频(Stable Audio、ACE Step)生成。

    详见 ComfyUI 工作流。

  • Fooocus:主打”像 Midjourney 一样简单”——你只管写提示词,它自动优化参数(采样器、步数、CFG 等)。零门槛,适合纯新手或只需快速出图不想学参数的用户。

  • InvokeAI:画布式交互,支持图生图、局部重绘的画布操作,适合创作型工作流(插画师在画布上反复修改)。

选择建议(2025 版):纯新手选 Fooocus 或 ComfyUI 桌面版(App Mode);想深入学习经典流程选 A1111;要玩 Flux 或复杂工作流务必选 ComfyUI——它已成为 2025 年生态事实上的标准前端。

  • LoRA(Low-Rank Adaptation,低秩适配):一种参数高效微调技术。它不修改整个模型(几十 GB),而是只训练一小组低秩矩阵(几十到几百 MB),叠加到基础模型上实现特定风格或人物效果。原理是利用矩阵分解(把大权重矩阵拆成两个小矩阵的乘积)大幅减少可训练参数。使用时在提示词里用 <lora:文件名:权重> 触发,可叠加多个。训练原理见 LoRA 训练。
  • Embedding(Textual Inversion,文本反转):用一个”触发词”代表一个概念(如特定画风、手部修正),文件极小(KB 级)。原理是训练一个固定的词向量来代表某个视觉概念,插入提示词即可调用。适合表达”很难用文字描述但有明确视觉特征”的东西。原理见 Textual Inversion。
  • Checkpoint 模型管理:基础模型动辄 2-7GB(Flux 更达 20GB+),建议按风格分类存放(写实、二次元、艺术),A1111/ComfyUI 都支持模型目录自动扫描。

ControlNet 是 SD 生态最重要的可控生成技术——它通过输入一张条件图(姿态骨架、边缘线稿、深度图等)来精确控制生成图像的构图和结构。可以把它理解为给 AI 画家一张”草稿”或”骨架”,让它在此基础上作画。详见 ControlNet。

常用控制类型:

  • OpenPose:提取人物骨骼关键点姿态(类似火柴人),让生成人物摆指定姿势。
  • Canny / Lineart:提取图像边缘线稿,适合线稿上色、建筑设计、动漫线稿填色。
  • Depth:深度图(每个像素离镜头的距离),控制空间层次和前后关系。
  • Tile:分块控制,用于高清放大时保持细节一致性。

A1111 中安装 ControlNet 扩展 + 下载对应预处理器模型即可。ComfyUI 中拖入 ControlNet 节点连接。

SD 原生出图分辨率有限(SD1.5 仅 512×512),放大是出大图的必经步骤:

  • Hires.fix(高清修复):A1111 内置功能,在文生图后对低分辨率图做二次重绘放大,保持细节。
  • Tiled VAE / Ultimate SD Upscale:分块放大,把大图分成多个小块分别处理,突破显存限制,适合出 4K 大图。
  • 专用 Upscaler 模型:如 4x-UltraSharp、ESRGAN,做纯超分辨率增强(只放大不改变内容)。详见图像放大器。

理解 SD 生态的商业逻辑,有助于判断技术走向和选型决策:

Stability AI:从开源理想主义到企业化转型

Section titled “Stability AI:从开源理想主义到企业化转型”

Stability AI 是 Stable Diffusion 背后的公司。2022-2023 年靠开源 SD 系列积累了巨大的社区影响力,但也因烧钱过快、管理层动荡一度陷入危机。2024 年换帅后由 Prem Akkaraju 出任 CEO,开始企业化转型:

  • 企业服务:2025 年 8 月推出 “Stability AI Solutions”,面向企业提供创意生产解决方案;9 月将 Stable Image Services 接入 Amazon Bedrock(AWS 的 AI 模型托管平台);8 月获得 SOC 2 Type II 安全合规认证——这些都是打动企业客户的必要资质。
  • 战略合作:与 EA(艺电,游戏巨头)合作开发游戏资产生成工具(2025 年 10 月);获得 WPP(全球最大广告集团)的战略投资(2025 年 3 月);与 AMD 合作优化 SD 在 Radeon GPU 和 Ryzen AI APU 上的运行效率(2025 年 4 月)。
  • 人才引进:聘请 Robert Legato( Avatar、Titanic 视效总监)为首席管线架构师,Ryan Ellis(前 Unity SVP)为产品负责人——表明公司重心从纯研究转向产品化和工业化管线。
  • 商业化挑战:Stable Diffusion 模型本身仍开源,但公司试图通过 API 服务、企业定制、合规认证来盈利。核心矛盾在于:开源模型免费可用,社区可以直接绕过官方 API 自己部署。

Black Forest Labs / Flux:SD 原班人马的新 venture

Section titled “Black Forest Labs / Flux:SD 原班人马的新 venture”

Flux 的开发商 Black Forest Labs 由 SD 论文作者 Robin Rombach 等人创立,采用了分层商业化策略:

  • 开源引流:Flux Dev / Schnell 以开源(非商用)权重发布,吸引社区和开发者使用,快速建立生态——CivitAI 上 Flux LoRA 数量在 2025 年爆发式增长。
  • API 变现:Flux Pro 等高性能版本通过付费 API 提供,按生成次数计费,面向不愿自建 GPU 集群的企业客户。
  • 企业授权:为大型企业提供商用授权和定制服务。
  • FLUX 3 布局多模态:预告中的 FLUX 3 将覆盖图像/视频/音频/动作预测,定位为统一的”视觉智能”平台——这是对标 OpenAI DALL-E、Google Imagen 等闭源巨头的战略举措。

CivitAI 建立了一个独特的创作者经济模型:用户上传自训练的 LoRA/Checkpoint,其他用户免费下载或通过”Buzz”(平台虚拟币)打赏。头部创作者可以通过模型分享获得收入,形成了”基础模型免费 + 微调模型增值”的生态分层。2025 年 CivitAI 上 Flux 相关模型快速增长,社区重心正从 SDXL 向 Flux 迁移。

阵营代表产品模式优势劣势
开源自部署Flux / SD3.5 / SDXL开源权重 + 社区免费、可控、可微调需自备 GPU、有技术门槛
闭源 API 服务Midjourney / DALL-E 3 / Flux Pro API订阅/按次付费省事、画质稳定不可控、数据上传第三方
企业级平台Stability AI Solutions / Amazon Bedrock企业合同合规、安全、可 SLA 保障价格高、灵活性低

下面用 Diffusers 库(HuggingFace)从零跑通 SDXL 文生图 + LoRA 叠加,这是脱离前端、用代码控图的基础:

import torch
from diffusers import StableDiffusionXLPipeline
# 加载 SDXL 基础模型(首次会自动下载,约 7GB)
pipe = StableDiffusionXLPipeline.from_pretrained(
"stabilityai/stable-diffusion-xl-base-1.0",
torch_dtype=torch.float16, variant="fp16").to("cuda")
# 加载风格 LoRA(在 CivitAI 下载的 .safetensors)
pipe.load_lora_weights("overture-creators/anime-style",
weight_name="anime.safetensors")
prompt = "a girl in cyberpunk city, neon lights, detailed, 8k"
neg = "lowres, bad anatomy, extra fingers, blurry" # 反向提示词:告诉模型不要生成什么
# 采样生成(DPM++ 采样器,30 步)
img = pipe(prompt, negative_prompt=neg, num_inference_steps=30,
guidance_scale=7.0, cross_attention_kwargs={"scale": 0.8}).images[0]
img.save("output.png") # 保存成图

这段代码展示了 SD 生态的内核:基础模型 + LoRA + 采样器 + 提示词。cross_attention_kwargs.scale 控制 LoRA 强度,等价于前端里的 LoRA 权重滑块。guidance_scale(CFG Scale)控制模型多大程度遵循提示词——值越高越听话但画面越”用力过猛”,一般 5-8 为佳。详见 Diffusers 库。

2025 年补充:用 Diffusers 跑 Flux(极简版):

import torch
from diffusers import FluxPipeline
# Flux Dev 需要更多显存,建议 16GB+;可用 enable_sequential_cpu_offload() 降占用
pipe = FluxPipeline.from_pretrained(
"black-forest-labs/FLUX.1-dev",
torch_dtype=torch.bfloat16).to("cuda")
# pipe.enable_sequential_cpu_offload() # 显存不够时开启,速度会变慢
img = pipe("a cat wearing a tiny top hat, oil painting style",
num_inference_steps=28, guidance_scale=3.5).images[0]
img.save("flux_output.png")

注意 Flux 的 guidance_scale 默认值远低于 SDXL(3.5 vs 7.0),因为 Flux 使用了流匹配(Flow Matching)而非传统 DDPM 采样,不需要很强的引导。Flux 使用 bfloat16(一种 16 位浮点格式,动态范围比 float16 更大,训练更稳定)。

  • 显存是硬约束:SD1.5 需 6GB、SDXL 需 8GB、Flux 需 12GB+ 显存。显存不足可用 --medvram/--lowvram(A1111)或 enable_sequential_cpu_offload()(Diffusers)降低占用——原理是把模型分层在 GPU 和 CPU 内存之间来回搬运,用时间换空间。ComfyUI 的智能显存管理可自动处理这些。量化部署(如 GGUF 8-bit/4-bit 量化版)也是低显存跑 Flux 的有效手段。
  • 采样器选择经验:DPM++ 2M Karras 是 SD1.5/SDXL 的万金油,20-30 步即可出好图;Euler a 更快但偏柔和;Flux 使用内置的 Euler 采样器配合流匹配,28 步左右为佳。详见采样器。
  • 提示词写法:SD1.5/SDXL 用关键词逗号分隔(tag 式),权重用 (关键词:1.3) 调整;SD3/Flux 支持自然语言长句(直接写完整描述句即可),这是 DiT 架构带来的语言理解能力提升。
  • LoRA 叠加别贪多:同时挂 3-4 个 LoRA 容易”风格打架”(不同 LoRA 的权重互相干扰),建议每个降权重到 0.6-0.8 再叠加。
  • 先调通再调精:新手先用 SD1.5 + A1111/ComfyUI 桌面版跑通基础流程,再逐步加 LoRA/ControlNet/放大,避免一开始就被复杂工作流劝退。
  • 流式推理(Streaming Inference)与批量生产:个人出图用本地前端即可;如果要做生产级批量生成(如电商批量出商品图),建议用 Diffusers + 推理服务框架(如 vLLM-Serve、Triton Inference Server)将模型部署为 API,配合队列做流式推理——即客户端发送请求后,服务端逐张返回结果,而非等所有图生成完再一次性返回。
  • 插画 / 概念设计:游戏、小说配图,用 LoRA 固定角色形象,ControlNet 控制构图。游戏公司如 EA 已与 Stability AI 合作,将生成式 AI 融入游戏资产生成管线。
  • 摄影级人像:写实类 Checkpoint + 面部 LoRA,生成商业级人像照片。
  • 二次元创作:动漫风格模型生态最丰富,社区模型海量(CivitAI 上二次元 LoRA 数以万计)。
  • 电商产品图:ControlNet 控制产品姿态 + 背景重绘,批量生成商品图。Stability AI 的 Brand Studio(2026 年 4 月发布)正是瞄准这一需求。
  • 建筑 / 室内设计:线稿 + Depth 控制生成效果图,快速出方案。
  • 视频与 3D 生成(2025 新方向):Stable Video 4D 2.0(单视频生成 4D 动态资产)、Stable Virtual Camera(2D 图像转 3D 视频)等新模型将 SD 生态从静态图像扩展到动态内容创作。
工具类型说明
ComfyUI前端2025 年生态核心,节点式工作流,桌面版+云端,支持图像/视频/3D/音频
A1111 WebUI前端最经典的 SD WebUI,标签式操作,插件全;但架构老迈,更新缓慢
Fooocus前端傻瓜化操作,零门槛出图
InvokeAI前端画布式交互,适合创作型工作流
CivitAI社区平台最大 SD 模型分享社区(LoRA/Checkpoint),创作者经济模式
HuggingFace模型仓库官方原版模型下载,Diffusers 库的模型来源
DiffusersPython 库HuggingFace 出品的扩散模型库,代码控图首选
ComfyUI-Manager扩展管理ComfyUI 的插件管理器,一键安装/更新自定义节点
TensorRT 优化推理加速NVIDIA 推出的推理加速引擎,SD3.5 经优化后速度翻倍
术语英文解释
基础模型Checkpoint完整的 SD 模型权重,决定出图基础风格
LoRALow-Rank Adaptation轻量微调权重,利用低秩矩阵分解大幅减少参数,用于固定风格/人物
ControlNet-通过条件图精确控制生成的技术(姿态/线稿/深度等)
采样器Sampler控制去噪过程的算法(DPM++/Euler 等),决定生成速度和画质
高清修复Hires.fix对低分辨率图二次重绘放大的流程
触发词Trigger Word激活 LoRA/Embedding 效果的关键词
量化部署Quantization将模型权重从高精度(16-bit)压缩到低精度(8/4-bit),降低显存占用
流式推理Streaming Inference服务端逐个返回生成结果,而非等全部完成再返回的推理模式
DiTDiffusion Transformer用 Transformer 架构替代 U-Net 的扩散模型,SD3/Flux 均采用
VAEVariational Autoencoder将像素空间与潜在空间互相转换的编解码器,SD 在潜在空间中做扩散
CFG ScaleClassifier-Free Guidance控制模型遵循提示词程度的参数,值越高越”听话”但可能过度
流匹配Flow MatchingFlux 采用的采样理论,替代传统 DDPM,所需步数更少
  1. Flux 取代 SDXL 成为高端首选:Flux 2 已发布,FLUX 3 多模态即将推出,ComfyUI 全面支持。CivitAI 上 Flux LoRA 生态快速成熟。
  2. ComfyUI 成为前端标准:桌面版、云端、App Mode、API Nodes 四管齐下,已远超 A1111 成为生态中心。A1111 仍适合传统用户但创新停滞。
  3. Stability AI 转型企业服务:从开源理想主义转向企业级 API + 合规 + 战略合作(EA、Amazon、WPP),SOC 2 认证、NVIDIA NIM 集成、Brand Studio 平台发布。
  4. 多模态扩展:SD 生态不再只是静态图像——视频(Stable Video 4D 2.0)、3D(Stable Virtual Camera)、音频(Stable Audio 3.0)全面铺开。
  5. 推理加速与低门槛部署:TensorRT 优化让 SD3.5 速度翻倍;ComfyUI 智能显存管理让 1GB 显存也能跑;量化技术让 Flux 在消费级显卡上可用。
  6. 创作者经济成熟:CivitAI 的 Buzz 打赏机制、Comfy Cloud 付费云服务,让独立创作者可以从模型分享中获利,形成可持续的生态循环。