ComfyUI 与 AUTOMATIC1111 对比
两大开源 Stable Diffusion 前端各占半壁江山:ComfyUI 以节点式工作流著称,AUTOMATIC1111(下称 A1111)以表单式易用性闻名。但进入 2025-2026 年,两者的命运出现显著分化——ComfyUI 演进为覆盖图像、视频、3D、音频、LLM 的通用 AI 媒体生成平台,而 A1111 的迭代明显放缓。本页从架构、交互、生态、性能、商业生态五个维度做深度对比,帮你选出适合自己场景的工具。前置阅读:ComfyUI 与节点式生成、ControlNet 与可控生成、图像 LoRA 训练。
把两个工具比作厨房——
- A1111 = 全自动料理机:你选菜谱(选模型)、放食材(写提示词)、按”开始”,机器按固定流程帮你炒好。简单、直接、上手零门槛,但想改翻炒顺序、中间加一道工序?菜单里没这个选项。
- ComfyUI = 专业厨房 + 菜谱笔记本:灶台、烤箱、蒸锅都是独立设备(节点),你自己决定先炒后蒸还是先蒸后炒。每次做菜的完整步骤都记在笔记本里(工作流 JSON),换个人按笔记操作,做出来味道一模一样。
本质区别在于对生成管线的封装粒度:A1111 把管线藏在表单后面,你调的是参数;ComfyUI 把管线暴露成可视化节点图,你调的是管线结构本身。前者胜在效率,后者胜在灵活与可复现。
这一区别在 2025 年变得更为关键:当生成式 AI 从”文生图”扩展到”文生视频""图生 3D""音频生成”等多模态任务时,ComfyUI 的节点架构天然适合串联不同模态的模型,而 A1111 的固定管线范式很难适配这些新场景。
技术架构拆解
Section titled “技术架构拆解”两者共享同一套底层技术栈——PyTorch + Diffusers/自定义推理引擎 + 模型权重(.safetensors 格式),差异全在中间件层与交互层。
什么是扩散模型(Diffusion Model)? 一种通过”逐步去噪”生成数据的生成式模型:先向纯噪声添加结构化的噪声,然后训练神经网络学会逆向去噪过程。Stable Diffusion 在图像的压缩潜空间(Latent Space)中执行这一过程,因此比像素空间扩散快得多。详见 扩散模型。
架构层次对比
Section titled “架构层次对比”| 层次 | AUTOMATIC1111 | ComfyUI |
|---|---|---|
| 前端交互 | Gradio 表单:文本框 + 滑块 + 下拉菜单 | 基于 LiteGraph 的节点画布:拖拽节点、连线(2025 年起内置新前端 comfyui-frontend-package,支持 React 风格的组件化 UI) |
| 请求处理 | Processing 类:固定流程 txt2img/img2img/inpaint | 执行引擎:将工作流 JSON 解析为 DAG(有向无环图),拓扑排序后逐节点执行 |
| 管线定义 | 硬编码在 Python 类中,用户无法改结构 | 由用户在工作流中自由定义,节点组合即管线 |
| 显存管理 | 模型加载后常驻显存,靠 --medvram/--lowvram 分块 | 按需加载(Smart Memory / Aimdo 系统):只在某节点需要时载入对应权重,用完即释放;支持 int8/int4 量化推理,大幅降低显存占用 |
| 扩展机制 | Extensions:向 UI 注入新选项卡或修改 Processing 逻辑 | Custom Nodes:注册新节点类型,用户自行连入工作流;通过 ComfyUI Manager 统一管理 |
| 多模态支持 | 以图像为核心,视频/3D/音频需依赖第三方扩展且支持有限 | 原生支持图像、视频(Wan、Seedance、LTX)、3D(Tripo、Uni3C、SeedVR2)、音频(Stable Audio、Seed Audio)及 LLM 调用 |
| 可复现性 | 依赖参数 + 种子,但隐含的管线行为难完全复刻 | 工作流 JSON 即完整定义,换机运行结果一致 |
一次生成请求的管线差异
Section titled “一次生成请求的管线差异”A1111 收到请求后,内部走一条固定的 Python 调用链:解析提示词 → 加载模型(常驻)→ 编码 CLIP → 构造 Latent → 调用采样器循环 → VAE 解码 → 后处理(放大、面部修复)→ 返回图像。中间每一步是否执行、顺序如何,由你在表单里勾选的选项决定——你没勾的选项不会出现在管线里。
CLIP 是 OpenAI 提出的文本-图像对比学习模型,在这里充当”翻译器”:把人类写的自然语言提示词编码成模型能理解的向量。VAE(Variational Autoencoder,变分自编码器)则负责在像素空间和压缩潜空间之间转换——编码时把 512×512 图片压缩成 64×64 的潜变量,解码时再还原。
ComfyUI 收到的是一张节点图 JSON,执行引擎先做拓扑排序确定节点执行顺序,然后逐个节点调度。每个节点声明自己需要的显存,引擎统一调度加载/卸载。管线结构完全由图定义,没有”隐藏步骤”。这种设计使得同一份 ComfyUI 既能做文生图,也能做视频生成、3D 重建——只要换一套节点图即可,引擎层无需修改。
关键技术点详解
Section titled “关键技术点详解”模型生态支持的分化
Section titled “模型生态支持的分化”进入 2025-2026 年,模型生态的快速扩张成为两者分化的最大推手:
- Flux(Black Forest Labs):基于 DiT(Diffusion Transformer,用 Transformer 替代 UNet 的扩散架构)的新一代图像模型,画质和文字渲染能力远超 SDXL。ComfyUI 在 Flux 发布后数天内即完成适配;A1111 因架构限制,社区需等待非官方补丁。
- 视频模型(Wan 2.1/2.5、Seedance 2.0、LTX Video):这些模型需要多帧 Latent 编码、时序注意力等全新管线结构,ComfyUI 通过自定义节点原生支持,A1111 几乎无法处理。
- 3D 生成(Tripo、Uni3C、SeedVR2):ComfyUI 内置了 Load3D / Save3D / Preview3D 等节点族,可直接在工作流中完成 3D 资产生成与预览。
- 音频生成(Stable Audio 3、Seed Audio 1.0):ComfyUI 同样原生支持,节点化后可嵌入到视频工作流中同步生成配乐。
扩散模型推理与采样
Section titled “扩散模型推理与采样”两者底层都执行 Stable Diffusion 的去噪循环,原理见 扩散模型。差异在于如何编排这条管线。采样器(如 DPM++ 2M Karras、Euler)决定了去噪的数学策略——详见 采样器详解。ComfyUI 的 KSampler 节点暴露了更底层的参数(如 denoise 比例可自由设定),适合精细控制 img2img 的修改幅度。
量化推理(Quantization):将模型权重从 16 位浮点数(fp16)压缩到 8 位整数(int8)甚至 4 位(int4),显存占用减少 2-4 倍,速度也有提升,代价是轻微的画质损失。ComfyUI 在 v0.27 起原生支持 int8,v0.28 进一步优化了 int4 在 Turing 架构 GPU 上的表现,使得 4GB 显存跑 Flux 成为可能。
ControlNet 与可控生成
Section titled “ControlNet 与可控生成”- A1111:在表单中启用 ControlNet 扩展后,勾选启用、上传参考图、选预处理器即可。
- ComfyUI:需要 ControlNet Loader + ControlNet Apply + 预处理器三个节点串联,搭建略繁但可同时叠加多个 ControlNet(如线稿 + 深度图 + 姿态检测并行引导),详见 ControlNet 与可控生成。
LoRA 使用
Section titled “LoRA 使用”LoRA(Low-Rank Adaptation,低秩适配)是一种参数高效微调技术:不改动原始模型的数十亿参数,而是在每层旁挂一个小型低秩矩阵(通常只占原模型大小的 1-5%),就能让模型学会新画风或新概念。多个 LoRA 可叠加使用,类似”滤镜”叠加。
- A1111:在提示词区用
<lora:名字:权重>语法加载,或在 LoRA 页面勾选。 - ComfyUI:用独立的 LoRA Loader 节点插入到 Checkpoint 和 KSampler 之间,可并排多个 Loader 做权重对比,详见 图像 LoRA 训练。
局部重绘 / Inpaint
Section titled “局部重绘 / Inpaint”- A1111:内置 Inpaint 画布,涂抹要修改的区域、写提示词即可,操作直观。
- ComfyUI:需要 VAE Encode (for Inpainting) + mask 输入 + KSampler 组合,搭建略繁但可批量化和精细化控制,详见 AI 图像编辑。
节点式工作流理念
Section titled “节点式工作流理念”ComfyUI 的 DAG、节点类型、数据类型系统等基础概念,详见 ComfyUI 与节点式生成,本页不再重复。
2025-2026 最新进展
Section titled “2025-2026 最新进展”ComfyUI:从 SD 前端到通用 AI 媒体平台
Section titled “ComfyUI:从 SD 前端到通用 AI 媒体平台”ComfyUI 在 2025-2026 年经历了爆发式演进(截至 2026 年 8 月已迭代至 v0.29.2),核心变化包括:
- Partner Nodes(合作伙伴节点):ComfyUI 不再只跑本地模型,而是通过”API 节点”直接调用云端的商业模型服务。已集成的合作伙伴包括:
- OpenAI(GPT-5.6 系列图像/文本模型)
- Google(Gemini 3.5 Flash、Nano Banana 2、Gemini Video Omni)
- Anthropic(Claude Opus 5)
- ByteDance / 字节跳动(Seedream 5 Pro 图像、Seedance 2.0 视频支持 4K 分辨率、Seed Audio 1.0 多语言语音)
- Kling / 快手可灵(V3-Turbo 视频模型)
- HeyGen(数字人 Avatar、Talking Photo、视频翻译、TTS)
- Runway(Aleph2)、Luma(Rays 3.2)、Recraft(V4.1)
- OpenRouter(统一 LLM 路由)、Grok(图像 1080p 输出)
- 这意味着用户可以在同一个工作流中混用本地和云端模型——例如用本地 Flux 生成草图,再用云端 Seedance 2.0 生成视频。
- 量化推理:v0.27 起原生支持 int8 模型,v0.28 扩展到 int4,配合 comfy-kitchen 优化后端显著降低显存门槛。
- 多 GPU 采样(MultiGPU Work Units):支持将采样任务分配到多张 GPU 上并行执行。
- Comfy Desktop(原 ComfyUI Desktop):官方桌面客户端,无需手动配置 Python 环境,一键安装。
- Comfy Platform / Cloud API:ComfyUI 官方推出云端平台,采用**积分制(Credits)**计费,用户通过 API 节点调用云端模型时按使用量扣费。这使得 ComfyUI 从纯开源工具转型为”开源核心 + 云服务”的商业模式。
- Trainer / Dataset 节点:内置训练功能,支持在工作流中直接进行 LoRA 微调和视频训练数据集处理。
- 3D 生成:原生支持 Uni3C ControlNet(Wan 视频模型用)、SeedVR2、Tripo3D、Rodin2.5 等 3D 模型,内置 Load3D/Save3D/Preview3D 节点族。
- 安全加固:v0.28 修复了多个安全漏洞(GHSA-779p-m5rp-r4h4),引入 OAuth 2.1 认证、CLA(贡献者许可协议)等企业级治理措施。
AUTOMATIC1111:迭代放缓,社区转向 Fork
Section titled “AUTOMATIC1111:迭代放缓,社区转向 Fork”A1111 主仓库的最新正式版本停留在 v1.10.1(2024 年中发布),核心功能更新包括:
- Stable Diffusion 3 支持(v1.10.0 新增),但仅支持基础采样,不支持完整的 SD3 能力。
- 大量性能优化(
use_checkpoint=False、half precision等)。 - FP8 支持、Soft Inpainting、Spandrel 架构迁移。
- 新调度器(Align Your Steps、KL Optimal 等)。
但 A1111 未能跟进 Flux 模型的官方支持,对新出的视频模型和 3D 模型也缺乏原生适配。社区普遍认为 A1111 已进入维护模式。用户大量迁移到以下替代方案:
- Forge(lllyasviel/stable-diffusion-webui-forge):A1111 的性能优化分支,重写了显存管理(借鉴 ComfyUI 思路),SDXL 速度提升显著,是 A1111 用户体验 Flux 等新模型的首选。但 Forge 自身的更新节奏也在放缓。
- ReForge / WebUI Forge 后续分支:社区驱动的持续维护版本。
- Fooocus:基于 A1111 后端但大幅简化 UI 的工具,面向”一键出图”用户,由 ControlNet 作者 lllyasviel 开发。
市场格局总结
Section titled “市场格局总结”| 维度 | ComfyUI | AUTOMATIC1111 / Forge |
|---|---|---|
| 开发活跃度 | 极高(月均多个版本,企业团队运作) | 低(A1111 停滞,Forge 缓慢) |
| 模型覆盖 | 图像/视频/3D/音频/LLM 全模态 | 以图像为主,新模型靠社区补丁 |
| 商业模式 | 开源核心 + Comfy Platform 云服务(积分制) | 纯开源,无商业化 |
| 目标用户 | 专业创作者、工作室、企业 pipeline | 入门用户、快速出图需求 |
| GitHub Stars | 7 万+(2026 年) | 14 万+(历史积累,但增速放缓) |
A1111:通过 API 提交文生图
Section titled “A1111:通过 API 提交文生图”import requests, base64
# A1111 默认开启 API(--api 参数),端口 7860payload = { "prompt": "a cyberpunk city at night, neon lights, ultra detailed", "negative_prompt": "blurry, low quality", "steps": 30, "cfg_scale": 7.0, "width": 1024, "height": 1024, "sampler_name": "DPM++ 2M Karras", "seed": -1, # -1 表示随机种子}resp = requests.post("http://127.0.0.1:7860/sdapi/v1/txt2img", json=payload)img_b64 = resp.json()["images"][0] # 返回 base64 编码的 PNGwith open("output.png", "wb") as f: f.write(base64.b64decode(img_b64.split(",", 1)[0]))print("图像已保存到 output.png")CFG Scale(Classifier-Free Guidance 比例)控制生成结果对提示词的”服从程度”:值越高越严格遵循提示词但可能过饱和,值越低越自由但可能偏离意图。典型范围 5-10。详见 CFG 与引导。
ComfyUI:通过 API 提交工作流
Section titled “ComfyUI:通过 API 提交工作流”import json, requests, time
# 导出 ComfyUI 界面的 "API 格式" JSON,修改参数后提交with open("workflow.json") as f: wf = json.load(f)
wf["6"]["inputs"]["text"] = "a cyberpunk city at night, neon lights" # 正面提示词wf["5"]["inputs"]["batch_size"] = 1 # 生成数量
prompt_id = requests.post( "http://127.0.0.1:8188/prompt", json={"prompt": wf}).json()["prompt_id"]
# 轮询 /history 直到任务完成while True: hist = requests.get(f"http://127.0.0.1:8188/history/{prompt_id}").json() if prompt_id in hist: print("生成完成,输出已保存到 ComfyUI 的 output 目录") break time.sleep(2)流式推理(Streaming Inference):ComfyUI 支持通过 WebSocket 实时推送生成进度(预览图逐帧更新),而非等全部完成才返回。这对于视频生成等长耗时任务尤为重要——用户可以提前发现方向不对并中断。A1111 也支持实时预览,但仅限图像采样的中间帧。
LoRA 加载方式对比
Section titled “LoRA 加载方式对比”# A1111: 在提示词中用标签语法,一行搞定prompt: "a girl in garden <lora:animeStyle:0.8>, detailed"
# ComfyUI: 用 LoRA Loader 节点,模型和权重分别连线# 节点结构: Checkpoint → LoRA Loader → KSampler# LoRA Loader 参数: lora_name="animeStyle.safetensors", strength_model=0.8商业模式与生态对比
Section titled “商业模式与生态对比”ComfyUI 的商业化路径
Section titled “ComfyUI 的商业化路径”ComfyUI 在 2025 年完成了从个人开源项目到商业化公司的转型,核心路径为”开源核心 + 增值云服务”:
- Comfy Platform(云端平台):提供托管的 ComfyUI 环境,用户无需本地 GPU 即可运行工作流。采用积分制(Credits)计费,按实际 GPU 消耗扣费。Partner Nodes 调用云端 API(如 GPT-5.6 图像、Seedance 视频)时也消耗积分。
- Comfy Desktop(桌面客户端):免费桌面应用,降低本地安装门槛,同时内置与 Comfy Platform 的无缝同步。
- 企业版 / API 服务:面向工作室和企业,提供团队协作、工作流版本管理、批量 API 调用等企业级功能。
- 开源核心不变:ComfyUI 核心引擎始终开源(GPL 协议),本地部署完全免费且功能完整。商业化的是云端算力和增值服务,不设功能墙。
这种模式类似于 Git(开源)+ GitHub(商业托管),以及 VS Code(开源)+ GitHub Copilot(商业服务)——用开源建立生态壁垒,用云服务变现。
A1111 的社区生态
Section titled “A1111 的社区生态”A1111 始终是纯社区驱动的开源项目,没有官方商业化:
- Civitai:最大的模型/LoRA 分享社区,与 A1111 的提示词语法深度绑定(
<lora:name:weight>语法已成事实标准)。 - Extensions 生态:A1111 拥有最庞大的扩展库(Extensions),但碎片化严重,不同扩展之间常冲突,安装和排错是新手的主要痛点。
- Civitai Link / Weaver:Civitai 推出的辅助工具,试图为 A1111 提供更好的模型管理体验。
A1111 缺乏商业化意味着没有全职团队维护新模型适配,这是其在快速变化的 AI 生态中逐渐掉队的根本原因。
技术选型建议
Section titled “技术选型建议”按用户画像选择
Section titled “按用户画像选择”| 你是…… | 推荐 | 理由 |
|---|---|---|
| 零基础新手 | A1111 或 Forge | 表单界面,写提示词即出图,30 分钟上手 |
| 快速原型 / 日常娱乐 | A1111 或 Fooocus | 三步出图,不需要理解管线 |
| 专业创作者 | ComfyUI | 多 LoRA 叠加、多 ControlNet 引导、分区域采样等复杂管线 |
| 视频 / 3D 创作者 | ComfyUI(唯一选择) | A1111 无原生视频/3D 支持 |
| 生产环境 / 批量生成 | ComfyUI | 工作流 JSON 可复现、可版本化、可纳入 Git 管理 |
| 二次开发 / API 服务 | ComfyUI | API 直接接收工作流 JSON,比 A1111 固定参数结构更灵活 |
| 低显存用户(4-8GB) | ComfyUI | 按需加载 + int8/int4 量化是架构级优势 |
| 混用本地 + 云端模型 | ComfyUI | Partner Nodes 支持 30+ 云端模型服务 |
- 4GB VRAM:ComfyUI + int8/int4 量化模型,可跑 SDXL 和 Flux Schnell。A1111 在此配置下几乎不可用。
- 8GB VRAM:两者皆可,A1111 跑 SDXL 流畅;ComfyUI 可跑 Flux Dev。
- 12GB+ VRAM:两者体验接近,选型取决于功能需求而非性能。
- 24GB+ VRAM(如 RTX 4090):ComfyUI 可跑视频生成(Wan 2.5)和高清放大管线;A1111 在此配置下浪费了大部分潜力。
- 多 GPU:ComfyUI 支持多 GPU 并行采样,A1111 不支持。
- 新手先用 A1111/Forge 入门:装好就能生成图,不需要理解管线概念。等遇到”A1111 做不到的需求”(如视频生成、Flux、复杂管线)时再迁移到 ComfyUI。
- 低显存优先选 ComfyUI:A1111 的
--medvram是权宜之计;ComfyUI 的按需加载 + int8/int4 量化是架构级优势。 - 批量自动化生产选 ComfyUI:工作流 JSON 的可复现性是生产环境的核心需求——同样的 JSON 在任何机器上结果一致,A1111 的参数复现常因隐含状态出错。
- 插件质量参差不齐:A1111 扩展生态庞大但碎片化严重,不同扩展之间常冲突;ComfyUI 的 Custom Nodes 通过 ComfyUI Manager 统一管理,相对规范。
- 模型文件可以共享:两个工具的模型目录可以指向同一份
.safetensors文件,用符号链接或配置路径即可,无需存两份。 - 学习曲线权衡:A1111 上手 30 分钟,ComfyUI 上手 2-3 小时,但掌握 ComfyUI 后能做的事远超 A1111。2025 年起,ComfyUI 官方提供了大量教程和模板工作流(workflow templates),降低了入门门槛。
- 关注 Forge 如果你是 A1111 用户:Forge 是 A1111 用户体验 Flux 和其他新模型的最佳路径,无需完全迁移到 ComfyUI。
典型应用场景
Section titled “典型应用场景”- 快速出图 / 日常娱乐:A1111 或 Forge。写提示词、拖滑块、点生成,三步出图。适合不想碰技术细节、只想快速看效果的用户。
- 复杂可控生成管线:ComfyUI。多 LoRA 叠加 + 多 ControlNet 并行引导 + 分区域采样 + 高清放大,这种组合在 A1111 中几乎无法配置,在 ComfyUI 中只是多连几根线。
- 视频生成:ComfyUI(唯一选择)。通过 Wan / Seedance / LTX 等视频模型节点,可实现文生视频、图生视频、视频风格迁移等。A1111 生态中有 AnimateDiff 扩展但功能有限。
- 3D 资产生成:ComfyUI。内置 Tripo / Uni3C / SeedVR2 等 3D 节点,可生成并预览 3D 模型。
- 生产环境批量生成:ComfyUI。电商商品图批量生成、游戏资产管线等需要可复现、可版本化的场景,工作流 JSON 可纳入 Git 管理。
- LoRA 训练与测试:ComfyUI(内置 Trainer 节点,支持视频训练)> A1111(需配合 Kohya_ss 等外部工具)。两者都行,但 ComfyUI 的训练流程可与推理工作流无缝衔接。
- 社区工作流复用:ComfyUI。Civitai、OpenArt 等平台有大量高质量工作流 JSON,下载即用,这是 ComfyUI 生态的杀手锏。
- 混用本地与云端 API:ComfyUI。Partner Nodes 允许在同一工作流中混用本地 Flux 和云端 GPT-5.6 / Seedance,实现”本地省钱 + 云端兜底”的混合策略。
典型类库与工具
Section titled “典型类库与工具”| 类库 | 语言 | 说明 |
|---|---|---|
| ComfyUI | Python/JS | 节点式 AI 媒体工作流引擎,覆盖图像/视频/3D/音频/LLM 全模态,2025-2026 年最活跃的开源 AI 工具 |
| Comfy Desktop | TypeScript/Electron | ComfyUI 官方桌面客户端,一键安装,无缝同步 Comfy Platform 云服务 |
| ComfyUI Manager | Python | ComfyUI 自定义节点包管理器,一键安装/更新社区节点 |
| AUTOMATIC1111 WebUI | Python/JS | 表单式 SD 界面,Gradio 前端,插件生态历史最庞大,但迭代放缓(v1.10.1) |
| Forge (A1111 fork) | Python | A1111 的性能优化分支,重写了显存管理,支持 Flux 等新模型,是 A1111 用户的首选升级路径 |
| Fooocus | Python | 基于 A1111 后端的极简 UI 工具,面向”一键出图”,由 lllyasviel(ControlNet 作者)开发 |
| InvokeAI | Python/JS | 介于两者之间的折中选择,内置统一画布,Inpaint 体验好,有商业化版本 |
| Stability Matrix | C#/Python | 跨平台桌面客户端,一键管理 A1111/ComfyUI/InvokeAI 多后端,适合不想折腾环境配置的用户 |
| Diffusers | Python | Hugging Face 的扩散模型库,是 ComfyUI 和许多工具底层依赖的模型加载/推理引擎 |
| 术语 | 英文 | 解释 |
|---|---|---|
| 表单式界面 | Form-based UI | A1111 的交互范式:文本框 + 滑块 + 按钮,用户调参数不调结构 |
| 节点式界面 | Node-based UI | ComfyUI 的交互范式:拖拽节点连线,用户直接编排管线结构 |
| 工作流 | Workflow | ComfyUI 中由节点和连线组成的完整生成管线,保存为 JSON |
| 扩展 | Extension | A1111 的插件机制,向 UI 注入新选项卡或修改处理逻辑 |
| 自定义节点 | Custom Node | ComfyUI 的扩展机制,注册新节点类型供用户连入工作流 |
| 处理对象 | Processing | A1111 内部封装一次生成请求全流程的核心类 |
| 拓扑排序 | Topological Sort | ComfyUI 执行引擎对 DAG 节点排序的算法,确定执行先后 |
| Partner Nodes | Partner Nodes | ComfyUI 的云端 API 节点机制,允许在工作流中直接调用 OpenAI、Google、ByteDance 等商业模型 |
| 量化推理 | Quantization | 将模型权重从 fp16 压缩到 int8/int4,降低显存占用和推理延迟 |
| 潜空间 | Latent Space | VAE 压缩后的低维表示空间,扩散模型在此空间执行去噪过程 |
| DiT | Diffusion Transformer | 用 Transformer 架构替代 UNet 的扩散模型,Flux、SD3 等新一代模型采用此架构 |
- ComfyUI GitHub:comfyanonymous/ComfyUI——ComfyUI 主仓库,理解节点式架构与执行引擎实现的最佳资料。2025-2026 年迭代极快,截至 2026 年 8 月已发布至 v0.29.2。
- ComfyUI 官方网站:comfy.org——ComfyUI 商业化后的官方网站,包含 Comfy Platform 云服务、桌面客户端下载、官方教程和 Newsletter。
- AUTOMATIC1111 GitHub:AUTOMATIC1111/stable-diffusion-webui——A1111 主仓库,Wiki 文档详尽,是了解表单式 SD 界面的首要参考。最新版本 v1.10.1。
- 节点式工作流详解:本站的 ComfyUI 与节点式生成 系统讲解了节点类型、DAG 原理、高级节点组合等概念。
- ControlNet 与 LoRA:两者的技术原理分别见 ControlNet 与可控生成 和 图像 LoRA 训练,这些是两个前端共同依赖的核心技术。
- Forge 分支:lllyasviel/stable-diffusion-webui-forge——A1111 的性能优化 fork,借鉴了 ComfyUI 的显存调度思路,是 A1111 用户提升 SDXL 性能和体验 Flux 的首选。
- 扩散模型原理:扩散模型 和 DiT 架构 解释了这些前端工具底层运行的模型是如何工作的。
- 采样器详解:采样器 深入讲解了 DPM++、Euler 等采样算法的原理和适用场景。