Midjourney 与开源生图生态
图像生成领域形成了三条截然不同的产品路线:Midjourney 代表闭源 SaaS 质量标杆,Stable Diffusion 生态代表开源本地管线,DALL-E / GPT Image 代表大模型平台集成。本页对比三者的技术架构、商业模式与创作工作流。前置阅读:扩散模型、图像生成模型演进。
把图像生成产品想象成三种餐厅——
- Midjourney = 米其林私厨:不用管厨房里发生了什么,你只管提需求(prompt,即用文字描述你想要的画面),大厨(闭源模型)端出一盘精美的菜。品质极高,但你不能改配方、不能带回家、按份付费。
- Stable Diffusion 生态 = 共享厨房 + 开源菜谱:模型权重(model weights,即神经网络的全部可学习参数)公开下载,你可以在自己电脑上搭管线——像搭 ComfyUI 工作流 一样自由组合 ControlNet、LoRA、放大器。菜可以随便改,但厨艺得自己练。
- DALL-E / GPT Image = 超市里的预制菜柜台:它藏在 ChatGPT 里,你用大白话描述需求,ChatGPT 帮你自动重写 prompt 再交给底层图像模型生成。门槛最低,但灵活性和可控性也最弱。
核心分歧在于”闭源 vs 开源”与”托管 vs 本地”。闭源产品以 API(Application Programming Interface,应用程序编程接口)形式提供服务,你付费用图,看不到模型;开源生态把模型权重和推理代码全部公开,你在自己的 GPU 上运行完整的扩散管线(diffusion pipeline,即从随机噪声逐步去噪生成图像的完整流程)。
技术架构拆解
Section titled “技术架构拆解”三类产品在技术栈上的定位差异巨大——从模型训练、推理部署到用户交互,每个环节的设计哲学都不同。
三类产品技术架构定位
Section titled “三类产品技术架构定位”生成请求处理流程对比
Section titled “生成请求处理流程对比”三类产品接收到用户 prompt 后的处理链路差异,决定了它们的可控性和易用性:
技术路线对比
Section titled “技术路线对比”| 维度 | Midjourney | Stable Diffusion 生态 | DALL-E 3 / GPT Image |
|---|---|---|---|
| 模型开源 | 闭源,仅通过 API 使用 | 完全开源,权重可下载 | 闭源,通过 OpenAI API 使用 |
| 架构推测 | 扩散模型(疑似融合自回归与 Transformer) | 潜在扩散模型(LDM)/ 多模态扩散 Transformer | 扩散模型,与 GPT 深度耦合;GPT Image 为原生多模态自回归 |
| 交互方式 | Discord bot / Web 界面 | 本地 WebUI / 节点编辑器 | ChatGPT 对话 |
| 可控性 | prompt 参数 + 风格/角色参考 | ControlNet + LoRA 精细控制 | 自然语言描述 |
| 部署方式 | 纯云端 SaaS | 本地推理或云 GPU | 纯云端 API |
| 费用模式 | 按月订阅(10-120 美元/月) | 模型免费,硬件/电费自付 | 按 API token 计费或包含在 ChatGPT Plus 中 |
| 社区生态 | 官方社区为主 | Civitai 海量模型/LoRA/工作流 | 依赖 OpenAI 生态 |
扩散模型基础:理解共同的技术底座
Section titled “扩散模型基础:理解共同的技术底座”什么是扩散模型(Diffusion Model)? 想象你往一杯清水里滴墨水——墨水慢慢扩散直到完全浑浊,这是”前向加噪”。扩散模型学会的是逆向过程:从一张完全随机的噪声图中,一步步把噪声去掉(“去噪”),最终”雕刻”出一张有意义的图像。训练时,模型看无数张”加噪→原图”的对照样本,学会在每一步预测应该去掉多少噪声。
无论闭源还是开源,当前主流图像生成产品都基于扩散模型。但具体实现上有深层差异:
潜在扩散(Latent Diffusion):降本增效的关键创新
Section titled “潜在扩散(Latent Diffusion):降本增效的关键创新”Stable Diffusion 之所以能在消费级 GPU 上运行,核心在于潜在扩散模型(Latent Diffusion Model, LDM)——它不在像素空间(比如 512×512×3 = 786,432 个数值)里做去噪,而是先用 VAE(Variational Autoencoder,变分自编码器——一种将高维数据压缩到低维”潜在空间”再还原的神经网络)把图像压缩到 64×64×4 的潜在表示(latent representation),在这个小得多的空间里做扩散。计算量降低约 64 倍,使消费级显卡也能运行。
文本如何引导生成:文本编码器与交叉注意力
Section titled “文本如何引导生成:文本编码器与交叉注意力”扩散模型本身不懂文字。要让它”听懂”你的 prompt,需要文本编码器(text encoder)把文字转换成向量(即一组浮点数),再通过交叉注意力机制(cross-attention)注入去噪网络。Stable Diffusion 各版本使用的文本编码器不断进化:
- SD 1.x:CLIP ViT-L/14(OpenAI 开源的图文对齐模型,将文本和图像映射到同一向量空间)
- SDXL:双文本编码器(CLIP ViT-L + OpenCLIP ViT-bigG),拼接两者的嵌入向量提升语义理解
- SD 3.x:引入三个文本编码器(CLIP × 2 + T5-XXL),T5(Google 的通用大语言模型)的加入大幅提升了对复杂 prompt 的理解力
从 U-Net 到 MMDiT:架构演进
Section titled “从 U-Net 到 MMDiT:架构演进”Stable Diffusion 1.x~XL 使用 U-Net(一种 U 形的卷积神经网络,因编码器-解码器对称结构形似字母 U 而得名)作为去噪骨干网络。SD 3 彻底更换为 MMDiT(Multimodal Diffusion Transformer,多模态扩散 Transformer)——用 Transformer 替代卷积 U-Net,在 Transformer 块内部混合文本编码和图像编码(而非单向的文本→图像影响),这是向更大规模模型扩展的关键架构选择。
什么是 Transformer? Transformer 是 2017 年 Google 论文 “Attention is All You Need” 提出的神经网络架构,核心是自注意力机制(self-attention)——让序列中每个位置都能”看到”并加权聚合所有其他位置的信息。它是 GPT、BERT 等大语言模型的基石,如今也被扩散模型采用作为去噪骨干。
Midjourney 的具体架构未公开,但从 V6 开始的行为表现推测——它显著加强了文本对齐能力(类似 DALL-E 3 的 prompt 重写思路),V7/V8 可能融合了自回归(autoregressive,逐 token 生成)与扩散两条技术路线。
关键技术点详解
Section titled “关键技术点详解”Stable Diffusion 的可控生成栈
Section titled “Stable Diffusion 的可控生成栈”开源生态最大的优势是可组合的控制工具链——这是闭源产品难以匹敌的核心竞争力:
- ControlNet:用线稿(canny)、深度图(depth map,表示场景中每个像素到相机的距离)、人体姿态(openpose)等结构信号精确约束生成构图,是实现”按草稿出图”的核心技术。原理是复制一份 U-Net 权重作为”可训练副本”,用结构图训练它学会在特定约束下微调输出,而原始权重”锁定”不变——这种”零卷积”设计保证小数据集训练也不会破坏基础模型。
- LoRA 微调(Low-Rank Adaptation,低秩适配——一种只训练少量低秩矩阵来近似全参数微调的高效方法):用少量样本(10-20 张)微调出特定角色、画风、概念,几十 MB 的权重文件即可叠加到基础模型上。LoRA 的数学原理是将原始权重矩阵的更新分解为两个小矩阵的乘积(,其中 和 远小于 ),大幅减少可训练参数量。
- ComfyUI 工作流:节点式管线编排,把 ControlNet + LoRA + 放大 + 局部重绘组合成可复现的 JSON 工作流。详见 ComfyUI vs AUTOMATIC1111 对比。
闭源产品几乎不提供这种级别的控制——Midjourney 的 --sref(风格参考)和 --cref(角色参考)是有限的方向尝试,DALL-E 3 / GPT Image 则完全依赖自然语言。
Midjourney 的 prompt 语法体系
Section titled “Midjourney 的 prompt 语法体系”Midjourney 有一套独特的参数语法,直接附加在 prompt 文本末尾:
--ar 16:9:设置宽高比。--v 8:指定模型版本。--s 750:stylize 值,控制艺术风格强度(0-1000)。--chaos 50:增加初代候选图的差异度。--style raw:减少 Midjourney 默认美化倾向,更忠于 prompt。--sref [URL]:用参考图的风格引导生成(Style Reference)。--cref [URL] --cw 100:用参考图的角色引导生成(Character Reference),--cw控制角色权重。--iw 2:图像权重(Image Weight),控制上传参考图对结果的影响程度。
DALL-E 3 的 prompt 自动重写与 GPT Image 的演进
Section titled “DALL-E 3 的 prompt 自动重写与 GPT Image 的演进”DALL-E 3 的核心创新不在模型本身,而在于用 GPT-4 重写用户 prompt。用户输入”一只猫在月球上”,GPT-4 会扩写成详细的描述性 prompt(“一只毛茸茸的橘猫站在月球表面,背景是蓝色的地球,电影级光影……”),再交给 DALL-E 3 生成。这大幅降低了 prompt engineering(提示工程——编写有效提示词以引导模型输出的技巧)门槛,但也意味着用户失去了对最终 prompt 的直接控制。
2025 年 3 月,OpenAI 推出 GPT Image,取代了 DALL-E 3 在 ChatGPT 中的位置。GPT Image 是一种原生多模态自回归模型——不再像 DALL-E 3 那样依赖独立的扩散模型,而是让 GPT-4o 直接生成图像 token(即图像被编码成离散序列后逐个生成)。这意味着图像生成和文本生成共享同一个模型权重,实现了文字与图像的真正统一。
FLUX:开源生态的新挑战者
Section titled “FLUX:开源生态的新挑战者”2024 年,由 Stable Diffusion 原始团队成员创立的 Black Forest Labs 发布了 FLUX 系列模型,迅速成为开源图像生成的新标杆。FLUX 采用 Rectified Flow Transformer 架构(与 SD 3 同源但规模更大),提供开源权重(FLUX.1 [dev]/[schnell])和闭源 API(FLUX.1 [pro])双轨模式。截至 2026 年,Black Forest Labs 预告了 FLUX 3,将支持图像、视频、音频和动作预测的多模态统一模型,直接对标 Midjourney 和 OpenAI 的多模态路线。
2025-2026 最新进展
Section titled “2025-2026 最新进展”图像生成领域在过去一年经历了剧烈变化——模型版本快速迭代、法律诉讼集中爆发、竞争格局重新洗牌。
Midjourney:V7→V8→V8.1 与版权风暴
Section titled “Midjourney:V7→V8→V8.1 与版权风暴”- V7(2025 年 4 月):时隔近一年发布的全新模型,引入全新的底层架构,画质和文本对齐显著提升。
- V8(2026 年 3 月)/ V8.1(2026 年 4 月):Alpha 阶段发布,进一步增强了真实感和文本渲染能力。Niji V7(2026 年 1 月)同步更新了动漫专用模型。
- Web 平台全面开放:自 2024 年 8 月推出 Web 界面以来,Midjourney 逐步摆脱对 Discord 的依赖,2025 年起 Web 端已成为主力交互方式,集成了区域重绘(Vary Region)、缩放、平移、风格混合等编辑工具。
- 版权诉讼:2025 年 6 月,迪士尼和环球影业联合起诉 Midjourney 侵犯版权,称其为”无底线的剽窃黑洞”;2025 年 9 月,华纳兄弟加入诉讼行列。这些诉讼聚焦于 Midjourney 能轻松生成蝙蝠侠、超人等知名 IP 形象,可能深刻影响 AI 生图行业的内容审核标准。
Stable Diffusion:SD 3.5 与社区分化
Section titled “Stable Diffusion:SD 3.5 与社区分化”- SD 3.5(2024 年 10 月):包含 Large(80 亿参数)、Large Turbo(蒸馏加速版,4 步出图)和 Medium(25 亿参数)三个规格。采用 MMDiT 架构和 Rectified Flow 训练方法,文本理解能力大幅提升。
- 许可证变更:SD 3.5 从早期的 CreativeML Open RAIL-M 改为 Stability AI Community License——年收入超过 100 万美元的企业需购买 Enterprise License,个人和小团队仍可免费商用。这一变更在社区引发了”开源是否还开源”的讨论。
- Getty Images 诉讼落幕:2025 年 11 月,英国法院基本驳回了 Getty Images 对 Stability AI 的多数侵权指控,被视为 AI 训练合理使用(fair use)的一次重要判例。
- 社区持续繁荣:Civitai 平台上积累了数万个社区训练的 LoRA、Checkpoint 和工作流,SD 1.5 因其轻量和可控性至今仍是社区最活跃的基座模型。FLUX 的崛起为开源生态注入了新的活力。
DALL-E 3 → GPT Image:平台集成路线的进化
Section titled “DALL-E 3 → GPT Image:平台集成路线的进化”- GPT Image 取代 DALL-E 3(2025 年 3 月):DALL-E 3 作为独立模型已逐步退出历史舞台,ChatGPT 中的图像生成能力由 GPT Image 接管。新模型支持更精准的文本渲染、多图编辑和风格保持。
- C2PA 水印:自 2024 年 2 月起,OpenAI 的所有生成图像均嵌入 C2PA(Coalition for Content Provenance and Authenticity)元数据标准的水印,用于标识 AI 生成来源。
- 定价策略:GPT Image 的费用包含在 ChatGPT Plus(20 美元/月)订阅中,API 按 token 计费,降低了入门门槛但增加了重度用户的成本。
商业模式深度分析
Section titled “商业模式深度分析”三条路线背后是三种完全不同的商业逻辑:
Midjourney:自给自足的订阅制
Section titled “Midjourney:自给自足的订阅制”Midjourney 从 2022 年起就持续盈利,不依赖外部融资——这在 AI 行业极为罕见。创始人 David Holz(Leap Motion 联合创始人)坚持小团队路线,仅有数十名员工。收入完全来自订阅:
- Basic:10 美元/月(约 200 张快速生成)
- Standard:30 美元/月(15 小时快速 + 无限慢速)
- Pro:60 美元/月(30 小时快速 + 隐私模式 + 商用许可)
- Mega:120 美元/月(60 小时快速)
这种模式的优势是不被投资人裹挟,可以专注于画质而非规模扩张;劣势是扩展速度受限,缺乏 API 生态。
Stable Diffusion:开源生态 + 多元变现
Section titled “Stable Diffusion:开源生态 + 多元变现”Stability AI 的商业模式更复杂——开源模型免费获取,通过服务层变现:
- DreamStudio:官方云端推理平台,按次付费
- API 服务:面向企业的 SD 3.5 推理 API,也部署在 AWS Bedrock 等云平台
- Enterprise License:年收入超 100 万美元的企业需购买商业许可
- 社区生态间接变现:Civitai、Replicate、fal.ai 等第三方平台围绕 SD 模型构建了完整的”模型市场 + 云推理”经济
这种模式的优势是社区飞轮效应——全球开发者免费贡献 LoRA、ControlNet、工作流,不断扩充生态价值;劣势是盈利能力不稳定,Stability AI 经历了管理层动荡和融资困难。
DALL-E / GPT Image:平台捆绑
Section titled “DALL-E / GPT Image:平台捆绑”OpenAI 不靠图像生成单独收费——图像生成是 ChatGPT 生态的附加值,目的是增强用户粘性和订阅意愿。API 计费则面向开发者生态。这种策略将图像生成变成了大模型平台的”功能”而非独立产品。
用户体验设计对比
Section titled “用户体验设计对比”Midjourney:从 Discord 到 Web 的产品进化
Section titled “Midjourney:从 Discord 到 Web 的产品进化”Midjourney 最初只通过 Discord bot 运行——这既是限制也是特色:用户在公共频道中生成图像,天然形成了”看别人怎么写 prompt”的学习社区。2024 年 Web 界面全面开放后,产品体验从”命令行式”进化为可视化编辑器,但保留了 prompt 参数语法体系。设计哲学是质量优先、操作极简:用户只需写 prompt + 选参数,不需要理解底层原理。
Stable Diffusion:专业工具的专业体验
Section titled “Stable Diffusion:专业工具的专业体验”开源生态面向的是愿意投入学习成本的专业用户:
- AUTOMATIC1111 WebUI(详见专题):表单式界面,上手快,参数一目了然
- ComfyUI:节点式编辑器,类似 Blender / Houdini 的可视化编程——拖拽节点连线,构建完整管线,工作流可导出为 JSON 复现和分享
- Fooocus:简化版界面,“一键出图”理念,降低 SD 的使用门槛
GPT Image:零门槛对话式体验
Section titled “GPT Image:零门槛对话式体验”用户只需用自然语言描述需求,GPT 自动重写 prompt、生成图像、支持迭代修改(“把背景改成夜晚""给她加一副眼镜”)。完全不需要学习任何参数语法,代价是失去精细控制力。
技术选型建议
Section titled “技术选型建议”场景驱动选型
Section titled “场景驱动选型”| 需求场景 | 推荐选择 | 理由 |
|---|---|---|
| 极致画质、概念图、情绪板 | Midjourney | 闭源模型的美学调优行业领先,开箱即用 |
| 完全可控、批量生产、集成管线 | SD 生态 + ComfyUI | ControlNet + LoRA 提供像素级控制,可程序化批处理 |
| 快速出图、零学习成本 | GPT Image(ChatGPT) | 对话式交互,LLM 自动优化 prompt |
| 角色/IP 一致性系列 | Midjourney --cref 或 SD + LoRA | 前者简单但一致性有限,后者需训练但可精确复现 |
| 电商商品图、换背景 | SD + ControlNet depth | 从商品实拍图约束结构,精准生成新场景 |
| 企业 API 集成 | OpenAI API / Stability API | 稳定的 SLA 保障,无需自建推理基础设施 |
| 预算为零、本地隐私 | SD 生态 | 模型免费,只需一块显卡 |
显存与硬件规划
Section titled “显存与硬件规划”| 模型 | 最低显存(fp16) | 推荐显存 | 备注 |
|---|---|---|---|
| SD 1.5 | 4 GB | 6-8 GB | 社区生态最丰富,轻量高效 |
| SDXL | 8 GB | 12-16 GB | 原生 1024×1024,画质显著提升 |
| SD 3.5 Medium | 8 GB | 12 GB | 25 亿参数,MMDiT 架构 |
| SD 3.5 Large | 16 GB | 24 GB | 80 亿参数,文本理解最强 |
| FLUX.1 [dev] | 12 GB | 24 GB | 开源新标杆,质量接近闭源 |
什么是量化(Quantization)? 量化是将模型参数从高精度浮点数(如 fp32,每个参数占 32 bit)压缩到低精度(如 fp16/int8/int4),以减少显存占用和推理速度。代价是少量精度损失——fp16 几乎无损,int8/int4 可能有可见画质下降。云端 GPU 平台(Replicate、fal.ai)按次计费(约 0.01-0.05 美元/张),偶尔使用比购买显卡更划算。
调用 OpenAI GPT Image API 生成图像
Section titled “调用 OpenAI GPT Image API 生成图像”import base64from openai import OpenAI
client = OpenAI(api_key="sk-your-key")
# GPT Image(DALL-E 3 的继任者)原生集成在 OpenAI API 中# 它会自动用 GPT 重写 prompt 再生成result = client.images.generate( model="gpt-image-1", # GPT Image 模型 prompt="一只赛博朋克风格的猫坐在霓虹灯下的街角,雨水倒映着招牌", size="1024x1024", # 可选 1024x1024 / 1536x1024 / 1024x1536 quality="high", # low / medium / high / auto n=1,)
# GPT Image 返回 base64 编码的图像img_data = base64.b64decode(result.data[0].b64_json)with open("cyber_cat.png", "wb") as f: f.write(img_data)print("图像已保存到 cyber_cat.png")注意:DALL-E 3 仍可通过 API 调用(
model="dall-e-3"),但 OpenAI 已将 ChatGPT 内的图像生成迁移到 GPT Image。新项目建议直接使用 GPT Image。
调用 Stability AI API(SD 3.5 云端推理)
Section titled “调用 Stability AI API(SD 3.5 云端推理)”import requests
# Stability AI 的 SD 3.5 推理 API(无需本地 GPU)url = "https://api.stability.ai/v2beta/stable-image/generate/sd3"headers = {"Authorization": "Bearer sk-your-key", "Accept": "image/*"}
# 用 multipart 表单提交参数files = {"none": ""} # 必须有至少一个文件字段data = { "prompt": "a futuristic city at sunset, ultra detailed, 8k", "negative_prompt": "blurry, low quality", "model": "sd3-large", # sd3-large / sd3-large-turbo / sd3-medium "mode": "text-to-image", "aspect_ratio": "16:9", "seed": 42,}
resp = requests.post(url, headers=headers, files=files, data=data, timeout=120)with open("city_sunset.png", "wb") as f: f.write(resp.content) # 直接返回二进制图像print("图像已保存到 city_sunset.png")本地运行 Stable Diffusion(使用 diffusers 库)
Section titled “本地运行 Stable Diffusion(使用 diffusers 库)”# 安装:pip install diffusers transformers accelerate torchimport torchfrom diffusers import StableDiffusionXLPipeline
# 加载 SDXL 模型(首次运行会自动下载约 7GB 权重)pipe = StableDiffusionXLPipeline.from_pretrained( "stabilityai/stable-diffusion-xl-base-1.0", torch_dtype=torch.float16, # fp16 量化,显存减半 variant="fp16",).to("cuda") # 移到 GPU
# 生成图像image = pipe( prompt="a serene mountain lake at dawn, reflections, photorealistic", negative_prompt="blurry, distorted, low quality", width=1024, height=1024, num_inference_steps=30, # 去噪步数,越多越精细但越慢 guidance_scale=7.5, # CFG:控制 prompt 引导强度 num_images_per_prompt=1,).images[0]
image.save("mountain_lake.png")print("图像已保存到 mountain_lake.png")关键参数解释:
num_inference_steps(推理步数)控制去噪迭代次数——通常 20-50 步即可,更多步数收益递减。guidance_scale(CFG,Classifier-Free Guidance)控制模型对 prompt 的”服从程度”——值越高越忠于描述但可能过饱和,值越低越有创意但可能偏离意图,推荐 5-10。
- 先明确需求再选工具:要极致画质且不在意可控性 → Midjourney;要完全可控且愿意折腾 → Stable Diffusion + ComfyUI;要最低门槛快速出图 → GPT Image via ChatGPT。
- Midjourney 的高阶玩法在参数组合:
--sref参考风格 +--cref锁定角色 +--chaos增加变体,三者组合可以稳定产出系列风格化作品。 - 开源生态务必先跑通基础管线:先用 SDXL/FLUX 基础模型生成出图,再加 ControlNet,最后加 LoRA——一步到位搭复杂管线容易出错且难排查。详见 ComfyUI vs AUTOMATIC1111。
- 显存规划:SD 1.5 需 4GB,SDXL 需 8GB,SD 3.5 Large / FLUX 需 16-24GB;用 fp16 量化可减半。云端方案(Replicate、fal.ai)按次计费,偶尔用比买显卡划算。
- 商业使用注意许可:Midjourney 订阅用户生成的图像商用需 Pro 及以上计划;Stable Diffusion 3.5 遵循 Stability AI Community License(年收入超 100 万美元需 Enterprise License);GPT Image 生成图归用户所有。
- prompt 差异巨大:Midjourney 偏好简洁意象 + 风格关键词(“ethereal, dreamlike —ar 2:3”),SD 需要详细描述 + 负面提示词(negative prompt,指定不希望出现的元素),GPT Image 直接大白话即可。
- 关注版权风险:2025 年迪士尼/环球/华纳相继起诉 Midjourney,Getty Images 对 Stability AI 的诉讼在 2025 年 11 月基本败诉。AI 生成图像的版权归属和训练数据合法性仍是未定之论,商业项目务必咨询法律意见。
典型应用场景
Section titled “典型应用场景”- 品牌视觉与广告创意(Midjourney):广告设计师用 Midjourney V8 快速产出高质量概念图和情绪板,
--sref统一系列风格,几小时内出几十版方案供客户挑选。 - 游戏美术资产管线(SD 生态):游戏团队用 ComfyUI + ControlNet 批量生成纹理、概念设定、NPC 头像,LoRA 训练角色专属画风,整套管线自动化集成进美术生产流程。
- 电商商品图(SD 生态 / GPT Image):用 ControlNet 的 depth 模式从商品实拍图生成多场景背景,或用 GPT Image 快速生成营销配图,降低拍摄成本。
- 个人创作与艺术探索(Midjourney / SD / FLUX):独立艺术家在 Midjourney 上探索风格,或用 FLUX + 自训练 LoRA 打造个人标志性画风。
- 教育与科普插图(GPT Image):教师用 ChatGPT 口语化描述即可生成教学插图,无需学习 prompt 工程,门槛极低。
- 建筑与室内设计可视化(SD + ControlNet):用线稿或深度图约束,从 CAD 草图生成照片级渲染效果图,ControlNet 的 canny/mlsd 模式是核心。
典型类库与工具
Section titled “典型类库与工具”| 类库 | 语言 | 说明 |
|---|---|---|
| Midjourney | 在线 | 闭源 SaaS,Discord/Web 交互,V8 为当前最新版本,画质行业标杆 |
| Stable Diffusion | Python | Stability AI 开源的潜在扩散模型,SD 3.5 / FLUX 为当前最新 |
| FLUX (Black Forest Labs) | Python | 2024 年崛起的开源新标杆,Rectified Flow Transformer 架构 |
| ComfyUI | Python/JS | 节点式工作流引擎,开源生态最灵活的管线编排工具 |
| AUTOMATIC1111 WebUI | Python | 表单式 SD 界面,上手快,社区插件丰富 |
| Fooocus | Python | 简化版 SD 界面,“一键出图”理念,降低使用门槛 |
| GPT Image | API | OpenAI 的原生多模态图像生成模型,2025 年取代 DALL-E 3 |
| Civitai | 在线 | SD 社区最大的模型/LoRA/工作流分享平台 |
| Replicate / fal.ai | API | 云端 GPU 平台,按次付费运行开源 SD / FLUX 模型 |
| diffusers | Python | Hugging Face 的扩散模型库,适合编程式调用 |
| 术语 | 英文 | 解释 |
|---|---|---|
| 闭源 SaaS | Closed-source SaaS | 模型和推理代码不公开,仅通过 API 或界面提供服务(SaaS = Software as a Service) |
| 潜在扩散模型 | Latent Diffusion Model (LDM) | 在 VAE 压缩的潜在空间中进行扩散,大幅降低计算成本 |
| VAE | Variational Autoencoder | 变分自编码器,将高维图像压缩到低维潜在空间再还原的神经网络 |
| CLIP | Contrastive Language-Image Pre-training | OpenAI 的图文对齐模型,将文本和图像映射到同一向量空间 |
| U-Net | U-Net | U 形卷积网络,SD 1.x~XL 的去噪骨干;SD 3 起被 MMDiT 替代 |
| MMDiT | Multimodal Diffusion Transformer | 多模态扩散 Transformer,在 Transformer 块内混合文本与图像编码 |
| Transformer | Transformer | 基于自注意力机制的神经网络架构,大语言模型和现代扩散模型的基石 |
| LoRA | Low-Rank Adaptation | 低秩适配,用少量参数高效微调大模型的方法 |
| Prompt 重写 | Prompt Rewriting | 用 LLM 将用户简短描述扩写为详细生成 prompt 的技术 |
| 风格参考 | Style Reference (—sref) | Midjourney 的功能,用参考图引导生成图像的艺术风格 |
| 角色参考 | Character Reference (—cref) | Midjourney 的功能,用参考图保持生成角色的外貌一致性 |
| 负面提示词 | Negative Prompt | 指定不希望出现的元素,引导模型避开(SD 生态常用) |
| Stylize 值 | Stylize Parameter | Midjourney 参数,控制模型艺术化处理的强度 |
| 量化 | Quantization | 将模型参数从高精度浮点压缩到低精度(fp16/int8),减少显存占用 |
| CFG | Classifier-Free Guidance | 无分类器引导,控制模型对 prompt 服从程度的参数 |
| C2PA | Coalition for Content Provenance and Authenticity | 内容来源标识标准,用于在 AI 生成图像中嵌入来源元数据 |
- 扩散模型 (Diffusion Model):理解三类产品背后的共同技术底座——前向加噪与反向去噪过程。
- 图像生成模型演进:从 GAN 到 VAE 再到扩散模型,梳理图像生成的技术发展脉络。
- SD 架构详解:Stable Diffusion 的 VAE + U-Net + 文本编码器三件套深度拆解。
- DiT 架构:Diffusion Transformer——SD 3 和 Sora 背后的新架构范式。
- ComfyUI 与节点式生成:开源生态中最灵活的管线编排工具详解。
- ControlNet 与可控生成:Stable Diffusion 精确构图控制的核心技术。
- 图像 LoRA 训练:用少量样本定制模型风格与角色的轻量微调方法。
- CFG 引导:Classifier-Free Guidance 的原理与调参技巧。
- ComfyUI vs AUTOMATIC1111:开源生图两大界面的深度对比与选择指南。
- PEFT 方法:LoRA 等 Parameter-Efficient Fine-Tuning 方法的系统综述。