Skip to content

Midjourney 与开源生图生态

图像生成领域形成了三条截然不同的产品路线:Midjourney 代表闭源 SaaS 质量标杆,Stable Diffusion 生态代表开源本地管线,DALL-E / GPT Image 代表大模型平台集成。本页对比三者的技术架构、商业模式与创作工作流。前置阅读:扩散模型、图像生成模型演进。

把图像生成产品想象成三种餐厅——

  • Midjourney = 米其林私厨:不用管厨房里发生了什么,你只管提需求(prompt,即用文字描述你想要的画面),大厨(闭源模型)端出一盘精美的菜。品质极高,但你不能改配方、不能带回家、按份付费。
  • Stable Diffusion 生态 = 共享厨房 + 开源菜谱:模型权重(model weights,即神经网络的全部可学习参数)公开下载,你可以在自己电脑上搭管线——像搭 ComfyUI 工作流 一样自由组合 ControlNet、LoRA、放大器。菜可以随便改,但厨艺得自己练。
  • DALL-E / GPT Image = 超市里的预制菜柜台:它藏在 ChatGPT 里,你用大白话描述需求,ChatGPT 帮你自动重写 prompt 再交给底层图像模型生成。门槛最低,但灵活性和可控性也最弱。

核心分歧在于”闭源 vs 开源”与”托管 vs 本地”。闭源产品以 API(Application Programming Interface,应用程序编程接口)形式提供服务,你付费用图,看不到模型;开源生态把模型权重和推理代码全部公开,你在自己的 GPU 上运行完整的扩散管线(diffusion pipeline,即从随机噪声逐步去噪生成图像的完整流程)。

三类产品在技术栈上的定位差异巨大——从模型训练、推理部署到用户交互,每个环节的设计哲学都不同。

三类产品接收到用户 prompt 后的处理链路差异,决定了它们的可控性和易用性:

维度MidjourneyStable Diffusion 生态DALL-E 3 / GPT Image
模型开源闭源,仅通过 API 使用完全开源,权重可下载闭源,通过 OpenAI API 使用
架构推测扩散模型(疑似融合自回归与 Transformer)潜在扩散模型(LDM)/ 多模态扩散 Transformer扩散模型,与 GPT 深度耦合;GPT Image 为原生多模态自回归
交互方式Discord bot / Web 界面本地 WebUI / 节点编辑器ChatGPT 对话
可控性prompt 参数 + 风格/角色参考ControlNet + LoRA 精细控制自然语言描述
部署方式纯云端 SaaS本地推理或云 GPU纯云端 API
费用模式按月订阅(10-120 美元/月)模型免费,硬件/电费自付按 API token 计费或包含在 ChatGPT Plus 中
社区生态官方社区为主Civitai 海量模型/LoRA/工作流依赖 OpenAI 生态

扩散模型基础:理解共同的技术底座

Section titled “扩散模型基础:理解共同的技术底座”

什么是扩散模型(Diffusion Model)? 想象你往一杯清水里滴墨水——墨水慢慢扩散直到完全浑浊,这是”前向加噪”。扩散模型学会的是逆向过程:从一张完全随机的噪声图中,一步步把噪声去掉(“去噪”),最终”雕刻”出一张有意义的图像。训练时,模型看无数张”加噪→原图”的对照样本,学会在每一步预测应该去掉多少噪声。

无论闭源还是开源,当前主流图像生成产品都基于扩散模型。但具体实现上有深层差异:

潜在扩散(Latent Diffusion):降本增效的关键创新

Section titled “潜在扩散(Latent Diffusion):降本增效的关键创新”

Stable Diffusion 之所以能在消费级 GPU 上运行,核心在于潜在扩散模型(Latent Diffusion Model, LDM)——它不在像素空间(比如 512×512×3 = 786,432 个数值)里做去噪,而是先用 VAE(Variational Autoencoder,变分自编码器——一种将高维数据压缩到低维”潜在空间”再还原的神经网络)把图像压缩到 64×64×4 的潜在表示(latent representation),在这个小得多的空间里做扩散。计算量降低约 64 倍,使消费级显卡也能运行。

文本如何引导生成:文本编码器与交叉注意力

Section titled “文本如何引导生成:文本编码器与交叉注意力”

扩散模型本身不懂文字。要让它”听懂”你的 prompt,需要文本编码器(text encoder)把文字转换成向量(即一组浮点数),再通过交叉注意力机制(cross-attention)注入去噪网络。Stable Diffusion 各版本使用的文本编码器不断进化:

  • SD 1.x:CLIP ViT-L/14(OpenAI 开源的图文对齐模型,将文本和图像映射到同一向量空间)
  • SDXL:双文本编码器(CLIP ViT-L + OpenCLIP ViT-bigG),拼接两者的嵌入向量提升语义理解
  • SD 3.x:引入三个文本编码器(CLIP × 2 + T5-XXL),T5(Google 的通用大语言模型)的加入大幅提升了对复杂 prompt 的理解力

Stable Diffusion 1.x~XL 使用 U-Net(一种 U 形的卷积神经网络,因编码器-解码器对称结构形似字母 U 而得名)作为去噪骨干网络。SD 3 彻底更换为 MMDiT(Multimodal Diffusion Transformer,多模态扩散 Transformer)——用 Transformer 替代卷积 U-Net,在 Transformer 块内部混合文本编码和图像编码(而非单向的文本→图像影响),这是向更大规模模型扩展的关键架构选择。

什么是 Transformer? Transformer 是 2017 年 Google 论文 “Attention is All You Need” 提出的神经网络架构,核心是自注意力机制(self-attention)——让序列中每个位置都能”看到”并加权聚合所有其他位置的信息。它是 GPT、BERT 等大语言模型的基石,如今也被扩散模型采用作为去噪骨干。

Midjourney 的具体架构未公开,但从 V6 开始的行为表现推测——它显著加强了文本对齐能力(类似 DALL-E 3 的 prompt 重写思路),V7/V8 可能融合了自回归(autoregressive,逐 token 生成)与扩散两条技术路线。

开源生态最大的优势是可组合的控制工具链——这是闭源产品难以匹敌的核心竞争力:

  • ControlNet:用线稿(canny)、深度图(depth map,表示场景中每个像素到相机的距离)、人体姿态(openpose)等结构信号精确约束生成构图,是实现”按草稿出图”的核心技术。原理是复制一份 U-Net 权重作为”可训练副本”,用结构图训练它学会在特定约束下微调输出,而原始权重”锁定”不变——这种”零卷积”设计保证小数据集训练也不会破坏基础模型。
  • LoRA 微调(Low-Rank Adaptation,低秩适配——一种只训练少量低秩矩阵来近似全参数微调的高效方法):用少量样本(10-20 张)微调出特定角色、画风、概念,几十 MB 的权重文件即可叠加到基础模型上。LoRA 的数学原理是将原始权重矩阵的更新分解为两个小矩阵的乘积(W=W0+A×BW = W_0 + A \times B,其中 AA 和 BB 远小于 W0W_0),大幅减少可训练参数量。
  • ComfyUI 工作流:节点式管线编排,把 ControlNet + LoRA + 放大 + 局部重绘组合成可复现的 JSON 工作流。详见 ComfyUI vs AUTOMATIC1111 对比。

闭源产品几乎不提供这种级别的控制——Midjourney 的 --sref(风格参考)和 --cref(角色参考)是有限的方向尝试,DALL-E 3 / GPT Image 则完全依赖自然语言。

Midjourney 有一套独特的参数语法,直接附加在 prompt 文本末尾:

  • --ar 16:9:设置宽高比。
  • --v 8:指定模型版本。
  • --s 750:stylize 值,控制艺术风格强度(0-1000)。
  • --chaos 50:增加初代候选图的差异度。
  • --style raw:减少 Midjourney 默认美化倾向,更忠于 prompt。
  • --sref [URL]:用参考图的风格引导生成(Style Reference)。
  • --cref [URL] --cw 100:用参考图的角色引导生成(Character Reference),--cw 控制角色权重。
  • --iw 2:图像权重(Image Weight),控制上传参考图对结果的影响程度。

DALL-E 3 的 prompt 自动重写与 GPT Image 的演进

Section titled “DALL-E 3 的 prompt 自动重写与 GPT Image 的演进”

DALL-E 3 的核心创新不在模型本身,而在于用 GPT-4 重写用户 prompt。用户输入”一只猫在月球上”,GPT-4 会扩写成详细的描述性 prompt(“一只毛茸茸的橘猫站在月球表面,背景是蓝色的地球,电影级光影……”),再交给 DALL-E 3 生成。这大幅降低了 prompt engineering(提示工程——编写有效提示词以引导模型输出的技巧)门槛,但也意味着用户失去了对最终 prompt 的直接控制。

2025 年 3 月,OpenAI 推出 GPT Image,取代了 DALL-E 3 在 ChatGPT 中的位置。GPT Image 是一种原生多模态自回归模型——不再像 DALL-E 3 那样依赖独立的扩散模型,而是让 GPT-4o 直接生成图像 token(即图像被编码成离散序列后逐个生成)。这意味着图像生成和文本生成共享同一个模型权重,实现了文字与图像的真正统一。

2024 年,由 Stable Diffusion 原始团队成员创立的 Black Forest Labs 发布了 FLUX 系列模型,迅速成为开源图像生成的新标杆。FLUX 采用 Rectified Flow Transformer 架构(与 SD 3 同源但规模更大),提供开源权重(FLUX.1 [dev]/[schnell])和闭源 API(FLUX.1 [pro])双轨模式。截至 2026 年,Black Forest Labs 预告了 FLUX 3,将支持图像、视频、音频和动作预测的多模态统一模型,直接对标 Midjourney 和 OpenAI 的多模态路线。

图像生成领域在过去一年经历了剧烈变化——模型版本快速迭代、法律诉讼集中爆发、竞争格局重新洗牌。

Midjourney:V7→V8→V8.1 与版权风暴

Section titled “Midjourney:V7→V8→V8.1 与版权风暴”
  • V7(2025 年 4 月):时隔近一年发布的全新模型,引入全新的底层架构,画质和文本对齐显著提升。
  • V8(2026 年 3 月)/ V8.1(2026 年 4 月):Alpha 阶段发布,进一步增强了真实感和文本渲染能力。Niji V7(2026 年 1 月)同步更新了动漫专用模型。
  • Web 平台全面开放:自 2024 年 8 月推出 Web 界面以来,Midjourney 逐步摆脱对 Discord 的依赖,2025 年起 Web 端已成为主力交互方式,集成了区域重绘(Vary Region)、缩放、平移、风格混合等编辑工具。
  • 版权诉讼:2025 年 6 月,迪士尼和环球影业联合起诉 Midjourney 侵犯版权,称其为”无底线的剽窃黑洞”;2025 年 9 月,华纳兄弟加入诉讼行列。这些诉讼聚焦于 Midjourney 能轻松生成蝙蝠侠、超人等知名 IP 形象,可能深刻影响 AI 生图行业的内容审核标准。
  • SD 3.5(2024 年 10 月):包含 Large(80 亿参数)、Large Turbo(蒸馏加速版,4 步出图)和 Medium(25 亿参数)三个规格。采用 MMDiT 架构和 Rectified Flow 训练方法,文本理解能力大幅提升。
  • 许可证变更:SD 3.5 从早期的 CreativeML Open RAIL-M 改为 Stability AI Community License——年收入超过 100 万美元的企业需购买 Enterprise License,个人和小团队仍可免费商用。这一变更在社区引发了”开源是否还开源”的讨论。
  • Getty Images 诉讼落幕:2025 年 11 月,英国法院基本驳回了 Getty Images 对 Stability AI 的多数侵权指控,被视为 AI 训练合理使用(fair use)的一次重要判例。
  • 社区持续繁荣:Civitai 平台上积累了数万个社区训练的 LoRA、Checkpoint 和工作流,SD 1.5 因其轻量和可控性至今仍是社区最活跃的基座模型。FLUX 的崛起为开源生态注入了新的活力。

DALL-E 3 → GPT Image:平台集成路线的进化

Section titled “DALL-E 3 → GPT Image:平台集成路线的进化”
  • GPT Image 取代 DALL-E 3(2025 年 3 月):DALL-E 3 作为独立模型已逐步退出历史舞台,ChatGPT 中的图像生成能力由 GPT Image 接管。新模型支持更精准的文本渲染、多图编辑和风格保持。
  • C2PA 水印:自 2024 年 2 月起,OpenAI 的所有生成图像均嵌入 C2PA(Coalition for Content Provenance and Authenticity)元数据标准的水印,用于标识 AI 生成来源。
  • 定价策略:GPT Image 的费用包含在 ChatGPT Plus(20 美元/月)订阅中,API 按 token 计费,降低了入门门槛但增加了重度用户的成本。

三条路线背后是三种完全不同的商业逻辑:

Midjourney 从 2022 年起就持续盈利,不依赖外部融资——这在 AI 行业极为罕见。创始人 David Holz(Leap Motion 联合创始人)坚持小团队路线,仅有数十名员工。收入完全来自订阅:

  • Basic:10 美元/月(约 200 张快速生成)
  • Standard:30 美元/月(15 小时快速 + 无限慢速)
  • Pro:60 美元/月(30 小时快速 + 隐私模式 + 商用许可)
  • Mega:120 美元/月(60 小时快速)

这种模式的优势是不被投资人裹挟,可以专注于画质而非规模扩张;劣势是扩展速度受限,缺乏 API 生态。

Stable Diffusion:开源生态 + 多元变现

Section titled “Stable Diffusion:开源生态 + 多元变现”

Stability AI 的商业模式更复杂——开源模型免费获取,通过服务层变现:

  • DreamStudio:官方云端推理平台,按次付费
  • API 服务:面向企业的 SD 3.5 推理 API,也部署在 AWS Bedrock 等云平台
  • Enterprise License:年收入超 100 万美元的企业需购买商业许可
  • 社区生态间接变现:Civitai、Replicate、fal.ai 等第三方平台围绕 SD 模型构建了完整的”模型市场 + 云推理”经济

这种模式的优势是社区飞轮效应——全球开发者免费贡献 LoRA、ControlNet、工作流,不断扩充生态价值;劣势是盈利能力不稳定,Stability AI 经历了管理层动荡和融资困难。

OpenAI 不靠图像生成单独收费——图像生成是 ChatGPT 生态的附加值,目的是增强用户粘性和订阅意愿。API 计费则面向开发者生态。这种策略将图像生成变成了大模型平台的”功能”而非独立产品。

Midjourney:从 Discord 到 Web 的产品进化

Section titled “Midjourney:从 Discord 到 Web 的产品进化”

Midjourney 最初只通过 Discord bot 运行——这既是限制也是特色:用户在公共频道中生成图像,天然形成了”看别人怎么写 prompt”的学习社区。2024 年 Web 界面全面开放后,产品体验从”命令行式”进化为可视化编辑器,但保留了 prompt 参数语法体系。设计哲学是质量优先、操作极简:用户只需写 prompt + 选参数,不需要理解底层原理。

Stable Diffusion:专业工具的专业体验

Section titled “Stable Diffusion:专业工具的专业体验”

开源生态面向的是愿意投入学习成本的专业用户:

  • AUTOMATIC1111 WebUI(详见专题):表单式界面,上手快,参数一目了然
  • ComfyUI:节点式编辑器,类似 Blender / Houdini 的可视化编程——拖拽节点连线,构建完整管线,工作流可导出为 JSON 复现和分享
  • Fooocus:简化版界面,“一键出图”理念,降低 SD 的使用门槛

用户只需用自然语言描述需求,GPT 自动重写 prompt、生成图像、支持迭代修改(“把背景改成夜晚""给她加一副眼镜”)。完全不需要学习任何参数语法,代价是失去精细控制力。

需求场景推荐选择理由
极致画质、概念图、情绪板Midjourney闭源模型的美学调优行业领先,开箱即用
完全可控、批量生产、集成管线SD 生态 + ComfyUIControlNet + LoRA 提供像素级控制,可程序化批处理
快速出图、零学习成本GPT Image(ChatGPT)对话式交互,LLM 自动优化 prompt
角色/IP 一致性系列Midjourney --cref 或 SD + LoRA前者简单但一致性有限,后者需训练但可精确复现
电商商品图、换背景SD + ControlNet depth从商品实拍图约束结构,精准生成新场景
企业 API 集成OpenAI API / Stability API稳定的 SLA 保障,无需自建推理基础设施
预算为零、本地隐私SD 生态模型免费,只需一块显卡
模型最低显存(fp16)推荐显存备注
SD 1.54 GB6-8 GB社区生态最丰富,轻量高效
SDXL8 GB12-16 GB原生 1024×1024,画质显著提升
SD 3.5 Medium8 GB12 GB25 亿参数,MMDiT 架构
SD 3.5 Large16 GB24 GB80 亿参数,文本理解最强
FLUX.1 [dev]12 GB24 GB开源新标杆,质量接近闭源

什么是量化(Quantization)? 量化是将模型参数从高精度浮点数(如 fp32,每个参数占 32 bit)压缩到低精度(如 fp16/int8/int4),以减少显存占用和推理速度。代价是少量精度损失——fp16 几乎无损,int8/int4 可能有可见画质下降。云端 GPU 平台(Replicate、fal.ai)按次计费(约 0.01-0.05 美元/张),偶尔使用比购买显卡更划算。

import base64
from openai import OpenAI
client = OpenAI(api_key="sk-your-key")
# GPT Image(DALL-E 3 的继任者)原生集成在 OpenAI API 中
# 它会自动用 GPT 重写 prompt 再生成
result = client.images.generate(
model="gpt-image-1", # GPT Image 模型
prompt="一只赛博朋克风格的猫坐在霓虹灯下的街角,雨水倒映着招牌",
size="1024x1024", # 可选 1024x1024 / 1536x1024 / 1024x1536
quality="high", # low / medium / high / auto
n=1,
)
# GPT Image 返回 base64 编码的图像
img_data = base64.b64decode(result.data[0].b64_json)
with open("cyber_cat.png", "wb") as f:
f.write(img_data)
print("图像已保存到 cyber_cat.png")

注意:DALL-E 3 仍可通过 API 调用(model="dall-e-3"),但 OpenAI 已将 ChatGPT 内的图像生成迁移到 GPT Image。新项目建议直接使用 GPT Image。

调用 Stability AI API(SD 3.5 云端推理)

Section titled “调用 Stability AI API(SD 3.5 云端推理)”
import requests
# Stability AI 的 SD 3.5 推理 API(无需本地 GPU)
url = "https://api.stability.ai/v2beta/stable-image/generate/sd3"
headers = {"Authorization": "Bearer sk-your-key", "Accept": "image/*"}
# 用 multipart 表单提交参数
files = {"none": ""} # 必须有至少一个文件字段
data = {
"prompt": "a futuristic city at sunset, ultra detailed, 8k",
"negative_prompt": "blurry, low quality",
"model": "sd3-large", # sd3-large / sd3-large-turbo / sd3-medium
"mode": "text-to-image",
"aspect_ratio": "16:9",
"seed": 42,
}
resp = requests.post(url, headers=headers, files=files, data=data, timeout=120)
with open("city_sunset.png", "wb") as f:
f.write(resp.content) # 直接返回二进制图像
print("图像已保存到 city_sunset.png")

本地运行 Stable Diffusion(使用 diffusers 库)

Section titled “本地运行 Stable Diffusion(使用 diffusers 库)”
# 安装:pip install diffusers transformers accelerate torch
import torch
from diffusers import StableDiffusionXLPipeline
# 加载 SDXL 模型(首次运行会自动下载约 7GB 权重)
pipe = StableDiffusionXLPipeline.from_pretrained(
"stabilityai/stable-diffusion-xl-base-1.0",
torch_dtype=torch.float16, # fp16 量化,显存减半
variant="fp16",
).to("cuda") # 移到 GPU
# 生成图像
image = pipe(
prompt="a serene mountain lake at dawn, reflections, photorealistic",
negative_prompt="blurry, distorted, low quality",
width=1024,
height=1024,
num_inference_steps=30, # 去噪步数,越多越精细但越慢
guidance_scale=7.5, # CFG:控制 prompt 引导强度
num_images_per_prompt=1,
).images[0]
image.save("mountain_lake.png")
print("图像已保存到 mountain_lake.png")

关键参数解释:num_inference_steps(推理步数)控制去噪迭代次数——通常 20-50 步即可,更多步数收益递减。guidance_scale(CFG,Classifier-Free Guidance)控制模型对 prompt 的”服从程度”——值越高越忠于描述但可能过饱和,值越低越有创意但可能偏离意图,推荐 5-10。

  • 先明确需求再选工具:要极致画质且不在意可控性 → Midjourney;要完全可控且愿意折腾 → Stable Diffusion + ComfyUI;要最低门槛快速出图 → GPT Image via ChatGPT。
  • Midjourney 的高阶玩法在参数组合:--sref 参考风格 + --cref 锁定角色 + --chaos 增加变体,三者组合可以稳定产出系列风格化作品。
  • 开源生态务必先跑通基础管线:先用 SDXL/FLUX 基础模型生成出图,再加 ControlNet,最后加 LoRA——一步到位搭复杂管线容易出错且难排查。详见 ComfyUI vs AUTOMATIC1111。
  • 显存规划:SD 1.5 需 4GB,SDXL 需 8GB,SD 3.5 Large / FLUX 需 16-24GB;用 fp16 量化可减半。云端方案(Replicate、fal.ai)按次计费,偶尔用比买显卡划算。
  • 商业使用注意许可:Midjourney 订阅用户生成的图像商用需 Pro 及以上计划;Stable Diffusion 3.5 遵循 Stability AI Community License(年收入超 100 万美元需 Enterprise License);GPT Image 生成图归用户所有。
  • prompt 差异巨大:Midjourney 偏好简洁意象 + 风格关键词(“ethereal, dreamlike —ar 2:3”),SD 需要详细描述 + 负面提示词(negative prompt,指定不希望出现的元素),GPT Image 直接大白话即可。
  • 关注版权风险:2025 年迪士尼/环球/华纳相继起诉 Midjourney,Getty Images 对 Stability AI 的诉讼在 2025 年 11 月基本败诉。AI 生成图像的版权归属和训练数据合法性仍是未定之论,商业项目务必咨询法律意见。
  • 品牌视觉与广告创意(Midjourney):广告设计师用 Midjourney V8 快速产出高质量概念图和情绪板,--sref 统一系列风格,几小时内出几十版方案供客户挑选。
  • 游戏美术资产管线(SD 生态):游戏团队用 ComfyUI + ControlNet 批量生成纹理、概念设定、NPC 头像,LoRA 训练角色专属画风,整套管线自动化集成进美术生产流程。
  • 电商商品图(SD 生态 / GPT Image):用 ControlNet 的 depth 模式从商品实拍图生成多场景背景,或用 GPT Image 快速生成营销配图,降低拍摄成本。
  • 个人创作与艺术探索(Midjourney / SD / FLUX):独立艺术家在 Midjourney 上探索风格,或用 FLUX + 自训练 LoRA 打造个人标志性画风。
  • 教育与科普插图(GPT Image):教师用 ChatGPT 口语化描述即可生成教学插图,无需学习 prompt 工程,门槛极低。
  • 建筑与室内设计可视化(SD + ControlNet):用线稿或深度图约束,从 CAD 草图生成照片级渲染效果图,ControlNet 的 canny/mlsd 模式是核心。
类库语言说明
Midjourney在线闭源 SaaS,Discord/Web 交互,V8 为当前最新版本,画质行业标杆
Stable DiffusionPythonStability AI 开源的潜在扩散模型,SD 3.5 / FLUX 为当前最新
FLUX (Black Forest Labs)Python2024 年崛起的开源新标杆,Rectified Flow Transformer 架构
ComfyUIPython/JS节点式工作流引擎,开源生态最灵活的管线编排工具
AUTOMATIC1111 WebUIPython表单式 SD 界面,上手快,社区插件丰富
FooocusPython简化版 SD 界面,“一键出图”理念,降低使用门槛
GPT ImageAPIOpenAI 的原生多模态图像生成模型,2025 年取代 DALL-E 3
Civitai在线SD 社区最大的模型/LoRA/工作流分享平台
Replicate / fal.aiAPI云端 GPU 平台,按次付费运行开源 SD / FLUX 模型
diffusersPythonHugging Face 的扩散模型库,适合编程式调用
术语英文解释
闭源 SaaSClosed-source SaaS模型和推理代码不公开,仅通过 API 或界面提供服务(SaaS = Software as a Service)
潜在扩散模型Latent Diffusion Model (LDM)在 VAE 压缩的潜在空间中进行扩散,大幅降低计算成本
VAEVariational Autoencoder变分自编码器,将高维图像压缩到低维潜在空间再还原的神经网络
CLIPContrastive Language-Image Pre-trainingOpenAI 的图文对齐模型,将文本和图像映射到同一向量空间
U-NetU-NetU 形卷积网络,SD 1.x~XL 的去噪骨干;SD 3 起被 MMDiT 替代
MMDiTMultimodal Diffusion Transformer多模态扩散 Transformer,在 Transformer 块内混合文本与图像编码
TransformerTransformer基于自注意力机制的神经网络架构,大语言模型和现代扩散模型的基石
LoRALow-Rank Adaptation低秩适配,用少量参数高效微调大模型的方法
Prompt 重写Prompt Rewriting用 LLM 将用户简短描述扩写为详细生成 prompt 的技术
风格参考Style Reference (—sref)Midjourney 的功能,用参考图引导生成图像的艺术风格
角色参考Character Reference (—cref)Midjourney 的功能,用参考图保持生成角色的外貌一致性
负面提示词Negative Prompt指定不希望出现的元素,引导模型避开(SD 生态常用)
Stylize 值Stylize ParameterMidjourney 参数,控制模型艺术化处理的强度
量化Quantization将模型参数从高精度浮点压缩到低精度(fp16/int8),减少显存占用
CFGClassifier-Free Guidance无分类器引导,控制模型对 prompt 服从程度的参数
C2PACoalition for Content Provenance and Authenticity内容来源标识标准,用于在 AI 生成图像中嵌入来源元数据