Skip to content

生成式 AI 概览

生成式 AI(Generative AI)是深度学习之下的一个重要分支(深度学习的整体位置见 深度学习概览)。本页给出其全景定位:深度生成模型(DGM)的分类框架、核心直觉,以及”架构 vs 生成机制”这一常被混淆的正交关系。

生成式 AI 的目标是让机器学会”创造”新内容——不是分类、不是预测,而是从无到有地生成新的图像、文本、音频、视频或代码。其技术核心是生成模型(Generative Model):与判别模型(Discriminative Model,如分类器,学习从输入到标签的映射)不同,生成模型试图学习训练数据背后的概率分布 p(x)p(x),然后从该分布中采样新数据。

从数学角度看,一张图像可以视为高维空间(如 512×512×3 ≈ 78 万维)中的一个点。所有”自然图像”在这个空间中只占据极小的一簇——一个低维流形(manifold)。生成模型的任务就是找到这个流形的结构,让我们能够从这个流形上”采”出新的点(新图像),而不是随机生成像素噪声。

术语解释:概率分布 p(x)p(x) —— 给定一个数据点 xx(如一张图片),p(x)p(x) 表示这个数据点”有多像是真实数据”。生成模型学习这个分布后,可以从中学到数据的本质结构(哪些像素组合是合理的、哪些不是),进而生成分布内的新样本。

生成式 AI 的三大主流路线各有直觉,背后对应着不同的数学框架和工程权衡:

VAE(变分自编码器,Variational Autoencoder)= 压缩再还原。想象你要把一张高清照片”压缩”成一串简短的密码(潜变量),再从密码”还原”出照片。训练过程中模型学会了”数据的本质特征”,之后你给它一串随机密码,它就能”解码”出一张合理的新照片。

更深入地说,VAE 由两部分组成:

  • 编码器(Encoder) qϕ(z∣x)q_\phi(z|x):将输入数据 xx(如一张 784 像素的 MNIST 手写数字)映射为一个潜变量分布——不是确定的一个点,而是一个均值 μ\mu 和方差 σ2\sigma^2,定义了一个高斯分布。这种”概率性编码”是 VAE 与普通自编码器的关键区别。
  • 解码器(Decoder) pθ(x∣z)p_\theta(x|z):从潜变量 zz 采样,重建原始数据 xx。

术语解释:潜变量(Latent Variable)/ 潜空间(Latent Space) —— 数据中不可直接观测的隐藏表示。例如一张人脸照片的潜变量可能编码了”性别""表情""发色”等抽象维度。潜空间是所有潜变量构成的空间,其中距离相近的点对应”相似”的数据。VAE 的优势在于潜空间是连续且有结构的——在潜空间中做线性插值(如从”微笑”到”大笑”),能得到平滑的过渡。

VAE 使用重参数化技巧(Reparameterization Trick)让随机采样过程可微分:不直接从 N(μ,σ2)\mathcal{N}(\mu, \sigma^2) 采样,而是计算 z=μ+σ⋅ϵz = \mu + \sigma \cdot \epsilon(其中 ϵ∼N(0,1)\epsilon \sim \mathcal{N}(0, 1)),这样梯度可以通过 μ\mu 和 σ\sigma 反向传播。训练目标是最大化证据下界(ELBO),即对数似然 log⁡p(x)\log p(x) 的一个可计算的下界。详见 VAE 变分自编码器。

GAN(生成对抗网络,Generative Adversarial Network)= 造假者 vs 鉴定师。两个网络互相博弈——生成器(Generator,造假者)努力造出逼真的假图,判别器(Discriminator,鉴定师)努力分辨真假。两者互相提升,直到假图逼真到鉴定师也认不出来。

从数学角度看,GAN 的训练是一个极小极大博弈(Minimax Game):

min⁡Gmax⁡D  Ex∼pdata[log⁡D(x)]+Ez∼pz[log⁡(1−D(G(z)))]\min_G \max_D \; \mathbb{E}_{x \sim p_{data}}[\log D(x)] + \mathbb{E}_{z \sim p_z}[\log(1 - D(G(z)))]

其中 D(x)D(x) 是判别器输出”真实”的概率,G(z)G(z) 是生成器从噪声 zz 生成的假样本。判别器想最大化这个目标(正确分类真伪),生成器想最小化它(让判别器出错)。在理想情况下,博弈的纳什均衡点是生成器完美捕捉了真实数据分布,判别器输出恒为 0.5(无法分辨)。

GAN 的优势是生成质量高、速度快(推理只需一次前向传播);难点在于训练不稳定——常见问题包括:

  • 模式崩塌(Mode Collapse):生成器找到”捷径”,只产出少数几种样本骗过判别器,丧失多样性。
  • 训练不收敛:判别器太强则生成器梯度消失,判别器太弱则生成器学不到东西。

后续改进如 WGAN(用 Wasserstein 距离替代 JS 散度)、StyleGAN(引入风格注入机制)大幅改善了这些问题。详见 GAN 生成对抗网络。

扩散模型(Diffusion Model)= 逐步加噪再去噪。就像往清水里滴墨水(加噪),再学会一步步把墨水”吸”出来(去噪)。模型学会了”从噪声中恢复清晰图像”的过程,于是可以从纯噪声开始生成新图像。

扩散模型的数学基础来自非平衡热力学。它包含两个过程:

  • 前向过程(Forward Process):逐步给图像添加高斯噪声,经过 TT 步(通常 T=1000T=1000)后,图像变成纯高斯噪声。这个过程是固定的(不需要学习),且每一步加噪可以写成:xt=βtxt−1+1−βtϵx_t = \sqrt{\beta_t} x_{t-1} + \sqrt{1-\beta_t} \epsilon,其中 βt\beta_t 是预设的噪声时间表(Noise Schedule),ϵ\epsilon 是标准高斯噪声。
  • 反向过程(Reverse Process):训练一个神经网络学习如何逐步去噪。从纯噪声 xTx_T 出发,反复调用网络”预测并减去噪声”,最终得到清晰图像。这就是生成过程。

术语解释:高斯噪声(Gaussian Noise) —— 每个像素值随机偏移,偏移量服从正态分布。加噪就是往图像中叠加这种随机扰动。扩散模型的关键洞察是:如果网络学会了”给定一张带噪图片,预测其中噪声是什么”,那么从纯噪声出发反复去噪,就能”无中生有”生成新图片。

扩散模型是当前图像生成的**SOTA(State-of-the-Art,当前最优)**方法,质量超过 GAN,且训练比 GAN 稳定得多。代价是生成速度较慢(需要多步迭代去噪)。后续的 DDIM、DPM++ 等采样器将步数从 1000 压缩到 20-50 步,Consistency Model 更是实现了单步生成。详见 扩散模型。

自回归模型(Autoregressive Model)= 逐词/逐像素预测。这是 GPT 系列语言模型的底层机制:每次预测下一个 token(文本中的最小单位),再将预测结果拼接回去继续预测,如此反复。

术语解释:自回归(Autoregressive) —— “自”指用自身的过去值预测未来值。在语言模型中,就是根据已生成的所有 token 预测下一个 token:P(x1,...,xn)=∏i=1nP(xi∣x1,...,xi−1)P(x_1, ..., x_n) = \prod_{i=1}^{n} P(x_i | x_1, ..., x_{i-1})。这种”链式分解”是 GPT 全系列、LLaMA、Claude 等所有主流 LLM 的生成机制。

自回归模型也可以用于图像(如 PixelRNN/PixelCNN,逐像素生成)和音频(如 WaveNet,逐个波形采样点生成)。详见 自回归模型。

生成式 AI 主线:AI → 机器学习 → 深度学习 → 深度生成模型(Deep Generative Models, DGM) → 具体方法(VAE / GAN / 自回归 / Normalizing Flow / 扩散模型 / EBM)。最广泛引用的分类框架是 Goodfellow 的 NIPS 2016 Tutorial,按”是否显式建模概率密度”划分:

深度生成模型(DGM)
├── 显式密度模型(Explicit Density Models)
│ ├── 可解密度(Tractable Density)
│ │ ├── 自回归模型(Autoregressive)
│ │ │ ├── 图像:PixelRNN/PixelCNN
│ │ │ ├── 音频:WaveNet
│ │ │ └── 文本:RNN 语言模型 → GPT 全系、LLaMA 等(即 LLM 主线)
│ │ └── Normalizing Flow(归一化流):NICE、RealNVP、Glow
│ │ └── Flow Matching / Rectified Flow → 与扩散合流(2023-2025 新主流)
│ └── 近似密度(Approximate Density)
│ ├── 变分类:VAE → VQ-VAE
│ ├── 马尔可夫链类:Boltzmann 机、Deep Belief Network
│ └── 扩散模型(Diffusion / Score-based)
│ ├── DDPM → DDIM;Score-based NCSN → Score SDE
│ ├── Latent Diffusion → Stable Diffusion
│ └── 骨干演进:U-Net → DiT(Diffusion Transformer)→ MMDiT(SD3/Flux)
├── 隐式密度模型(Implicit Density Models)
│ └── GAN → DCGAN、WGAN、StyleGAN、CycleGAN
└── 基于能量的模型(EBM,横跨显式/隐式讨论)

Goodfellow 框架的核心区分维度是模型是否显式地建模概率密度函数 p(x)p(x):

  • 显式密度模型:直接定义 p(x)p(x) 的数学形式,可以计算(或近似计算)给定数据的似然。优点是可以做密度估计(异常检测、数据压缩),缺点是架构设计受限(如 Normalizing Flow 要求变换可逆)。自回归模型属于”可解密度”——虽然不直接写出 p(x)p(x) 的闭式解,但通过链式分解可以精确计算 log⁡p(x)\log p(x)。
  • 隐式密度模型:不显式定义 p(x)p(x),而是通过某种过程(如 GAN 的生成器映射)隐含地定义分布。优点是架构自由度高,缺点是无法计算似然,难以做密度估计。
  • 近似密度模型:介于两者之间——定义了 p(x)p(x) 的形式但无法精确计算,需用变分推断(如 VAE 的 ELBO)等方法近似。

术语解释:似然(Likelihood) —— 给定模型参数时观测数据出现的概率。直觉上,好的模型应该给真实数据”高分”(高概率)。最大化似然就是让模型认为训练数据”最像真实数据”。这是大多数生成模型的训练目标。

生成模型 → 潜变量生成模型(latent variable model),训练用变分推断(ELBO)。Wikipedia 定义其为”diffusion-based / score-based generative models, a class of latent variable generative models typically trained using variational inference”。存在三种等价形式化——DDPM(马尔可夫链视角)、NCSN(score matching 视角)、SDE(随机微分方程视角)——被 Song et al. 2021 证明等价,所以”基于分数的生成模型”与”扩散模型”是同一族,不是并列两类。

这三种视角虽然数学形式不同,但描述的是同一个过程:

  1. DDPM 视角(马尔可夫链):前向是逐步加噪的马尔可夫链,反向是逐步去噪的神经网络。最直观,工程实现最简单。
  2. Score-based 视角(NCSN):训练网络学习分数函数(score function)∇xlog⁡p(x)\nabla_x \log p(x)——概率密度对数据求梯度,指向”数据密度增大的方向”。沿分数函数走就能从噪声走向数据。
  3. SDE 视角(随机微分方程):将离散的扩散步骤连续化,写成随机微分方程 dx=f(x,t)dt+g(t)dw\mathrm{d}x = f(x,t)\mathrm{d}t + g(t)\mathrm{d}w。这个视角最优雅,统一了 DDPM 和 NCSN,也启发了后续的 Flow Matching。

术语解释:分数函数(Score Function) —— 对数概率密度的梯度 ∇xlog⁡p(x)\nabla_x \log p(x),指向概率增大最快的方向。想象站在山坡上(概率密度的”地形”),分数函数告诉你最陡上坡的方向。从噪声出发沿分数函数走,就像从山谷走向山顶(高概率区域),这就是 score-based 生成的直觉。

若套用 Goodfellow 框架,DDPM 落在”显式密度 → 近似 → 变分”一格(扩散模型可视为”固定编码器的多级 VAE”,Luo 2022 统一视角)。详见 扩散模型。

2024-2025 新趋势:Flow Matching 与 Rectified Flow

Section titled “2024-2025 新趋势:Flow Matching 与 Rectified Flow”

2023-2025 年最重要的架构演进是 Flow Matching(Lipman et al. 2022)和 Rectified Flow(Liu et al. 2022)的兴起,它们正逐步取代传统扩散过程成为新一代生成模型的标准框架:

  • 核心思想:传统扩散模型的前向过程(加噪路径)是固定的(高斯扩散),反向去噪需要求解 SDE,路径弯曲且需要多步。Flow Matching 的思路是直接学习一条从噪声到数据的”直线路径”(最优传输路径),让生成过程变成求解一个 ODE(常微分方程),路径更直、步数更少。
  • 效率提升:直线/近直线路径意味着用更少的采样步数就能达到同样质量。Stable Diffusion 3 采用 Rectified Flow 后,在 10-25 步内即可生成高质量图像。
  • 已采用的模型:Stable Diffusion 3(2024)、Flux(Black Forest Labs, 2024)、Meta Movie Gen(2024)均已采用 Flow Matching/Rectified Flow 作为训练框架。

术语解释:Flow Matching —— 一种训练连续归一化流(CNF)的方法。不通过扩散路径,而是学习一个速度场(velocity field),让粒子从噪声分布”流动”到数据分布。当使用最优传输(Optimal Transport)路径时,流动轨迹接近直线,采样极其高效。可以理解为:扩散模型是”随机游走”去噪,Flow Matching 是”直线导航”去噪。

Flow Matching 的兴起使得扩散模型与归一化流(Normalizing Flow)的边界变得模糊——它们正在合流为一族统一的连续生成模型。

LLM 主线:AI → 机器学习 → 深度学习 → Transformer 架构 → NLP → 语言模型 → 神经语言模型 → 预训练语言模型 → LLM。关键交叉点:GPT 类 LLM 同时是自回归生成模型(按 Goodfellow 框架属”显式-可解密度”格)——LLM 横跨”NLP/序列建模”与”生成模型”两个分类维度。详见 语言模型演进。

Transformer 是当前几乎所有生成式 AI 模型的骨干架构(GPT 用它做自回归,DiT/Sora 用它做扩散),其核心是自注意力机制(Self-Attention):

术语解释:注意力机制(Attention)/ 自注意力(Self-Attention) —— 让模型在处理序列时”关注”最相关的部分。对序列中每个位置,计算它与其他所有位置的”相关度”权重,然后加权汇总信息。直觉上,就像读一句话时,理解”它”指的是上文哪个词。自注意力让序列中任意两个位置都能直接交互(而 RNN 只能顺序传递信息),且可以高度并行化,这是 Transformer 能扩展到超大规模的关键。

自注意力的具体计算(Scaled Dot-Product Attention):

Attention(Q,K,V)=softmax(QKTdk)V\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right)V

其中 QQ(Query,查询)、KK(Key,键)、VV(Value,值)是输入经过线性变换得到的矩阵,dkd_k 是键的维度(用于缩放防止梯度消失)。多头注意力(Multi-Head Attention)并行地执行多组注意力,让模型从不同子空间捕捉不同模式。

术语解释:归一化(Normalization) —— 在神经网络中,将中间层的激活值缩放到统一范围(如均值为 0、方差为 1),防止数值过大或过小导致训练不稳定。Transformer 中常用 LayerNorm(层归一化)。现代 LLM 如 LLaMA 采用 RMSNorm(均方根归一化),计算更快且效果相当。

另注意架构与生成机制是两个正交概念:Transformer 是”架构”,自回归/扩散是”生成机制”——GPT 用 Transformer 做自回归,DiT/Sora 用 Transformer 做扩散。不要把”Transformer”与”扩散”当作并列类别。

这个正交关系可以画成一个矩阵:

自回归生成扩散生成对抗生成流生成
Transformer 架构GPT、LLaMA、GeminiDiT、Sora、SD3、Flux—Flow Matching + Transformer
CNN/U-Net 架构PixelRNN(RNN)Stable Diffusion 1.x/2.xDCGAN、StyleGANGlow(CNN)

理解这个正交关系有助于避免常见概念混淆。例如”Sora 是 Transformer 还是扩散模型?“——答案是:两者都是,它用 Transformer 架构执行扩散生成机制。

DiT(Diffusion Transformer) 是扩散模型骨干从 U-Net 向 Transformer 迁移的关键节点(Peebles & Xie, 2023)。传统扩散模型(如 Stable Diffusion 1.x/2.x)使用 U-Net 作为去噪网络——一个编码器-解码器结构加上跳跃连接(skip connection),擅长保留空间细节。DiT 将去噪网络替换为 Transformer:将图像(或潜空间表示)切成 patch(小块),当作”token”序列处理,用自注意力建模全局关系。

MMDiT(Multimodal Diffusion Transformer) 是 DiT 的进一步发展,在 Stable Diffusion 3 和 Flux 中采用:文本 token 和图像 patch 在同一个 Transformer 中通过注意力机制交互,比传统的 cross-attention 方案更高效。这使得文本-图像对齐质量显著提升(SD3 在文字渲染方面大幅优于 SD 1.x/2.x)。

  • 选型直觉:要生成高质量图像 → 扩散模型(当前 SOTA);要快速生成 → GAN(速度快但训练不稳定)或 Consistency Model(单步扩散);要做表示学习/异常检测 → VAE(潜空间有意义);要生成文本 → 自回归模型(GPT 类)。
  • GAN 不是”过时”了:扩散模型在图像生成上取代了 GAN,但 GAN 在实时推理(如视频换脸、风格迁移)上仍有速度优势,因为只需一次前向传播而扩散需要多步去噪。StyleGAN 系列在人脸生成领域仍有不可替代的地位。
  • “生成”不等于”创造”:生成模型学的是训练数据的分布,生成的内容是”分布内的重组”而非真正的原创。理解这点有助于合理评估 AI 生成内容的原创性。
  • Flow Matching 正在取代传统扩散:2024-2025 年新发布的模型(SD3、Flux、Movie Gen)几乎都采用 Flow Matching/Rectified Flow,它比传统 DDPM 训练更稳定、采样更快。在选择模型框架时,应优先考虑 Flow Matching 系方案。
  • Consistency Model 实现单步生成:OpenAI 于 2023 年提出的 Consistency Model 通过训练一个直接从噪声映射到数据的网络,实现了一步(或几步)生成,大幅缩短推理时间。虽然质量仍略逊于多步扩散,但在实时场景中有巨大潜力。
  • 模型坍塌(Model Collapse)风险:如果用 AI 生成的数据训练下一代 AI 模型,会导致质量逐代退化(ICLR 2024 论文证实)。2025 年的研究表明,互联网上 AI 生成内容的比例正在快速增长,这对未来模型训练的数据质量构成严峻挑战。

Midjourney(v6, 2024)、DALL-E 3、Stable Diffusion 3 和 Flux 让用户用一句文字描述就生成高质量图片,已广泛用于插画、概念设计和广告素材制作。2024-2025 年的进展主要体现在:

  • 文字渲染能力突破:SD3 和 Flux 通过 MMDiT 架构大幅改善了图像中文字的准确生成(此前模型生成的文字几乎都是乱码)。
  • 开源模型追平闭源:Flux.1(Black Forest Labs,由原 SD 团队成员创建)在 2024 年发布的开源模型质量已接近 Midjourney v6 水平。
  • 提示词依从性提升:新模型更准确地理解和执行复杂提示词(如”一只戴红色帽子的猫坐在蓝色椅子上”),减少了需要反复修改提示词的次数。

OpenAI Sora(2024 年 2 月发布预览)、Google Veo(2024)、Runway Gen-3 和开源的 LTX-2(Lightricks, 2025)根据文字提示生成视频。关键技术突破是将扩散模型从 2D 空间扩展到 3D 时空(加时间维度),用 DiT 架构处理视频 token。应用场景包括影视预可视化、广告制作和社交媒体内容创作。2025 年视频生成的时长和质量持续提升,部分模型已能生成 60 秒以上的连贯视频。

Suno(v3/v4, 2024-2025)、Udio 根据文字描述生成带人声的完整歌曲,大幅降低音乐创作门槛。底层技术从早期的 MIDI 符号级生成发展到直接在音频波形上做扩散/自回归生成(类似 WaveNet 的思路但规模更大)。被广泛用于短视频配乐和 demo 制作。2025 年的音乐生成模型在人声自然度和编曲复杂度上已接近专业水准。

GitHub Copilot、Cursor、Claude Code 根据自然语言注释或代码上下文自动生成代码片段和函数实现,已成为开发者日常工作流的一部分。2025 年的趋势是从”代码补全”向”自主编程 Agent”演进——模型不仅能写代码,还能理解需求、运行测试、修复 bug、提交 PR。

ChatGPT、Claude、Gemini、DeepSeek、通义千问等 LLM 被用于生成营销文案、邮件草稿、报告摘要、翻译等。2025 年的焦点转向 Agent 化——LLM 不再只是单轮问答,而是能调用工具、浏览网页、操作软件完成多步骤任务。

Google DeepMind 在 2025 年发布 AlphaEvolve,使用 LLM 提出候选代码方案、自动评估器打分、进化算法迭代,已发现优于人类已知结果的算法(如矩阵乘法的更高效算法)。2026 年,一群数学家发布了《莱顿宣言》(Leiden Declaration on AI and Mathematics),呼吁在学术论文中披露 AI 的使用、确保 AI 辅助论文的同行评审质量。

  • 生成式 AI 概览:本分类的全景定位——DGM 分类框架、核心直觉、架构与生成机制的正交关系
  • 扩散模型:前向加噪+反向去噪原理、U-Net 骨干、numpy 噪声时间表代码
  • 语言模型演进:从 Shannon n-gram 到现代 LLM、next-token prediction 代码
  • 多模态模型:CLIP 对比学习原理、图文对齐代码
  • AI 音乐生成:从 MIDI 符号级到音频波形生成,Suno/MusicGen 让”哼一段就出歌”
  • ControlNet 与可控生成:用线稿、深度图、姿态骨架等条件输入精确控制扩散生成的构图与结构
  • AI 图像编辑:图生图、Inpainting、指令式编辑等以现有图像为起点的修改技术谱系
  • 采样器详解:从 DDPM 到 DPM++,决定反向去噪轨迹与质量/速度权衡的采样器谱系
  • 图像提示词艺术:从基础语法到结构化模板的图像提示词工程方法论
  • GAN 生成对抗网络:对抗博弈原理、训练难题与解决方案、条件 GAN,及与扩散模型的定位差异
  • 图像放大器与后处理:从传统插值到 AI 高清修复(Hi-Res Fix),让生成图像达到 4K/8K 细节
  • VAE 变分自编码器:编码器-解码器结构、重参数化技巧、ELBO 损失、β-VAE 可控生成
  • AnimateDiff 与 AI 动画:插入图像扩散模型的运动模块,无需重训即可生成连贯动画
  • 自回归模型:将生成拆解为”预测下一步”——PixelRNN、WaveNet 到 GPT 的范式
  • Textual Inversion 与超网络:用极少数据和参数教会模型理解新概念的轻量定制技术
  • ComfyUI 与节点式生成:节点式图像生成——像连线路画流程图一样组装 AI 绘画管线
  • 主流图像生成模型对比:Stable Diffusion 到 Flux,开源与闭源主流模型的能力定位与选型
  • 图像 LoRA 训练:给基础模型插”记忆模块”,学会画特定角色/风格/物体的微调方法
  • AI 视频生成:Sora 与 DiT 架构,扩散模型从 2D 图像向 3D 时空扩展
  • 风格迁移:从神经风格迁移到现代扩散风格化的完整脉络
  • 3D资产生成:从 NeRF 到 3D Gaussian Splatting 的三维资产生成技术谱系
  • AI艺术版权与伦理:版权归属、训练数据合法性、署名披露、有害内容治理四大议题
  • 数据集制作与标注:图像/文本数据集的采集、清洗、标注与自动化标注流水线
  • DreamBooth完整训练:几张照片个性化微调 SD,与 LoRA 的区别及完整训练流程
类库语言说明
HuggingFace DiffusersPython扩散模型主流库,提供 Stable Diffusion、Flux 等模型的训练与推理接口
HuggingFace TransformersPythonGPT/LLaMA 等自回归语言模型的统一加载与推理库
PyTorchPython实现各类生成模型底层架构的通用深度学习框架
LangChain / LlamaIndexPython搭建 LLM 应用(链式调用、RAG、Agent)的开发框架
Stable Diffusion WebUIPythonAUTOMATIC1111 开源的前端,图形化使用 Stable Diffusion 生图
ComfyUIPython节点式图像生成工作流引擎,灵活组装生成管线
Flux / diffusersPythonBlack Forest Labs 开源的 DiT + Flow Matching 图像生成模型
TensorFlow / KerasPython也可用于构建 VAE/GAN 等生成模型
术语英文解释
生成模型Generative Model学习数据分布并从中采样新样本的模型,目标是”创造”新内容
判别模型Discriminative Model学习从输入到输出的映射关系(如分类),目标是”判断”而非创造
潜变量Latent Variable数据背后不可直接观测的隐藏表示,生成模型通过它来生成样本
潜空间Latent Space所有潜变量构成的空间,空间中距离相近的点对应”相似”的数据
似然Likelihood给定模型参数时观测数据出现的概率,生成模型常以最大化似然为目标
证据下界ELBO (Evidence Lower Bound)变分推断中优化的目标函数,是对数似然的便于计算的下界
重参数化技巧Reparameterization Trick将随机采样改写为确定变换加随机噪声,使梯度可反向传播
模式崩塌Mode CollapseGAN 训练失败现象:生成器只产出少数几种样本,缺乏多样性
变分自编码器VAE (Variational Autoencoder)用编码器将数据映射到潜空间、再用解码器重建的生成模型
分数函数Score Function对数概率密度的梯度,指向概率增大最快的方向
注意力机制Attention Mechanism让模型在处理序列时动态”关注”最相关的部分
归一化Normalization将激活值缩放到统一范围,防止数值不稳定
Flow MatchingFlow Matching训练连续归一化流的方法,学习从噪声到数据的速度场,路径近直线
Rectified FlowRectified FlowFlow Matching 的变体,通过”拉直”流动路径实现高效少步采样
模型坍塌Model Collapse用 AI 生成数据训练下一代 AI 导致质量逐代退化的现象
Consistency ModelConsistency Model训练网络直接从任意噪声步映射到干净数据,实现单步生成
  • Goodfellow 分类框架:Ian Goodfellow 在 NIPS 2016 Tutorial “Generative Adversarial Networks” 中按”是否显式建模概率密度”将深度生成模型分为显式密度(可解/近似)与隐式密度两大类,至今仍是标准参考。
  • 三大路线的奠基:VAE 由 Kingma & Welling 2013 提出(“Auto-Encoding Variational Bayes”);GAN 由 Goodfellow et al. 2014 提出;扩散模型由 Sohl-Dickstein 2015 奠基(非平衡热力学视角),Ho et al. 2020 的 DDPM 使其真正可用。
  • 统一视角:Luo 2022 将扩散模型理解为”固定编码器的多级 VAE”(“Understanding Diffusion Models: A Unified Perspective”);Song et al. 2021 用 SDE 统一了 DDPM、NCSN 和 score-based 三种形式化(“Score-Based Generative Modeling through Stochastic Differential Equations”)。
  • Flow Matching 与 Rectified Flow:Lipman et al. 2022(“Flow Matching for Generative Modeling”, arXiv:2210.02747)提出 Flow Matching 框架;Liu et al. 2022(“Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow”, arXiv:2209.03003)提出 Rectified Flow 并引入”reflow”路径拉直技术。这两项工作是新一代生成模型(SD3、Flux、Movie Gen)的理论基础。
  • DiT 与架构演进:Peebles & Xie 2023(“Scalable Diffusion Models with Transformers”, arXiv:2212.09748)提出 Diffusion Transformer,证明了 Transformer 在扩散模型中的可扩展性,直接启发了 Sora 和 SD3 的架构设计。
  • Consistency Model:Song et al. 2023(“Consistency Models”, ICML 2023)提出单步生成方案,通过一致性蒸馏将多步扩散压缩为单步推理。
  • Transfusion:统一自回归与扩散:Meta 2024 的 Transfusion 在单一 Transformer 中同时用自回归预测文本、用扩散生成图像,探索了多模态统一生成的新范式。
  • 行业趋势:2025 年中,Gartner 和 The Economist 指出生成式 AI 正进入”幻灭低谷期”(Trough of Disillusionment)——许多企业的试点项目因集成困难、数据质量和回报不达预期而搁置。但底层技术(Flow Matching、DiT、Consistency Model)仍在快速进步,长期前景依然被看好。