Skip to content

生成式模型

本页速览 从 GAN 到扩散模型到大语言模型——生成式模型是"学会创造"的一类方法。本文讲清生成建模的本质(学习数据分布)、三大技术路线(VAE/GAN/扩散)的原理与对比,以及生成式 AI 的能力边界与风险。

生成式模型 ​

概念定义:学会"创造"而不是"判断" ​

判别式模型(discriminative)学决策边界:给定 x,输出类别概率 P(y|x)——分类、回归都是。生成式模型(generative)学数据本身的分布:估计 P(x)(或联合分布 P(x,y)),从而能从分布中采样出新的、与训练数据相似但不同的样本。

判别式模型生成式模型
学习目标决策边界 P(yx)
输入输出x → 标签噪声/条件 → 新样本
代表逻辑回归、SVM、CNN 分类GAN、VAE、扩散模型、GPT
一句话"这个东西是猫还是狗?""画一只不存在的猫"

生成建模的本质:如果模型真正学到了数据分布 P(x),那么从 P(x) 采样就能生成逼真的新数据。难点在于高维数据的分布极其复杂(一张 1024×1024 的图是百万维空间里的一个流形),无法显式写出,只能近似。

二、三大技术路线 ​

1. VAE:变分自编码器(2013) ​

思想:把数据压缩到低维隐空间(latent space),再从隐空间重建。编码器把 x 映射到隐变量 z 的分布(均值+方差),解码器从 z 重建 x。用"变分推断"训练:最大化"重建似然 - KL 散度"(让隐空间接近标准正态)。

  • 优点:训练稳定、隐空间连续可插值(z₁ 和 z₂ 中间走一步,生成中间态);
  • 缺点:生成图像偏模糊(用高斯似然重建导致"均值糊")。

2. GAN:生成对抗网络(2014) ​

思想:两个网络互相博弈——生成器 G 造假的(从噪声生成图像),判别器 D 分辨真假。G 的目标是骗过 D,D 的目标是识破 G,对抗训练直到 G 生成的样本以假乱真。

生成器 G: 噪声 z → 假样本 G(z)
判别器 D: 样本 → 真/假 概率
目标: min_G max_D  E[log D(x)] + E[log(1 - D(G(z)))]
  • 优点:生成样本清晰锐利(2014–2020 年图像生成霸主:人脸生成 StyleGAN、图像翻译 pix2pix);
  • 缺点:训练不稳定(模式崩塌 mode collapse:只会生成少数几种样本)、难收敛——"炼丹"名声主要来自 GAN。

3. 扩散模型:去噪扩散(2020) ​

思想:先给数据逐步加噪声直到变成纯噪声(前向过程),再学一个网络逐步去噪还原数据(反向过程)。生成 = 从纯噪声出发,一步步去噪得到清晰图像。

前向(训练时): x₀ → 加噪 → x₁ → … → x_T(纯噪声)
反向(生成时): 纯噪声 → 去噪 → … → x₀(图像)
  • 优点:训练稳定、生成质量当前最佳(2022 年起统治文生图:Stable Diffusion、DALL·E、Midjourney、Imagen 全部是扩散模型);
  • 缺点:生成慢(要迭代几十~上千步去噪),需要加速采样(DDIM、LCM)与蒸馏。

路线对比 ​

VAEGAN扩散模型
训练稳定性稳定差(易崩塌)稳定
生成质量模糊好但多样性差最佳
多样性好差(模式崩塌)好
采样速度快快慢(需加速)
当前地位理论基石部分领域仍用图像/音频生成标准

三、条件生成:让生成可控 ​

无条件的生成只是"随机画一张图",业务需要的是条件生成——给定提示词/标签/图像,生成对应内容:

  • 条件扩散(text-to-image):Stable Diffusion 用文本编码器(CLIP)把提示词变成条件,注入去噪网络;
  • ControlNet:用边缘图、姿态、深度图控制构图;
  • 文本到图像工作流:提示词 → 扩散采样 → 放大(超分)→ 后处理,见扩散模型与生成式 AI。

四、自回归生成与大语言模型 ​

另一条生成路线是自回归(autoregressive):把生成当成"逐 token 预测下一个"的序列问题——GPT 就是这么做的:

P(x) = P(t₁)·P(t₂|t₁)·P(t₃|t₁,t₂)·…
生成 = 一个个采样下一个 token,拼成完整文本

大语言模型(LLM)本质上是条件自回归生成模型:给定提示词,逐 token 生成回复。它的能力(翻译、摘要、代码、推理)全部来自"学会预测下一个词"这个看似简单的目标——规模法则让"预测下一个词"涌现出理解与推理能力。完整讨论见大语言模型(LLM)与Transformer 与 NLP。

多模态生成:文本、图像、音频、视频的互相生成正在统一——CLIP 把图像和文本嵌入同一空间,文生图、图生文、文生视频(Sora 等)共用同一套"条件生成"思想。

五、生成式模型的评估难题 ​

生成结果没有"标准答案",评估比判别模型难得多。三类指标各有权衡:

指标衡量局限
FID(图像)生成分布与真实分布的特征距离需要大量样本,偏统计
IS(Inception Score)生成质量 × 多样性对"类别"敏感,非自然图像失真
人工评估真实用户体验贵、慢、主观但最终标准
BLUE/ROUGE(文本)与参考文本的重合度生成式文本"对但不一样"会被打低分

实践共识:生成质量的最终裁判是人(或下游任务效果)。工业界常用"自动化指标初筛 + 人工抽检 + 下游任务评测"三层体系。评测方法论详见从零搭一套模型评估。

六、生成式 AI 的能力边界与风险 ​

生成式模型带来了判别模型没有的新风险,从业者必须正视:

  • 幻觉(hallucination):生成式模型会"一本正经地胡说"——编造不存在的引用、事实。本质是它学的是"像人话的序列",不是"事实数据库";
  • 版权与合规:训练数据包含受版权保护的素材,生成结果可能侵权(文生图、代码生成的合规问题在 2023 年后持续争议);
  • 深度伪造(deepfake):换脸、伪造语音的技术滥用;
  • 数据污染:AI 生成内容回流训练集,可能导致模型退化("模型近亲繁殖")——这是 2024 年后数据工程的新课题;
  • 对齐问题:模型可能被诱导生成有害内容,需要安全对齐(RLHF、护栏),见大语言模型(LLM)。

生成 ≠ 事实

生成式模型的目标是"分布相似",不是"事实正确"。把 LLM 当搜索引擎用、把生成图像当真实证据用,都会踩坑。生成式 AI 的工程定位是"创造性工具",需要验证与人的判断兜底。

七、权衡与取舍 ​

  • 质量 vs 速度:扩散模型步数越多越清晰但越慢——用蒸馏/加速采样换实时性;
  • 可控性 vs 多样性:条件越强(ControlNet、低温度采样)越可控但多样性下降,业务按场景调;
  • 自建 vs 用现成 API:训练生成模型成本极高(GPU 集群 + 海量数据),除非核心业务,否则优先用现成模型(Stable Diffusion、GPT API)做微调/提示工程;
  • 创造力 vs 风险:生成式 AI 是双刃剑,落地必须配内容审核与合规评估。

延伸阅读 ​

参考资料 ​