外观
生成式模型
概念定义:学会"创造"而不是"判断"
判别式模型(discriminative)学决策边界:给定 x,输出类别概率 P(y|x)——分类、回归都是。生成式模型(generative)学数据本身的分布:估计 P(x)(或联合分布 P(x,y)),从而能从分布中采样出新的、与训练数据相似但不同的样本。
| 判别式模型 | 生成式模型 | |
|---|---|---|
| 学习目标 | 决策边界 P(y | x) |
| 输入输出 | x → 标签 | 噪声/条件 → 新样本 |
| 代表 | 逻辑回归、SVM、CNN 分类 | GAN、VAE、扩散模型、GPT |
| 一句话 | "这个东西是猫还是狗?" | "画一只不存在的猫" |
生成建模的本质:如果模型真正学到了数据分布 P(x),那么从 P(x) 采样就能生成逼真的新数据。难点在于高维数据的分布极其复杂(一张 1024×1024 的图是百万维空间里的一个流形),无法显式写出,只能近似。
二、三大技术路线
1. VAE:变分自编码器(2013)
思想:把数据压缩到低维隐空间(latent space),再从隐空间重建。编码器把 x 映射到隐变量 z 的分布(均值+方差),解码器从 z 重建 x。用"变分推断"训练:最大化"重建似然 - KL 散度"(让隐空间接近标准正态)。
- 优点:训练稳定、隐空间连续可插值(z₁ 和 z₂ 中间走一步,生成中间态);
- 缺点:生成图像偏模糊(用高斯似然重建导致"均值糊")。
2. GAN:生成对抗网络(2014)
思想:两个网络互相博弈——生成器 G 造假的(从噪声生成图像),判别器 D 分辨真假。G 的目标是骗过 D,D 的目标是识破 G,对抗训练直到 G 生成的样本以假乱真。
生成器 G: 噪声 z → 假样本 G(z)
判别器 D: 样本 → 真/假 概率
目标: min_G max_D E[log D(x)] + E[log(1 - D(G(z)))]- 优点:生成样本清晰锐利(2014–2020 年图像生成霸主:人脸生成 StyleGAN、图像翻译 pix2pix);
- 缺点:训练不稳定(模式崩塌 mode collapse:只会生成少数几种样本)、难收敛——"炼丹"名声主要来自 GAN。
3. 扩散模型:去噪扩散(2020)
思想:先给数据逐步加噪声直到变成纯噪声(前向过程),再学一个网络逐步去噪还原数据(反向过程)。生成 = 从纯噪声出发,一步步去噪得到清晰图像。
前向(训练时): x₀ → 加噪 → x₁ → … → x_T(纯噪声)
反向(生成时): 纯噪声 → 去噪 → … → x₀(图像)- 优点:训练稳定、生成质量当前最佳(2022 年起统治文生图:Stable Diffusion、DALL·E、Midjourney、Imagen 全部是扩散模型);
- 缺点:生成慢(要迭代几十~上千步去噪),需要加速采样(DDIM、LCM)与蒸馏。
路线对比
| VAE | GAN | 扩散模型 | |
|---|---|---|---|
| 训练稳定性 | 稳定 | 差(易崩塌) | 稳定 |
| 生成质量 | 模糊 | 好但多样性差 | 最佳 |
| 多样性 | 好 | 差(模式崩塌) | 好 |
| 采样速度 | 快 | 快 | 慢(需加速) |
| 当前地位 | 理论基石 | 部分领域仍用 | 图像/音频生成标准 |
三、条件生成:让生成可控
无条件的生成只是"随机画一张图",业务需要的是条件生成——给定提示词/标签/图像,生成对应内容:
- 条件扩散(text-to-image):Stable Diffusion 用文本编码器(CLIP)把提示词变成条件,注入去噪网络;
- ControlNet:用边缘图、姿态、深度图控制构图;
- 文本到图像工作流:提示词 → 扩散采样 → 放大(超分)→ 后处理,见扩散模型与生成式 AI。
四、自回归生成与大语言模型
另一条生成路线是自回归(autoregressive):把生成当成"逐 token 预测下一个"的序列问题——GPT 就是这么做的:
P(x) = P(t₁)·P(t₂|t₁)·P(t₃|t₁,t₂)·…
生成 = 一个个采样下一个 token,拼成完整文本大语言模型(LLM)本质上是条件自回归生成模型:给定提示词,逐 token 生成回复。它的能力(翻译、摘要、代码、推理)全部来自"学会预测下一个词"这个看似简单的目标——规模法则让"预测下一个词"涌现出理解与推理能力。完整讨论见大语言模型(LLM)与Transformer 与 NLP。
多模态生成:文本、图像、音频、视频的互相生成正在统一——CLIP 把图像和文本嵌入同一空间,文生图、图生文、文生视频(Sora 等)共用同一套"条件生成"思想。
五、生成式模型的评估难题
生成结果没有"标准答案",评估比判别模型难得多。三类指标各有权衡:
| 指标 | 衡量 | 局限 |
|---|---|---|
| FID(图像) | 生成分布与真实分布的特征距离 | 需要大量样本,偏统计 |
| IS(Inception Score) | 生成质量 × 多样性 | 对"类别"敏感,非自然图像失真 |
| 人工评估 | 真实用户体验 | 贵、慢、主观但最终标准 |
| BLUE/ROUGE(文本) | 与参考文本的重合度 | 生成式文本"对但不一样"会被打低分 |
实践共识:生成质量的最终裁判是人(或下游任务效果)。工业界常用"自动化指标初筛 + 人工抽检 + 下游任务评测"三层体系。评测方法论详见从零搭一套模型评估。
六、生成式 AI 的能力边界与风险
生成式模型带来了判别模型没有的新风险,从业者必须正视:
- 幻觉(hallucination):生成式模型会"一本正经地胡说"——编造不存在的引用、事实。本质是它学的是"像人话的序列",不是"事实数据库";
- 版权与合规:训练数据包含受版权保护的素材,生成结果可能侵权(文生图、代码生成的合规问题在 2023 年后持续争议);
- 深度伪造(deepfake):换脸、伪造语音的技术滥用;
- 数据污染:AI 生成内容回流训练集,可能导致模型退化("模型近亲繁殖")——这是 2024 年后数据工程的新课题;
- 对齐问题:模型可能被诱导生成有害内容,需要安全对齐(RLHF、护栏),见大语言模型(LLM)。
生成 ≠ 事实
生成式模型的目标是"分布相似",不是"事实正确"。把 LLM 当搜索引擎用、把生成图像当真实证据用,都会踩坑。生成式 AI 的工程定位是"创造性工具",需要验证与人的判断兜底。
七、权衡与取舍
- 质量 vs 速度:扩散模型步数越多越清晰但越慢——用蒸馏/加速采样换实时性;
- 可控性 vs 多样性:条件越强(ControlNet、低温度采样)越可控但多样性下降,业务按场景调;
- 自建 vs 用现成 API:训练生成模型成本极高(GPU 集群 + 海量数据),除非核心业务,否则优先用现成模型(Stable Diffusion、GPT API)做微调/提示工程;
- 创造力 vs 风险:生成式 AI 是双刃剑,落地必须配内容审核与合规评估。
延伸阅读
- 深度学习基础——生成模型的网络底座
- 扩散模型与生成式 AI——文生图的实战拆解
- 大语言模型(LLM)——自回归生成的最强形态
- Transformer 与 NLP——生成式 NLP 的架构
- 可解释性与公平性——生成模型的可信问题
- 数据与数据工程——AI 生成数据的污染问题
参考资料
- Kingma & Welling. Auto-Encoding Variational Bayes(VAE, ICLR 2014)
- Goodfellow et al. Generative Adversarial Nets(GAN, NeurIPS 2014)
- Ho, Jain, Abbeel. Denoising Diffusion Probabilistic Models(DDPM, 2020) —— 扩散模型奠基论文
- Rombach et al. High-Resolution Image Synthesis with Latent Diffusion Models(Stable Diffusion, 2022)
- Radford et al. Learning Transferable Visual Models From Natural Language Supervision(CLIP, 2021)
- Brown et al. Language Models are Few-Shot Learners(GPT-3, 2020)
- Heusel et al. GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium(FID, 2017)