跳到正文

主流生成式模型有哪些?

GAN、VAE、Diffusion、Autoregressive 技术路线及应用场景

原题:除了Stable Diffusion之外,你还了解哪些主流的生成式模型?请列举并简要说明它们的技术路线(如GAN、VAE、Diffusion、Autoregressive等)及其典型应用场景。

多模态 · 小红书真题

回答与解析

可按五条公开技术路线回答

路线 代表工作 机制与常见场景
GAN StyleGAN2、CycleGAN 生成器与判别器对抗训练;采样通常单次前向,适合人脸生成、图像翻译,但可能有训练不稳和mode collapse
连续VAE VAE 学习连续潜变量的变分后验和decoder;适合表示学习、可控latent与概率建模,单独像素似然方案可能偏平滑
离散tokenizer+AR VQ-VAE、Parti、LlamaGen 图像量化成离散token后做next-token预测;便于复用Transformer,生成通常串行
Diffusion DDPM、Imagen、Latent Diffusion/Stable Diffusion、SDXL 学习逐步去噪;文生图、编辑和视频均有应用,采样NFE与质量是重要取舍
Flow/Rectified Flow Flow Matching、Stable Diffusion 3相关路线 学习连续速度场并用ODE类采样;路径和求解器决定训练、步数与质量

容易混淆的归属

  • DALL·E 2使用CLIP图像表征prior与diffusion decoder,不应简单叫latent diffusion。
  • SDXL属于latent diffusion体系,可使用base与refiner,但不宜笼统写成“cascade路线”。
  • 对没有公开论文或完整官方技术报告的产品,不把它用作具体架构归类的证据。
  • GPT-4V架构未公开到足以作为自回归图像生成范例;LlamaGen不是Meta项目。

LoRA主要减少适配参数,不天然降低扩散采样步数或推理时延;U-Net扩散也不能无条件套用LLM式KV cache。选型应按质量、可控性、单次延迟、吞吐、训练稳定性和公开证据比较。

口语版讲法(约4分钟)

  • 用五条路线分类
  • 逐类说明机制、代表和场景
  • 纠正DALL·E 2、SDXL与flow归属
  • 不使用未公开产品架构
  • 按业务指标选型

除了Stable Diffusion,我会按生成机制分路线,而不是把所有模型混成一个榜单。第一类是GAN,例如StyleGAN2和CycleGAN。它通过生成器与判别器对抗训练,采样通常一次前向就能完成,延迟有优势;但训练可能不稳定,也可能出现mode collapse。常见场景包括人脸生成和图像到图像翻译。

第二类是VAE。连续VAE学习近似后验、潜变量先验和decoder,适合概率建模、表示学习和可控latent。VQ-VAE则是离散表示路线,用码本把图像或音频变成离散索引,再训练自回归先验。两者不能只用“都叫VAE”就混为一类,连续与离散潜变量、梯度和生成先验都不同。

第三类是离散token加自回归模型,例如Parti或LlamaGen这类公开工作。它们把图像量化为token,再像语言模型一样做next-token预测,容易复用Transformer和图文序列接口,但生成通常受串行解码影响。LlamaGen是论文方法名,不能错误归为Meta项目;GPT-4V的生成架构公开信息不足,也不适合作为技术例证。

第四类是diffusion,包括DDPM、Imagen、Latent Diffusion和SDXL。它们学习从噪声逐步恢复数据或相关参数化,优点是生成质量和条件控制路线成熟,代价是通常需要多次网络评估。Stable Diffusion和SDXL在连续latent上运行。SDXL可以组合base与refiner,但不应因此把整个技术路线笼统叫cascade。

DALL·E 2也要说准确。它先处理CLIP表征之间的prior,再使用diffusion decoder生成图像,不是通常所说的latent diffusion。把它和Stable Diffusion放在同一“latent VAE扩散”格子里,会掩盖两者潜空间和decoder设计的差异。

第五类是flow matching或rectified flow路线,通过学习随时间变化的速度场,再用ODE类方法从基分布运输到数据分布。Stable Diffusion 3论文采用相关的rectified flow Transformer路线。对没有公开论文或完整官方技术报告的产品,我不会仅凭宣传名称替它归类。具体步数和速度仍取决于训练路径、求解器和实现,不能说flow天然单步。

工程选型时,我会看质量、可控性、单请求延迟、批吞吐、显存、训练稳定性和许可证。实时头像可能偏向GAN或蒸馏后的少步模型,高质量文生图可选择成熟diffusion或flow系统,统一图文序列研究可看自回归路线。LoRA只减少适配参数,不天然减少采样步数;KV cache也只有存在不变且可复用的K/V时才成立,不能当U-Net通用加速。

这些路线也并非互斥。很多系统用autoencoder压缩表示,再在latent上训练diffusion或flow;离散VQ tokenizer后面可接自回归Transformer;生成结果还可能由对抗损失改善感知质量。因此分类时应说清楚主要生成过程和各组件角色,而不是看到一个VAE组件就把整套系统归为VAE。

关键一句:DALL·E 2的CLIP prior加diffusion decoder与latent diffusion并非同一结构。

核验来源

  1. Analyzing and Improving the Image Quality of StyleGAN
  2. Auto-Encoding Variational Bayes
  3. High-Resolution Image Synthesis with Latent Diffusion Models
  4. Hierarchical Text-Conditional Image Generation with CLIP Latents
  5. Scaling Rectified Flow Transformers for High-Resolution Image Synthesis
  6. SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis
  7. Parti: Pathways Autoregressive Text-to-Image Model
  8. Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation

面试官还可能这样问

  1. 问法 1 · 场景切入

    假设你在做一个电商图片生成功能,除了常见的Stable Diffusion,还有哪些生成式模型可以用?技术路线和场景上各有什么侧重?

  2. 问法 2 · 层层追问

    你了解哪些主流的生成式模型?……除了扩散模型,还有别的路线吗?……GAN和VAE现在还有应用场景吗?它们跟扩散模型比有什么优缺点?

  3. 问法 3 · 直球架构

    请列举主流的生成式模型技术路线(如GAN、VAE、Diffusion、自回归等),各举一个代表模型,并说明它们的技术特点和典型应用场景。

同模块相关题目