主流生成式模型有哪些?
GAN、VAE、Diffusion、Autoregressive 技术路线及应用场景
原题:除了Stable Diffusion之外,你还了解哪些主流的生成式模型?请列举并简要说明它们的技术路线(如GAN、VAE、Diffusion、Autoregressive等)及其典型应用场景。
多模态 · 小红书真题
回答与解析
可按五条公开技术路线回答
| 路线 | 代表工作 | 机制与常见场景 |
|---|---|---|
| GAN | StyleGAN2、CycleGAN | 生成器与判别器对抗训练;采样通常单次前向,适合人脸生成、图像翻译,但可能有训练不稳和mode collapse |
| 连续VAE | VAE | 学习连续潜变量的变分后验和decoder;适合表示学习、可控latent与概率建模,单独像素似然方案可能偏平滑 |
| 离散tokenizer+AR | VQ-VAE、Parti、LlamaGen | 图像量化成离散token后做next-token预测;便于复用Transformer,生成通常串行 |
| Diffusion | DDPM、Imagen、Latent Diffusion/Stable Diffusion、SDXL | 学习逐步去噪;文生图、编辑和视频均有应用,采样NFE与质量是重要取舍 |
| Flow/Rectified Flow | Flow Matching、Stable Diffusion 3相关路线 | 学习连续速度场并用ODE类采样;路径和求解器决定训练、步数与质量 |
容易混淆的归属
- DALL·E 2使用CLIP图像表征prior与diffusion decoder,不应简单叫latent diffusion。
- SDXL属于latent diffusion体系,可使用base与refiner,但不宜笼统写成“cascade路线”。
- 对没有公开论文或完整官方技术报告的产品,不把它用作具体架构归类的证据。
- GPT-4V架构未公开到足以作为自回归图像生成范例;LlamaGen不是Meta项目。
LoRA主要减少适配参数,不天然降低扩散采样步数或推理时延;U-Net扩散也不能无条件套用LLM式KV cache。选型应按质量、可控性、单次延迟、吞吐、训练稳定性和公开证据比较。
口语版讲法(约4分钟)
- 用五条路线分类
- 逐类说明机制、代表和场景
- 纠正DALL·E 2、SDXL与flow归属
- 不使用未公开产品架构
- 按业务指标选型
除了Stable Diffusion,我会按生成机制分路线,而不是把所有模型混成一个榜单。第一类是GAN,例如StyleGAN2和CycleGAN。它通过生成器与判别器对抗训练,采样通常一次前向就能完成,延迟有优势;但训练可能不稳定,也可能出现mode collapse。常见场景包括人脸生成和图像到图像翻译。
第二类是VAE。连续VAE学习近似后验、潜变量先验和decoder,适合概率建模、表示学习和可控latent。VQ-VAE则是离散表示路线,用码本把图像或音频变成离散索引,再训练自回归先验。两者不能只用“都叫VAE”就混为一类,连续与离散潜变量、梯度和生成先验都不同。
第三类是离散token加自回归模型,例如Parti或LlamaGen这类公开工作。它们把图像量化为token,再像语言模型一样做next-token预测,容易复用Transformer和图文序列接口,但生成通常受串行解码影响。LlamaGen是论文方法名,不能错误归为Meta项目;GPT-4V的生成架构公开信息不足,也不适合作为技术例证。
第四类是diffusion,包括DDPM、Imagen、Latent Diffusion和SDXL。它们学习从噪声逐步恢复数据或相关参数化,优点是生成质量和条件控制路线成熟,代价是通常需要多次网络评估。Stable Diffusion和SDXL在连续latent上运行。SDXL可以组合base与refiner,但不应因此把整个技术路线笼统叫cascade。
DALL·E 2也要说准确。它先处理CLIP表征之间的prior,再使用diffusion decoder生成图像,不是通常所说的latent diffusion。把它和Stable Diffusion放在同一“latent VAE扩散”格子里,会掩盖两者潜空间和decoder设计的差异。
第五类是flow matching或rectified flow路线,通过学习随时间变化的速度场,再用ODE类方法从基分布运输到数据分布。Stable Diffusion 3论文采用相关的rectified flow Transformer路线。对没有公开论文或完整官方技术报告的产品,我不会仅凭宣传名称替它归类。具体步数和速度仍取决于训练路径、求解器和实现,不能说flow天然单步。
工程选型时,我会看质量、可控性、单请求延迟、批吞吐、显存、训练稳定性和许可证。实时头像可能偏向GAN或蒸馏后的少步模型,高质量文生图可选择成熟diffusion或flow系统,统一图文序列研究可看自回归路线。LoRA只减少适配参数,不天然减少采样步数;KV cache也只有存在不变且可复用的K/V时才成立,不能当U-Net通用加速。
这些路线也并非互斥。很多系统用autoencoder压缩表示,再在latent上训练diffusion或flow;离散VQ tokenizer后面可接自回归Transformer;生成结果还可能由对抗损失改善感知质量。因此分类时应说清楚主要生成过程和各组件角色,而不是看到一个VAE组件就把整套系统归为VAE。
关键一句:DALL·E 2的CLIP prior加diffusion decoder与latent diffusion并非同一结构。
核验来源
- Analyzing and Improving the Image Quality of StyleGAN
- Auto-Encoding Variational Bayes
- High-Resolution Image Synthesis with Latent Diffusion Models
- Hierarchical Text-Conditional Image Generation with CLIP Latents
- Scaling Rectified Flow Transformers for High-Resolution Image Synthesis
- SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis
- Parti: Pathways Autoregressive Text-to-Image Model
- Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation
面试官还可能这样问
- 问法 1 · 场景切入
假设你在做一个电商图片生成功能,除了常见的Stable Diffusion,还有哪些生成式模型可以用?技术路线和场景上各有什么侧重?
- 问法 2 · 层层追问
你了解哪些主流的生成式模型?……除了扩散模型,还有别的路线吗?……GAN和VAE现在还有应用场景吗?它们跟扩散模型比有什么优缺点?
- 问法 3 · 直球架构
请列举主流的生成式模型技术路线(如GAN、VAE、Diffusion、自回归等),各举一个代表模型,并说明它们的技术特点和典型应用场景。