跳到正文

主流图像生成模型有哪些?

区分 DALL·E、Midjourney 等闭源产品与 Imagen 等公开技术路线

原题:除了Stable Diffusion之外,你还了解哪些主流的图像或内容生成模型?请列举并简要说明它们的技术特点和适用场景。

模型架构 · 小红书真题

回答与解析

按公开生成机制分类

  • GAN:生成器与判别器对抗训练,StyleGAN适合高质量人脸等图像生成,CycleGAN用于未配对图像翻译。采样通常一次前向,但训练可能不稳定。
  • 连续VAE:学习连续潜变量的近似后验和decoder,适合表示学习、生成和可控潜空间。
  • 离散token自回归:先把图像量化为token,再按序生成。Parti是公开的文生图自回归路线,生成受序列解码成本影响。
  • 掩码生成:Muse并非自回归模型,它并行预测被mask的图像token并迭代细化。
  • Diffusion与flow:Imagen等扩散模型逐步去噪;rectified flow类方法学习速度场并通过ODE类路径采样。

DALL-E 3和Midjourney等闭源产品只能依据官方披露描述能力,不能替其断言具体backbone、训练数据或内部损失。比较模型时应区分公开论文方法与商业产品,并按质量、可控性、延迟、训练稳定性、许可证和证据完整度选型。

口语版讲法(约4分钟)

  • 先按生成机制分类
  • 比较GAN和VAE
  • 区分Parti自回归与Muse掩码生成
  • 说明diffusion和flow
  • 限定闭源产品证据边界

除了Stable Diffusion,我会按生成机制来回答,而不是把产品名堆成榜单。一种常见路线是GAN,生成器负责造样本,判别器负责区分真伪,两者对抗训练。StyleGAN系列常用于高质量人脸和可控图像生成,CycleGAN则是未配对图像翻译的代表。GAN采样通常只需一次生成器前向,但训练平衡、模式覆盖和稳定性需要单独处理。

另一类是VAE。连续VAE学习近似后验、潜变量先验和decoder,通过重参数化训练。它适合概率建模、表示学习和潜空间控制,但具体重建观感取决于似然、decoder和感知损失,不能简单概括成一定模糊。VQ-VAE一类方法则把表示离散化,后续可以训练图像token先验。

离散token路线要区分自回归与掩码生成。Parti把图像表示成离散token,再像语言模型一样按序预测下一个token,属于自回归文生图路线。Muse同样使用离散图像token,但它是masked generative Transformer:从被mask的位置出发并行预测,再迭代细化。因此不能因为两者都处理token,就把Muse归为自回归模型。

后续还要看diffusion和flow。Imagen等扩散模型从噪声逐步恢复图像,条件控制成熟,但通常需要多次网络评估。Flow matching或rectified flow学习随时间变化的速度场,通过ODE类求解把基分布运输到数据分布。实际速度取决于训练路径、求解器和实现,不能说flow天然单步或一定更快。

闭源产品要保留证据边界。DALL-E 3、Midjourney等可以按官方公开材料描述输入能力、输出控制和安全策略,但如果没有论文或技术报告,就不能替它们指定U-Net、Transformer、训练数据或损失函数。面试时我会明确说“公开信息不足”,这比编一个看似具体的架构更专业。

最后做选型时,我会比较目标质量、可控性、单请求延迟、吞吐、训练稳定性、数据许可和部署条件。很多系统还会混合autoencoder、diffusion、Transformer或对抗损失,所以分类要说主要生成过程和组件角色,而不是看到一个VAE就给整套系统贴VAE标签。

很多现代系统还是混合架构,例如先用autoencoder压缩,再在latent上训练diffusion或flow;离散tokenizer后可接自回归或masked生成器。面试里应说明哪个组件负责表示压缩,哪个组件才是主要生成过程,并用公开证据支持归类。

视频、音频和三维内容还会引入时序一致性、长序列和物理约束,不能把图像模型名称直接迁移成这些模态的能力证明。应查看对应论文的训练对象和公开评测。

关键一句:同样生成离散图像token,Parti与Muse的解码依赖为何不同。

核验来源

  1. Generative Adversarial Nets
  2. Auto-Encoding Variational Bayes
  3. Parti: Pathways Autoregressive Text-to-Image Model
  4. Muse: Text-To-Image Generation via Masked Generative Transformers
  5. A Style-Based Generator Architecture for Generative Adversarial Networks
  6. Unpaired Image-to-Image Translation using Cycle-Consistent Adversarial Networks
  7. Neural Discrete Representation Learning
  8. Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding
  9. Flow Matching for Generative Modeling
  10. Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow

面试官还可能这样问

  1. 问法 1 · 场景切入

    假设你在做一个AI绘图工具,用户想要生成一张‘赛博朋克风格的猫’,你觉得除了SD,还有哪些模型能搞定?各自有什么特点?

  2. 问法 2 · 层层追问

    你平时用过的图像生成模型有哪些?……除了SD,还有别的吗?……那它们的底层技术路线有什么不同?比如扩散和自回归,具体适用什么场景?

  3. 问法 3 · 直球架构

    请列举目前主流的图像或内容生成模型,并说明它们的技术特点和适用场景。不用讲SD,讲其他几个就行。

同模块相关题目