主流图像生成模型有哪些?
区分 DALL·E、Midjourney 等闭源产品与 Imagen 等公开技术路线
原题:除了Stable Diffusion之外,你还了解哪些主流的图像或内容生成模型?请列举并简要说明它们的技术特点和适用场景。
模型架构 · 小红书真题
回答与解析
按公开生成机制分类
- GAN:生成器与判别器对抗训练,StyleGAN适合高质量人脸等图像生成,CycleGAN用于未配对图像翻译。采样通常一次前向,但训练可能不稳定。
- 连续VAE:学习连续潜变量的近似后验和decoder,适合表示学习、生成和可控潜空间。
- 离散token自回归:先把图像量化为token,再按序生成。Parti是公开的文生图自回归路线,生成受序列解码成本影响。
- 掩码生成:Muse并非自回归模型,它并行预测被mask的图像token并迭代细化。
- Diffusion与flow:Imagen等扩散模型逐步去噪;rectified flow类方法学习速度场并通过ODE类路径采样。
DALL-E 3和Midjourney等闭源产品只能依据官方披露描述能力,不能替其断言具体backbone、训练数据或内部损失。比较模型时应区分公开论文方法与商业产品,并按质量、可控性、延迟、训练稳定性、许可证和证据完整度选型。
口语版讲法(约4分钟)
- 先按生成机制分类
- 比较GAN和VAE
- 区分Parti自回归与Muse掩码生成
- 说明diffusion和flow
- 限定闭源产品证据边界
除了Stable Diffusion,我会按生成机制来回答,而不是把产品名堆成榜单。一种常见路线是GAN,生成器负责造样本,判别器负责区分真伪,两者对抗训练。StyleGAN系列常用于高质量人脸和可控图像生成,CycleGAN则是未配对图像翻译的代表。GAN采样通常只需一次生成器前向,但训练平衡、模式覆盖和稳定性需要单独处理。
另一类是VAE。连续VAE学习近似后验、潜变量先验和decoder,通过重参数化训练。它适合概率建模、表示学习和潜空间控制,但具体重建观感取决于似然、decoder和感知损失,不能简单概括成一定模糊。VQ-VAE一类方法则把表示离散化,后续可以训练图像token先验。
离散token路线要区分自回归与掩码生成。Parti把图像表示成离散token,再像语言模型一样按序预测下一个token,属于自回归文生图路线。Muse同样使用离散图像token,但它是masked generative Transformer:从被mask的位置出发并行预测,再迭代细化。因此不能因为两者都处理token,就把Muse归为自回归模型。
后续还要看diffusion和flow。Imagen等扩散模型从噪声逐步恢复图像,条件控制成熟,但通常需要多次网络评估。Flow matching或rectified flow学习随时间变化的速度场,通过ODE类求解把基分布运输到数据分布。实际速度取决于训练路径、求解器和实现,不能说flow天然单步或一定更快。
闭源产品要保留证据边界。DALL-E 3、Midjourney等可以按官方公开材料描述输入能力、输出控制和安全策略,但如果没有论文或技术报告,就不能替它们指定U-Net、Transformer、训练数据或损失函数。面试时我会明确说“公开信息不足”,这比编一个看似具体的架构更专业。
最后做选型时,我会比较目标质量、可控性、单请求延迟、吞吐、训练稳定性、数据许可和部署条件。很多系统还会混合autoencoder、diffusion、Transformer或对抗损失,所以分类要说主要生成过程和组件角色,而不是看到一个VAE就给整套系统贴VAE标签。
很多现代系统还是混合架构,例如先用autoencoder压缩,再在latent上训练diffusion或flow;离散tokenizer后可接自回归或masked生成器。面试里应说明哪个组件负责表示压缩,哪个组件才是主要生成过程,并用公开证据支持归类。
视频、音频和三维内容还会引入时序一致性、长序列和物理约束,不能把图像模型名称直接迁移成这些模态的能力证明。应查看对应论文的训练对象和公开评测。
关键一句:同样生成离散图像token,Parti与Muse的解码依赖为何不同。
核验来源
- Generative Adversarial Nets
- Auto-Encoding Variational Bayes
- Parti: Pathways Autoregressive Text-to-Image Model
- Muse: Text-To-Image Generation via Masked Generative Transformers
- A Style-Based Generator Architecture for Generative Adversarial Networks
- Unpaired Image-to-Image Translation using Cycle-Consistent Adversarial Networks
- Neural Discrete Representation Learning
- Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding
- Flow Matching for Generative Modeling
- Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow
面试官还可能这样问
- 问法 1 · 场景切入
假设你在做一个AI绘图工具,用户想要生成一张‘赛博朋克风格的猫’,你觉得除了SD,还有哪些模型能搞定?各自有什么特点?
- 问法 2 · 层层追问
你平时用过的图像生成模型有哪些?……除了SD,还有别的吗?……那它们的底层技术路线有什么不同?比如扩散和自回归,具体适用什么场景?
- 问法 3 · 直球架构
请列举目前主流的图像或内容生成模型,并说明它们的技术特点和适用场景。不用讲SD,讲其他几个就行。