Stable Diffusion 各版本怎么选?
SD v1/v2/XL/3/Turbo 架构、数据、质量、效率对比
原题:请详细说明Stable Diffusion v1、v2、XL、3以及SDXL-Turbo等主要版本在模型架构、训练数据、生成质量、推理效率和应用场景方面的关键差异,并分析其技术演进路径。
多模态 · 小红书真题
回答与解析
版本差异要按模型族与具体 checkpoint 说明
Stable Diffusion v1 以 Latent Diffusion 为基础,在 VAE 潜空间中使用 U-Net 去噪,并通过 CLIP 文本编码器提供条件。常见 v1.x checkpoint 以 512×512 为主要训练分辨率,但不同衍生模型的数据与许可不能混写。
Stable Diffusion v2 系列仍是潜空间扩散与 U-Net 路线,文本侧改用 OpenCLIP,但不同 checkpoint 的预测目标不能混写:512-base 使用标准 noise/epsilon-prediction;768-v 从 512-base 继续训练到 768×768,并采用 v-objective。v2 发布还包含深度条件、放大和修复等 checkpoint,因此既不能把整个 v2 系列统一说成 512 模型,也不能把 v-prediction 泛化为所有 v2 checkpoint 的共同训练目标。
SDXL 扩大 U-Net,使用双文本编码器、额外文本与尺寸条件,并提供 base 与可选 refiner,官方基线面向 1024×1024。Stable Diffusion 3 则改用 MMDiT,让文本 token 与图像 token 以各自权重交互,并采用 rectified-flow 训练框架。论文的 scaling study 训练了约 450M 到 8B 的模型;Stability AI 当时公布的初始发布规划则是 800M 到 8B。前者是研究缩放范围,后者是发布规划口径,不能混写,也不能把所有 SD3 都说成 8B。
SDXL-Turbo 是从 SDXL 蒸馏出的低步数模型,采用 Adversarial Diffusion Distillation,可在 1 到 4 步生成。官方模型卡建议 512×512;更高分辨率可以尝试但质量可能下降,而且模型卡明确说明不能稳定生成可读文字。显存、延迟和吞吐必须绑定 checkpoint、精度、分辨率、采样步数、batch 与硬件实测,不存在通用的 24GB 门槛。
口语版讲法(30秒速答 + 90秒主答 + 完整展开)
- 按模型族和 checkpoint 区分版本
- 解释 U-Net 潜扩散到 MMDiT 的变化
- 说明 SDXL-Turbo 的低步数与能力边界
- 把数据、质量和硬件结论绑定公开证据
- 用统一工作负载比较部署成本
【30秒速答】 Stable Diffusion 的演进不能只按版本号背参数。v1 和 v2 都属于 VAE 潜空间里的 U-Net 扩散,v2 系列更换了 OpenCLIP 文本编码器,但 512-base 使用标准 noise/epsilon-prediction,768-v 才是从 base 继续训练并采用 v-objective。SDXL 扩大 U-Net,加入双文本编码器和尺寸条件,主要面向 1024 分辨率。SD3 改成 MMDiT 与 rectified flow,论文缩放实验覆盖约 450M 到 8B,官方当时公布的初始发布规划则为 800M 到 8B,两种口径不能混写。SDXL-Turbo 从 SDXL 蒸馏而来,重点是 512 分辨率与 1 到 4 步,不保证可读文字。显存和速度只能按具体模型与硬件实测。
【90秒主答】 v1 的关键不是“能画图”这一个结论,而是把扩散过程放进 VAE 潜空间,用 U-Net 预测去噪方向,再通过文本编码器做条件控制。常见 v1.x 权重围绕 512 分辨率训练。v2 沿用潜扩散主干,文本条件改为 OpenCLIP,但训练目标要按 checkpoint 区分:512-base 在 512×512 上采用标准 noise/epsilon-prediction;768-v 从 512-base 继续训练到 768×768,并采用 v-objective。发布物还包括深度、修复与放大版本,所以说“v2 就是 512”会把模型族和单个权重混在一起,把 v-prediction 写成整个 v2 系列的共同属性也同样不准确。SDXL 仍是 U-Net 路线,但网络更大,使用两个文本编码器,并把原始尺寸、裁剪位置和目标尺寸等微条件输入模型,通常由 base 直接生成,也可以再接 refiner。SD3 的技术路径不同,MMDiT 为文本和图像 token 保留不同参数并进行双向交互,训练目标采用 rectified flow。论文的 scaling study 从约 450M 扩到 8B;Stability AI 当时公布的初始发布规划是 800M 到 8B。研究缩放范围和发布规划分别回答不同问题,部署时还必须指出实际使用的 checkpoint。
【完整展开】 Turbo 的定位也要单独说。它通过 Adversarial Diffusion Distillation 把 SDXL 压到很少的网络评估次数,模型卡给出的典型范围是 1 到 4 步,并建议关闭传统 classifier-free guidance。官方重点分辨率是 512×512,尝试 768 或 1024 并不等于保持 SDXL 的画质,文生字也仍是公开限制。它适合交互草图、实时预览和低延迟创意工具,但不应因为速度快就宣称细节、文字与高分辨率都和 SDXL 相同。
训练数据同样要按公开材料说到边界。v1、v2 与 SDXL 的论文和模型卡披露程度不同,闭源或未完整公开的过滤规则不能自行补齐。质量比较要固定提示词、种子策略、分辨率、采样器与步数,分别看提示遵循、构图、文字、人像失败、安全和用户偏好。部署比较则记录权重精度、峰值显存、冷启动、单图延迟、吞吐与能耗。某张显卡能否运行还取决于 offload、量化、attention 实现和 batch,不能把一个测试环境写成全系列固定门槛。
【验证补充】版本对比还要锁定许可证与安全过滤。不同权重即使名字相近,也可能使用不同文本编码器、VAE、噪声目标和默认调度器。迁移应用时先读取对应模型卡,再做相同提示和人工盲评,不能把社区衍生权重的表现归给官方基础模型。
关键一句:SD3 和 SDXL-Turbo 的版本名都不能替代具体 checkpoint、训练目标与评测条件。
核验来源
- High-Resolution Image Synthesis with Latent Diffusion Models
- SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis
- Scaling Rectified Flow Transformers for High-Resolution Image Synthesis
- Stable Diffusion 3: Research Paper, Stability AI
- Stable Diffusion v2-base Model Card
- Stable Diffusion v2 768-v Model Card
- Stable Diffusion 2.0 Release
- SDXL-Turbo Model Card
面试官还可能这样问
- 问法 1 · 场景切入
假设你要做一个电商海报生成的AI工具,用户既想要快速预览图,又要求最终出图质量高、文字清晰。市面上有Stable Diffusion v1、SDXL、SD3、还有Turbo版本,你怎么给业务方推荐?它们到底差在哪儿?
- 问法 2 · 层层追问
从SD v1到SD3,Stable Diffusion的架构发生了哪些主要变化?……那SDXL的双模型级联设计是为什么?……到了SD3为什么又换成了DiT?……这种演进路径背后,你觉得根本的驱动力是什么?
- 问法 3 · 直球架构
请系统比较Stable Diffusion v1、v2、XL、3和XL-Turbo在模型架构、训练数据、生成质量、推理效率和应用场景上的关键差异,并分析其技术演进路径。