跳到正文

Stable Diffusion 各版本怎么选?

SD v1/v2/XL/3/Turbo 架构、数据、质量、效率对比

原题:请详细说明Stable Diffusion v1、v2、XL、3以及SDXL-Turbo等主要版本在模型架构、训练数据、生成质量、推理效率和应用场景方面的关键差异,并分析其技术演进路径。

多模态 · 小红书真题

回答与解析

版本差异要按模型族与具体 checkpoint 说明

Stable Diffusion v1 以 Latent Diffusion 为基础,在 VAE 潜空间中使用 U-Net 去噪,并通过 CLIP 文本编码器提供条件。常见 v1.x checkpoint 以 512×512 为主要训练分辨率,但不同衍生模型的数据与许可不能混写。

Stable Diffusion v2 系列仍是潜空间扩散与 U-Net 路线,文本侧改用 OpenCLIP,但不同 checkpoint 的预测目标不能混写:512-base 使用标准 noise/epsilon-prediction;768-v 从 512-base 继续训练到 768×768,并采用 v-objective。v2 发布还包含深度条件、放大和修复等 checkpoint,因此既不能把整个 v2 系列统一说成 512 模型,也不能把 v-prediction 泛化为所有 v2 checkpoint 的共同训练目标。

SDXL 扩大 U-Net,使用双文本编码器、额外文本与尺寸条件,并提供 base 与可选 refiner,官方基线面向 1024×1024。Stable Diffusion 3 则改用 MMDiT,让文本 token 与图像 token 以各自权重交互,并采用 rectified-flow 训练框架。论文的 scaling study 训练了约 450M 到 8B 的模型;Stability AI 当时公布的初始发布规划则是 800M 到 8B。前者是研究缩放范围,后者是发布规划口径,不能混写,也不能把所有 SD3 都说成 8B。

SDXL-Turbo 是从 SDXL 蒸馏出的低步数模型,采用 Adversarial Diffusion Distillation,可在 1 到 4 步生成。官方模型卡建议 512×512;更高分辨率可以尝试但质量可能下降,而且模型卡明确说明不能稳定生成可读文字。显存、延迟和吞吐必须绑定 checkpoint、精度、分辨率、采样步数、batch 与硬件实测,不存在通用的 24GB 门槛。

口语版讲法(30秒速答 + 90秒主答 + 完整展开)

  • 按模型族和 checkpoint 区分版本
  • 解释 U-Net 潜扩散到 MMDiT 的变化
  • 说明 SDXL-Turbo 的低步数与能力边界
  • 把数据、质量和硬件结论绑定公开证据
  • 用统一工作负载比较部署成本

【30秒速答】 Stable Diffusion 的演进不能只按版本号背参数。v1 和 v2 都属于 VAE 潜空间里的 U-Net 扩散,v2 系列更换了 OpenCLIP 文本编码器,但 512-base 使用标准 noise/epsilon-prediction,768-v 才是从 base 继续训练并采用 v-objective。SDXL 扩大 U-Net,加入双文本编码器和尺寸条件,主要面向 1024 分辨率。SD3 改成 MMDiT 与 rectified flow,论文缩放实验覆盖约 450M 到 8B,官方当时公布的初始发布规划则为 800M 到 8B,两种口径不能混写。SDXL-Turbo 从 SDXL 蒸馏而来,重点是 512 分辨率与 1 到 4 步,不保证可读文字。显存和速度只能按具体模型与硬件实测。

【90秒主答】 v1 的关键不是“能画图”这一个结论,而是把扩散过程放进 VAE 潜空间,用 U-Net 预测去噪方向,再通过文本编码器做条件控制。常见 v1.x 权重围绕 512 分辨率训练。v2 沿用潜扩散主干,文本条件改为 OpenCLIP,但训练目标要按 checkpoint 区分:512-base 在 512×512 上采用标准 noise/epsilon-prediction;768-v 从 512-base 继续训练到 768×768,并采用 v-objective。发布物还包括深度、修复与放大版本,所以说“v2 就是 512”会把模型族和单个权重混在一起,把 v-prediction 写成整个 v2 系列的共同属性也同样不准确。SDXL 仍是 U-Net 路线,但网络更大,使用两个文本编码器,并把原始尺寸、裁剪位置和目标尺寸等微条件输入模型,通常由 base 直接生成,也可以再接 refiner。SD3 的技术路径不同,MMDiT 为文本和图像 token 保留不同参数并进行双向交互,训练目标采用 rectified flow。论文的 scaling study 从约 450M 扩到 8B;Stability AI 当时公布的初始发布规划是 800M 到 8B。研究缩放范围和发布规划分别回答不同问题,部署时还必须指出实际使用的 checkpoint。

【完整展开】 Turbo 的定位也要单独说。它通过 Adversarial Diffusion Distillation 把 SDXL 压到很少的网络评估次数,模型卡给出的典型范围是 1 到 4 步,并建议关闭传统 classifier-free guidance。官方重点分辨率是 512×512,尝试 768 或 1024 并不等于保持 SDXL 的画质,文生字也仍是公开限制。它适合交互草图、实时预览和低延迟创意工具,但不应因为速度快就宣称细节、文字与高分辨率都和 SDXL 相同。

训练数据同样要按公开材料说到边界。v1、v2 与 SDXL 的论文和模型卡披露程度不同,闭源或未完整公开的过滤规则不能自行补齐。质量比较要固定提示词、种子策略、分辨率、采样器与步数,分别看提示遵循、构图、文字、人像失败、安全和用户偏好。部署比较则记录权重精度、峰值显存、冷启动、单图延迟、吞吐与能耗。某张显卡能否运行还取决于 offload、量化、attention 实现和 batch,不能把一个测试环境写成全系列固定门槛。

【验证补充】版本对比还要锁定许可证与安全过滤。不同权重即使名字相近,也可能使用不同文本编码器、VAE、噪声目标和默认调度器。迁移应用时先读取对应模型卡,再做相同提示和人工盲评,不能把社区衍生权重的表现归给官方基础模型。

关键一句:SD3 和 SDXL-Turbo 的版本名都不能替代具体 checkpoint、训练目标与评测条件。

核验来源

  1. High-Resolution Image Synthesis with Latent Diffusion Models
  2. SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis
  3. Scaling Rectified Flow Transformers for High-Resolution Image Synthesis
  4. Stable Diffusion 3: Research Paper, Stability AI
  5. Stable Diffusion v2-base Model Card
  6. Stable Diffusion v2 768-v Model Card
  7. Stable Diffusion 2.0 Release
  8. SDXL-Turbo Model Card

面试官还可能这样问

  1. 问法 1 · 场景切入

    假设你要做一个电商海报生成的AI工具,用户既想要快速预览图,又要求最终出图质量高、文字清晰。市面上有Stable Diffusion v1、SDXL、SD3、还有Turbo版本,你怎么给业务方推荐?它们到底差在哪儿?

  2. 问法 2 · 层层追问

    从SD v1到SD3,Stable Diffusion的架构发生了哪些主要变化?……那SDXL的双模型级联设计是为什么?……到了SD3为什么又换成了DiT?……这种演进路径背后,你觉得根本的驱动力是什么?

  3. 问法 3 · 直球架构

    请系统比较Stable Diffusion v1、v2、XL、3和XL-Turbo在模型架构、训练数据、生成质量、推理效率和应用场景上的关键差异,并分析其技术演进路径。

同模块相关题目