视频生成加速有哪些方法?
采样策略、帧间压缩、模型轻量化等关键技术详解
原题:在大模型或多模态系统的第二轮技术面试中,关于视频生成或推理过程中的加速方法,常见的技术问题包括哪些?例如采样策略、帧间压缩、模型轻量化等。
推理优化 · 百度真题
回答与解析
面试回答框架:先拆六层
视频生成加速不能只列模型名,应先确认瓶颈来自采样步数、latent体积、attention、模型参数、通信还是服务调度。
- 采样器与步数:DDIM、DPM-Solver类方法改变数值求解器;LCM、consistency distillation等通过训练或蒸馏减少步数。DPM-Solver++不是“动态跳步”的同义词。
- latent压缩:空间或时空autoencoder减少进入生成模型的token/latent数量;压缩率、重建误差和时序一致性需要共同评测。
- 时空建模:全时空attention为
O((THW)^2);先空间后时间的分解仍为O(T(HW)^2 + T^2HW),并没有变成线性。 - 局部与稀疏计算:窗口、块稀疏、token pruning或条件缓存可减少特定重复计算,但必须说明可见范围和复用条件。3D因果VAE描述的是编码/解码结构,不能单独证明主干使用因果或滑窗attention。
- 模型与算子:蒸馏、量化、低秩或稀疏专家需要分别验证质量和硬件收益;FlashAttention、算子融合、sequence parallel属于kernel与并行层。
- 服务系统:批处理、offload、分块解码和多卡流水要用端到端延迟、吞吐、峰值显存与通信占比评估。
KV cache只在架构存在可安全复用的K/V时成立,不是视频时序建模的通用替代。任何“某模型用了MoE/滑窗/因果attention”的说法都要绑定准确版本和论文;若公开材料不支持,就不作断言。
口语版讲法(约4分钟)
- 先用profile定位瓶颈
- 比较采样器与蒸馏
- 推导时空attention复杂度
- 说明latent、模型和kernel优化
- 用端到端指标做系统取舍
这道题我不会先堆模型名,而会先问清楚目标:是离线生成追求吞吐,还是交互式生成追求单请求延迟;分辨率、帧数、步数和硬件是多少。视频成本可能卡在去噪步数、latent token数量、attention、模型参数、跨卡通信或解码器。先profile,后面的优化才有对应关系。
第一层是采样。DDIM、DPM-Solver类方法主要改变反向过程的数值求解,目标是在更少函数评估下维持质量;LCM或consistency distillation则包含额外训练或蒸馏,让模型适应少步生成。不能把DPM-Solver++简单叫作动态跳步,也不能说少步一定更快,因为每步kernel、批大小、解码开销和质量回退都要一起测。
第二层是latent压缩。空间或时空autoencoder先降低H、W甚至T方向的表示规模,再让扩散或flow模型在较小latent上工作。它能直接减少后续token,但压缩率越高,重建细节、运动连续性和文字区域可能越难保留。所以要把autoencoder重建质量与生成主干的速度分开测。
第三层是时空attention。全时空attention对THW个token做全连接,复杂度是THW整体的平方。若分成逐帧空间attention和同位置时间attention,复杂度大致是T乘HW的平方,加T平方乘HW,仍然含二次项,并没有变成线性。窗口或块稀疏可以进一步降成本,但也缩小了直接可见范围。
这里要避免用错模型证据。3D因果VAE说明编码器和解码器怎样压缩视频,不代表生成主干一定采用因果或滑窗attention。KV cache也不是视频建模的通用替代,只有计算图中历史K/V在后续步骤确实不变且可复用时才成立。类似“某版本使用MoE”的说法必须查到对应版本论文,否则不作为面试事实。
第四层是模型和kernel。可以做教师学生蒸馏、量化、低秩或稀疏专家,但量化后的时序误差、专家通信和硬件支持必须实测。FlashAttention、算子融合和sequence parallel是在数学结构确定后减少中间读写或分摊序列维,不能和模型结构优化混为一谈。
最后是系统层:批处理、分块解码、offload、多卡流水和结果缓存都可能有用,但要报告端到端延迟、吞吐、峰值显存、通信占比和质量指标。我的选型顺序会是先减不必要的采样步和latent规模,再优化attention与kernel,最后做跨卡和服务调度;每一步都在相同画质、帧数和质量门槛下比较,避免只看某个算子的局部加速。
面试里若要求量化,我会给出测量公式而不是拍一个倍率:记录固定分辨率和帧数下的网络函数评估次数、每步耗时、VAE耗时与通信时间,再计算各阶段占比。这样才能判断下一步该减少采样步、压缩token,还是优化并行。
关键一句:时空分解attention降低的是哪一项成本,以及为何仍非线性。
核验来源
面试官还可能这样问
- 问法 1 · 场景切入
假设你要做一个短视频生成的APP,用户输入一段描述,你希望能在1秒内生成一个5秒的视频,而不是等一分钟。你会从哪些角度去加速这个生成过程?
- 问法 2 · 层层追问
视频生成比图像生成慢很多,你觉得瓶颈在哪?……除了减少采样步数,模型架构上有什么办法?……那帧间的冗余信息怎么利用起来?
- 问法 3 · 直球架构
聊一下视频生成加速的核心技术,从采样策略、模型轻量化、帧间压缩这几个维度,你分别知道哪些具体方法?