实现4.87倍加速,每秒成本低于0.15元,且生成质量完全无损!
多卡并行选型
此类业务具有几个典型特征:流量以在线请求为主,对任务堆积的容忍度极低;在相同质量条件下,生成速度越快,用户体验越佳,竞争力也越强;同时需要结合多种加速策略。因此,我们最终选择了Deepspeed Ulysses序列并行方案,将线性层和注意力层的计算负载均匀分配到所有设备上。下图展示了序列切分的具体过程:
的输出
与
的输出
差异非常小,因此可以直接复用。然而,在推理过程中,必须完成当前步的计算才能进行这一比较,从而产生了“不计算就无法得知差异”的矛盾。为克服这一矛盾,TeaCache提出:模型输入与输出之间存在强相关性,并且可以通过一个多项式进行拟合。
计算并缓存输出结果。
- 对于后续时间步,将
与
进行累加。 - 若累加和
(即设定的阈值),则复用缓存;若
,则执行完整计算并更新缓存。
最优调度选择阶段:用动态规划完成关键时间步序列计算
该阶段在线上初始化时进行,在只允许完整计算K次的前提下,以PACT为成本,采用动态规划作为最优路径算法,计算出最优采样序列。优化目标如下:
动态规划递推公式:
其中D[m, k]表示用m个关键步到达时间步k的最小累积成本,P[m, k]记录达成该最小成本时的上一个关键步(用于回溯最优路径)。得到的关键时间步序列与采样配置绑定,一旦生成,可在生产环境长期复用,直到配置变更才需重新计算。
推理阶段:按关键时间步序列执行推理
在线推理时,每个时间步执行如下策略:
- 关键步:执行完整模型前向计算,得到该时间步的输出,并将指定特征写入缓存;
- 非关键步:调用与校准时完全相同的预测器,根据缓存快速生成该时间步所需的特征。
落地效果
- 生成质量:生成结果退化比例明显低于TeaCache及TaylorSeer。
- 加速性能:DPCache通过校准找到最优采样序列,可进一步减少完整计算步数,加速效果约为140%–160%。
已落地方案对比
下面这张表从多个维度综合对比了我们在探索过程中已落地的三种缓存策略:
通过实践,可以得出以下结论:
- TeaCache是视频生成缓存加速领域的经典方法,但在高质量生成场景下,其启发式阈值难以平衡质量与速度。
- TaylorSeer证明了“预测范式”的有效性,大幅提升了加速比,但固定间隔限制了进一步优化空间,且额外的显存占用对实际落地影响较大。
- DPCache在大多数情况下是更好的选择。它通过路径感知成本与动态规划的结合,找到全局最优的计算路径。在线上AB测试中,DPCache不仅继承并进一步提升了TaylorSeer的高加速比,而且在灵活性及生成质量稳定性上实现了突破。

