7月9日消息,欧洲计算机视觉顶级国际会议ECCV 2026正式公布论文录取结果,阿里云与上海交通大学张林峰教授团队合作的3篇论文被主会收录。这些研究成果均聚焦于Diffusion Transformer(DiT)架构下的高效推理加速,分别围绕时序误差校正、自适应特征分解以及时空令牌筛选三条不同技术路线展开。在高分辨率图像生成场景中,这些创新方法能够将计算需求缩减近90%,综合推理速度最高提升达14.76倍。
ECCV到底有多权威?作为计算机视觉领域公认的三大国际顶级学术会议之一,目标检测、图像分割、视觉Transformer等多项影响行业发展方向的核心技术,都曾在此首次亮相。而DiT作为当前主流视觉生成模型的通用架构,在文生图、文生视频、图像编辑等场景中得到广泛应用。然而,其推理成本高、生成耗时长的问题也日益凸显,被业界视为阻碍AIGC规模化落地的关键瓶颈。

3篇论文入选视觉顶会ECCV 2026
首先介绍第一篇论文,《Accelerating Diffusion Transformers with Gaussian Process Rectified Feature Cache》。其核心思路是解决时序缓存中的误差校正问题。DiT生成一张图像通常需要执行几十甚至上百步的迭代去噪,业界常用的“特征缓存”策略虽然能够跳过部分步骤进行复用,但预测偏差会像滚雪球一样逐渐累积放大。团队发现缓存残差在局部严格服从零均值高斯分布,因此创新性地利用高斯过程回归构建了一个轻量级校正模块,可直接挂载到现有主流时序缓存算法之后。与TaylorSeer结合后,在Qwen-Image上计算量能再降低19.3%,同时PSNR提升0.9dB,LPIPS从0.65降至0.29,生成效果更快且更清晰,成功解决了长区间预测漂移这一长期存在的技术难题。

对比不同基线缓存方法与GP-Refiner结合前后生成图像的视觉效果
第二篇论文《LinCa: Accelerating Diffusion Models via Learnable Decomposed Feature Caching》提出了一个基于可学习可逆网络的特征缓存框架,命名为LinCa。该研究首次系统性地揭示了扩散特征演化过程中的异质性——这种异质性不仅存在于跨模型之间,还同时存在于跨去噪阶段和跨特征维度这三个层面。LinCa的核心做法是将原始特征沿通道维度拆解成具有不同“性格”的子分量,对连续性强的部分使用高阶预测器进行外推,而对突变性强的部分则直接复用。仅需单卡GPU训练1小时即可完成适配。测试数据表现优异:FLUX.1-dev实现5.51倍加速,Qwen-Image达到6.95倍,HunyuanVideo视频模型实现5.50倍加速,图像质量指标全面领先现有方案。

在Qwen-Image-Edit上,LinCa表现出更优的提示理解能力,能够生成高保真图像,同时保持未编辑区域的一致性
动态分辨率是高分辨率DiT推理的核心加速方向之一,但传统方案存在一个尴尬之处:分辨率切换时,会统一上采样全部隐式令牌,导致大量背景和低语义区域产生冗余计算;而现有的局部上采样方法,又大多依赖边缘、纹理这类底层视觉特征,难以准确匹配文本语义和编辑指令的需求,关键区域的细节容易丢失。
阿里云与交大合作的第三篇论文《A ViTS: Adaptive Spatiotemporal Token Selection for Efficient DiTs with Dynamic Resolution》提出了一种时空动态令牌筛选框架。该框架通过“低分辨率打底—选择性上采样—全分辨率精修”三阶段生成流程,巧妙地去除了背景与低语义区域的冗余算力。该方法完全在推理阶段执行,无需重新训练,并且与特征缓存、模型蒸馏、量化等加速技术完全正交。实验数据显示,A ViTS在FLUX模型上最高可实现6.34倍推理加速,编辑场景下FLOPs削减近9倍;叠加步骤蒸馏后,综合提速最高能达到14.76倍。

A ViTS 整体架构:包含时空重要度计算模块与三级分辨率递进调度流程
据了解,上述3项技术已完整集成到阿里云自研的WuYingDiT推理加速引擎,并全量落地至无影灵构一站式AIGC创研平台,服务于游戏美术、电商设计、影视制作、新媒体等行业客户。该套引擎原生适配FLUX、Qwen、混元视频等主流生成基座,客户无需改造现有工作流即可一键启用。
阿里云方面表示,未来将持续在端侧生成式AI前沿技术方向开展研究,将真实业务场景中的技术难题与学术研究紧密结合,不断迭代WuYingDiT加速引擎,进一步降低端侧和边缘场景下高保真生成式AI的应用门槛。
