游乐游手机版
首页/科技数码/文章详情

阿里云与上海交大联合攻关DiT推理加速,三篇论文入选ECCV

时间:2026-07-19 11:44
阿里云与上海交通大学合作的三篇论文入选ECCV2026,聚焦DiffusionTransformer推理加速,提出时序误差校正、自适应特征分解、时空令牌筛选技术,将算力需求缩短近90%,综合提速最高达14 76倍。这些创新显著降低了扩散模型推理成本,为高效AI生成奠定基础。

7月9日消息,欧洲计算机视觉顶级国际会议ECCV 2026正式公布论文录取结果,阿里云与上海交通大学张林峰教授团队合作的3篇论文被主会收录。这些研究成果均聚焦于Diffusion Transformer(DiT)架构下的高效推理加速,分别围绕时序误差校正、自适应特征分解以及时空令牌筛选三条不同技术路线展开。在高分辨率图像生成场景中,这些创新方法能够将计算需求缩减近90%,综合推理速度最高提升达14.76倍。

ECCV到底有多权威?作为计算机视觉领域公认的三大国际顶级学术会议之一,目标检测、图像分割、视觉Transformer等多项影响行业发展方向的核心技术,都曾在此首次亮相。而DiT作为当前主流视觉生成模型的通用架构,在文生图、文生视频、图像编辑等场景中得到广泛应用。然而,其推理成本高、生成耗时长的问题也日益凸显,被业界视为阻碍AIGC规模化落地的关键瓶颈。


3篇论文入选视觉顶会ECCV 2026

首先介绍第一篇论文,《Accelerating Diffusion Transformers with Gaussian Process Rectified Feature Cache》。其核心思路是解决时序缓存中的误差校正问题。DiT生成一张图像通常需要执行几十甚至上百步的迭代去噪,业界常用的“特征缓存”策略虽然能够跳过部分步骤进行复用,但预测偏差会像滚雪球一样逐渐累积放大。团队发现缓存残差在局部严格服从零均值高斯分布,因此创新性地利用高斯过程回归构建了一个轻量级校正模块,可直接挂载到现有主流时序缓存算法之后。与TaylorSeer结合后,在Qwen-Image上计算量能再降低19.3%,同时PSNR提升0.9dB,LPIPS从0.65降至0.29,生成效果更快且更清晰,成功解决了长区间预测漂移这一长期存在的技术难题。


对比不同基线缓存方法与GP-Refiner结合前后生成图像的视觉效果

第二篇论文《LinCa: Accelerating Diffusion Models via Learnable Decomposed Feature Caching》提出了一个基于可学习可逆网络的特征缓存框架,命名为LinCa。该研究首次系统性地揭示了扩散特征演化过程中的异质性——这种异质性不仅存在于跨模型之间,还同时存在于跨去噪阶段和跨特征维度这三个层面。LinCa的核心做法是将原始特征沿通道维度拆解成具有不同“性格”的子分量,对连续性强的部分使用高阶预测器进行外推,而对突变性强的部分则直接复用。仅需单卡GPU训练1小时即可完成适配。测试数据表现优异:FLUX.1-dev实现5.51倍加速,Qwen-Image达到6.95倍,HunyuanVideo视频模型实现5.50倍加速,图像质量指标全面领先现有方案。


在Qwen-Image-Edit上,LinCa表现出更优的提示理解能力,能够生成高保真图像,同时保持未编辑区域的一致性

动态分辨率是高分辨率DiT推理的核心加速方向之一,但传统方案存在一个尴尬之处:分辨率切换时,会统一上采样全部隐式令牌,导致大量背景和低语义区域产生冗余计算;而现有的局部上采样方法,又大多依赖边缘、纹理这类底层视觉特征,难以准确匹配文本语义和编辑指令的需求,关键区域的细节容易丢失。

阿里云与交大合作的第三篇论文《A ViTS: Adaptive Spatiotemporal Token Selection for Efficient DiTs with Dynamic Resolution》提出了一种时空动态令牌筛选框架。该框架通过“低分辨率打底—选择性上采样—全分辨率精修”三阶段生成流程,巧妙地去除了背景与低语义区域的冗余算力。该方法完全在推理阶段执行,无需重新训练,并且与特征缓存、模型蒸馏、量化等加速技术完全正交。实验数据显示,A ViTS在FLUX模型上最高可实现6.34倍推理加速,编辑场景下FLOPs削减近9倍;叠加步骤蒸馏后,综合提速最高能达到14.76倍。


A ViTS 整体架构:包含时空重要度计算模块与三级分辨率递进调度流程

据了解,上述3项技术已完整集成到阿里云自研的WuYingDiT推理加速引擎,并全量落地至无影灵构一站式AIGC创研平台,服务于游戏美术、电商设计、影视制作、新媒体等行业客户。该套引擎原生适配FLUX、Qwen、混元视频等主流生成基座,客户无需改造现有工作流即可一键启用。

阿里云方面表示,未来将持续在端侧生成式AI前沿技术方向开展研究,将真实业务场景中的技术难题与学术研究紧密结合,不断迭代WuYingDiT加速引擎,进一步降低端侧和边缘场景下高保真生成式AI的应用门槛。

来源:https://www.163.com/dy/article/L1D2516M055040N3.html
上一篇富兰地易购破解刀具采购痛点探索工业品流通数字化路径 下一篇花旗AI峰会:数据稀缺成本高,机器人规模化需十年长跑
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
中科量枢4个月两轮融资,打造量子计算全栈软件生态
科技数码 · 2026-07-20

中科量枢4个月两轮融资,打造量子计算全栈软件生态

中科量枢成立4个月完成两轮融资,团队源自中科院计算所,具备二十余年量子计算理论与算法研究经验。公司打造“天枢”操作系统、“天璇”编译平台及“天玑”算法库,构建全栈式软件生态,与中石油勘探院合作推动量子计算在油气勘探等领域的应用落地。

比亚迪巴西工厂第10万辆新能源车下线员工超5500人
科技数码 · 2026-07-20

比亚迪巴西工厂第10万辆新能源车下线员工超5500人

比亚迪巴西卡马萨里工厂投产满一年,第10万辆新能源汽车下线,车型为海鸥。工厂在岗员工超5500人,总投资约55亿雷亚尔,一期年产能15万辆。计划2026年底实现半数零部件本地化,已获阿根廷和墨西哥10万辆出口订单。

三星晶圆代工部门超八成员工因奖金不满欲离职
科技数码 · 2026-07-20

三星晶圆代工部门超八成员工因奖金不满欲离职

三星电子晶圆代工部门超八成员工因奖金差距巨大有意离职,离职意向是存储器部门的两倍以上。工会警告危机感突出,已着手研讨人才留存对策。

无问芯穹在AGI到来前构建前店后厂一中心
科技数码 · 2026-07-20

无问芯穹在AGI到来前构建前店后厂一中心

无问芯穹发布面向Agent时代的“前店后厂一中心”架构,涵盖算力集散中心、Token工厂和AI生产力商店,旨在解决算力异构与跨域协同难题,提升Token生产效率,并通过智能体蜂群优化基础设施运维,实现用智能进化智能。

WAIC青年论坛把AI圈真话全说了
科技数码 · 2026-07-20

WAIC青年论坛把AI圈真话全说了

在WAIC青年论坛上,多位从业者围绕模型格局、垂直AI、Agent确定性、具身智能机会、运动健康垂类模型、数据重要性及14岁AI原生思考等话题展开讨论,直言行业正从炫技转向较真付费与落地。