游乐游手机版
首页/AI热点日报/热点详情

阿里RTPurboV2:原生Transformer再次崛起,百步训练实现10倍稀疏注意

类型:热点整理2026-07-20
“Full Attention 正逐渐被遗忘”——这一观点在业内正慢慢形成共识。然而,事实真的如此简单吗? 随着 Agent 应用对长序列处理需求的急剧增长,传统 GPT 架构中的 Attention 模块,由于 O(N²) 计算复杂度的固有缺陷,确实越来越被视为性能瓶颈,各类替代方案层出不穷。当前

“Full Attention 正逐渐被遗忘”——这一观点在业内正慢慢形成共识。然而,事实真的如此简单吗?

随着 Agent 应用对长序列处理需求的急剧增长,传统 GPT 架构中的 Attention 模块,由于 O(N²) 计算复杂度的固有缺陷,确实越来越被视为性能瓶颈,各类替代方案层出不穷。当前,注意力机制的架构迭代速度可谓日新月异。业界主流方案主要分为两大流派:Linear Attention 与 Sparse Attention。前者以 Qwen-Next 和 Kimi-K2 为代表,其核心是通过改进后的 Linear Attention 实现信息压缩,将存储开销降至 O(1),计算开销降至 O(N);后者则借助稀疏化手段优化计算成本,实践中通常能达到 90% 以上的稀疏度——这也是 DeepSeek-V4 正式采用的技术路线。

然而有趣的是,早期的 RTPurbo 工作已明确表明:仅凭 Full Attention 配合 Sliding Window Attention(SWA),即可在精度无损的前提下,将原生 Transformer 中 85% 的注意力头替换为 SWA,构建出 15% Full Attention + 85% SWA 的混合架构,实现 5 倍的 KV 与 Attention 压缩。无独有偶,近期诸如 MIMO、Gemma4、GPT-OSS 等开源架构,也纷纷采用 SWA + Full Attention 的设计方案。这背后,颇有几分“大道至简”的意味。

不过,即便替换掉了 85% 的 Full Attention,剩余 15% 在面对超长序列(如 1M)时,依然是难以回避的瓶颈。为了彻底攻克 Attention 的推理难题,阿里的 RTP 团队推出了第二代压缩技术:RTPurboV2。该技术通过 Headwise 压缩、低秩投影压缩以及聚类方法,能够在 V1 架构基础上,进一步将 Full Attention 部分的计算压缩提升至 16 到 32 倍。

图 1:RTPurboV2 性能

那么,这一切究竟是如何实现的呢?

先给出一个核心判断:Full Attention 模型在预训练过程中,早已自发形成了高度稀疏的注意力结构。我们要做的并非“强行施加”稀疏性,而是将其“释放”出来。这一判断得以成立,依赖于四个可量化的关键发现。

发现一:85% 的注意力头天然适配滑动窗口

研究人员发现,Full Attention 模型中的不同 Attention Head 各司其职。有的专注于捕捉局部信息(如相邻 token 之间的关系),有的则负责长距离依赖(如与自身相关信息的关联)。

图 3:与多数仅关注局部信息的 Attention Head 不同,Retrieval Heads 会关注与当前 query token 语义相关的区域,即便这些区域在上下文中相隔甚远。

具体而言,通过可视化分析,在 Qwen3 系列模型中:约 15% 的 Head 呈现出明显的“召回头”(retrieval head)特征——其注意力分布极为稀疏,仅聚焦于少数关键 token,专门执行长距离信息召回任务;其余 85% 则为“流式头”(streaming head)——注意力分布相对均匀,主要关注局部上下文。这种分工在不同输入和序列长度下均保持高度稳定,是模型在预训练过程中自行习得的内在结构。因此,顺理成章的推论是:85% 的 Full Attention 计算完全可以安全地替换为 SWA(参考 RTPurbo),对模型能力几乎无影响。真正需要着力解决的,仅有剩余 15% 召回头的高效计算问题。

发现二:长程检索依赖低维子空间

召回头的核心任务是在整个序列中执行语义匹配——这看上去仍是 O(N²) 的问题。RTPurboV2 的一项关键升级,源于对召回头与 RoPE 的精细剖析。深入分析 RoPE 位置编码的频率结构后,团队发现召回头上的 RoPE 分量存在显著的维度冗余。在 RoPE 机制下,Query-Key 的注意力得分可拆解为不同频率分量的叠加。其中,不同频率分量的作用差异显著:低频分量(θ_i 较小)随位置偏移缓慢变化,承载 token 间的语义相关性信号;高频分量(θ_i 较大)则随位置偏移快速振荡,引入距离敏感性干扰。

对于长距离检索而言,高频分量会使注意力得分随位置距离剧烈波动,削弱语义信号的稳定传递。而从召回任务本身的特性思考:一个 token 的召回强度,不应因相对位置的变化而快速波动。由此可推断,召回头上的高频分量必然受到抑制——召回头实质上仅利用 RoPE 的低频分量。

图 4:RoPE 下高频分量随位置快速旋转,影响长程检索。

沿着这一思路,一个很自然的设计是训练一个低维的 projector。通过低秩映射,将原始特征维度从 D 压缩至 r=16(r ≪ D),系统性地保留低频语义分量,同时过滤掉高频位置噪声。实验迅速验证了这一点:仅用 16 维,即可达到 90% 以上的 token 召回率。

发现三:序列维度的冗余——基于高质量特征的自适应聚类

这是 RTPurboV2 的另一项核心技术升级。团队意识到,低秩投影带来的好处远不止计算量的直接降低——它从根本上改善了 Key 向量在语义空间中的分布质量。高频噪声被滤除后,语义相似的 token 在低秩空间中自然聚拢,语义无关的则彼此远离。这为序列维度的进一步压缩创造了理想条件。

基于这一特性,我们在序列维度上引入了自适应聚类,构建了两级漏斗式计算流程:
1. 粗粒度匹配:将 N 个 token 聚类为 K 个语义簇(如 K=128),Query 先与这 K 个簇中心进行轻量级匹配,复杂度仅为 O(N·K)。
2. 细粒度计算:仅在命中的相关簇内部,执行完整的 Attention 计算。

两阶段串联后,整体复杂度从 O(N²) 降至 O(N·K)。这两步压缩之间还存在显著的协同增益:特征维度降低,单步计算开销下降,同时产出高质量的聚类输入;序列维度通过聚类压缩,跳过大量语义无关的 token,减少总计算步数。更重要的是,特征压缩提纯后的向量使聚类中心更加精准,即使在极端压缩比下仍能保持高召回率。两者结合,形成了乘法效应:压缩比越激进,协同增益越明显。

发现四:动态 top-p 显著优于固定 top-k

传统的稀疏注意力方法通常采用固定 top-k 策略——每个 query 仅保留 attention score 最高的 k 个 token。但这存在一个根本性问题:不同的 attention head、不同的序列长度、不同的 query,所需的上下文 token 数量差异巨大。以同一模型同一层的三个召回头为例,在 64K 上下文下,要覆盖 90% 的注意力质量,所需 token 数可能相差三个数量级。这意味着,不存在一个固定的 k 值能同时满足所有场景。

表 1:不同 Attention Head 在不同序列长度下,top_p = 0.9 时召回的 Token 数量。

因此,RTPurboV2 选择了动态 top-p 策略:对每个 query,保留累积注意力得分达到 p(如 0.9)的 token 集合。集中型的 query 自动节省预算,分散型的 query 自动扩大覆盖。同时,我们设计了一个无排序的 top-p 解码核——用 256-bin 直方图替代 的排序操作,将评分与筛选融合为一次 kernel launch,内存开销压至 O(1)。

两阶段微调训练——百步完成稀疏化适配

四个发现汇聚在一起,RTPurboV2 的推理架构自然成型:
- 流式头(85%)→ SWA(窗口 8192)
- 召回头(15%)→ 低秩投影 + 聚类索引 + 动态 top-p

让模型适配这套稀疏化架构,仅需训练约 600 步,约 1M label tokens。具体而言,训练分为两个阶段:
- 阶段 1——投影对齐:冻结模型主体,仅训练各召回头的低秩投影矩阵,最小化投影注意力分布与原始分布之间的 KL 散度。
- 阶段 2——端到端自蒸馏:启用稀疏模式,让稀疏模型学习原始稠密模型的 next-token 预测分布。

在数十万亿 token 的预训练语境下,1M token 几乎可以忽略不计。这也从另一个角度验证了核心论点:Full Attention 的稀疏性是内生的,微调不过是帮助它完成从隐式到显式的转化。

实验结果与性能评估

为全面验证 RTPurboV2 的实际表现,我们在 Qwen3-Coder-30B-A3B 和 Qwen3.5-35B-A3B 这两款主流模型上,对长文本核心基准进行了系统性评估。

1. Ruler 基准测试:长程检索的精度突破

在 Qwen3-Coder-30B-A3B 模型上,通过离线校准识别出约 15% 的关键召回头。针对这些 Head,Prefill 阶段采用 Full Attention 配合 K Cache 聚类,Decode 阶段则应用 RTPurboV2 实现稀疏化;其余流式头统一使用 SWA(局部窗口设为 8192)。结果如图 3 所示,RTPurboV2 在 32K 和 64K 序列长度下均取得了最优平均分(89.69 和 85.61),显著优于除 Full Attention 之外的所有基线方法——长程信息召回的精度确实过硬。

图 5:Ruler 测评结果。

2. LongBenchV2 基准测试:高召回比例下的无损压缩

在 Qwen3.5-35B-A3B 模型上,校准发现超过 70% 的 Head 具有召回特性。因此采取了全量稀疏化策略。实验结果(图 4)显示,RTPurboV2 在大幅降低计算开销的同时,完整保留了模型的基础能力,精度表现与 Full Attention 持平。

图 6:LongBenchV2 测评结果。

3. CoT 推理任务:复杂逻辑的稳定支撑

在链式思维(CoT)推理任务中,RTPurboV2 同样表现出色(图 5),模型推理能力近乎无损保留。这进一步说明,该方案在复杂逻辑场景下的鲁棒性相当可靠。

图 7:CoT 任务测评结果。

更大的图景

当前注意力机制的研究重心,大量集中在设计全新的高效架构上。这条路径当然有其价值。但 RTPurboV2 揭示了一个容易被忽略的事实:Full Attention 模型自身就蕴含着巨大的效率空间,而释放这种内生稀疏性的成本,低得惊人。

600 步训练,精度几乎无损,Prefill 阶段最高 9.36 倍加速。这意味着,对于那些选用 SWA + Full Attention 混合架构的团队——包括 MIMO、Gemma 4、GPT-OSS——他们无需替换架构,即可获得接近当前最优稀疏方案的压缩效率。

原生 Transformer,从未过时。Full Attention strikes back.

团队介绍

RTP-LLM 是阿里巴巴智能引擎团队自研的高性能大模型推理引擎,支撑了淘宝、天猫、高德等核心业务的大模型推理需求。智能引擎脱胎于阿里巴巴搜索、推荐和广告技术,是阿里 AI 工程领域的老牌深耕者。团队专注于 AI 工程系统建设,主导打造了大数据 AI 工程体系 AI·OS,持续为阿里集团各业务提供高质量的 AI 工程服务。

参考文献

[1]: 仅需 15% 全量 Attention!「RTPurbo」阿里 Qwen3 长文本推理 5 倍压缩方案来了。
[2]: Full Attention Strikes Back。

来源:https://www.jiqizhixin.com/api/article_library/articles/2026-06-08-3

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。