游乐游手机版
首页/AI热点日报/热点详情

DeepSeek获ACL最佳论文 长文推理飙升11.6倍

类型:热点整理2026-07-20
DeepSeek与北京大学联合提出的NSA注意力机制获ACL2025最佳论文奖。该机制通过压缩粗粒度、选择性保留细粒度与滑动窗口三种分支协同,在64k上下文长度下前向传播速度提升9倍,内存访问量减少11 6倍,实现长文推理效率显著突破。

DeepSeek与北大联合研发NSA注意力机制:ACL 2025最佳论文技术深度解析

近日,ACL 2025最佳论文奖正式揭晓,由DeepSeek与北京大学联合完成、梁文锋署名的论文 《Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention》 荣获此项殊荣。该论文提出的NSA(Native Sparse Attention)注意力机制,在长文本推理效率上实现了重大突破——长文推理效率提升11.6倍,前向传播速度提升9倍,为AI推理领域树立了全新标杆。本文将从获奖背景、架构创新、性能数据等方面,为你详细拆解这项前沿技术。

一、ACL 2025最佳论文获奖名单

本次ACL 2025共评选出四篇最佳论文,除NSA论文外,还有以下三篇:

  • 论文一:《A Theory of Response Sampling in LLMs: Part Descriptive and Part Prescriptive》
  • 论文二:《Fairness through Difference Awareness: Measuring Desired Group Discrimination in LLMs》
  • 论文三:《Language Models Resist Alignment: Evidence From Data Compression》

其中,NSA论文因其在稀疏注意力硬件对齐与原生可训练性方面的创新,获得了评审团的高度认可。

二、NSA架构的三大创新

NSA的核心思想是通过 三种互补的注意力分支 来高效处理长序列信息,具体包括:

  • 压缩粗粒度token:将键(Key)和值(Value)聚合成块级表示,捕捉整个块的核心信息,大幅降低注意力计算负担。
  • 选择性保留细粒度token:通过块选择机制,仅保留当前查询最相关的键和值,确保关键细节信息不被丢失。
  • 滑动窗口:专门处理局部上下文信息,防止模型过度依赖局部模式,同时让其他分支能够专注于学习全局信息。

小提示:可以把这个结构想象成“先看整体(粗粒度)、再挑重点(细粒度)、同时关注附近(滑动窗口)”,三者协同实现高效注意力。

三、性能突破:速度与内存访问量双提升

NSA在长序列场景下的性能提升非常显著,以下为官方公布的测试数据:

3.1 计算速度对比

  • 64k上下文长度 下,NSA的 前向传播速度比FlashAttention-2快9.0倍,反向传播速度快 6.0倍
  • 随着上下文长度增加,NSA的速度优势进一步扩大,表明它在处理超长序列时效率更高

3.2 内存访问量对比

  • 在64k上下文中,全注意力模型需要访问 65536 个标记,而NSA仅需访问 5632 个标记,内存访问量减少了11.6倍
  • 由于解码阶段算术强度低且内存受限,预期速度提升与内存访问量呈线性关系,因此实际推理速度也得到接近11.6倍的提升。

小提示:内存访问量的降低意味着模型可以在同样硬件上处理更长的上下文,或者用更低的成本完成推理。

四、常见问题解答(FAQ)

Q1:NSA中的“滑动窗口”有什么独特作用?

滑动窗口专注于捕捉相邻token之间的局部依赖关系。它确保了模型不会因为过度关注全局而忽略局部模式,同时让另外两个分支(粗粒度与细粒度)能够更自由地学习全局和关键信息。三者各司其职,共同提升长序列建模效果。

Q2:NSA和FlashAttention-2相比,优势到底在哪?

FlashAttention-2主要通过优化内存读写和分块计算来加速注意力,但本质上仍需要计算所有token的注意力权重。而NSA通过稀疏化设计,只计算部分关键的token,因此从根源上减少了计算量和内存访问量。在64k长序列下,NSA的前向速度是FlashAttention-2的9倍,内存访问量减少11.6倍。

Q3:NSA能直接用于现有的Transformer模型吗?

是的。论文标题中强调了“Natively Trainable”(原生可训练),这意味着NSA可以作为标准注意力层直接插入现有模型进行端到端训练,无需额外的特殊处理。DeepSeek已在相关项目中验证了其兼容性。

五、论文信息与资源

该论文目前已在arXiv发布,欢迎查阅原文获取更详细的技术细节:

https://arxiv.org/abs/2502.11089
Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention

六、总结与展望

NSA注意力机制的出现,为处理超长上下文(如64k及以上)提供了一种高效、可训练的稀疏注意力方案。它不仅大幅提升了推理速度,还有效降低了内存占用,有望推动大模型在文档分析、代码生成、多轮对话等长序列任务中的应用。未来,这一技术或将成为新一代Transformer架构的基础组件。


欢迎关注公众号 PaperAgent,每天一篇大模型文章,用简单案例锻炼思维。

来源:https://www.53ai.com/news/LargeLanguageModel/2025080178401.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。