
在今年的ACL2025颁奖典礼上,来自DeepSeek的梁文锋作为通讯作者,与北京大学等机构联合发表的论文荣获最佳论文奖。此次ACL 2025规模空前,总投稿量达到8360篇,相较于去年的4407篇几乎翻倍,竞争异常激烈。
这篇获奖论文提出了原生稀疏注意力(NSA)机制,长久以来,大语言模型处理长文本就像是戴着镣铐跳舞。传统的全注意力机制计算复杂度随序列长度呈平方级增长,处理64k长度的文本时,注意力计算竟然要占到总延迟的70-80%。而NSA机制通过算法与硬件的协同优化,直接把长文本处理速度提升了11倍,性能不仅没降,反而还超越了传统的全注意力模型。一作袁境阳在会上发表演讲时,透露这项技术可以把上下文长度扩展到1百万tokens,将被应用到下一个前沿模型中。结合论文发表于DeepSeek-R1推出之后,实验设置中也提到使用了DeepSeek-R1的蒸馏数据来微调新的模型,大家纷纷猜测,这项技术将被用于下一代DeepSeek-V4以及DeepSeek-R2。
NSA采用了一种动态分层的稀疏策略,通过三条并行的注意力分支协同工作。压缩注意力负责捕捉粗粒度的全局信息模式,就像快速浏览全文抓住大意;选择性注意力专注于序列中最重要的词块,相当于精读关键段落;滑动注意力负责获取局部的上下文信息,确保细节不丢失。这种设计不是简单地丢弃信息,而是通过精心设计的算法平衡了计算密度。并且,整个架构针对现代GPU硬件进行了深度优化,实现了端到端的原生可训练模式。
在实际测试中,处理64k长度序列时,NSA在解码、前向传播和反向传播的全生命周期中都展现出惊人的速度优势。解码阶段速度提升11.6倍,前向传播提升9倍,反向传播也有6倍的加速,无论是模型推理还是训练,都能获得实实在在的效率提升。
在通用基准测试中,采用NSA预训练的27B参数模型在9个评测指标中有7个超越了全注意力基线。特别是在推理相关的基准测试上,DROP提升了0.042,GSM8K提升了0.034,显示出稀疏注意力在强制模型聚焦关键信息方面的独特优势。在64k上下文的”大海捞针”测试中,NSA在所有位置都实现了完美的检索准确率。在LongBench基准测试上,NSA取得了0.469的平均分,不仅超越了全注意力基线(+0.032),更是大幅领先其他稀疏注意力方法。在需要复杂推理的多跳问答任务上,NSA相比全注意力分别提升了0.087(HPQ)和0.051(2Wiki);在代码理解任务(LCC)上提升了0.069;在段落检索任务(PassR-en)上提升了0.075。研究团队还用DeepSeek-R1的数学推理数据对模型进行微调,然后在美国数学邀请赛(AIME24)上测试,结果显示,NSA-R在8k上下文设置下的准确率达到0.121,而全注意力模型只有0.046;即使在16k上下文下,NSA-R仍然保持0.146的准确率,远超全注意力的0.092。
原生稀疏注意力(NSA)机制为长文本处理带来了全新的解决方案,随着其被应用到下一代DeepSeek-V4及DeepSeek-R2中,有望在更多领域推动人工智能技术的进一步发展与应用,值得我们持续关注。






