大模型注意力机制演变

最近各个厂商都在推进长文本、低成本的大模型,这必然会在注意力层面做很多文章。传统注意力机制的计算复杂度随序列长度呈二次方增长,随着文本长度增加,计算量会急剧上升,且中间激活的存储量也随之膨胀,导致成本难以控制。从2022年开始,业界便出现了多种解决手段。

2022

Flash Attention 开始出现。这一时期的大模型注意力仍以MHA为主,但 Flash Attention 在工程上运用了多种技巧来降低计算成本。因为此时大模型的瓶颈不在计算,而在内存带宽上。它借鉴了"分块计算"与"用计算换内存"的思想,通过多种技巧来提升计算效率。

2023

2023年,业界发现主要瓶颈在于KV Cache,优化重点也集中于此。这一时期出现了GQA和Paged Attention等方案,用于降低KV Cache的存储规模,并更好地管理KV Cache。

KV Cache

KV Cache是一优化注意力计算过程中的存储的技术,主要方式是在大模型推理过程中,存储前序token计算得到的KV值,避免重复计算。其主要过程如下(假设没有prompt,直接从第一个token开始生成,即输入的prompt是</S>,是起始字符):

假设</S>已经通过投影矩阵计算好了QKV,那么注意力机制的计算过程如下图所示:

在这里插入图片描述

因此其实Q1在公式中是用不到了,这里就可以进行删除。故只要保存KV 就可以了。本质上还是因为架构是decode-only模式,前面的token是看不到后面的token,所以Q1是不用用到后面的计算过程。

2024

2024年出现了两条并行的路线:一条是继续压缩KV Cache,另一条则是采用全新的架构(如Mamba/线性注意力)。

例如,DeepSeek-V2 使用了MLA(Multi-head Latent Attention),本质上是对KV矩阵进行压缩,让模型可以学习到KV向量之间的相似性,去除噪声和冗余。实验结果甚至优于传统注意力,其原因可能是模型在学习压缩的过程中,也学会了如何去除噪声和冗余,从而获得更好的表示效果。"压缩即架构"的思想,让某些压缩操作可以直接体现在模型结构之中,无需事后处理。

2025-2026

这一阶段从推理阶段的补丁走向了模型原生架构,如DeepSeek团队的DSA、Qwen团队的Gated Attention等。

DSA

DeepSeek 的DSA:

DSA的核心insight是,我们不需要计算所有的attention,只需要计算其中最相关的Attention即可。
DeepSeek的注意力机制主要通过两种互补的注意力机制结合进行的,分别是CSA和HCA。

首先是CSA,全称是compressed sparse attention。他的核心思想是将所有的token按照4个token进行分块,然后进行加权求平均后计算top-k的分块,最后使用MQA来计算最后的注意力分数。通过CSA计算得到的是最相关的几个token的注意力的值,这有一个缺点,部分不是很相关的token的信息会丢失,于是又实用了HCA(highly compress attention)来计算全局的注意力。HCA是将每128个token → 1个摘要块,然后对所有的块计算注意力,这样子可以极度节省内存和注意力,感知文章的全局结构,但是粒度较粗

原始序列(100万 token)
│
├─── HCA ──────────────────────────────────────
│    每128个token → 1个摘要块
│    100万 → 7812个摘要块
│    对全部7812个块做注意力
│    
│    优点:极度省内存和计算
│    缺点:细节损失大
│    适合:感知文章整体结构、远距离粗粒度依赖
│
└─── CSA ──────────────────────────────────────
     每4个token → 1个摘要块
     100万 → 25万个摘要块
         ↓ 智能筛选
     只选最相关的1024个块
     对这1024个块做精细注意力
     
     优点:细节保留好,计算也可控
     缺点:需要额外的筛选步骤
     适合:精准的语义匹配、细粒度信息检索


之后。。。。

从当前的技术脉络来看,注意力机制的演变可能会沿着以下几个方向继续推进:

完全自适应的混合注意力。 未来的模型可能不再为整层固定一种注意力模式,而是让每个 token、每个头甚至每个前向步骤动态选择最合适的计算方式——局部用稠密、全局用稀疏、低频信息用线性/状态空间,由模型自己学习最优的"注意力路由"策略。

注意力与记忆的边界消融。 KV Cache 本质上是一种"被动缓存",未来的架构可能会将注意力计算与主动记忆管理合二为一。模型不再简单"存储"历史信息,而是像人脑一样主动编码、巩固、遗忘和联想,注意力机制本身可能成为记忆系统的一部分,而非独立模块。

硬件-算法的一体化设计。 随着存算一体、近存计算等新硬件形态的成熟,注意力机制可能会跳出 GPU 的内存层次约束,被重新设计为匹配新硬件原语的形态。届时,"注意力"的定义可能不再局限于当前的矩阵运算范式。

跨模态的统一注意力。 文本、图像、视频、音频的注意力机制目前仍是各自为政。未来可能会出现一种统一的注意力原语,能够原生处理多模态的时空关系,不再依赖将图像打成 patch 或将视频抽帧等预处理手段。

总体而言,注意力机制正在从"一个固定的数学公式"进化为"一种可塑的信息检索与压缩范式"。它的核心使命——让模型动态地关注重要信息——不会改变,但实现这一使命的具体形态,还会经历多次迭代。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐