首页/AI 百科词条/KV 缓存(KV Cache)
🔧 技术与方法

KV 缓存(KV Cache)

KV CacheKV缓存键值缓存Key-Value Cache注意力缓存

KV 缓存(Key-Value Cache)是一种大模型推理加速技术,通过缓存 Transformer 注意力计算中的 Key 和 Value 矩阵,避免在生成每个新 token 时重新计算历史 token 的注意力值,是自回归生成中的核心优化手段。


什么是 KV 缓存?

KV 缓存(Key-Value Cache)是大模型推理加速的关键技术。在 Transformer 的自回归生成过程中,模型每生成一个新 token,都需要计算当前 token 与所有历史 token 之间的注意力分数。如果不做缓存,每次生成都需要重新计算所有历史 token 的 Key 和 Value 矩阵,造成大量重复计算。

KV 缓存的工作原理

在生成第一个 token 时,模型计算并存储所有 token 的 Key 和 Value 矩阵(即 KV Cache)。生成后续 token 时,只需计算新 token 的 Key 和 Value,然后从缓存中读取历史 KV,组合后计算注意力。这样,每次推理的计算量从 O(n²) 降为 O(n)(n 为序列长度),大幅提升了推理速度。

KV 缓存的内存挑战

KV 缓存虽然加速了推理,但也带来了巨大的内存开销。对于一个 70B 参数的模型处理 128K 上下文,KV 缓存可能占用数十 GB 显存。这是长上下文推理的主要瓶颈之一。为此,研究者提出了各种 KV 缓存优化技术:Multi-Query Attention (MQA)、Grouped-Query Attention (GQA)、PagedAttention、KV 缓存量化等。


相关术语

分享: