首页/问答百科/多头注意力(Multi-Head Attention)
🔧 技术与方法

多头注意力(Multi-Head Attention)

多头注意力机制Multi-Head AttentionMHA多头自注意力

多头注意力是 Transformer 的核心机制,通过并行计算多组注意力头使模型能够从多个子空间同时关注信息的不同方面,显著提升了表征能力。


多头注意力是什么

多头注意力(Multi-Head Attention,简称 MHA)是 Transformer 架构最核心的组件。它将输入同时投影到多组 Query、Key、Value 空间中,每组称为一个"注意力头",每个头独立计算注意力权重和加权求和,最后将所有头的输出拼接并线性变换得到最终结果。

工作原理

给定输入序列,MHA 首先通过可学习的权重矩阵将输入投影为 Q、K、V 向量。头数 h 通常为 8、16 或 32,每个头的维度 d_k 等于模型维度 d_model 除以头数 h。每个头执行缩放点积注意力:计算 Q 与 K 的点积并缩放到 d_k 的平方根,经 softmax 得到注意力权重后加权求和 V。

变体与发展

多头注意力的变体包括:Multi-Query Attention(MQA):所有头共享 Key 和 Value 矩阵;Grouped-Query Attention(GQA):将头分组,组内共享 Key/Value;Flash Attention:通过分块和重计算高效加速 MHA。


相关术语

分享: