首页/问答百科/注意力机制
📖 基础概念

注意力机制

Attention注意力机制自注意力Self-Attention注意力

注意力机制(Attention)是深度学习中的一种核心技术,让模型在处理一个词时能够"关注"输入序列中的其他相关词,捕捉长距离依赖关系。自注意力机制(Self-Attention)是 Transformer 架构的基础,也是大模型成功的核心原因。


什么是注意力机制?

注意力机制(Attention Mechanism)是一种让模型在处理信息时能够"聚焦"于重要部分的技术。就像人类阅读时,眼睛会关注关键词而不是逐字阅读一样,注意力机制让模型能够动态地决定"应该关注输入的哪些部分"。

注意力机制的核心思想

在传统序列模型中,处理长句时,开头的信息往往会"被遗忘"。注意力机制解决了这个问题——无论两个词在句子中隔得多远,模型都可以直接计算它们之间的相关性。例如在"我今天在公园里看到了一只非常可爱的猫"中,无论"猫"和"可爱"相隔多远,注意力机制都能将它们关联起来。

自注意力机制(Self-Attention)

自注意力是 Transformer 使用的注意力变体——每个词都关注句子中的所有其他词(包括自己),计算它们之间的相关性分数。这让模型能够理解复杂的上下文依赖关系。

为什么注意力机制如此重要?

注意力机制是大模型成功的核心原因之一。它解决了传统 RNN 模型无法有效处理长序列的缺陷,让模型能够捕捉长距离的语义依赖关系。同时,自注意力机制可以并行计算(不像 RNN 需要串行处理),大幅提升了训练效率。


相关术语

分享: