首页/问答百科/Transformer
🧠 模型与架构

Transformer

Transformer模型变换器自注意力模型Transformer架构

Transformer 是一种基于自注意力机制的深度学习模型架构,由 Google 在 2017 年提出,是现代大模型(如 GPT、BERT)的基石架构,彻底改变了自然语言处理和 AI 领域。


什么是 Transformer?

Transformer 是一种深度学习模型架构,由 Google 团队在 2017 年发表的论文《Attention Is All You Need》中提出。它彻底摒弃了传统的循环神经网络(RNN)和卷积神经网络(CNN)结构,完全基于自注意力机制(Self-Attention)来建模序列数据。

Transformer 的核心创新

自注意力机制:这是 Transformer 最核心的思想。简单来说,模型在处理一个词时,会计算它和句子中所有其他词的相关性(注意力分数),然后根据这些相关性来理解这个词在上下文中的含义。比如在"苹果很好吃"和"苹果发布了新手机"中,"苹果"一词的注意力分布完全不同。

并行计算:传统 RNN 需要按顺序逐词处理,而 Transformer 可以同时处理整个序列,大幅提升了训练效率。

位置编码:由于 Transformer 没有 RNN 的时序结构,它通过位置编码(Positional Encoding)来告诉模型每个词在句子中的位置信息。

Transformer 的关键组件

编码器-解码器结构:原始 Transformer 包含编码器(将输入序列转为特征表示)和解码器(根据特征生成输出序列)两部分。BERT 只用了编码器,GPT 只用了解码器。

多头注意力:同时从多个不同的角度计算注意力,让模型能够捕捉不同类型的语义关系。

前馈神经网络:每个注意力层之后接一个前馈网络,增加模型的表达能力。

为什么 Transformer 如此重要?

Transformer 是现代 AI 大模型的基石。GPT、BERT、Claude、Gemini、LLaMA 等几乎所有主流大模型都基于 Transformer 架构。它不仅在自然语言处理领域取得突破,还被成功应用于计算机视觉(ViT)、语音识别、蛋白质结构预测(AlphaFold2)等广泛领域。


相关术语

分享: