🧠 模型与架构

BERT

Bidirectional Encoder Representations from TransformersBERT模型Bert

BERT(Bidirectional Encoder Representations from Transformers)是Google于2018年提出的预训练语言模型,通过双向Transformer编码器和掩码语言模型实现深度上下文理解,是NLP领域里程碑式的模型。


BERT 简介

BERT(Bidirectional Encoder Representations from Transformers)是 Google AI 于 2018 年提出的预训练语言表示模型,由 Jacob Devlin 等人发表在论文《BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding》中。BERT 在发布时刷新了 11 项 NLP 任务的基准,被认为是 NLP 领域的 ImageNet 时刻。

核心创新

BERT 的核心创新在于双向上下文预训练。与之前的单向语言模型(如 GPT)不同,BERT 使用 Transformer 的 Encoder 部分,通过掩码语言模型(Masked Language Model, MLM) 随机遮盖输入中 15% 的 token,让模型根据左右两侧的上下文预测被遮盖的词。同时引入下一句预测(Next Sentence Prediction, NSP) 任务来学习句子间关系。

模型架构

BERT 提供两个版本:BERT-Base(12 层 Transformer,1.1 亿参数)和 BERT-Large(24 层 Transformer,3.4 亿参数)。输入表示为 Token Embeddings、Segment Embeddings 和 Position Embeddings 三者之和,特殊标记 [CLS] 用于分类任务,[SEP] 用于分隔句子。

影响与应用

BERT 开启了 NLP 领域的预训练-微调范式,此后几乎所有中文 NLP 模型(如 ERNIE、RoBERTa、ALBERT)都基于 BERT 架构改进。BERT 广泛应用于搜索引擎(Google 搜索)、问答系统、情感分析、命名实体识别等场景。


相关术语

分享: