🧠 模型与架构

GPT

Generative Pre-trained Transformer生成式预训练TransformerGPT模型

GPT(Generative Pre-trained Transformer)是 OpenAI 开发的一系列大语言模型,采用"预训练+微调"范式,通过海量文本数据预训练后适应各种任务,ChatGPT 即基于 GPT 系列模型。


什么是 GPT?

GPT 全称 Generative Pre-trained Transformer(生成式预训练 Transformer),是 OpenAI 开发的一系列大语言模型。GPT 的核心思想是:先在大量互联网文本数据上预训练一个通用的语言模型,然后针对具体任务进行微调或直接通过提示词来使用。

GPT 的发展历程

GPT-1(2018):首次展示了 Transformer 解码器在语言建模上的潜力,1.17 亿参数。

GPT-2(2019):展示了规模扩展的有效性,15 亿参数,生成质量大幅提升,OpenAI 曾因安全顾虑延迟发布。

GPT-3(2020):1750 亿参数,展现出强大的少样本学习能力,是真正意义上的"大模型"。

GPT-3.5(2022):ChatGPT 的基座模型,通过 InstructGPT 技术(指令微调 + RLHF)大幅提升了对话能力和安全性。

GPT-4(2023):多模态能力、推理能力大幅提升,在各种专业考试中表现优异。

GPT-4o(2024):"o"代表"omni"(全能的),实现文本、图像、音频的端到端多模态处理。

GPT 的核心技术

预训练:在数万亿 token 的互联网数据上训练,学习语言的统计规律和知识。

指令微调:用人工标注的指令-回答对来微调模型,使其更好地理解和遵循人类指令。

RLHF:基于人类反馈的强化学习,让模型的输出更符合人类偏好。

GPT 的影响力

GPT 系列不仅催生了 ChatGPT 这一现象级产品,还深刻影响了整个 AI 行业,推动了大模型技术的快速发展和普及。GPT 的"预训练+微调"范式也成为后续几乎所有大模型的标准做法。


相关术语

分享: