什么是 GPT?
GPT 全称 Generative Pre-trained Transformer(生成式预训练 Transformer),是 OpenAI 开发的一系列大语言模型。GPT 的核心思想是:先在大量互联网文本数据上预训练一个通用的语言模型,然后针对具体任务进行微调或直接通过提示词来使用。
GPT 的发展历程
GPT-1(2018):首次展示了 Transformer 解码器在语言建模上的潜力,1.17 亿参数。
GPT-2(2019):展示了规模扩展的有效性,15 亿参数,生成质量大幅提升,OpenAI 曾因安全顾虑延迟发布。
GPT-3(2020):1750 亿参数,展现出强大的少样本学习能力,是真正意义上的"大模型"。
GPT-3.5(2022):ChatGPT 的基座模型,通过 InstructGPT 技术(指令微调 + RLHF)大幅提升了对话能力和安全性。
GPT-4(2023):多模态能力、推理能力大幅提升,在各种专业考试中表现优异。
GPT-4o(2024):"o"代表"omni"(全能的),实现文本、图像、音频的端到端多模态处理。
GPT 的核心技术
预训练:在数万亿 token 的互联网数据上训练,学习语言的统计规律和知识。
指令微调:用人工标注的指令-回答对来微调模型,使其更好地理解和遵循人类指令。
RLHF:基于人类反馈的强化学习,让模型的输出更符合人类偏好。
GPT 的影响力
GPT 系列不仅催生了 ChatGPT 这一现象级产品,还深刻影响了整个 AI 行业,推动了大模型技术的快速发展和普及。GPT 的"预训练+微调"范式也成为后续几乎所有大模型的标准做法。