LLaMA 简介
LLaMA(Large Language Model Meta AI)是 Meta 于 2023 年 2 月发布的大语言模型系列。LLaMA 以其"小模型训更多 token"的理念著称——LLaMA-13B 在多数基准上超越 GPT-3(175B),极大冲击了"越大越好"的 scaling law 认知。
核心特点
LLaMA 仅使用公开可用的数据进行训练(CommonCrawl、C4、GitHub、Wikipedia 等),使用 SwiGLU 激活函数、RoPE(旋转位置编码) 和 RMSNorm 归一化。LLaMA 2 引入了 40% 更多的训练数据和翻倍的上下文长度。
模型规模
LLaMA 系列提供多种参数规模:7B、13B、33B、65B(LLaMA 1),7B、13B、70B(LLaMA 2),8B、70B、405B(LLaMA 3)。
开源生态影响
LLaMA 的开源(LLaMA 2 起真正开源)催生了繁荣的微调生态:Alpaca、Vicuna、WizardLM、Code Llama 等衍生模型层出不穷,被广泛认为是"开源大模型的 Android 时刻"。