🧠 模型与架构

LLaMA

Large Language Model Meta AILLaMA模型Meta LLaMALlama

LLaMA(Large Language Model Meta AI)是Meta(原Facebook)发布的一系列开源大语言模型,以较小的参数量达到媲美甚至超越更大模型的性能,推动了开源大模型生态的快速发展。


LLaMA 简介

LLaMA(Large Language Model Meta AI)是 Meta 于 2023 年 2 月发布的大语言模型系列。LLaMA 以其"小模型训更多 token"的理念著称——LLaMA-13B 在多数基准上超越 GPT-3(175B),极大冲击了"越大越好"的 scaling law 认知。

核心特点

LLaMA 仅使用公开可用的数据进行训练(CommonCrawl、C4、GitHub、Wikipedia 等),使用 SwiGLU 激活函数、RoPE(旋转位置编码)RMSNorm 归一化。LLaMA 2 引入了 40% 更多的训练数据和翻倍的上下文长度。

模型规模

LLaMA 系列提供多种参数规模:7B、13B、33B、65B(LLaMA 1),7B、13B、70B(LLaMA 2),8B、70B、405B(LLaMA 3)。

开源生态影响

LLaMA 的开源(LLaMA 2 起真正开源)催生了繁荣的微调生态:Alpaca、Vicuna、WizardLM、Code Llama 等衍生模型层出不穷,被广泛认为是"开源大模型的 Android 时刻"。


相关术语

分享: