什么是 LoRA?
LoRA(Low-Rank Adaptation,低秩适配)是一种参数高效微调技术,由微软团队在 2021 年提出。它的核心思想是:在微调时,不直接修改原始模型的海量参数,而是在原始权重旁添加一个小的"旁路"矩阵,只训练这个旁路矩阵,最终将训练好的旁路与原模型权重合并使用。
LoRA 为什么有效?
研究发现,大模型在微调时,权重的变化量其实是一个低秩矩阵(即大部分信息可以用很少的维度表示)。LoRA 利用这一特性,将权重变化量分解为两个小矩阵的乘积,大幅减少了需要训练的参数数量。
LoRA 的优势
极低的训练成本:只需要训练约 0.1%-1% 的参数。例如,微调一个 70 亿参数的模型,全量微调需要 4-8 张 A100 GPU,而 LoRA 只需要 1 张消费级 GPU(如 RTX 4090)。
快速切换:LoRA 训练出的"旁路"权重文件通常只有几 MB 到几十 MB,可以随时加载和卸载,一个基座模型可以搭配多个不同的 LoRA 权重,实现"一基座多风格"。
不损失原能力:由于只微调旁路而不改动原模型,LoRA 在适应新任务的同时,不会破坏模型原有的通用能力。
LoRA 的应用
LoRA 在 AI 绘画领域(Stable Diffusion)尤为流行,用户可以用 LoRA 训练特定角色、画风或物体。在语言模型领域,LoRA 也是微调大模型最常用的方法,支撑了无数垂直领域的模型定制。