首页/问答百科/Scaling Law(扩展定律)
🚀 进阶概念

Scaling Law(扩展定律)

Scaling Law扩展定律规模法则尺度定律伸缩定律

Scaling Law(扩展定律)是指大模型性能随模型规模、数据量和计算量的增加而可预测地提升的规律。简单说就是"越大越好"——参数越多、数据越多、算力越多,模型就越强,而且这种提升是可预测的。


什么是 Scaling Law?

Scaling Law(扩展定律)是 OpenAI 在 2020 年发现的重要规律:大语言模型的性能与模型参数量、训练数据量和计算量之间存在可预测的幂律关系。简单来说,当你把模型做得更大、用更多数据训练、投入更多算力时,模型性能会以可预测的方式提升。

Scaling Law 的核心发现

参数越多越好:模型参数量翻倍,性能提升可预测。GPT-3 的 1750 亿参数比 GPT-2 的 15 亿参数强得多。

数据越多越好:训练数据量翻倍,性能也提升。这就是为什么大模型公司都在疯狂收集训练数据。

算力投入越多越好:投入更多计算资源训练更长时间,模型性能持续提升。

Scaling Law 的局限性

收益递减:虽然性能持续提升,但提升的幅度在边际递减。从 10 亿参数到 100 亿参数的提升,远大于从 1000 亿到 2000 亿的提升。

数据瓶颈:互联网上的高质量文本数据是有限的,可能在未来几年内被耗尽。

算力成本:训练更大模型的成本呈指数级增长,GPT-4 的训练成本据估计超过 1 亿美元。

涌现天花板:Scaling Law 能预测性能提升,但无法预测"涌现能力"——有些能力在达到一定规模后突然出现,无法用 Scaling Law 预测。

Scaling Law 的行业影响

Scaling Law 是 AI 军备竞赛的核心驱动力。它意味着:谁有更多的算力、更多的数据,谁就能训练出更强的模型。这推动了各大公司投入数十亿美元建设算力基础设施,也引发了关于"AI 算力垄断"的讨论。


相关术语

分享: