什么是模型量化?
模型量化(Quantization)是一种模型压缩技术,通过降低模型参数和计算的数值精度来减少模型体积和加速推理。简单来说,就是把模型中的"高精度数字"换成"低精度数字",在尽可能少损失效果的前提下,让模型跑得更快、占更少内存。
量化的精度级别
FP32(32 位浮点):原始精度,模型最大最慢,但效果最好。
FP16 / BF16(16 位):精度减半,模型体积减半,效果损失很小,是目前训练和推理的主流格式。
INT8(8 位整数):体积再减半,速度提升明显,效果有一定损失但在可接受范围内。
INT4(4 位):极致压缩,体积只有 FP32 的 1/8,可以在消费级 GPU 上运行百亿参数模型,但质量损失较大。
量化的好处
量化让大模型在更廉价的硬件上运行成为可能。一个 700 亿参数的模型在 FP32 下需要约 280GB 显存(需要多张服务器级 GPU),量化到 INT4 后只需约 35GB(可以在一张 RTX 4090 或甚至 Apple Silicon Mac 上运行)。这大大降低了使用大模型的门槛。