首页/问答百科/模型量化
🔧 技术与方法

模型量化

量化模型量化量化压缩Quantization模型量化技术

模型量化(Quantization)是一种减少模型体积和加速推理的技术,通过降低模型参数的数据精度(如从 32 位浮点数降到 8 位整数),使模型体积缩小 4 倍,推理速度提升 2-4 倍,适合在消费级显卡上运行大模型。


什么是模型量化?

模型量化(Quantization)是一种模型压缩技术,通过降低模型参数和计算的数值精度来减少模型体积和加速推理。简单来说,就是把模型中的"高精度数字"换成"低精度数字",在尽可能少损失效果的前提下,让模型跑得更快、占更少内存。

量化的精度级别

FP32(32 位浮点):原始精度,模型最大最慢,但效果最好。

FP16 / BF16(16 位):精度减半,模型体积减半,效果损失很小,是目前训练和推理的主流格式。

INT8(8 位整数):体积再减半,速度提升明显,效果有一定损失但在可接受范围内。

INT4(4 位):极致压缩,体积只有 FP32 的 1/8,可以在消费级 GPU 上运行百亿参数模型,但质量损失较大。

量化的好处

量化让大模型在更廉价的硬件上运行成为可能。一个 700 亿参数的模型在 FP32 下需要约 280GB 显存(需要多张服务器级 GPU),量化到 INT4 后只需约 35GB(可以在一张 RTX 4090 或甚至 Apple Silicon Mac 上运行)。这大大降低了使用大模型的门槛。


相关术语

分享: