首页/问答百科/知识蒸馏
🔧 技术与方法

知识蒸馏

知识蒸馏模型蒸馏Knowledge Distillation蒸馏技术

知识蒸馏(Knowledge Distillation)是一种将大型复杂模型(教师模型)的知识迁移到小型模型(学生模型)的技术,让小模型在推理速度和资源消耗上接近大模型的效果,是模型轻量化的核心方法。


什么是知识蒸馏?

知识蒸馏(Knowledge Distillation)是一种模型压缩技术,核心思想是让一个大型、高性能的模型(教师模型)来"教导"一个小型、高效的模型(学生模型)。学生模型学习教师模型的输出模式,目标是达到接近教师模型的效果,但计算成本大幅降低。

知识蒸馏的工作原理

传统训练中,学生模型直接学习真实标签(如"这张图片是猫")。知识蒸馏则让学生模型同时学习教师模型的"软标签"——教师模型不仅告诉学生"这是猫",还告诉学生"有 80% 像猫、15% 像狗、5% 像老虎",这些丰富的概率分布信息包含了教师模型学到的知识。

为什么需要知识蒸馏?

大模型虽然能力强,但推理成本高、速度慢,不适合部署在手机、IoT 设备等资源受限的环境。知识蒸馏可以将大模型的能力"压缩"到小模型中,在保持较高性能的同时,大幅提升推理速度、降低部署成本。

知识蒸馏的应用

知识蒸馏被广泛应用于模型部署:将 GPT-4 级别的模型蒸馏到更小的模型,用于实时对话场景;将视觉模型蒸馏到移动端,实现手机上的实时图像处理;将语音模型蒸馏到嵌入式设备,实现离线语音识别。


相关术语

分享: