什么是指令微调?
指令微调(Instruction Tuning)是指用大量"指令-回答"对数据来微调大模型,让模型学会理解和遵循人类指令。经过指令微调后,模型不再只是"预测下一个词",而是成为能听懂人类需求并做出回应的 AI 助手。
指令微调 vs 传统预训练
传统预训练的目标是"预测下一个词"——模型看到"今天天气真",预测"好"。而指令微调的目标是"遵循指令"——模型看到"请翻译'今天天气真好'为英文",输出"Today's weather is great"。
指令微调的关键要素
数据质量:指令微调的数据质量比数量更重要。一个高质量的人工标注指令数据集,效果可能远超百万条自动生成的指令数据。
多样性:指令需要覆盖各种任务类型——写作、翻译、编程、问答、分析、创意等,让模型学会处理不同类型的指令。
格式统一:通常使用统一的对话格式(如 ChatML 格式),让模型理解用户和助手的角色。
指令微调的效果
指令微调是 ChatGPT 产品成功的核心技术之一。GPT-3 原始模型虽然能力强大,但不太会"听话"。经过指令微调(InstructGPT/ChatGPT)后,模型输出的质量、有用性和安全性都大幅提升。目前几乎所有面向用户的大模型产品都经过了指令微调。