什么是 RLHF?
RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)是一种将人类偏好纳入 AI 模型训练的技术。它让大模型不仅仅是"学会语言",更是"学会符合人类期望的表达方式"。
为什么需要 RLHF?
传统的大模型训练只关注"预测下一个词"的准确性,但这并不等同于输出质量。一个在统计上准确的回答可能不够有帮助、不够安全、不够礼貌。RLHF 解决了这个问题——让人类来告诉模型什么回答是好的,什么是不好的。
RLHF 的三个步骤
第一步:收集人类偏好数据。让人类标注员对模型生成的多个回答进行排序(哪个更好、哪个更差),收集大量偏好数据。
第二步:训练奖励模型。基于偏好数据训练一个奖励模型(Reward Model),它能自动评估模型输出的质量。
第三步:强化学习优化。使用 PPO 等强化学习算法,让语言模型不断生成回答,由奖励模型打分,模型根据分数调整自己的策略,生成更符合人类偏好的回答。
RLHF 的效果
经过 RLHF 训练的模型在多个方面显著提升:回答更有帮助、更准确;更安全,减少有害输出;更符合人类的使用习惯和审美偏好。ChatGPT 之所以比 GPT-3 原始版本好用得多,核心原因之一就是 RLHF。
RLHF 的局限性
RLHF 依赖大量高质量的人类标注,成本高昂;奖励模型可能被"欺骗";人类偏好本身存在主观性和不一致性。这些也是当前 AI 对齐研究的重要方向。