首页/问答百科/RLHF(基于人类反馈的强化学习)
🔧 技术与方法

RLHF(基于人类反馈的强化学习)

RLHF人类反馈强化学习Reinforcement Learning from Human Feedback强化学习人类反馈

RLHF(Reinforcement Learning from Human Feedback)是一种将人类偏好融入 AI 模型训练的技术,通过人类对模型输出的评分来训练奖励模型,再用强化学习优化语言模型,使模型输出更符合人类期望,ChatGPT 的核心技术之一。


什么是 RLHF?

RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)是一种将人类偏好纳入 AI 模型训练的技术。它让大模型不仅仅是"学会语言",更是"学会符合人类期望的表达方式"。

为什么需要 RLHF?

传统的大模型训练只关注"预测下一个词"的准确性,但这并不等同于输出质量。一个在统计上准确的回答可能不够有帮助、不够安全、不够礼貌。RLHF 解决了这个问题——让人类来告诉模型什么回答是好的,什么是不好的。

RLHF 的三个步骤

第一步:收集人类偏好数据。让人类标注员对模型生成的多个回答进行排序(哪个更好、哪个更差),收集大量偏好数据。

第二步:训练奖励模型。基于偏好数据训练一个奖励模型(Reward Model),它能自动评估模型输出的质量。

第三步:强化学习优化。使用 PPO 等强化学习算法,让语言模型不断生成回答,由奖励模型打分,模型根据分数调整自己的策略,生成更符合人类偏好的回答。

RLHF 的效果

经过 RLHF 训练的模型在多个方面显著提升:回答更有帮助、更准确;更安全,减少有害输出;更符合人类的使用习惯和审美偏好。ChatGPT 之所以比 GPT-3 原始版本好用得多,核心原因之一就是 RLHF。

RLHF 的局限性

RLHF 依赖大量高质量的人类标注,成本高昂;奖励模型可能被"欺骗";人类偏好本身存在主观性和不一致性。这些也是当前 AI 对齐研究的重要方向。


相关术语

分享: