什么是 PPO?
PPO(Proximal Policy Optimization,近端策略优化)是一种强化学习算法,由 OpenAI 在 2017 年提出。在 AI 大模型领域,PPO 是 RLHF(基于人类反馈的强化学习)训练流程中的核心算法——它负责根据奖励模型的评分来更新语言模型的参数,让模型生成更符合人类偏好的回答。
PPO 的核心思想
策略优化:PPO 是一种"策略梯度"算法,它直接优化模型(策略)的参数,让模型更倾向于选择能获得高奖励的行为。
近端约束:PPO 的关键创新是"近端"——它限制每次更新的步长,不让模型参数在一次更新中变化太大。这保证了训练的稳定性,防止模型突然"崩溃"。
重要性采样:PPO 使用重要性采样技术,让模型能够利用旧策略生成的数据来更新新策略,提高了数据利用效率。
PPO 在 RLHF 中的角色
在 RLHF 的三个步骤中,PPO 负责第三步——强化学习优化:
1. 大语言模型生成回答
2. 奖励模型给回答打分
3. PPO 算法根据分数更新语言模型的参数
4. 重复上述过程,直到模型收敛
PPO vs 其他方法
PPO 之所以成为 RLHF 的主流选择,是因为它在训练稳定性、样本效率、实现复杂度之间取得了良好的平衡。相比更早的 TRPO 算法,PPO 更简单易实现;相比更激进的策略梯度方法,PPO 更稳定可靠。