什么是 RLVR?
RLVR(Reinforcement Learning with Verifiable Rewards,基于规则验证的强化学习)是一种将客观、可自动验证的规则作为强化学习奖励信号的方法。与 RLHF 依赖人类主观偏好不同,RLVR 的奖励信号来自可程序化验证的规则——数学题答案是否正确、代码能否编译运行、SQL 查询是否返回正确结果等。
RLVR 的工作方式
在训练推理模型时,让模型生成解答步骤和最终答案,然后用自动验证器检查答案是否正确(如数学答案是否匹配标准答案、代码测试是否通过)。验证结果(正确/错误)作为强化学习的奖励信号,优化模型的推理能力。
RLVR 的优势
零主观偏差:奖励信号完全客观,不受人类标注员主观偏好的影响。可规模化:自动验证可以无限扩展,不受人工标注产能限制。训练效率高:验证过程是即时自动的,无需等待人工标注。推理能力强化:RLVR 特别适合强化数学、编程、逻辑推理等有明确"正确答案"的能力。
RLVR 的应用
DeepSeek-R1 是 RLVR 最成功的应用案例——通过在大规模数学和编程题目上的 RLVR 训练,R1 的推理能力达到了媲美 OpenAI o1 的水平。RLVR 也被应用于代码生成模型的训练中(验证代码正确性)和数学竞赛模型。