什么是宪法 AI?
宪法 AI(Constitutional AI, CAI)是 Anthropic 在 2022 年提出的一种 AI 对齐技术,旨在减少 AI 模型训练中对大量人工反馈的依赖。传统 RLHF 需要大量人类标注员对模型输出进行评分,而宪法 AI 让模型根据一套预设的"宪法"原则(如"AI 不应提供有害信息")来自我评估和修正自己的输出。
宪法 AI 的工作原理
第一阶段:自我修正。模型生成一个初始回答后,根据宪法规则对自己进行批评("我的回答是否违反了规则 X?"),然后根据自我批评修正回答。这个阶段使用监督学习。
第二阶段:RLHF 替代。使用宪法生成的"偏好数据"(修正前 vs 修正后的回答)来训练奖励模型,或者直接使用这些数据进行偏好优化(类似 DPO)。
宪法 AI vs RLHF
宪法 AI 的核心理念创新在于:RLHF 依赖人类标注员的"主观偏好"来判断什么是好的回答;宪法 AI 则依赖一套透明、可审核的"成文规则"来判断。这不仅减少了对大量人工标注的依赖,也让模型的价值观来源更加透明和可控。
实际应用
宪法 AI 已被应用于 Anthropic 的 Claude 系列模型,是 Claude 在安全性和有用性之间取得良好平衡的关键技术之一。