什么是 AI 偏见?
AI 偏见(Bias)是指 AI 系统的输出表现出系统性的、不公正的偏差或歧视。例如,一个招聘 AI 可能更倾向于男性候选人,一个面部分析 AI 可能对某些肤色的人准确率更低。
AI 偏见的来源
训练数据偏见:如果训练数据中男性程序员占 90%,模型可能学会"程序员=男性"的偏见。这是 AI 偏见最主要的来源。
标注偏见:数据标注员的主观判断可能引入偏见,不同文化背景的标注员对同一内容可能有不同判断。
算法偏见:模型架构和训练方法本身可能放大某些模式,导致偏见被强化。
使用偏见:用户的使用方式也可能引入偏见,如只向 AI 提出特定类型的问题。
AI 偏见的例子
- ·语言模型在描述"护士"时更多使用女性代词,描述"CEO"时更多使用男性代词
- ·图像识别模型在识别深色皮肤的人时准确率低于浅色皮肤
- ·信用评估模型可能对某些社区的居民不公平地降低信用评分
如何减少 AI 偏见?
数据多样化:确保训练数据覆盖不同人群、地区和文化背景。
偏见检测:在模型上线前进行偏见检测和评估。
去偏技术:使用数据重采样、对抗训练等技术减少模型偏见。
持续监控:模型上线后持续监控输出,及时发现和纠正偏见。
AI 偏见是一个复杂的社会技术问题,没有简单的"修复"方案,需要技术、伦理和制度的综合应对。