什么是 AI 安全?
AI 安全(AI Safety)是研究如何确保人工智能系统安全、可靠、可控地运行的跨学科领域。它涵盖技术、伦理、政策等多个层面,目标是让 AI 在发挥巨大价值的同时,最小化潜在风险。
AI 安全的主要研究方向
内容安全:防止模型生成有害、违法、歧视、暴力等内容。这是 AI 产品上线前必须解决的基线问题。
对抗攻击防御:防止提示注入(Prompt Injection)、越狱攻击(Jailbreak)等恶意输入。攻击者可能通过精心构造的提示词绕过模型的安全限制。
隐私保护:确保模型不会泄露训练数据中的个人信息,防止通过模型提取敏感数据。
滥用防范:防止 AI 被用于生成虚假信息、深度伪造、网络诈骗等恶意用途。
可控性:确保 AI 系统始终在人类控制之下,不会出现失控行为。
主流 AI 安全实践
安全训练:在训练阶段通过数据过滤、RLHF 等技术让模型学会拒绝有害请求。
安全评测:通过红队测试、基准评估等方式持续测试模型的安全性。
内容过滤:在模型输入和输出层添加内容安全过滤器。
使用规范:制定明确的使用条款和可接受使用政策。
AI 安全的挑战
AI 安全是一个持续的"猫鼠游戏"——攻击者不断发现新的绕过方式,防御者需要不断改进。没有绝对安全的 AI 系统,只有持续投入的安全实践。