什么是越狱攻击?
越狱攻击(Jailbreak)是指用户通过精心构造的提示词,绕过 AI 模型内置的安全限制和内容过滤,让模型生成本应被拒绝的内容。就像"越狱"这个词的本意——打破牢笼,逃离限制。
常见的越狱方法
角色扮演:让模型扮演一个"不受限制的"角色(如 DAN)。假设场景:构建一个虚构的假设场景来绕过限制。编码绕过:用 Base64、凯撒密码等编码方式隐藏恶意指令。多轮诱导:先问无害问题建立对话,然后逐步引导到敏感话题。
越狱攻击的防御
安全训练(在 RLHF 训练阶段加入对抗性数据)、输入检测、拒绝策略、红队测试。越狱攻击与防御是一个持续的"猫鼠游戏"。