首页/问答百科/越狱攻击(Jailbreak)
🚀 进阶概念

越狱攻击(Jailbreak)

越狱攻击JailbreakAI越狱越狱提示大模型越狱Jailbreak攻击

越狱攻击(Jailbreak)是指通过精心设计的提示词绕过 AI 模型的安全限制,让模型生成本应被拒绝的有害内容或执行非授权操作的技术,是提示注入的一种特殊形式。


什么是越狱攻击?

越狱攻击(Jailbreak)是指用户通过精心构造的提示词,绕过 AI 模型内置的安全限制和内容过滤,让模型生成本应被拒绝的内容。就像"越狱"这个词的本意——打破牢笼,逃离限制。

常见的越狱方法

角色扮演:让模型扮演一个"不受限制的"角色(如 DAN)。假设场景:构建一个虚构的假设场景来绕过限制。编码绕过:用 Base64、凯撒密码等编码方式隐藏恶意指令。多轮诱导:先问无害问题建立对话,然后逐步引导到敏感话题。

越狱攻击的防御

安全训练(在 RLHF 训练阶段加入对抗性数据)、输入检测拒绝策略红队测试。越狱攻击与防御是一个持续的"猫鼠游戏"。


相关术语

分享: