什么是对抗样本?
对抗样本(Adversarial Examples)是专门设计用来欺骗 AI 模型的输入数据。攻击者在原始输入上添加精心计算的、人眼几乎无法察觉的微小扰动,导致模型产生完全错误的输出。
为什么对抗样本存在?
深度神经网络本质上是一个高维空间中的复杂函数。模型在训练数据上表现良好,但数据分布中的"盲区"广泛存在——只需沿着特定方向移动一小步,就能让模型的决策发生剧烈变化。
对抗样本的防御
对抗训练:在训练数据中加入对抗样本,让模型学会抵抗攻击。输入预处理:通过去噪、压缩等方式消除潜在的对抗扰动。认证防御:通过数学证明模型在某个扰动范围内不会改变输出。