首页/问答百科/对抗样本
🚀 进阶概念

对抗样本

对抗样本Adversarial Examples对抗性样本对抗攻击对抗扰动

对抗样本(Adversarial Examples)是指通过对输入数据施加人眼难以察觉的微小扰动,导致 AI 模型产生完全错误输出的样本,揭示了深度学习模型在鲁棒性方面的根本脆弱性。


什么是对抗样本?

对抗样本(Adversarial Examples)是专门设计用来欺骗 AI 模型的输入数据。攻击者在原始输入上添加精心计算的、人眼几乎无法察觉的微小扰动,导致模型产生完全错误的输出。

为什么对抗样本存在?

深度神经网络本质上是一个高维空间中的复杂函数。模型在训练数据上表现良好,但数据分布中的"盲区"广泛存在——只需沿着特定方向移动一小步,就能让模型的决策发生剧烈变化。

对抗样本的防御

对抗训练:在训练数据中加入对抗样本,让模型学会抵抗攻击。输入预处理:通过去噪、压缩等方式消除潜在的对抗扰动。认证防御:通过数学证明模型在某个扰动范围内不会改变输出。


相关术语

分享: