🛡️ 安全风险

对抗性攻击(Adversarial Attack)

别名:对抗样本Adversarial投毒扰动模型攻击
分类🛡️ 安全风险
阅读时间⏱️ 16 分钟
更新时间📅 2026-07-16
条目编号ENC-SECURITY-12-adversarial-attack
对抗性攻击指通过精心设计的输入(文本扰动、视觉对抗样本、训练投毒)使模型产生错误输出或行为。在 Agent 场景,它可与 prompt injection、记忆投毒结合,成为隐蔽而系统性的威胁。

关键要点 ✦

对抗的形态

文本对抗:在不改变语义的前提下做扰动——同义替换、插入不可见 Unicode、拼写变体、少样本误导示范,使模型判断偏移。视觉对抗:在图像上叠加人眼难辨的噪声,让视觉模型/Computer Use 误识别界面元素。投毒(Poisoning):在训练数据或 Agent 记忆中埋入恶意样本,使模型在特输入时出错。

在 Agent 中的链式危害

Agent 的「感知-规划-行动」链使对抗危害被放大:一个被扰动的输入 → 触发错误规划 → 调用错误工具 → 产生真实后果。与 prompt injection 结合时,对抗样本可成为「触发开关」,在特定扰动下激活恶意行为。

防御思路

鲁棒训练:用对抗样本做数据增强提升抗性。输入净化:归一化文本、剥离不可见字符、对图像做去噪。异常检测:监测输入困惑度、输出偏离度识别可疑样本。记忆洁净:对写入记忆的内容做来源与一致性校验,抵御投毒。

🎯 应用场景

模型鲁棒性测试
用对抗样本评估 Agent 输入解析的健壮性。
视觉 Agent 防护
对截图做去噪,防对抗噪声误导点击。
红队演练
综合对抗+注入手法验证端到端防护。

✅ 最佳实践

  • 对用户输入做净化(剥离不可见字符/归一化)
  • 监测输出偏离度,异常即触发人工复核
  • 记忆写入前校验来源可信与内容一致性
  • 持续用对抗样本做红队回归测试

🔮 未来展望

对抗防御将与模型训练深度绑定:原生鲁棒模型 + 运行时对抗检测成为 Agent 标配;「对抗训练即服务」降低中小团队构建安全 Agent 的门槛。

📖 相关条目

🛠️ 相关产品

🏷️ 标签对抗攻击Adversarial对抗样本投毒安全扰动