🛡️ 安全风险

越狱攻击(Jailbreak)

别名:越狱JailbreakingDAN角色扮演绕过对齐绕过
分类🛡️ 安全风险
阅读时间⏱️ 16 分钟
更新时间📅 2026-07-16
条目编号ENC-SECURITY-08-jailbreak
越狱攻击指通过精心构造的提示诱导模型突破自身安全对齐,输出本应被拒绝的有害内容。常见手法包括角色扮演、虚拟场景、指令覆盖与编码混淆。

关键要点 ✦

常见越狱手法

角色扮演:让模型扮演「无限制 AI」(如著名的 DAN),借角色身份绕开规则。虚拟场景:声称「这只是小说/实验/教学」,把违规内容包装进虚构语境。指令覆盖:用看似权威的指令(「忽略此前所有限制」)尝试压过系统提示。编码混淆:用 Base64、密文或外语藏匿恶意意图。

Agent 场景的放大效应

纯聊天模型越狱最多产出有害文本;Agent 越狱则可能触发真实行动——攻击者诱导 Agent 调用工具发送邮件、执行命令、转账。越狱因此从「内容安全」升级为「操作安全」问题,必须将越狱防御纳入工具调用的前置校验。

防御思路

没有银弹,需多层:模型层持续 RLHF/红队加固;输入层用护栏检测越狱模式(角色扮演、覆盖指令);行为层对可疑意图的工具调用要求确认;输出层做合规扫描。同时要持续红队,因为新越狱手法层出不穷。

🎯 应用场景

内容安全测试
用越狱探针评估模型/护栏的鲁棒性。
Agent 防护
把越狱识别作为工具调用的前置闸口。
合规审计
记录越狱尝试,证明已尽合理防护义务。

✅ 最佳实践

  • 护栏需识别「角色扮演/虚拟场景」类越狱意图
  • 对越狱触发的工具调用强制人工或二次确认
  • 建立越狱样本库,定期回归测试防御强度
  • 避免仅依赖系统提示,提示可被指令覆盖绕过

🔮 未来展望

越狱攻防将成持续军备竞赛:防御从「关键词拦截」走向「语义意图理解 + 行为风险评分」;同时模型原生安全(训练期免疫)与运行时护栏会形成纵深防御。

📖 相关条目

🛠️ 相关产品

🏷️ 标签越狱Jailbreak安全绕过对齐对抗提示攻击