越狱攻击(Jailbreak)
别名:越狱JailbreakingDAN角色扮演绕过对齐绕过
| 分类 | 🛡️ 安全风险 |
| 阅读时间 | ⏱️ 16 分钟 |
| 更新时间 | 📅 2026-07-16 |
| 条目编号 | ENC-SECURITY-08-jailbreak |
越狱攻击指通过精心构造的提示诱导模型突破自身安全对齐,输出本应被拒绝的有害内容。常见手法包括角色扮演、虚拟场景、指令覆盖与编码混淆。
关键要点 ✦
- 越狱通过构造提示突破模型安全对齐,获取违规输出
- 经典手法:角色扮演(DAN)、虚拟场景、Few-shot 示范
- 多轮「步步为营」式越狱比单轮更隐蔽有效
- Agent 场景下越狱后果更重(可触发工具行动)
- 防御需模型对齐 + 输入护栏 + 行为监控多层结合
常见越狱手法
角色扮演:让模型扮演「无限制 AI」(如著名的 DAN),借角色身份绕开规则。虚拟场景:声称「这只是小说/实验/教学」,把违规内容包装进虚构语境。指令覆盖:用看似权威的指令(「忽略此前所有限制」)尝试压过系统提示。编码混淆:用 Base64、密文或外语藏匿恶意意图。
Agent 场景的放大效应
纯聊天模型越狱最多产出有害文本;Agent 越狱则可能触发真实行动——攻击者诱导 Agent 调用工具发送邮件、执行命令、转账。越狱因此从「内容安全」升级为「操作安全」问题,必须将越狱防御纳入工具调用的前置校验。
防御思路
没有银弹,需多层:模型层持续 RLHF/红队加固;输入层用护栏检测越狱模式(角色扮演、覆盖指令);行为层对可疑意图的工具调用要求确认;输出层做合规扫描。同时要持续红队,因为新越狱手法层出不穷。
🎯 应用场景
内容安全测试
用越狱探针评估模型/护栏的鲁棒性。
Agent 防护
把越狱识别作为工具调用的前置闸口。
合规审计
记录越狱尝试,证明已尽合理防护义务。
✅ 最佳实践
- 护栏需识别「角色扮演/虚拟场景」类越狱意图
- 对越狱触发的工具调用强制人工或二次确认
- 建立越狱样本库,定期回归测试防御强度
- 避免仅依赖系统提示,提示可被指令覆盖绕过
🔮 未来展望
越狱攻防将成持续军备竞赛:防御从「关键词拦截」走向「语义意图理解 + 行为风险评分」;同时模型原生安全(训练期免疫)与运行时护栏会形成纵深防御。
📖 相关条目
🛠️ 相关产品
🏷️ 标签越狱Jailbreak安全绕过对齐对抗提示攻击