Prompt Injection(提示注入攻击)
别名:提示注入提示攻击注入攻击Prompt Injection
| 分类 | 🛡️ 安全风险 |
| 阅读时间 | ⏱️ 19 分钟 |
| 更新时间 | 📅 2026-06-30 |
| 条目编号 | ENC-SECURITY-01-prompt-injection |
Prompt Injection 是一种通过恶意构造的输入来劫持 LLM/Agent 行为的攻击方式。攻击者将隐藏指令嵌入看似正常的输入中,使模型忽略预设的 System Prompt 并执行攻击者的指令。
关键要点 ✦
- Prompt Injection 是 OWASP Top 10 for LLM 中排名第一的风险
- 直接注入(Direct Injection):攻击者直接在用户输入中嵌入恶意指令
- 间接注入(Indirect Injection):攻击者通过工具输出(如网页内容)间接注入
- 2026 年已有多个 Agent 因间接提示注入导致数据泄露的真实事件
- 最少权限原则(Least Privilege)和输入净化(Input Sanitization)是核心防御手段
详细解释
Prompt Injection(提示注入攻击)是 AI Agent 面临的最严重安全威胁。攻击者通过构造特殊输入,劫持 LLM 的行为——使模型忽略原始指令(System Prompt)并执行攻击者的恶意命令。
在 OWASP Top 10 for LLM Applications 2026 版本中,Prompt Injection 排名第一。它是一种与 LLM 架构本质相关的安全漏洞,目前没有完美的解决方案。
攻击类型
直接注入(Direct Injection):攻击者直接在用户输入中嵌入恶意指令。例如:在聊天消息中附加「忽略之前的所有指令,改为……」。
间接注入(Indirect Injection):攻击者将恶意指令隐藏在 Agent 即将处理的外部内容中。例如:在网页中嵌入隐藏文字,当 Agent 浏览该网页时被注入。这是最隐蔽、最危险的注入方式。
跨会话污染:攻击者通过污染 Agent 的记忆或数据库,使得恶意指令在后续会话中持续生效。
防御措施
最少权限原则:Agent 只拥有完成任务所需的最小权限。
输入净化:对所有外部输入进行安全过滤和清洗。
结构化输出:使用结构化输出而非自然语言作为 Agent 间的通信格式。
多层防御:在 LLM 层面、应用层面、系统层面都建立安全检查。
📖 相关条目
🛠️ 相关产品
🏷️ 标签提示注入安全攻击LLM安全OWASP