安全护栏(Guardrails)
别名:护栏安全围栏输出过滤Content ModerationSafety Guard
| 分类 | 🧠 基础概念 |
| 阅读时间 | ⏱️ 17 分钟 |
| 更新时间 | 📅 2026-07-16 |
| 条目编号 | ENC-CONCEPT-18-guardrails |
安全护栏是一组在 Agent 输入与输出环节施加的约束与校验机制,用于拦截有害请求、规范输出格式、限制越权行为。它介于模型能力与业务安全之间,是 Agent 上线的必备保护层。
关键要点 ✦
- 护栏是 Agent 的「安全带」,在输入/输出两端双向校验
- 可分为主题护栏、格式护栏、安全护栏与权限护栏四类
- 静态规则(关键词/正则)与动态模型判定(LLM 审核)需结合
- 过度护栏会损害可用性,需在安全与体验间取平衡
- 护栏本身也应被测试,防止被绕过(Red Teaming)
护栏的类型
主题护栏限制 Agent 只处理授权领域(如「只谈理赔,不谈投资建议」)。格式护栏强制输出符合 Schema(如必须返回合法 JSON)。安全护栏拦截违法、暴力、隐私泄露内容。权限护栏对工具调用做白名单与审批控制。
实践中常用 Rebuff、Guardrails AI、LiteLLM 等框架在推理前后插入校验节点。
实现方式
前置校验:用户请求进入前先做意图分类与敏感词/正则扫描;后置校验:模型输出后再做合规审核与格式校验;过程校验:对每一步工具调用做权限与参数校验。
校验失败时的策略包括:拒绝回答、引导到安全话题、要求人工审批,而非简单报错。
与模型安全的关系
模型自身有对齐训练(RLHF、Constitutional AI),但 Agent 打开了工具与数据,仅依赖模型对齐不足。护栏提供可审计、可配置、可更新的额外防线,且与具体业务规则解耦——合规要求变了,改护栏即可,无需重训模型。
🎯 应用场景
金融客服 Agent
限制只答业务范围内问题,拦截投资建议与转账诱导。
代码 Agent
护栏约束可执行命令白名单,禁止危险系统操作。
内容生成
输出前做版权与合规扫描,规避违规风险。
✅ 最佳实践
- 护栏规则与业务合规保持同步更新并版本化管理
- 对拦截事件做日志,持续发现新的绕过手法
- 给用户清晰的解释而非生硬拒绝,保护体验
- 定期用对抗样本测试护栏有效性
🔮 未来展望
护栏正从「规则脚本」演进为「自适应的策略层」:结合在线学习识别新型风险,并在边缘侧(端侧模型)做轻量实时校验,实现安全与延迟的平衡。
📖 相关条目
🛠️ 相关产品
🏷️ 标签护栏Guardrails安全合规输出控制过滤