🧠 基础概念

安全护栏(Guardrails)

别名:护栏安全围栏输出过滤Content ModerationSafety Guard
分类🧠 基础概念
阅读时间⏱️ 17 分钟
更新时间📅 2026-07-16
条目编号ENC-CONCEPT-18-guardrails
安全护栏是一组在 Agent 输入与输出环节施加的约束与校验机制,用于拦截有害请求、规范输出格式、限制越权行为。它介于模型能力与业务安全之间,是 Agent 上线的必备保护层。

关键要点 ✦

护栏的类型

主题护栏限制 Agent 只处理授权领域(如「只谈理赔,不谈投资建议」)。格式护栏强制输出符合 Schema(如必须返回合法 JSON)。安全护栏拦截违法、暴力、隐私泄露内容。权限护栏对工具调用做白名单与审批控制。

实践中常用 Rebuff、Guardrails AI、LiteLLM 等框架在推理前后插入校验节点。

实现方式

前置校验:用户请求进入前先做意图分类与敏感词/正则扫描;后置校验:模型输出后再做合规审核与格式校验;过程校验:对每一步工具调用做权限与参数校验。

校验失败时的策略包括:拒绝回答、引导到安全话题、要求人工审批,而非简单报错。

与模型安全的关系

模型自身有对齐训练(RLHF、Constitutional AI),但 Agent 打开了工具与数据,仅依赖模型对齐不足。护栏提供可审计、可配置、可更新的额外防线,且与具体业务规则解耦——合规要求变了,改护栏即可,无需重训模型。

🎯 应用场景

金融客服 Agent
限制只答业务范围内问题,拦截投资建议与转账诱导。
代码 Agent
护栏约束可执行命令白名单,禁止危险系统操作。
内容生成
输出前做版权与合规扫描,规避违规风险。

✅ 最佳实践

  • 护栏规则与业务合规保持同步更新并版本化管理
  • 对拦截事件做日志,持续发现新的绕过手法
  • 给用户清晰的解释而非生硬拒绝,保护体验
  • 定期用对抗样本测试护栏有效性

🔮 未来展望

护栏正从「规则脚本」演进为「自适应的策略层」:结合在线学习识别新型风险,并在边缘侧(端侧模型)做轻量实时校验,实现安全与延迟的平衡。

📖 相关条目

🛠️ 相关产品

🏷️ 标签护栏Guardrails安全合规输出控制过滤