护栏与安全性

护栏是 Harness 中“约束、验证与纠正”层面的核心实现手段——单个护栏不太可能提供足够的保护,但将多个专门的护栏按输入侧、执行侧、输出侧分层组合,就能构建出更有韧性的 agent 系统。

护栏是 Harness 中“约束、验证与纠正”层面的核心实现手段——它们构成了保障 agent 行为安全可控的分层防线。精心设计的护栏(Guardrails)有助于管理数据隐私风险(例如防止系统提示泄露)或声誉风险(例如确保模型行为与品牌形象一致)。你可以先针对已识别的风险设置护栏,然后在发现新漏洞时逐步添加新的护栏。可以将护栏理解为分层防御机制:单个护栏不太可能提供足够的保护,但将多个专门的护栏组合使用,就能构建出更有韧性的 agent 系统。

三类护栏:按防护位置

按防护位置可以分为三类:输入侧、执行侧和输出侧。

输入侧护栏在请求到达 agent 之前拦截,通常包含四种机制。相关性分类器标记偏离主题的查询(比如编程助手收到“帝国大厦有多高?”这类无关问题)。安全分类器检测越狱和提示注入,两者的关键区别在于:越狱是用户自己试图绕过模型的安全限制,提示注入则是攻击者通过外部数据(如网页内容、文档)间接操纵模型行为。内容审核标记有害或不当的输入。基于规则的保护则采用确定性措施,包括黑名单、输入长度限制、正则表达式过滤器,用以防范 SQL 注入等已知威胁。

执行侧护栏在工具调用时验证。其核心是工具风险评级:根据操作是否可逆、权限等级、财务影响,为每个工具标注风险等级(低/中/高),高风险操作需额外审查或人工确认。

输出侧护栏在响应返回用户之前检查。PII 过滤器审查输出中的个人身份信息(如身份证号、手机号),防止不必要的暴露;输出验证则通过内容检查确保回复与品牌价值一致。

某些机制(如基于规则的正则过滤)既可以用在输入侧也可以用在输出侧,上文按最常见的部署位置归类。分类器护栏的一个代表性工业实践是 Anthropic 的 Constitutional Classifiers,其核心机制有三点:规则驱动(用自然语言写成的“宪法”生成合成训练数据,训练输入输出分类器)、上下文联合判断(把用户提问和模型回答放在一起检查,因为有些回答单独看毫无问题,只有对照提问才能发现暗语)、两级筛查(先用极轻量的探针检查所有对话,发现可疑之处再交给更强的分类器复审,第一级即使误报较多也不影响用户体验,成本也大大降低)。

人工干预

人工干预(Human in the loop,人在回路)是一个关键的保护措施,它让 agent 能够在不损害用户体验的情况下提升实际性能。这在部署早期尤为重要,有助于识别失败模式、发现边缘情况并建立健壮的评估周期。实施人工干预机制,可以让 agent 在无法完成任务时优雅地转移控制权:在客户服务中,这意味着将问题升级到人工客服;对于 Coding Agent,这意味着将控制权交还给开发者。通常有两种主要情况会触发人工干预:

  • 超过失败阈值。 为 agent 的重试次数或操作次数设置上限。如果 agent 超过了这些限制(例如多次尝试后仍未能理解客户意图),就应该升级到人工干预。
  • 高风险操作。 涉及敏感、不可逆或高风险的操作时,应触发人工监督,至少在团队对 agent 可靠性建立起足够信心之前是如此。典型的例子包括取消用户订单、授权大额退款或付款。

护栏是分层防御的第一线,无法做到万无一失。它们的具体实现细节将在后续各章分别展开:提示注入防护见提示工程,工具权限控制与工具风险评级见第 4 章,代码执行安全见第 5 章。

相关阅读

  • Harness 工程——护栏是 Harness“约束、验证、纠正”三层的落地手段。
  • 提示工程——提示注入这一输入侧威胁的上下文层防御。
这页有帮助吗?