治理与安全 (G)

ETCLOVG 之 G 层:约束行为。权限与身份、生命周期 hook、组件加固、声明式 constitution、审计、安全全景。

本节对应综述《Agent Harness Engineering: A Survey》§9,是 ETCLOVG 七层的第七层,也是综述提升为一等层的第二层。该层处理 agent 行为如何被约束、变安全、被追责。LLM agent 如今执行 shell 命令、发邮件、提交代码、调用第三方 API;生产部署的核心 问题是:它们应在什么约束下行动、约束失效时谁负责。综述围绕五种机制展开,再定位到安全全景并给出研究方向。

权限模型与身份管理

首要治理问题是访问控制。agent 负载比传统 RBAC/ABAC 更难,因为所需工具集常取决于部署时未知的自然语言任务。文献沿粒度 轴推进:

粒度机制代表
静态权限边界部署时固定、越界需升级;易检视但无法表达任务意图Codex 受限沙箱、Gemini CLI allow/deny
上下文相关权限控制对工具名/参数/环境状态做谓词、每次调用前求值;策略生成与强制分离Progent(DSL)、Conseca(生成+确定性检查器)
身份与 agent 间访问控制建立“谁在请求”,绑定用户意图到 agent 权限,形成可验证问责链Authenticated Delegation(扩展 OAuth/OIDC)、SAGA(一次性密钥+短时令牌)、IsolateGPT(hub-and-spoke)
凭据管理密钥存 vault、只暴露占位符、执行层替换真实值Skyvern
Web 级权限协调跨组织,网站声明可用 UI 元素/速率/需确认动作agent-permissions.json(类比 robots.txt

开放挑战:表达力与可用性难兼得;无跨 harness 可移植的权限规约语言;动作应归属人类操作者、agent 实例还是瞬态任务身份, 仍无定论。凭据的长程会话生命周期(令牌中途过期/撤销后续期仍须留在模型上下文外)是未解问题。

生命周期 hook

权限模型定义什么被允许,生命周期 hook 定义检查何时触发。综述沿一次工具使用循环给出四个 hook 点:

Hook位置作用代表
H1 输入护栏LLM 之前检测输入/检索内容中的注入载荷(规则式严格但脆,模型式泛化好但慢且易受自适应攻击)PromptShield、DataSentinel
H2 动作校验工具执行之前检查提议动作;多 agent 中约束控制流图防未授权转移ShieldAgent(可验证谓词)、ControlValve
H3 信息流控制工具执行之后基于能力的 IFC,数据带来源标签,禁止不可信数据影响控制流CaMeL(在 AgentDojo 上以灵活性换更强控制/数据流边界)
H4 human-in-the-loop交付之前对破坏性/越界动作要求用户批准Codex、Gemini CLI、Cursor、OpenHands

关于 H4,综述引 Felt et al. (2012):仅 17% 的 Android 用户在安装时关注权限对话框、仅 3% 能正确理解所授权限——agent 批准对话框面临类似习惯化与理解风险:频繁请求致反射性批准,稀疏请求又留覆盖缺口。部分系统把 hook 当可编程强制基质 (AgentSpec 的 trigger/predicate/action;AgentDoG 从单动作分类转向轨迹级诊断)。开放挑战:hook API 异构、无通用接口标准、 引入延迟,且堆叠 hook 的相互作用几无研究(上游净化器可能改变下游检测器依赖的信号,使组合弱于单个组件)。

组件加固

hook 在 harness 层强制治理,组件加固强化单个组件本身:

  • 模型加固:注入根因是 LLM 平等对待所有输入文本。Instruction Hierarchy(Wallace et al.)训练模型对特权指令(系统提示) 优先于低权(用户消息、工具输出);SecAlign 以偏好优化表达同一目标。减轻下游护栏负载,但不能单独防无约束数据流或越权动作。
  • 分类器运行时加固:Llama Guard 用独立小模型按可配置分类法筛输入/输出——分类法可不重训即编辑、检测器可跨后端复用, 代价是每循环一次额外前向。
  • 工具与 MCP 安全:MCP 初始规范缺原生安全原语。McpSafetyScanner(hacker/auditor/supervisor 三 agent)展示可诱导商用 LLM 用 MCP 工具执行恶意代码;投毒工具描述可在注册时即影响 LLM。防御侧 ETDI 以密码学签名+版本化工具定义阻止“rug-pull”; SAFEFLOW 引入协议级 IFC + 事务语义,违规调用可回滚。
  • 供应链风险:开源模型幻觉不存在包名率达 21.7%,攻击者注册这些名字注入恶意代码(“slopsquatting”);包管理器与检索源 多在治理栈之外。

开放挑战:模型加固与工具加固覆盖互补威胁面,但无统一框架连接——加固的模型仍可能调用被攻陷工具,签名工具定义也挡不住被 越狱模型误用。

声明式 constitution

把治理逻辑硬编码进应用代码使策略不透明、难审计、难更新;越来越多 harness 外化规则为声明式配置:

层次机制代表
训练时塑形模型对齐;四级优先层级(safety→ethics→compliance→helpfulness),区分硬约束(如禁 CBRN)与可调软默认Anthropic Constitutional AI
部署时 YAMLharness 可读、校验、强制;指定管线模式、风险模式、工具 allow/deny、token 预算、审计目的地;可版本化/diff,非开发者可审阅AutoHarness
可编程策略语言形式表达力 + 可读性Progent(谓词+量词)、Formal-LLM(下推自动机)、VeriSafeAgent(UI 状态转移 DSL)

两层操作性不同:训练时 constitution 难改且须行为探针推断、可被对抗 prompt 覆盖;部署时 YAML 直接可读、diff 可审、作为 harness 检查执行。开放挑战:无标准 schema(策略不可移植);一致性/完备性校验工具有限;训练时与部署时的相互作用尤欠研究 ——YAML deny 能否可靠覆盖 RLHF 强化的行为,仍是有实际安全含义的开放问题。

审计基础设施

治理需要问责。可重放的审计记录至少需要 trace 标识、principal 身份、工具调用、策略决策及版本、执行结果、资源成本、以及对 相关输入输出的完整性哈希;多数系统只记子集、少有签名或哈希,使审计易被受攻陷进程篡改。异常检测分逐动作(便宜、易审计, 但抓不住分散在多个各自良性动作中的攻击,如每分钟读一文件的慢速外泄;AgentMonitor 属此)与轨迹级(AgentAuditor 行为 模式匹配+LLM 推理、SentinelAgent 时序图建模;抓多步攻击但延迟高、触发点不局部);实践中逐动作内联、轨迹级异步跑在审计 日志上。成本/资源审计(OWASP 把资源耗尽列为独立风险;扇出可指数放大调用)与分层治理管线(AutoHarness 三档,按部署 风险声明式选择,使治理开销随风险伸缩)亦在其中。开放挑战:长程审计日志迅速膨胀,带来存储、隐私、信噪比压力,缺标准 schema。

安全全景中的定位

综述援引 Kim et al. (2026)(综述 128 篇论文、编目 51 种攻击/60 种防御)把治理机制映射到七个设计维度与 R1–R7 风险类别 (Table 3 摘录):

治理机制缓解/检测的风险
权限模型与身份管理R1 不可信接口、R5 数据泄露、R6 未授权动作
输入护栏R1、R2 错误指令跟随
输出护栏R2、R4 幻觉、R5、R6
信息流控制R3 无约束数据流、R5、R6
组件加固R1、R2、R4
监控与审计R5、R6、R7 资源耗尽
human-in-the-loopR2、R6
声明式 constitution横切:配置以上全部

现实防御缺口:Kim et al. 对六个 agent 系统(Codex、Gemini CLI、OpenHands、Browser Use、Nanobrowser、Skyvern)的案例 显示无一实现全部防御类别,信息流控制、身份管理、形式化验证在全部系统中缺席,监控普遍只记工具调用而缺自动异常检测 (综述 Table 4 的治理覆盖矩阵普遍稀疏)。防御应分层互补(输入护栏为一线、输出护栏为末线、IFC 与监控为持续运行时防护、 访问控制做认证授权、human-in-the-loop 管关键决策),但分层非免费——协调不当的层会相互干扰,可组合性基本未经检验,治理 可充当让各机制协作而非冲突的编排层。综述另记 Kim et al. 提出把“上下文安全”作为 CIA 三元组之外的第四安全目标(尚未被 NIST 等采纳,作为有用框架而非既定定义看待);Conseca 与 CaMeL 示例其工程方向:上下文须被当作受治理状态而非被动 prompt 材料。

研究方向

综述列出的治理专属方向包括:标准化的策略与审计语言(类比 MCP 之于工具接口,使策略可移植、模块可组合、跨 harness 审计 可互操作)、形式化治理保证(证明 constitution 内部一致且覆盖所有工具类别)、自适应治理(机器生成策略的可信度,以及 策略生成器自身如何被治理),另有长程 agent 治理、可用治理界面、跨层治理一致性、端到端供应链治理、统一对抗 benchmark 等 (见总论 §12 的开放问题)。

这页有帮助吗?