安全

Vtslx AO:LLM 安全政策与三层拦截架构

解释入口、网关与出口三层 LLM 安全拦截:提示注入、工具授权、流式终止与安全治理。

阅读文章20 分钟阅读
Vtslx AO LLM 安全研究封面

摘要

Vtslx AO 的 LLM 安全边界不能只放在模型前或模型后。请求在入口可能携带未授权身份、畸形协议、重放与资源消耗;执行时可能遭遇提示注入、越权工具引导和不可信检索内容;返回时可能包含敏感信息、不安全参数或未完成的流式状态。本文定义入口层、网关层和出口层的纵深防御语义,将处置统一为放行、变换、要求确认、阻断与隔离审查。

公开目标是可解释、可观测、可回退的拦截决策,而非公开规则阈值、检测特征、提示模板、密钥或客户数据。关键验证失败不得默认放行;非关键观测失败不得破坏已授权业务;模型文本也不能创建身份、提升权限或绕过租户边界。

一、威胁模型与原则

威胁主体包括权限有限的合法调用方、试图绕过系统指令的输入、不可信网页/文件/检索结果/MCP 输出、被模型选择的外部工具、模型或工具供应方,以及试图耗尽共享配额的自动化客户端。提示注入、敏感信息泄露、不当输出处理、过度代理和无界消耗不能由单一内容分类器充分处理。

策略坚持先授权后推理、最小能力、不可信内容不升权、关键检查失败即拒绝、流式也可终止,以及公开语义但隐藏可绕过的检测细节。应用侧业务授权仍属于应用;本文不承诺模型永远正确,也不把平台拦截器当作业务判断的替代物。

二、三层安全架构

Client / Agent入口层认证 · 限速 · schema · 准入网关层策略绑定 · guardrails · 工具授权出口层数据最小化 · 参数验证 · 输出处理Model / Tool / MCPdestination安全响应与最小化审计
图 1. 三层拦截架构。入口建立可信请求边界,网关绑定本次执行的模型/工具/预算/内容政策,出口控制目的地、数据、参数和返回;阻断、审查或流式终止进入统一安全响应面。

三层不是三个独立产品,而是同一策略对象在不同时间点的执行位置。入口取得可信主体与资源资格;网关将模型路由、允许工具、预算、内容政策和审计级别绑定到一次执行;出口在数据离开平台或返回调用方前落实目的地控制、最小化、参数验证和输出处理。每层只记录最小化决策元数据,以支持审计而不复制敏感 payload。

拦截决策探索器

选择策略层和风险类型,查看公开职责与推荐处置;不公开规则阈值、检测特征或供应商配置。

网关层职责绑定模型、工具、预算、内容和审计策略。
检查面路由能力;提示注入;工具最小权限;异常模式
推荐处置要求确认或阻断:模型文本不自动获得能力权限。

三、入口层:准入与攻击面收敛

入口回答“请求是否可以进入系统”,而不是判断模型回复是否合适。必须在此执行可信传输与代理边界、认证与租户解析、schema/大小限制、重放与幂等、频率/并发/预算预检以及基础格式风险筛查。客户端自带的模型、组织、角色或工具权限字段只是请求数据;真正的授权范围应由可信认证和服务端策略计算。

入口处置可为 allow、transform、challenge 或 block。拒绝响应应有稳定的错误类别、可安全公开的 correlation ID 和重试建议,绝不回显规则、密钥、上游地址或其他主体信息。

四、网关层:执行策略与工具授权

网关层把身份结果转换为本次执行的可用模型、最大资源、允许工具、数据范围、内容治理、流式许可、确认要求和审计级别。模型路由不能突破这份策略,模型输出也不能修改它。提示注入被看作不可信内容试图改变指令层级或调用边界:系统/开发者指令、用户输入、工具输出与检索内容必须保持来源分离;每次模型到工具的转换都重新检查授权。

允许模型提出工具调用,不等于工具获准执行。每次调用至少绑定主体、租户/项目范围、工具版本、操作类型、参数 schema、资源范围、幂等与确认要求。高影响能力应要求确认、双人审批或禁止自动执行;读取工具也需限制资源和返回字段。MCP 连接器是能力提供者,不是可信指令源。

五、出口层:数据、目的地与输出

出口层仅对策略允许的模型和工具目的地发起调用,并按目的地、租户和操作范围注入服务端凭据。它最小化发送字段,移除不必要的认证、追踪和个人数据;再次验证模型生成的工具参数,禁止将自然语言直接拼接为命令、查询或 URL;同时施加超时、输出上限、工具调用上限、并发与取消传播。

返回调用方前,文本、结构化对象、HTML、URL、代码、文件链接和工具参数都不能被无条件渲染或执行。SSE/WS 中若出现应阻断内容或未授权工具结果,出口层停止继续发送,给出 failedincomplete,并保存不含敏感 payload 的审计记录。已发出的字节不能收回,因此高风险能力必须在执行前控制。

六、拦截矩阵、状态与编排

风险类首选层默认处置可安全公开不应公开
身份无效/范围不足入口阻断或挑战错误类别、重试路径身份解析规则
超额/异常速率入口+网关延后、限速、阻断限额类别阈值、反滥用信号
提示注入/指令冲突网关变换、阻断、审查高层风险类别特征、提示模板、置信分数
越权/高影响工具网关+出口确认或阻断不可用/需确认状态授权规则、资源清单
敏感数据外发网关+出口脱敏、最小化、阻断数据政策类别匹配模式
不安全输出/链接出口清理、失败、终止流不可交付类别检测器实现

安全政策必须与 orchestration 状态机兼容:入口拒绝在 created 前结束;网关拒绝可产生 failed;输出中止可产生 incomplete;工具确认等待不得伪装为 completed。任何 output_text.delta 都不代表策略整体通过,更不代表工具已成功执行。重连、恢复和 call_id 关联也必须重新验证主体与范围。

七、观测、治理与局限

公开聚合指标可包括入口拒绝率、限速命中率、工具确认/阻断率、输出终止率、流式安全终止后的协议完整率、关键检查可用性、误拦申诉率和策略版本覆盖率。它们应按模型、接口形态和风险类汇总,采用最小样本阈值;不得公开租户级数据、规则命中样本、模型提示词或阈值。

三层架构降低风险,却不保证模型永不出错。提示注入检测有误报和漏报,供应方能力会变化,工具安全依赖工具自身授权,流式系统无法撤回已发送数据。路线图包括三层 conformance fixture、JSON/SSE/WS/工具循环端到端回归、公开安全错误分类、影子评估与分阶段发布,并持续依据 OWASP、NIST 与连接器指南更新威胁模型。

八、结论

Vtslx AO 将安全控制分布在入口、网关和出口:身份与资源边界在推理前建立,模型/工具执行在策略交集内运行,数据和结果在离开边界前再验证。该分层使“模型拒绝”不再是唯一控制,也让每一次阻断、确认、变换或安全终止能以稳定协议语义呈现给客户端,而不暴露能够被绕过的实现细节。