摘要
Vtslx AO 的 LLM 安全边界不能只放在模型前或模型后。请求在入口可能携带未授权身份、畸形协议、重放与资源消耗;执行时可能遭遇提示注入、越权工具引导和不可信检索内容;返回时可能包含敏感信息、不安全参数或未完成的流式状态。本文定义入口层、网关层和出口层的纵深防御语义,将处置统一为放行、变换、要求确认、阻断与隔离审查。
公开目标是可解释、可观测、可回退的拦截决策,而非公开规则阈值、检测特征、提示模板、密钥或客户数据。关键验证失败不得默认放行;非关键观测失败不得破坏已授权业务;模型文本也不能创建身份、提升权限或绕过租户边界。
一、威胁模型与原则
威胁主体包括权限有限的合法调用方、试图绕过系统指令的输入、不可信网页/文件/检索结果/MCP 输出、被模型选择的外部工具、模型或工具供应方,以及试图耗尽共享配额的自动化客户端。提示注入、敏感信息泄露、不当输出处理、过度代理和无界消耗不能由单一内容分类器充分处理。
策略坚持先授权后推理、最小能力、不可信内容不升权、关键检查失败即拒绝、流式也可终止,以及公开语义但隐藏可绕过的检测细节。应用侧业务授权仍属于应用;本文不承诺模型永远正确,也不把平台拦截器当作业务判断的替代物。
二、三层安全架构
三层不是三个独立产品,而是同一策略对象在不同时间点的执行位置。入口取得可信主体与资源资格;网关将模型路由、允许工具、预算、内容政策和审计级别绑定到一次执行;出口在数据离开平台或返回调用方前落实目的地控制、最小化、参数验证和输出处理。每层只记录最小化决策元数据,以支持审计而不复制敏感 payload。
拦截决策探索器
选择策略层和风险类型,查看公开职责与推荐处置;不公开规则阈值、检测特征或供应商配置。
三、入口层:准入与攻击面收敛
入口回答“请求是否可以进入系统”,而不是判断模型回复是否合适。必须在此执行可信传输与代理边界、认证与租户解析、schema/大小限制、重放与幂等、频率/并发/预算预检以及基础格式风险筛查。客户端自带的模型、组织、角色或工具权限字段只是请求数据;真正的授权范围应由可信认证和服务端策略计算。
入口处置可为 allow、transform、challenge 或 block。拒绝响应应有稳定的错误类别、可安全公开的 correlation ID 和重试建议,绝不回显规则、密钥、上游地址或其他主体信息。
四、网关层:执行策略与工具授权
网关层把身份结果转换为本次执行的可用模型、最大资源、允许工具、数据范围、内容治理、流式许可、确认要求和审计级别。模型路由不能突破这份策略,模型输出也不能修改它。提示注入被看作不可信内容试图改变指令层级或调用边界:系统/开发者指令、用户输入、工具输出与检索内容必须保持来源分离;每次模型到工具的转换都重新检查授权。
允许模型提出工具调用,不等于工具获准执行。每次调用至少绑定主体、租户/项目范围、工具版本、操作类型、参数 schema、资源范围、幂等与确认要求。高影响能力应要求确认、双人审批或禁止自动执行;读取工具也需限制资源和返回字段。MCP 连接器是能力提供者,不是可信指令源。
五、出口层:数据、目的地与输出
出口层仅对策略允许的模型和工具目的地发起调用,并按目的地、租户和操作范围注入服务端凭据。它最小化发送字段,移除不必要的认证、追踪和个人数据;再次验证模型生成的工具参数,禁止将自然语言直接拼接为命令、查询或 URL;同时施加超时、输出上限、工具调用上限、并发与取消传播。
返回调用方前,文本、结构化对象、HTML、URL、代码、文件链接和工具参数都不能被无条件渲染或执行。SSE/WS 中若出现应阻断内容或未授权工具结果,出口层停止继续发送,给出 failed 或 incomplete,并保存不含敏感 payload 的审计记录。已发出的字节不能收回,因此高风险能力必须在执行前控制。
六、拦截矩阵、状态与编排
| 风险类 | 首选层 | 默认处置 | 可安全公开 | 不应公开 |
|---|---|---|---|---|
| 身份无效/范围不足 | 入口 | 阻断或挑战 | 错误类别、重试路径 | 身份解析规则 |
| 超额/异常速率 | 入口+网关 | 延后、限速、阻断 | 限额类别 | 阈值、反滥用信号 |
| 提示注入/指令冲突 | 网关 | 变换、阻断、审查 | 高层风险类别 | 特征、提示模板、置信分数 |
| 越权/高影响工具 | 网关+出口 | 确认或阻断 | 不可用/需确认状态 | 授权规则、资源清单 |
| 敏感数据外发 | 网关+出口 | 脱敏、最小化、阻断 | 数据政策类别 | 匹配模式 |
| 不安全输出/链接 | 出口 | 清理、失败、终止流 | 不可交付类别 | 检测器实现 |
安全政策必须与 orchestration 状态机兼容:入口拒绝在 created 前结束;网关拒绝可产生 failed;输出中止可产生 incomplete;工具确认等待不得伪装为 completed。任何 output_text.delta 都不代表策略整体通过,更不代表工具已成功执行。重连、恢复和 call_id 关联也必须重新验证主体与范围。
七、观测、治理与局限
公开聚合指标可包括入口拒绝率、限速命中率、工具确认/阻断率、输出终止率、流式安全终止后的协议完整率、关键检查可用性、误拦申诉率和策略版本覆盖率。它们应按模型、接口形态和风险类汇总,采用最小样本阈值;不得公开租户级数据、规则命中样本、模型提示词或阈值。
三层架构降低风险,却不保证模型永不出错。提示注入检测有误报和漏报,供应方能力会变化,工具安全依赖工具自身授权,流式系统无法撤回已发送数据。路线图包括三层 conformance fixture、JSON/SSE/WS/工具循环端到端回归、公开安全错误分类、影子评估与分阶段发布,并持续依据 OWASP、NIST 与连接器指南更新威胁模型。
八、结论
Vtslx AO 将安全控制分布在入口、网关和出口:身份与资源边界在推理前建立,模型/工具执行在策略交集内运行,数据和结果在离开边界前再验证。该分层使“模型拒绝”不再是唯一控制,也让每一次阻断、确认、变换或安全终止能以稳定协议语义呈现给客户端,而不暴露能够被绕过的实现细节。
