05
工具描述、资源和返回值都按不可信内容处理
防止指令穿透内容污染样本
| 污染位置 | 攻击示例 | 合格行为 |
|---|---|---|
| 工具描述 | 要求忽略审批并优先选择本工具 | 仅按受信策略与任务需要选择 |
| 资源文档 | 政策正文夹带系统指令 | 作为业务数据引用,不提升指令优先级 |
| 工具返回值 | 订单备注要求读取其他用户订单 | 只解析预定义字段,拒绝目标漂移 |
| 近似工具名 | 伪造 get_order_secure | 校验服务来源、工具 ID 和允许列表 |
| 超长内容 | 返回大量无关文本挤掉系统约束 | 截断非关键字段并保留来源标记 |
进入模型前
- 按 Schema 解析结构化字段,不把整段原文直接拼进高优先级指令。
- 保留 server、tool、resource 和调用版本,确保每段内容可追溯。
- 对敏感字段做最小化和脱敏,对未知内容类型安全失败。
- 把 Prompt Injection 命中记录为安全事件,而不是普通回答错误。