AI 安全不能只靠一句“不要泄露敏感信息”。模型会读取用户输入、检索内容和工具返回,其中任何一层都可能携带恶意指令。安全治理要放在系统结构里,而不是放在模型自觉里。
提示注入是上下文污染
当文档、网页或用户输入中包含“忽略之前规则”之类的内容时,模型可能把它当成指令。解决思路不是让模型更听话,而是区分指令、资料和用户内容,并对外部内容做隔离标记。
权限过滤必须在工具层完成
不要把用户无权访问的数据交给模型再要求它保密。权限过滤要发生在数据库、检索和工具调用之前。模型只能看到用户本来就有权看到的信息。
高风险动作需要人工确认
发送邮件、删除数据、修改订单、发起付款、发布公告,这些动作不能只由模型决定。系统应展示模型计划、关键参数和影响范围,让用户确认后再执行。
敏感信息要最小化进入上下文
身份证、手机号、合同金额、客户资料等敏感内容,能脱敏就脱敏,能摘要就摘要,能用 ID 引用就不要直接放入模型上下文。
安全清单
- 区分系统指令、用户输入和外部资料。
- 检索前完成权限过滤。
- 工具按风险等级分层授权。
- 敏感信息进入上下文前做脱敏。
- 所有高风险动作保留审计日志。