上游模型
“未联调”表示接入代码已写好,但尚未对接真实推理端点验证,启用前需要联调测试。
分级策略摘要
处理流程
业务应用把模型地址改为本网关(OpenAI 兼容接口)即可接入。每次调用依次经过:
输入脱敏(身份证、手机号等换成占位符,模型拿不到真实值)→ 注入检测(规则 + 可选的内网模型二次研判)→
上游模型 → 流式输出护栏(滞留窗口,屏蔽模型“背出来”的个人信息、系统提示词、金丝雀和违规用语)→
占位符还原(有权限的应用)→ 水印(零宽水印 + 文本指纹)→ 事件记录(日志中不保存真实个人信息)。
在线测试
允许把占位符还原为真实值
演示模型是字符级 n 元模型,不是大模型;它被刻意做成“好骗”,会背出训练语料里的虚构客户记录、会复述系统提示词,用来检验护栏能否兜住。
① 输入检查
发送后显示
② 交付给应用的回答
发送后显示
新建接入应用
允许还原占位符(应用可见真实值)
接入应用
调用示例
调用事件与告警
日志中的敏感信息已替换为类别名(如〔身份证号〕),系统不保存还原后的真实值。
外泄文本溯源
把在外部发现的疑似外泄文本粘贴进来。系统先读取不可见的零宽水印;水印被去掉或文本被改写时,再用文本指纹比对找出最可能的来源事件。
溯源结果
提交后显示
遗忘校验
客户依据《个人信息保护法》行使删除权后,需要确认模型不再“记得”这些数据。校验包括:金丝雀暴露度、提取攻击、成员推断。
演示模型在线状态
切换后,在线测试和接入应用使用的演示模型随之改变。
校验结果
选择对象并开始校验
历史记录
评测报告
护栏策略
按数据级别配置输入处置、输出处置和注入阈值。修改保存后立即生效,并记入审计日志。阈值为示例值,应由数据安全归口部门审定。