🔏
安全与审计域 · 考点 安5

提示注入

📝 Tips 笔记解读▾

以下为 tips_pdf_text.txt 中直接服务于本考点的笔记条目(逐条标注类型并补全为可命题的考点定义):

  • 「提示词注入」一节中的「输入过滤」 → ● 关键词输入过滤。补全定义:对进入模型的用户输入进行过滤,是防御提示注入的第一道控制,用于拦截可疑指令模式。
  • 「提示词注入」一节中的「输入验证」 → ● 关键词输入验证。补全定义:对输入做结构化校验与清洗,识别并剔除恶意提示指令,是提示注入的核心防御手段。
  • 「鲁棒性」一节中的「极端条件/意外/极限/微小改变/对抗性输入」 → ● 风险对抗性/被篡改输入可操纵模型输出。补全定义:提示注入常表现为对抗性输入,应通过对抗性测试与异常检测识别差距。
  • 「数据/模型中毒」一节(模型中毒保护权限、数据中毒来自可信来源+数据验证) → ● 风险被污染/被操纵的输入源会引入风险。补全定义:来自外部(如供应商邮件、工作表)的内容须在进入模型前验证与清洗,与提示注入防御同源。
⚠ 笔记缺漏补充▾

以下知识点考点明显在考,但 tips 仅给了"输入过滤/输入验证"两个词,须补入:

  • 提示注入的定义与分类:包含即时注入(直接向模型输入恶意文本)、越狱(jailbreak,借角色扮演/理论情境绕过伦理护栏)、对抗性输入(篡改输入操纵输出)等。
  • 典型越狱/注入手法:借"理论情境/角色扮演"包装违规请求、在文本中嵌入不可见字体或隐藏字符/单元格夹带指令、借外部文件(邮件、工作表)携带隐藏指令。
  • 事件管理与响应:提示注入事件管理程序应部署输入验证清理滥用提示;审计员对提示与输出的关注重点是敏感信息保护措施被规避。
  • 防御的"在模型接收前"原则:清理/删除恶意内容应在内容送达模型之前完成,而非依赖给模型加"忽略指令"或调低温度。
🎯 考点分析▾
  • 考察主线:本批题聚焦"提示注入是什么、有哪些手法、如何有效防御"三条线。既考概念辨析(识别某攻击属于提示注入而非数据漂移/中毒),也考具体绕过手法(越狱、不可见文本、隐藏单元格),更重考防御控制的取舍——正确答案几乎都落在"输入验证/清理/异常检测"上,而错误项多为微调模型、防火墙、降温度、加忽略指令等无效或治标手段。
  • 正确答案的共同知识方向(只写方向,不写原句):
  • 1. 借"理论情境/角色扮演"包装违规请求以绕过伦理护栏,属于提示注入(越狱)手法。
  • 2. 用户向模型输入恶意文本以泄露私人信息,属于即时提示注入攻击。
  • 3. 提示注入事件管理最有效措施是部署输入验证、清理滥用提示。
  • 4. 对易受提示操纵的神经网络系统,最佳建议是严格输入验证加异常检测。
  • 5. 审计员审查提示与输出时,最值得关注的是敏感信息保护措施被规避(即注入得逞)。
  • 6. 对易受对抗性攻击的模型,最佳应对是验证"处理被篡改输入"的过程(输入校验)。
  • 7. 邮件中不可见字体隐藏的注入文本,最佳控制是在模型接收前清理删除不可见文本。
  • 8. 工作表隐藏单元格夹带"忽略控制"指令,最佳方案是只允许提取预定义值与标题,避免执行自由指令。
  • 常见干扰方向(错误选项通常误导的方向,概括):
  • 1. 用微调模型来应对注入(治标且不直接解决输入层)。
  • 2. 用网络防火墙或基于角色的访问控制替代输入层防御(层位错误)。
  • 3. 靠"给模型加更多忽略指令"或"降低温度"来抵抗注入(不可靠,治标)。
  • 4. 仅扫描特殊字符/代码结构或评估日志/响应时间等周边指标,未触达输入验证本质。
  • 5. 把数据漂移、数据中毒、蛮力等异类攻击与提示注入混淆。
  • 场景分布(题目常用业务场景类型):
  • 1. 生成式人工智能聊天/问答系统的伦理护栏绕过。
  • 2. 供应商邮件中夹带注入文本(不可见字体)。
  • 3. 工作表/文档汇总时隐藏单元格夹带指令。
  • 4. 保险/风险评估类神经网络模型受对抗性输入。
  • 5. 审计员审查人工智能提示与输出(合规关注点)。
📋 考察范围清单▾

出题必须覆盖以下知识点,每条一行,格式"知识点:一句话定义/边界":

  • 提示注入定义:通过构造输入操纵AI模型行为/输出、绕过护栏或泄露信息的攻击,含即时注入与越狱。
  • 越狱(jailbreak)手法:借角色扮演、理论情境、假设性前提包装违规请求以绕过伦理限制。
  • 不可见/隐藏载体注入:利用不可见字体、隐藏字符、隐藏单元格/元数据中夹带指令操纵模型。
  • 外部内容注入:来自邮件、文档、工作表等外部材料的注入,须在进入模型前清洗。
  • 输入验证(核心防御):对输入做结构化校验与清理,剔除恶意提示,是防御首选。
  • 输入过滤:在入口层过滤可疑指令模式,与输入验证配合构成第一道防线。
  • 异常检测配合:对输入/输出做异常检测,识别对抗性或被操纵的迹象。
  • "模型接收前"原则:删除/清理恶意内容应在内容送达模型之前完成,不依赖模型自我约束。
  • 预定义提取控制:对结构化文件只提取预定义值与标题,避免执行其中的隐藏指令。
  • 防御误区:微调模型、防火墙、RBAC、降温度、加忽略指令等均非根本解决提示注入的手段。
  • 审计关注点:审查提示与输出时最应关注敏感信息保护措施被注入规避。
  • 对抗性输入:被篡改的输入属对抗性攻击,应验证模型处理被篡改输入的流程。
📄 Tips.pdf 补充对照▾
  • 防护:输入过滤、输入验证

→ 打开 PDF 补充页查看全部条目

← 上一个考点审计报告首页导航下一个考点 →政策培训