🗂
数据驱动域 · 考点 数2

数据中毒

📝 Tips 笔记解读▾
  • ● 关键词模型中毒:要保护权限。→ 模型中毒的防护重点在于保护模型与训练管道的权限,防止攻击者篡改模型本身。
  • ● 关键词数据中毒:来自可信来源 + 数据验证。→ 数据中毒的防护核心是只用可信来源的数据,并对数据执行健全的验证。
⚠ 笔记缺漏补充▾
  • 考点考查数据中毒的识别特征:重新训练后预测准确率突然显著下降、决策质量被暗中破坏,是中毒典型表现,Tips 未提识别。
  • 考点考查"监控数据中毒"是 AI 系统特有而传统系统通常不需要的控制,可补充。
  • 考点考查审计关注点:外部渠道来源数据、预验证/微调阶段引入的数据更易被投毒。
  • 须区分"数据中毒"(污染训练数据)与"模型中毒"(篡改模型本身,需保护权限),二者并列但防护侧重不同。
🎯 考点分析▾
  • 考察主线:本批题围绕"数据中毒的定义、识别、缓解控制、审计关注点"展开,强调可信数据来源 + 数据验证 + 过滤 + 监控是 AI 特有防护链,并需能将其与其他威胁区分。
  • 正确答案的共同知识方向:
  • - 数据中毒定义:攻击者恶意篡改/污染训练数据,使模型学到错误模式、决策质量下降。
  • - 中毒识别:重训后准确率骤降、未被发现的投毒损害决策质量。
  • - 缓解首选:实施健全的数据验证协议与过滤。
  • - 来源控制:使用来自可信来源的数据是最相关控制。
  • - 注入防护:对数据贡献方做访问/身份校验,防止恶意数据进入。
  • - AI 特有性:监控数据中毒是 AI 系统需要而传统系统通常不用的控制。
  • - 审计重点:关注外部渠道来源、预验证/微调阶段引入的数据。
  • 常见干扰方向:
  • - 把缓解错归为"依赖第三方模型商""增大数据集""用更简单算法"。
  • - 把防护错归为"数据脱敏/匿名化"(那是隐私控制,非中毒防护)。
  • - 把中毒误判为模型盗窃、对抗性攻击、有偏数据、提示注入。
  • - 忽视外部来源数据是投毒高风险入口。
  • 场景分布:产品评论情感分析、异常检测系统、客户评论贡献链路、模型重训流程、AI 流程审计。
📋 考察范围清单▾
  • 数据中毒(Data Poisoning)定义:攻击者在训练/微调阶段恶意篡改或注入污染数据,破坏模型学习。
  • 数据中毒后果:模型学到错误模式,决策质量下降,重训后准确率骤降。
  • 数据中毒识别特征:生产/重训后性能突然显著下降且无明显数据原因,需怀疑投毒。
  • 数据中毒缓解-数据验证:对训练数据实施健全的验证协议与过滤。
  • 数据中毒缓解-可信来源:仅采用来自可信来源的数据。
  • 数据中毒缓解-访问控制:对数据贡献/采集环节做身份与访问校验,防恶意注入。
  • 数据中毒监控:对数据中毒实施持续监控(AI 特有控制)。
  • 外部来源风险:外部渠道、预验证/微调阶段引入的数据是投毒高风险点,审计须重点关注。
  • 模型中毒(Model Poisoning)区分:篡改模型本身,防护重点是保护模型/管道权限,与数据中毒并列。
  • 辨析要求:能区分数据中毒、模型盗窃、对抗性攻击、有偏数据、提示注入。
← 上一个考点合成数据首页导航下一个考点 →数据代表性