🗂
数据驱动域 · 考点 数1

合成数据

📝 Tips 笔记解读▾
  • ● 关键词罕见的情况无法获得样本:使用合成数据。→ 补全:当真实场景样本(尤其罕见、高影响事件)难以获取时,可用合成数据替代或补充训练/测试数据。
  • ● 风险合成数据不能偏离真实分布。→ 补全:合成数据必须贴近真实数据分布,否则模型学到失真规律,在真实场景失效;需对合成数据质量进行验证。
⚠ 笔记缺漏补充▾
  • 合成数据质量验证:使用合成数据(尤其为降低隐私风险而采用时)必须验证其质量,包括是否代表真实分布、是否覆盖罕见事件与异常值。
  • 未标注AI生成内容的污染风险:将AI生成内容未经标注混入训练数据,会使模型把自身错误当作事实反复强化,放大幻觉与错误传播。
  • 罕见场景测试价值:合成数据特别适用于测试生产中尚未发生的高影响罕见场景。
🎯 考点分析▾
  • 考察主线:本批次考察合成数据的适用场景、质量风险与验证要求,重点是其用于罕见/高影响场景的优势,以及"不能偏离真实分布、须验证质量、避免未标注AI内容污染"的风险边界。
  • 正确答案的共同知识方向:
  • - 方向:为降低隐私风险使用合成数据训练时,审计最佳建议是要求验证合成数据质量。
  • - 方向:将未经标注的AI生成内容混入训练数据,最大风险是模型把自身错误当作事实强化。
  • - 方向:用合成数据训练图像识别算法时,最堪忧的是合成数据无法准确代表罕见事件/异常值。
  • - 方向:测试生产中尚未发生的高影响罕见场景,合成数据最有用。
  • 常见干扰方向:
  • - 把"停止使用合成数据""改用聚类/回归测试"等消极或无关处置,误当作最佳审计建议。
  • - 将"验证过程效率低""不符合标签标准""增加分析复杂性"等次要问题,误当作最核心担忧。
  • - 用"基准数据集、匿名化历史数据、去标识化数据"等,替代合成数据在罕见场景测试中的独特价值。
  • 场景分布:金融信用风险评估、图像识别算法、高影响罕见事件测试、训练数据污染审计。
📋 考察范围清单▾
  • 合成数据定义与用途:由模型/算法生成的、非直接来自真实采集的数据,用于训练或测试。
  • 适用场景:真实样本稀缺(尤其罕见、高影响事件)或需降低隐私风险时,用合成数据替代/补充。
  • 核心约束:合成数据不能偏离真实数据分布,否则模型在真实场景失效。
  • 质量验证:使用合成数据(尤其涉及隐私或关键决策)必须验证其质量、分布代表性与异常值覆盖。
  • 罕见事件覆盖:合成数据须能代表罕见事件与异常值,否则评估失真。
  • 污染风险:未经标注的AI生成内容混入训练数据,会使模型强化自身错误(幻觉放大)。
  • 隐私关联:合成数据常被用于降低训练中的隐私风险,但须以质量为前提。
  • 与真实数据对照:合成数据应与真实数据验证/比对,确认代表性与可用性。
📄 Tips.pdf 补充对照▾
  • 适用场景:罕见的情况无法获得样本:使用合成数据
  • 约束:合成数据不能偏离真实分布

→ 打开 PDF 补充页查看全部条目

首页导航下一个考点 →数据中毒