🗂
数据驱动域 · 考点 数13

数据集拆分

📝 Tips 笔记解读▾
  • ● 风险如果3个数据集(训练/验证/测试)有重叠,会导致:信息泄露。→ 补全:三个数据集之间若存在记录重叠,会使模型在评估阶段间接"见过"测试样本,造成数据泄露、评估结果失真。
⚠ 笔记缺漏补充▾
  • 预处理时机风险:标准化/归一化等特征变换若在整个数据集上先做、再拆分,会令测试集信息提前渗入训练过程,同样构成数据泄露。拆分必须在任何特征缩放/编码之前完成。
  • 集合间互斥原则:训练集、验证集、测试集的记录应互不相交;三集合记录总数不应超过原始数据集总数。
  • 测试集污染后果:将测试数据混入训练数据,会使模型在"已见过"的样本上评估,高估性能并掩盖泛化缺陷。
🎯 考点分析▾
  • 考察主线:本批次全部考察"数据集拆分不当导致的数据泄露(data leakage)",具体覆盖三类情形:拆分前先做标准化、集合间记录重叠、测试数据被并入训练数据。
  • 正确答案的共同知识方向:
  • - 方向:拆分前对全量数据做标准化,模型会经数据泄露获得间接知识,属最大风险。
  • - 方向:训练/验证/测试三集记录总数超过原始总数,说明存在重叠记录导致数据泄露,应优先排查。
  • - 方向:训练流程中将测试数据包含进训练集,是最应关注的泄露风险。
  • 常见干扰方向:
  • - 把"验证集是否与训练集记录数相同""集合创建顺序"等次要问题,误当作首要审计关注点。
  • - 将泄露风险归因为"模型影响数据分布""需要外部验证"等无关表述。
  • - 用"缺乏KPI""缺乏超参数优化程序""使用增量训练"等流程缺失,替代真正的数据泄露问题。
  • 场景分布:通用机器学习训练流程审计、数据预处理流水线审计。
📋 考察范围清单▾
  • 数据泄露定义:模型在训练/评估阶段间接接触了本应不可见的测试或目标信息,导致评估失真。
  • 三集互斥原则:训练集、验证集、测试集记录应互不重叠,且三集合记录总数不超过原始总数。
  • 拆分时机:必须在特征缩放、标准化、编码、缺失值处理等任何预处理之前完成数据集拆分。
  • 预处理泄露风险:在全量数据上先标准化/归一化再拆分,会使测试统计信息渗入训练,构成泄露。
  • 测试集污染:测试数据被并入训练数据是典型泄露,会高估模型性能、掩盖泛化缺陷。
  • 审计关注点:发现集合记录总数异常时应首先怀疑重叠导致的泄露;应验证拆分逻辑与集合来源。
  • 泄露后果:模型性能被高估、在生产环境表现不佳、偏差与不可靠决策。
📄 Tips.pdf 补充对照▾
  • 重叠危害:如果 3 个数据集有重叠,会导致:信息泄露

→ 打开 PDF 补充页查看全部条目

← 上一个考点数据质量首页导航下一个考点 →输入规范