🗂
数据驱动域 · 考点 数4

数据增强

📝 Tips 笔记解读▾
  • ● 好处/优点数据增强:提高模型准确性、泛化能力等性能指标。→ 补全:数据增强通过对现有数据做可控变换来扩充样本,从而提升模型的准确性与泛化能力。
⚠ 笔记缺漏补充▾
  • 增强有效性评估:判断数据增强是否有效的核心依据是模型性能指标在增强前后的变化,而非类别平衡、特征重要性等间接指标。
  • 增强数据质量边界:增强数据应与原始数据保持亲和性与多样性,避免脱离真实分布;其价值最终体现在模型性能提升上。
🎯 考点分析▾
  • 考察主线:本批次考察数据增强的核心价值与有效性判定,重点是其对模型准确性与泛化能力的提升,以及用模型性能指标变化来衡量增强效果。
  • 正确答案的共同知识方向:
  • - 方向:数据增强是提升模型准确性与(或)理解能力的主要手段。
  • - 方向:数据增强对模型的主要好处是增强泛化能力。
  • - 方向:评估数据增强是否有效,最应看增强前后模型性能指标的变化。
  • 常见干扰方向:
  • - 把"增强前后数据类别的平衡""增强前后模型特征重要性总结""增强数据与原始数据的亲和力和多样性"等间接指标,误当作判定有效性的首要依据。
  • - 将均值聚类、提示模板、数据压缩等无关技术,误当作提升准确性的等同手段。
  • 场景分布:机器学习建模审计、图像/通用分类模型训练。
📋 考察范围清单▾
  • 数据增强定义:对现有训练样本做可控变换以扩充数据量、丰富样本多样性。
  • 核心收益:提升模型准确性与泛化能力,是缓解数据不足的有效手段。
  • 有效性判定:以增强前后模型性能指标的对比为首要依据(而非类别平衡、特征重要性等间接指标)。
  • 质量边界:增强数据应与原始数据保持亲和性与多样性,不得脱离真实分布。
  • 与其他技术区分:区别于聚类、压缩、提示模板等不直接以扩充样本提升泛化为目的的技术。
📄 Tips.pdf 补充对照▾
  • 目的:提高模型准确性、泛化能力等性能指标

→ 打开 PDF 补充页查看全部条目

← 上一个考点数据代表性首页导航下一个考点 →数据完整性