🗂
数据驱动域 · 考点 数9

数据清洗

📝 Tips 笔记解读▾
  • ● 风险"缺失值处理:不能盲目填写0,要按照真实分布" —— 缺失值填补严禁简单填0,应参照真实数据分布;可命题:错误填补方式(填0/盲目均值)的危害。
  • ● 不完整描述"用平均值填补缺失值:不是最准确的方法(分箱比均值好一点)" —— 均值/中位数/众数填补会引入偏差与信息丢失,并非最优;分箱(binning)优于简单均值。需补全:这类填充方式的主要风险是引入偏差与信息丢失,且对分组数据用组内统计值填充风险尤大。
  • ● 关键词"归一化处理:特征距离缩放(K均值聚类)" —— 归一化/特征缩放用于特征间距离度量(如K均值聚类前),可避免量纲大的特征主导。
  • ● 关键词"删除重复值" —— 重复条目应识别并删除,否则影响模型(如特征重要性偏差)。

以下为考点明显在考但Tips未覆盖的内容,单列作补充:

⚠ 笔记缺漏补充▾
  • ● 风险用列的"模式(众数)"填充单个空记录,同样引入偏差风险最大。
  • ● 风险直接按百分位数(如第5/95百分位)删除异常值,是风险最大的数据管理实践(异常值未必是错误)。
  • ● 关键词探索性数据分析(EDA)是初始填充数据框时检查类型错误、空值、重复条目的最重要步骤。
  • ● 关键词监督学习训练数据应仅包含高置信度标记示例。
  • ● 关键词NLP预处理:对非正式/多语言数据,应规范化(词典)并加入翻译,而非简单删除多语言数据。
🎯 考点分析▾
  • 考察主线:本批题考查数据清洗/预处理各项技术的正当用法与风险边界,重点是"缺失值填补方式的选择与偏差风险""重复值与异常值处理""EDA检查""特定场景(NLP/监督学习)的预处理要点"。
  • 正确答案的共同知识方向:
  • - 缺失值填补(均值/中位数/众数/模式)会引入偏差与信息丢失,是高风险策略。
  • - 初始填充数据框最重要的是做EDA,检查类型错误、空值、重复。
  • - 重复条目会导致特征重要性偏差,应删除。
  • - 直接按百分位删除异常值风险最大(异常值未必错误)。
  • - NLP多语言/非正式数据应规范化+翻译处理,而非删除多语言数据。
  • - 监督学习训练数据应只含高置信度标记示例。
  • - 数据清理是收集数据时最重要的任务。
  • 常见干扰方向:
  • - 把"删除多语言/仅用单一语言"当作简化复杂性的正确做法。
  • - 把数据分层、系统训练、隔离系统当作收集数据时最重要任务。
  • - 把管理层批准、标准分布当作监督学习数据最重要考虑。
  • - 把分箱/归一化等正确技术误标为风险最大。
  • 场景分布:数据框初始填充、NLP聊天机器人、监督学习训练数据准备、审计审查训练数据集。
📋 考察范围清单▾
  • 缺失值填补风险:均值/中位数/众数/模式填充会引入偏差与信息丢失,非最优;应参照真实分布,分箱优于简单均值。
  • 禁止盲目填0:缺失值不能简单填0。
  • EDA检查:初始填充数据框时最重要步骤是探索性数据分析,检查类型错误、空值、重复。
  • 重复值处理:重复条目导致特征重要性偏差,应识别删除。
  • 异常值处理边界:按百分位直接删除异常值风险最大,异常值不等于错误。
  • 归一化/特征缩放:用于消除量纲主导(如K均值聚类前),属特征缩放而非相关性技术。
  • NLP预处理:非正式/多语言数据应规范化+翻译,避免简单丢弃。
  • 监督学习数据要求:训练数据应仅含高置信度标记示例。
  • 数据清理定位:是数据收集阶段最重要的任务之一。
📄 Tips.pdf 补充对照▾
  • 缺失值处理:不能盲目填写 0,要按照真实分布
  • 归一化处理:特征距离缩放(K 均值聚类)
  • 删除重复值:去重
  • 平均值填补:不是最准确的方法(分箱比均值好一点)

→ 打开 PDF 补充页查看全部条目

← 上一个考点数据沿袭首页导航下一个考点 →数据相关性