- ● 风险"缺失值处理:不能盲目填写0,要按照真实分布" —— 缺失值填补严禁简单填0,应参照真实数据分布;可命题:错误填补方式(填0/盲目均值)的危害。
- ● 不完整描述"用平均值填补缺失值:不是最准确的方法(分箱比均值好一点)" —— 均值/中位数/众数填补会引入偏差与信息丢失,并非最优;分箱(binning)优于简单均值。需补全:这类填充方式的主要风险是引入偏差与信息丢失,且对分组数据用组内统计值填充风险尤大。
- ● 关键词"归一化处理:特征距离缩放(K均值聚类)" —— 归一化/特征缩放用于特征间距离度量(如K均值聚类前),可避免量纲大的特征主导。
- ● 关键词"删除重复值" —— 重复条目应识别并删除,否则影响模型(如特征重要性偏差)。
以下为考点明显在考但Tips未覆盖的内容,单列作补充: