🗂
数据驱动域 · 考点 数11

数据编码

📝 Tips 笔记解读▾
  • ● 关键词"独热编码:针对无序数据的" —— 独热编码(one-hot)适用于无序/名义类别变量;可命题:对有序类别误用独热会丢失顺序信息,对无序类别误用序数编码会引入虚假顺序。
  • ● 关键词"百分比数据(包含非数值类型数据):无法作为训练数据训练预测模型" —— 含非数值类型的百分比数据不能直接作为训练数据,须先转为数值格式。可命题:对象/非数值格式字段无法被模型处理。

以下为考点明显在考但Tips未覆盖的内容,单列作补充:

⚠ 笔记缺漏补充▾
  • ● 风险序数标签编码(ordinal/label encoding)适用于有序类别;若用于无序(名义)类别会引入虚假的顺序关系,是最大风险。
  • ● 风险对本身有序的类别(如舱位等级)使用独热编码会丢失其顺序信息,是风险最大的转换方式。
  • ● 关键词模型能否处理数据取决于字段格式:整数/浮点/布尔可处理,对象格式(如百分比存为文本)无法处理或做关联分析。
🎯 考点分析▾
  • 考察主线:本批题考查类别变量编码方式的正确选择及其风险——独热编码用于无序、序数标签编码用于有序;编码方式选错(对有序用独热丢失顺序、对无序用序数引入虚假顺序)是核心风险;非数值/对象格式数据无法训练。
  • 正确答案的共同知识方向:
  • - 独热编码适用于无序(名义)类别,对有序类别误用会丢失顺序信息(风险)。
  • - 序数标签编码适用于有序类别,对无序类别误用会引入虚假顺序关系(风险)。
  • - 含非数值/对象格式的字段(尤其百分比)无法作为训练数据,模型无法处理。
  • - 判断"模型能否处理全部数据"应看字段是否均为数值格式。
  • 常见干扰方向:
  • - 把未做数据缩放、未做聚类分析当作最大风险(实为编码方式错误)。
  • - 把整数编号、浮点等级、布尔字段当作无法处理的问题字段。
  • - 把"字段无关业务目标""存在空值"当作最令人担忧(实为格式/非数值问题)。
  • 场景分布:汽车颜色/产品口味/客户舱位/狗品种等类别编码、大学成绩预测数据集。
📋 考察范围清单▾
  • 独热编码:适用于无序/名义类别;对有序类别使用会丢失顺序信息(风险)。
  • 序数标签编码:适用于有序类别;对无序类别使用会引入虚假顺序关系(风险)。
  • 编码选择原则:按类别是否有序选择独热或序数编码,避免顺序信息失真或虚假顺序。
  • 数值格式要求:训练数据须为数值格式;对象/非数值类型(如百分比存为文本)无法作为训练数据,须先转换。
  • 格式判定:整数、浮点、布尔可处理;对象格式字段是模型无法处理/关联分析的来源。
  • 与数据相关性边界:编码属类别→数值转换,与相关性强弱分析区分。
📄 Tips.pdf 补充对照▾
  • 独热编码:针对无序数据
  • 百分比数据:包含非数值类型数据,无法作为训练数据训练预测模型

→ 打开 PDF 补充页查看全部条目

← 上一个考点数据相关性首页导航下一个考点 →数据质量