🏠 首页
› 数据驱动域 ›
数据编码
📄 PDF 补充页
🗂 返回导航
🗂
数据驱动域 · 考点 数11
数据编码
本页目录:
Tips 笔记解读
笔记缺漏补充
考点分析
考察范围清单
📝 Tips 笔记解读
▾
● 关键词
"独热编码:针对无序数据的" —— 独热编码(one-hot)适用于无序/名义类别变量;可命题:对有序类别误用独热会丢失顺序信息,对无序类别误用序数编码会引入虚假顺序。
● 关键词
"百分比数据(包含非数值类型数据):无法作为训练数据训练预测模型" —— 含非数值类型的百分比数据不能直接作为训练数据,须先转为数值格式。可命题:对象/非数值格式字段无法被模型处理。
以下为考点明显在考但Tips未覆盖的内容,单列作补充:
⚠ 笔记缺漏补充
▾
● 风险
序数标签编码(ordinal/label encoding)适用于有序类别;若用于无序(名义)类别会引入虚假的顺序关系,是最大风险。
● 风险
对本身有序的类别(如舱位等级)使用独热编码会丢失其顺序信息,是风险最大的转换方式。
● 关键词
模型能否处理数据取决于字段格式:整数/浮点/布尔可处理,对象格式(如百分比存为文本)无法处理或做关联分析。
🎯 考点分析
▾
考察主线
:本批题考查类别变量编码方式的正确选择及其风险——独热编码用于无序、序数标签编码用于有序;编码方式选错(对有序用独热丢失顺序、对无序用序数引入虚假顺序)是核心风险;非数值/对象格式数据无法训练。
正确答案的共同知识方向
:
- 独热编码适用于无序(名义)类别,对有序类别误用会丢失顺序信息(风险)。
- 序数标签编码适用于有序类别,对无序类别误用会引入虚假顺序关系(风险)。
- 含非数值/对象格式的字段(尤其百分比)无法作为训练数据,模型无法处理。
- 判断"模型能否处理全部数据"应看字段是否均为数值格式。
常见干扰方向
:
- 把未做数据缩放、未做聚类分析当作最大风险(实为编码方式错误)。
- 把整数编号、浮点等级、布尔字段当作无法处理的问题字段。
- 把"字段无关业务目标""存在空值"当作最令人担忧(实为格式/非数值问题)。
场景分布
:汽车颜色/产品口味/客户舱位/狗品种等类别编码、大学成绩预测数据集。
📋 考察范围清单
▾
独热编码
:适用于无序/名义类别;对有序类别使用会丢失顺序信息(风险)。
序数标签编码
:适用于有序类别;对无序类别使用会引入虚假顺序关系(风险)。
编码选择原则
:按类别是否有序选择独热或序数编码,避免顺序信息失真或虚假顺序。
数值格式要求
:训练数据须为数值格式;对象/非数值类型(如百分比存为文本)无法作为训练数据,须先转换。
格式判定
:整数、浮点、布尔可处理;对象格式字段是模型无法处理/关联分析的来源。
与数据相关性边界
:编码属类别→数值转换,与相关性强弱分析区分。
📄 Tips.pdf 补充对照
▾
独热编码
:针对无序数据
百分比数据
:包含非数值类型数据,无法作为训练数据训练预测模型
→ 打开 PDF 补充页查看全部条目
← 上一个考点
数据相关性
首页导航
下一个考点 →
数据质量
↑