以下逐条列出 Tips 笔记中与本考点相关的内容,并标注类型、补全为可命题的考点定义。
- ● 风险/方法"缓解偏见的方法:定期测试 + 调整参数" —— 偏见的运营层缓解依赖建立"定期测试系统是否存在偏差 + 据结果调参"的常态化流程,而非一次性动作。
- ● 好处/方法"彻底解决偏见的方法:训练数据的代表性/维度,真实数据分布、重新训练/校准,过采样,欠采样" —— 根除偏见的根本路径在训练数据:提升代表性、贴合真实分布、重新训练或校准、对少数类过采样或对多数类欠采样。
- ● 关键词"检测偏见的方法:分层切片分析、差异性影响分析、特征差异评估" —— 命题的检测类考点固定落在三者:按子群体分层切片、差异性影响(disparate impact)分析、特征差异评估。
- ● 关键词"偏见的典型词汇:公平/敏感属性/民族/种族/年龄/性别/地域/面部识别/群体" —— 题干出现这些词通常指向偏见/公平考点;敏感属性即受保护群体特征。
- ● 不完整描述"准确率:无法评估是否存在偏见" —— 需补全:单一总体准确率不能判断偏见,但若改为"跨子群体(分层)比较各群体的准确率范围是否相近",则可作无偏见的证据;命题常设"仅靠总体高准确率=无偏见"为陷阱。
- ● 关键词"典型的偏见场景:招聘" —— 招聘筛选是偏见最高频业务场景,信贷、保险、医疗、动态定价、面部识别也常出现。
- ● 风险"错误的处理偏见的办法:增加数量、加权重" —— 单纯增加数据量或简单加权重不是根本解法(注意:配合分层划分的"类别加权损失"属可接受技术,与"盲目加权重"不同,命题会区分)。
- ● 关键词"异常检测流程:偏差" —— 异常检测流程本身须能识别会引致训练数据偏差的异常。
- ● 关键词"代理变量:指表面非敏感的特征(例如:邮编/地址)与种族/性别等保护属性高度相关,模型利用其间接做出歧视性决策" —— 代理变量是隐性歧视核心机制;审计须评估剩余特征是否与已排除的敏感属性相关。
- ● 关键词"80%法则(4/5 Rule):是判定差异性影响(Disparate Impact)的标准阈值。当受保护群体的通过率低于最高群体通过率的 80% 时,即构成了非法的统计偏见与隐性歧视" —— 差异性影响的法定量化阈值,常作计算/判定题。
- ● 关键词"平等机会(Equal Opportunity):是算法公平性的核心统计标准之一,要求不同受保护群体之间的真阳性率或假阴性率保持相等" —— 公平性统计标准的另一支柱,与差异性影响并列。