🧠
模型与算法域 · 考点 模3

性能指标

📝 Tips 笔记解读▾
  • ● 风险 / 关键词准确度陷阱:极不平衡数据下高 Accuracy 掩盖对稀有正例完全无识别能力——高准确率具欺骗性。
  • ● 关键词偏见:差异性影响比率——偏见度量用差异性影响比率。
  • ● 关键词性能平衡指标:F1 分数——不平衡数据用 F1 综合精确率与召回率。
  • ● 关键词误报多(假阳性多):精确度低——误报对应精确率下降。
  • ● 关键词漏报多(假阴性多):召回率低——漏报对应召回率下降。
  • ● 关键词召回率:医院漏诊、反洗钱漏筛——召回率适用漏检代价高场景。
  • ● 关键词精确度:合法交易被拦截、被投诉——精确率适用误报代价高场景。
  • ● 关键词F1 / 混淆矩阵:综合精确率与召回率,是真实性能标准。
  • ● 关键词PR-AUC:正例极稀缺场景比 ROC-AUC 更准确。
  • ● 关键词ROC-AUC:正负样本差距不大时优先用。

补全为可命题考点定义:性能评估须按业务风险(漏报 / 误报)与数据分布(平衡 / 不平衡)选用正确指标,避免单一 Accuracy 误导,并用混淆矩阵 / F1 综合判断。

⚠ 笔记缺漏补充▾

考点明显考查但笔记未覆盖的知识点:

  • 模型卡解读:能根据模型卡中的准确率、精确率、召回率、F1 正确得出业务结论(笔记未提模型卡)。
  • 业务目标度量:用性能基准测试与需求可追溯性证明 AI 达成业务目标(速度、违约率等),笔记未覆盖「业务目标达成证据」。
🎯 考点分析▾
  • 考察主线:本批题考查依业务场景选择正确性能指标(召回率 / 精确率 / F1 / 混淆矩阵 / 基准测试),理解不平衡数据下的准确度陷阱,并能解读模型卡与混淆矩阵。
  • 正确答案的共同知识方向:
  • - 故障 / 疾病 / 欺诈漏检场景关注召回率(漏报风险)。
  • - 误报 / 合法拦截场景关注精确率。
  • - 不平衡数据用 F1 分数综合,避免单一 Accuracy 陷阱。
  • - 混淆矩阵是评估分类性能、展示预测结果的核心工具。
  • - 业务目标达成用性能基准测试 + 需求可追溯性证明。
  • - NLP 可靠性用面向召回的概要评估指标;模型卡需正确解读指标含义。
  • 常见干扰方向:
  • - 在不平衡 / 故障场景用准确性作主指标。
  • - 用特异性、均方误差、ROC 等不匹配指标。
  • - 把重训练假阴性、限制交易量、员工培训当漏报管理主要手段。
  • - 把行业符合百分比、模型更新频率、场景总数等业务无关计数当 KPI。
  • - 混淆矩阵用途误解为回归 / 重训练需求。
  • 场景分布:风力发电故障预测、金融欺诈检测、NLP、制造预测性维护、信贷审批、模型卡解读、电网预测性维护。
📋 考察范围清单▾
  • 准确度陷阱:极不平衡数据下高 Accuracy 掩盖对稀有正例失效,不能作主指标。
  • 召回率(Recall):衡量漏报 / 假阴性,适用漏检代价高场景(故障、疾病漏诊、反洗钱漏筛)。
  • 精确率(Precision):衡量误报 / 假阳性,适用误报代价高场景(合法交易被拦截、被投诉)。
  • F1 分数:精确率与召回率调和平均,不平衡数据的平衡性能 KPI。
  • 混淆矩阵:展示 TP / FP / TN / FN,是评估分类模型性能与解读预测结果的核心工具。
  • 模型卡解读:能据模型卡中准确率 / 精确率 / 召回率 / F1 正确得出业务结论。
  • 业务目标度量:用性能基准测试与需求可追溯性证明 AI 达成业务目标(速度、违约率等)。
  • NLP 指标:可靠性可用面向召回的概要评估指标(如 ROUGE)。
  • 指标选择原则:依业务风险(漏报 vs 误报)与业务目标选定 KPI,而非统一用 accuracy。
  • PR-AUC vs ROC-AUC:极不平衡用 PR-AUC,样本均衡用 ROC-AUC。
📄 Tips.pdf 补充对照▾
  • 准确度陷阱:极不平衡数据下,高 Accuracy 掩盖模型对稀有正例无识别能力
  • 偏见:差异性影响比率
  • 性能平衡:F1 分数
  • 误报多(假阳性多):精确度低
  • 漏报多(假阴性多):召回率低
  • 召回率场景:医院漏诊病人、反洗钱漏筛
  • 精确度场景:合法交易被拦截、被投诉
  • F1 / 混淆矩阵:综合精确率与召回率,或 PR-AUC,是衡量模型性能的真实标准
  • PR-AUC:正例稀缺(极不平衡)场景专注于少数类识别质量,比 ROC-AUC 更准确
  • ROC-AUC:正负样本数量差距不大时优先用

→ 打开 PDF 补充页查看全部条目

← 上一个考点幻觉首页导航下一个考点 →模型-算法-类型