🧠
模型与算法域 · 考点 模4

模型-算法-类型

📝 Tips 笔记解读▾
1. 监督学习相关▾
  • ● 关键词标签(标注信息可能受到人为影响产生偏差)
  • - 考点定义:监督学习依赖已标注样本训练;标签由人工产生,标注过程可能引入主观偏差,需在命题中作为监督学习的固有风险点。
  • ● 好处/优点逻辑回归支持情感分析
  • - 考点定义:逻辑回归作为线性分类器,可用于情感极性等二分类任务,属监督学习典型应用。
  • ● 好处/优点线性回归易于解释、透明度高
  • - 考点定义:线性回归模型结构简单、系数可解读,在需要透明度和可审计性的场景(如信用评估)具有优势。
2. 监督学习具体算法▾
  • ● 关键词决策树:构建树形结构完成分类或回归,是常用监督学习方法
  • - 考点定义:决策树通过树状结构进行划分,是基学习器;可进一步解释特征贡献。
  • ● 好处/优点随机森林:基于决策树的集成学习算法
  • - 考点定义:随机森林通过集成多棵决策树提升泛化,属集成/ Bagging 思路。
  • ● 好处/优点XGBoost(极端梯度提升):基于梯度提升决策树(GBDT),组合多个弱学习器(决策树)构建强学习器
  • - 考点定义:XGBoost 属 Boosting 类集成算法,通过迭代加权弱学习器降低偏差。
3. 非监督学习相关▾
  • ● 风险K均值聚类:受到异常值影响大,依赖相似性
  • - 考点定义:K均值对离群点敏感且聚类结果依赖距离度量和量纲,需数据清洗与归一化前置。
  • ● 关键词隔离森林:针对识别异常数据的技术
  • - 考点定义:隔离森林是无监督异常检测方法,通过随机分割隔离异常点。
  • ● 关键词主成分分析(降维)
  • - 考点定义:PCA 通过线性变换压缩维度,用于降维与去冗余,提升后续模型稳定性。
  • ● 关键词Z分数分布(分布统计)
  • - 考点定义:Z分数用于基于分布的统计异常度量,属非监督式离群识别手段。
4. 强化学习▾
  • ● 关键词反向传播、Q值函数(累计效益)、奖励机制
  • - 考点定义:强化学习通过奖励信号驱动;反向传播支持从输出反馈持续学习;Q值/值函数用于评估累积回报。
  • ● 不完整描述机器学习是神经网络的一种(隐藏层大于等于2),模仿人类思考过程,处理复杂问题
  • - 考点定义(纠正并补全):应为"深度学习/神经网络(含不少于两个隐藏层的网络)是机器学习的一个子集";其通过隐藏层堆叠模拟人类认知、处理复杂问题。命题须按正确层级关系出题,避免颠倒包含关系。
5. 神经网络▾
  • ● 关键词单馈(垃圾邮件识别)、循环(有时序、语言翻译)、卷积(图像识别)
  • - 考点定义:前馈网络适合静态分类;循环网络(RNN)适合时序/序列(如翻译);卷积网络(CNN)适合图像。
  • ● 好处/优点卷积神经网络利用迁移学习:复用预训练模型的卷积层特征提取能力,仅替换并训练自定义分类层,在有限数据集上获得良好效果
  • - 考点定义:数据有限时采用迁移学习复用预训练特征层,是 CNN 的实务最佳实践。
⚠ 笔记缺漏补充▾
  • ● 缺漏机器学习(ML)的通用目标:执行通常须由人类智能才能完成的任务,是区别于"具体算法家族"的上位概念,命题常考。
  • ● 缺漏基于树模型的特征重要性(feature importance):可识别影响模型结论的关键数据属性,是树模型可解释性的重要价值,常作为正确选项方向。
  • ● 缺漏聚类业务解读:聚类结果应按业务语义(如客户细分市场)解读,而非判定算法"失败",命题常以此区分正确/错误应对。
🎯 考点分析▾
考察主线▾

本批次系统考察"在给定业务场景下应选何种学习范式或算法",以及"各算法的固有特征、优势与风险"。重点覆盖监督/无监督/强化/神经网络四大范式的识别,以及具体算法(K均值、隔离森林、线性回归、逻辑回归、树模型、CNN/RNN)的适用条件与局限。审计员视角贯穿始终:关注可解释性、透明度、异常值敏感、偏见消除等治理属性。

正确答案的共同知识方向▾
  • 监督学习必须使用已标注/带标签的训练样本。
  • 无监督学习(聚类、异常检测、降维)用于处理无标签数据、发现潜在模式。
  • K均值属于无监督,可消除人工标注的主观性与偏见,但对异常值敏感、依赖相似性度量。
  • 隔离森林是专门的无监督异常检测技术。
  • 降维技术可降低高维非结构化文本导致无监督模型失效的风险。
  • 强化学习通过与环境交互和奖励反馈持续优化动作(如机械臂);反向传播支撑从输出持续学习;值函数/Q值解决累积效益问题。
  • 神经网络/深度学习通过隐藏层模拟人类决策、处理复杂海量问题。
  • 隐藏层承担特征提取职能。
  • 循环网络因顺序/时序处理擅长语言翻译任务。
  • 卷积网络擅长图像;数据有限时迁移学习为最佳实务。
  • 线性回归因易解释、透明,最适于需高透明度的信用评分等场景。
  • 逻辑回归可支撑情感分析类的分类训练。
  • 树模型(决策树/随机森林/XGBoost)可输出特征重要性以识别关键驱动属性。
  • 机器学习的总体目标是执行需人类智能的任务(上位概念)。
常见干扰方向▾
  • 把"无监督"说成"需要监督/标注",或反之。
  • 声称 K均值对异常值不敏感、对数据清洗需求少。
  • 将强化学习的"累积效益"误归于奖励函数、代理功能或政策职能,而非值函数。
  • 把机器学习与神经网络作反向包含(误认为神经网络是机器学习的子集之外,或颠倒层级)。
  • 在需高透明度场景推荐黑箱模型(如树模型、K均值)而非线性回归。
  • 把聚类结果异常判定为"算法失败"而非"潜在有效细分"。
  • 在数据有限时推荐重复数据集、简单划分而非迁移学习。
场景分布▾
  • 审计文档/模型审查(审计员审阅算法文档、特征重要性、聚类工具)
  • 制造业机械臂/机器人持续学习
  • 法务/合同库相似性分析与客户评论挖掘
  • 信用评分与透明度要求场景
  • 客服反馈生成标准化报告(边缘出现在自然语言考点)
  • 网络安全/异常识别
📋 考察范围清单▾
  • 监督学习:依赖已标注样本训练;标签质量受人工标注偏差影响。
  • 无监督学习:在无标签数据中发现结构/模式,含聚类、异常检测、降维三大用途。
  • K均值聚类:无监督聚类;对异常值敏感、依赖距离/相似性度量、需预设簇数;优势是消除标注主观性与偏见。
  • 隔离森林:无监督异常检测技术,识别离群数据。
  • 主成分分析/降维:压缩维度、处理高维数据、提升无监督模型稳定性。
  • Z分数/分布统计:基于分布的统计离群度量手段。
  • 强化学习:智能体通过环境交互与奖励反馈持续优化动作;反向传播支撑从输出不断学习。
  • 值函数/Q值函数:用于评估强化学习中的累积回报/长期效益(区别于奖励函数本身)。
  • 奖励函数:应与风险指标保持一致,防止奖励破解。
  • 神经网络/深度学习:含≥2个隐藏层的网络,模拟人类认知、处理复杂问题;是机器学习的子集而非相反。
  • 隐藏层:执行特征提取,是深度学习模拟人类决策的核心层。
  • 循环神经网络(RNN):擅长时序/顺序数据(如语言翻译)。
  • 卷积神经网络(CNN):擅长图像识别。
  • 迁移学习:复用预训练模型特征层、仅训练自定义层,适配有限数据集(CNN 最佳实践)。
  • 线性回归:高度可解释、透明,适合需审计/透明的信用评分等场景。
  • 逻辑回归:可用于情感分析等二分类任务。
  • 决策树:通过树形结构完成分类/回归的基础监督算法。
  • 随机森林:基于决策树的集成(Bagging)算法。
  • XGBoost/梯度提升:基于决策树的 Boosting 集成,组合弱学习器成强学习器。
  • 树模型特征重要性:可识别影响模型结论的关键数据属性,是可解释性价值点。
  • 聚类结果业务解读:按业务语义(如客户细分)解读,而非判定算法失败。
  • 机器学习通用目标:执行通常需人类智能的任务(上位概念,区别于具体算法)。
📄 Tips.pdf 补充对照▾
  • 监督学习:标签(标注信息可能受人为影响产生偏差)、回归
  • 逻辑回归:支持情感分析
  • 线性回归:易于解释、透明度
  • 决策树:构建树形结构完成分类或回归,常用监督学习方法
  • 随机森林:基于决策树的集成学习算法
  • XGBoost:基于梯度提升决策树(GBDT),组合多个弱学习器构建强学习器
  • 非监督学习-K均值:聚类,受异常值影响大、依赖相似性
  • 非监督学习-隔离森林:针对识别异常数据的技术
  • 非监督学习-主成分分析:降维
  • 分布统计:Z 分数分布
  • 强化学习:反向传播、Q 值函数(累计效益)、奖励机制
  • 机器学习定位:机器学习是神经网络的一种(隐藏层 ≥2),模仿人类思考、处理复杂问题
  • 神经网络-单馈:垃圾邮件识别
  • 神经网络-循环:有时序、语言翻译
  • 神经网络-卷积:图像识别;可利用迁移学习复用预训练卷积层特征提取能力,仅替换并训练自定义分类层

→ 打开 PDF 补充页查看全部条目

← 上一个考点性能指标首页导航下一个考点 →模型泄露