🗂
数据驱动域 · 考点 数6

数据来源

📝 Tips 笔记解读▾
  • ● 风险数据来源 / 知识产权:确认数据来源可靠、许可 —— 用于训练或输入AI的数据必须来源可靠且已获合法许可,未授权或侵权来源会带来知识产权与合规风险。
⚠ 笔记缺漏补充▾
  • 数据来源文档化与可追溯(数据沿袭):训练数据的来源、权利与许可状况应被清晰记录并可证明,来源缺乏文档是重大隐患。
  • 数据使用协议审查:评估知识产权与数据权利合规时,须审查数据使用/许可协议。
  • 数据可靠性与相关性判断:在将源数据用于AI(尤其生成式AI辅助)前,须判断信息是否可靠,并记录预期用途、验证其与业务目标的相关性。
  • 违反使用限制时的处置:发现数据使用限制被违反,应停止使用相关训练数据。
  • 合规新数据源获取:内部数据耗尽时,应优先采用无版权或已获许可的清洁数据源。
🎯 考点分析▾
  • 考察主线:本批题考察"AI所用数据的来源是否合法、可靠、可追溯、与目的相关"。重点识别数据权属/许可风险、来源文档缺失风险,以及选择合规数据源与验证动作。
  • 正确答案的共同知识方向:
  • - 验证数据权利与许可:审计知识产权/数据权利合规应审查数据使用协议;选用能证明训练数据来源与许可的平台或供应商。
  • - 来源可追溯与文档化:训练数据来源缺乏文档是最值得关注的问题;须验证供应商训练数据的来源。
  • - 数据可靠性优先:将源数据输入生成式AI前,首要判断信息是否可靠。
  • - 用途记录与相关性:采集数据时应记录预期用途并验证其与目标的相关。
  • - 违规即停用:发现许可/使用限制被违反应停止使用该训练数据。
  • - 清洁数据源:获取新数据应优先无版权或已授权数据。
  • 常见干扰方向:
  • - 以"数据格式一致性、加密传输、公开存储库"等技术细节替代"来源合法/可追溯"这一根本问题。
  • - 以"暂停平台、人工审核输出、标注输出"等事后处置替代"从源头证明许可"的对策。
  • - 用"延长保留期、爬虫数据、阴影数据"等不合规范来源作为新数据源建议。
  • - 以模型性能/效率日志、SLA惩罚条款等偏离"数据来源权属"的审计关注点。
  • 场景分布:图像生成平台版权图像、外部AI服务提供商、第三方授权数据、公开社媒或网络数据、内部数据源耗尽后的新数据获取、审计中判定是否将数据输入生成式AI。
📋 考察范围清单▾
  • 数据来源合法性与许可:训练/输入AI的数据须来源可靠且取得合法授权,禁止侵权来源。
  • 数据使用/许可协议审查:以协议审查确认知识产权与数据权利合规。
  • 数据来源文档化与可追溯(数据沿袭):训练数据来源与权利应被记录、可证明;来源无文档为重大隐患。
  • 数据可靠性验证:将源数据(尤其输入生成式AI)前须判断其可靠性。
  • 数据预期用途记录与相关性:采集时记录预期用途并验证与业务目标相关。
  • 违规停用原则:发现使用限制/许可被违反应立即停止使用该数据。
  • 合规新数据源:优先采用无版权或已获许可的清洁数据。
  • 供应商训练数据来源验证:使用外部AI供应商时须验证其训练数据来源与许可。
📄 Tips.pdf 补充对照▾
  • 知识产权:确认数据来源可靠、许可

→ 打开 PDF 补充页查看全部条目

← 上一个考点数据完整性首页导航下一个考点 →数据治理