12/13 年第 2 学期《数据挖掘与知识发现》期末考试试卷及答案一、什么是数据挖掘
什么是数据仓库
并简述数据挖掘的步骤
(20 分)数据挖掘是从大量数据中提取或发现(挖掘)知识的过程
数据仓库是面对主题的、集成的、稳定的、不同时间的数据集合,用于支持经营管理中的决策制定过程
步骤: 1)数据清理 (消除噪声或不一致数据) 2) 数据集成 (多种数据源可以组合在一起) 3 ) 数据选择 (从数据库中检索与分析任务相关的数据) 4 ) 数据变换 (数据变换或统一成适合挖掘的形式,如通过汇总或聚集操作) 5) 数据挖掘 (基本步骤,使用智能方法提取数据模式) 6) 模式评估 (根据某种兴趣度度量,识别表示知识的真正有趣的模式;) 7) 知识表示 (使用可视化和知识表示技术,向用户提供挖掘的知识) 二、元数据的定义是什么
元数据包括哪些内容
(20 分) 元数据是关于数据的数据
在数据仓库中, 元数据是定义仓库对象的数据
元数据包括 :数据仓库结构的描述,包括仓库模式、视图、维、分层结构、导出数据的定义, 以及数据集市的位置和内容
操作元数据,包括数据血统(移植数据的历史和它所使用的变换序列)、数据流通(主动的、档案的或净化的)、管理信息(仓库使用统计量、错误报告和审计跟踪)
汇总算法,包括度量和维定义算法, 数据所处粒度、划分、主题领域、聚集、汇总、预定义的查询和报告
由操作环境到数据仓库的映射,包括源数据库和它们的内容,网间连接程序描述, 数据划分, 数据提取、清理、转换规则和缺省值, 数据刷新和净化规则, 安全 (用户授权和存取控制)
关于系统性能的数据,刷新、更新定时和调度的规则与更新周期,改善数据存取和检索性能的索引和配置
商务元数据,包括商务术语和定义, 数据拥有者信息和收费策略
三、在 O L A P 中,如何使用概念分层
请解释多维数据模型中的 OLAP