数据挖掘课后题答案VIP免费

下载本文档

阅读 141
下载 2
格式 pdf
大小 132.96 KB
约21页
2024-12-09 发布于天津市
收藏
评论
点赞(0)
海报
举报

1/21页

2/21页

3/21页

在线预览已结束，请下载后查看完整版，加入VIP享文档下载特权

/21

文本预览下载提示常见问题

. 可编辑文本数据挖掘——概念概念与技术Jiawei Han Micheline Kamber 著范明孟晓峰译第 1章引言1.1 什么是数据挖掘？在你的回答中，针对以下问题：1.2 1.6 定义下列数据挖掘功能：特征化、区分、关联和相关分析、预测聚类和演变分析。使用你熟悉的现实生活的数据库，给出每种数据挖掘功能的例子。解答：?特征化是一个目标类数据的一般特性或特性的汇总。例如，学生的特征可被提出，形成所有大学的计算机科学专业一年级学生的轮廓，这些特征包括作为一种高的年级平均成绩(GPA：Grade point aversge) 的信息，还有所修的课程的最大数量。?区分是将目标类数据对象的一般特性与一个或多个对比类对象的一般特性进行比较。例如，具有高 GPA 的学生的一般特性可被用来与具有低 GPA 的一般特性比较。最终的描述可能是学生的一个一般可比较的轮廓，就像具有高 GPA 的学生的 75%是四年级计算机科学专业的学生，而具有低 GPA 的学生的 65%不是。?关联是指发现关联规则，这些规则表示一起频繁发生在给定数据集的特征值的条件。例如，一个数据挖掘系统可能发现的关联规则为：major(X, “computing science”) ? owns(X, “ personal computer ”) [support=12%, confid ence=98%]其中， X 是一个表示学生的变量。这个规则指出正在学习的学生，12%（支持度）主修计算机科学并且拥有一台个人计算机。这个组一个学生拥有一台个人电脑的概率是 98%（置信度，或确定度）。?分类与预测不同，因为前者的作用是构造一系列能描述和区分数据类型或概念的模型（或功能），而后者是建立一个模型去预测缺失的或无效的、并且通常是数字的数据值。它们的相似性是他们都是预测的工具：分类被用作预测目标数据的类的标签，而预测典型的应用是预测缺失的数字型数据的值。. 可编辑文本?聚类分析的数据对象不考虑已知的类标号。对象根据最大花蕾内部的相似性、最小化类之间的相似性的原则进行聚类或分组。形成的每一簇可以被看作一个对象类。聚类也便于分类法组织形式，将观测组织成类分层结构，把类似的事件组织在一起。?数据延边分析描述和模型化随时间变化的对象的规律或趋势，尽管这可能包括时间相关数据的特征化、区分、关联和相关分析、分类、或预测，这种分析的明确特征包括时间序列数据分析、序列或周期模式匹配、和基于相似性的数据分析1.3 1.9 列举并描述说明数据挖...

1、当您付费下载文档后，您只拥有了使用权限，并不意味着购买了版权，文档只能用于自身使用，不得用于其他商业用途（如 [转卖]进行直接盈利或[编辑后售卖]进行间接盈利）。
2、本站所有内容均由合作方或网友上传，本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺！文档内容仅供研究参考，付费前请自行鉴别。
3、如文档内容存在违规，或者侵犯商业秘密、侵犯著作权等，请点击“违规举报”。

碎片内容

数据挖掘课后题答案

可编辑文本数据挖掘——概念概念与技术Jiawei Han Micheline Kamber 著范明孟晓峰译第 1章引言1

1 什么是数据挖掘

在你的回答中，针对以下问题：1

6 定义下列数据挖掘功能：特征化、区分、关联和相关分析、预测聚类和演变分析

使用你熟悉的现实生活的数据库，给出每种数据挖掘功能的例子

特征化是一个目标类数据的一般特性或特性的汇总

例如，学生的特征可被提出，形成所有大学的计算机科学专业一年级学生的轮廓，这些特征包括作为一种高的年级平均成绩(GPA：Grade point aversge) 的信息，还有所修的课程的最大数量

区分是将目标类数据对象的一般特性与一个或多个对比类对象的一般特性进行比较

例如，具有高 GPA 的学生的一般特性可被用来与具有低 GPA 的一般特性比较

最终的描述可能是学生的一个一般可比较的轮廓，就像具有高 GPA 的学生的 75%是四年级计算机科学专业的学生，而具有低 GPA 的学生的 65%不是

关联是指发现关联规则，这些规则表示一起频繁发生在给定数据集的特征值的条件

例如，一个数据挖掘系统可能发现的关联规则为：major(X, “computing science”)

owns(X, “ personal computer ”) [support=12%, confid ence=98%]其中， X 是一个表示学生的变量

这个规则指出正在学习的学生，12%（支持度）主修计算机科学并且拥有一台个人计算机

这个组一个学生拥有一台个人电脑的概率是 98%（置信度，或确定度）

分类与预测不同，因为前者的作用是构造一系列能描述和区分数据类型或概念的模型（或功能），而后者是建立一个模型去预测缺失的或无效的、并且通常是数字的数据值

它们的相似性是他们都是预测

文库响当当 + 关注: 实名认证
内容提供者

该用户很懒，什么也没介绍

收藏店铺进入空间

数据挖掘课后题答案VIP免费

数据挖掘课后题答案

您可能关注的文档

相关文档

热门下载

相关标签