深入了解数据挖掘那些事-开课吧

大数据时代已经来临,利用网络和生活中产生的大量数据发现问题并创造价值,使得数据挖掘成了一门新的学科和技术。今天这篇文章,将带你一起了解数据挖掘的那些事儿。

深入了解数据挖掘那些事-开课吧

数据挖掘到底是什么?

官方的定义,数据挖掘(Data Mining)就是从大量的、不完全的、有噪声的、模糊的、随机的数据中提取隐含在其中的、人们事先不知道的、但又是潜在有用的信息和知识的过程。

通俗易懂地说,数据挖掘就是从大量的数据中,发现那些我们想要的“东西”。

深入了解数据挖掘那些事-开课吧

这个“东西”具体指什么?

一种被称为预测任务。

也就是说给了一定的目标属性,让去预测目标的另外一特定属性。如果该属性是离散的,通常称之为'分类’,而如果目标属性是一个连续的值,则称之为'回归’。

另一种被称为描述任务。

这是指找出数据间潜在的联系模式。比方说两个数据存在强关联的关系,像大数据分析发现的一个特点:买尿布的男性通常也会买点啤酒,那么商家根据这个可以将这两种商品打包出售来提高业绩。另外一个非常重要的就是聚类分析,这也是在日常数据挖掘中应用非常非常频繁的一种分析,旨在发现紧密相关的观测值组群,可以在没有标签的情况下将所有的数据分为合适的几类来进行分析或者降维。

其他的描述任务还有异常检测,其过程类似于聚类的反过程,聚类将相似的数据聚合在一起,而异常检测将离群太远的点给剔除出来。

(0)

相关推荐