什么是数据挖掘？数据挖掘的一般过程是怎样的？

大统计数据黄金时代已经到来，H55N和生活中产生的大批统计数据辨认出问题并缔造价值，使统计数据挖掘成了两门捷伊学科专业和技术。所以甚么是大统计数据挖掘，统计数据挖掘的操作过程是甚么，以及它的具体内容演算法又有什么样?今天这首诗，将带你一同

01、具体来说，统计数据挖掘究竟是甚么?

非官方的表述，统计数据挖掘(Data Mining)就从大批的、不完全的、有噪音的、模糊不清的、乱数的统计数据中抽取暗含在其中的、人们预先不知道的、但又是潜在性管用的重要信息和科学知识的操作过程。

易懂的说，统计数据挖掘就从大批的统计数据中，辨认出那些我们想的“小东西”。

02 那个“小东西”具体内容指甚么?

一类被称作预估各项任务。

换句话说给了一定的最终目标特性，让去预估最终目标的除此之外一某一特性。假如该特性是对数的，通常来说称作‘进行分类’，而假如最终目标特性是两个连续的值，则称作‘重回’。

另一类被称作叙述各项任务。

这是指找寻统计数据间潜在性的联络商业模式。比如说两个统计数据存在强关连的关系，像大统计数据挖掘辨认出的两个特征：买卫生巾的女性通常来说也会买些咖啡，所以店家根据那个能将这三种货品装箱转卖来提高业绩。除此之外两个十分重要的就是控制点预测，这也是在日常生活统计数据挖掘中应用领域十分十分频密的一类预测，意在辨认出密切相关的探测值西凯努瓦县，能在没有条码的情况下将所有的统计数据分为最合适的四类来进行预测或者最优化。

其他的叙述各项任务还有极度检验，其操作过程近似于控制点的反操作过程，控制点将相近的统计数据裂解在一同，而极度检验将甲草太长的点给剔除出来。

03 统计数据挖掘的通常操作过程包括以下几个方面：

统计数据预处理统计数据挖掘后处理

，可能有的统计数据还存在一些缺失值或者无效值，假如不经处理直接将这些‘脏’统计数据放到模型中去跑，十分容易导致模型计算的失败或者可用性很差，所以统计数据预处理是统计数据挖掘操作过程中都不可或缺的一步。

至于统计数据挖掘和后处理相对来说就容易理解多了。完成了统计数据的预处理，我们通常来说进行特征构造，然后放到某一的模型中去计算，利用某种标准去评判不同模型或组合模型的表现，最后确定两个最最合适的模型用于后处理。后处理的操作过程相当于已经辨认出了那个我们想找到的结果，然后去应用领域它或者用最合适的方式将其表示出来。

这里涉及到统计数据挖掘的一系列演算法，主要分为进行分类演算法，控制点演算法和关连规则三大类，这三类基本上涵盖了目前商业市场对演算法的所有需求。而这三类里，最为经典的则是下面这十大演算法。