数据挖掘新人必看:类别与分析步骤的基础知识


数据挖掘旨在从大量的、不完全的、有噪声的、模糊的、随机的数据中, 提取隐含在其中的、人们事先不知道的、但又是潜在有用的信息和知识。还有很多和这一术语相近似的术语,如从数据库中发现知识、数据分析、数据融合以及决策支持等。

 

基本任务:数据挖掘的任务主要是关联分析、聚类分析、分类、预测、时序模式和偏差分析等。


数据挖掘新人必看:类别与分析步骤的基础知识


1. 关联分析 association analysis  

 

关联规则挖掘由Rakesh Apwal等人首先提出。两个或两个以上变量的取值之间存在的规律性称为关联。数据关联是数据库中存在的一类重要的、可被发现的知识。关联分为简单关联、时序关联和因果关联。关联分析的目的是找出数据库中隐藏的关联网。一般用支持度和可信度两个阀值来度量关联规则的相关性,还不断引入兴趣度、相关性等参数,使得所挖掘的规则更符合需求。


2. 聚类分析 clustering

 

聚类是把数据按照相似性归纳成若干类别,同一类中的数据彼此相似,不同类中的数据相异。聚 类分析可以建立宏观的概念,发现数据的分布模式,以及可能的数据属性之间的相互关系。


3. 分类 classification

 

分类就是找出一个类别的概念描述,它代表了这类数据的整体信息,即该类的内涵描述,并用这 种描述来构造模型,一般用规则或决策树模式表示。分类是利用训练数据集通过一定的算法而求得分类规则。分类可被用于规则描述和预测。


数据挖掘新人必看:类别与分析步骤的基础知识


4. 预测 predication

 

预测是利用历史数据找出变化规律,建立模型,并由此模型对未来数据的种类及特征进行预测。预测关心的是精度和不确定性,通常用预测方差来度量。

 

5. 时序模式 time-series pattern

 

时序模式是指通过时间序列搜索出的重复发生概率较高的模式。与回归一样,它也是用己知的数据预测未来的值,但这些数据的区别是变量所处时间的不同。


6. 偏差分析 deviation

 

在偏差中包括很多有用的知识,数据库中的数据存在很多异常情况,发现数据库中数据存在的异常情况是非常重要的。偏差检验的基本方法就是寻找观察结果与参照之间的差别。


数据挖掘新人必看:类别与分析步骤的基础知识


数据挖掘的过程可以分为6个步骤:


01. 理解业务:从商业的角度理解项目目标和需求,将其转换成一种数据挖掘的问题定义,设计出达到目标的一个初步计划。

02. 理解数据:收集初步的数据,进行各种熟悉数据的活动。包括数据描述,数据探索和数据质量验证等。

03. 准备数据:将最初的原始数据构造成最终适合建模工具处理的数据集。包括表、记录和属性的选择,数据转换和数据清理等。

04. 建模:选择和应用各种建模技术,并对其参数进行优化。

05. 模型评估:对模型进行较为彻底的评价,并检查构建模型的每个步骤,确认其是否真正实现了预定的商业目的。

06. 模型部署:创建完模型并不意味着项目的结束,即使模型的目的是为了增进对数据的了解,所获得的知识也要用一种用户可以使用的方式来组织和表示。通常要将活动模型应用到决策制订的过程中去。该阶段可以简单到只生成一份报告,也可以复杂到在企业内实施一个可重复的数据挖掘过程。控制得到普遍承认。

数据挖掘新人必看:类别与分析步骤的基础知识

人工智能研究领域的科学家普遍认为,下一个人工智能应用的重要课题之一,将是以机器学习算法为主要工具的大规模的数据库知识发现。尽管数据挖掘还是一个很新的研究课题,但它所固有的为企业创造巨大经济效益的潜力,已使其很快有了许多成功的应用,具有代表性的应用领域有市场预测、投资、制造业、银行、通讯等。

数据挖掘汇集了来自机器学习、模式识别、数据库、统计学、人工智能以及管理信息系统等各学科的成果,多学科的相互交融和相互促进,使得这一新学科得以蓬勃发展,而且已初具规模。

END



任务广场免费收集样本数据👇

数据挖掘新人必看:类别与分析步骤的基础知识


数据挖掘新人必看:类别与分析步骤的基础知识
数据挖掘新人必看:类别与分析步骤的基础知识
“阅读原文”进入官网免费使用~

发布者:调研工厂,转载请注明出处:https://baike.survey.work/0957a9807f/

(0)
打赏 支付宝扫一扫 支付宝扫一扫
上一篇 2022年12月8日 下午1:53
下一篇 2022年12月11日 上午6:27

相关推荐

  • 解读“调研工厂”应用场景(三):图解明察暗访操作流程

    大家心心念的明察暗访操作图解来喽 拿去收藏吧~    一、任务创建 1.注册登录【调研工厂】,点击“明察暗访”模块,然后点击“新建项目” 2.根据自身所需的检查项目,设置检查流程(下面演示的是第一种流程) 3.填写项目名称和项目说明,然后添加需要检查的点位(注意左边栏有详细的介绍和示例) 4.添加完一级检查点位后,可根据一级点位添加下级检…

    2022年12月18日
    5800
  • 百科 | 如何做好来源分析工作?先明确三大痛点

    在互联网时代里,流量就是钱,流量是硬通货 ,产品都希望能控制更多流量,但流量不是凭空而来的,不论是线下邀请、口碑传播,还是投放推广,都是获取的过程 。 客户来源是指客户得知企业和产品的来源渠道,比如某客户通过朋友介绍来购买公司产品,“朋友介绍”就是客户来源,再比如某客户通过您在知乎的问答了解您的产品并进入官网,“知乎问答”就是客户来源。 每个企业的发展历程不…

    2022年11月24日
    6200
  • 调研工厂手把手教你使用单变量统计图表

    俗话说的好,“字不如表,表不如图”、“有图有真相,一图胜千言”……何况人是视觉动物,取悦了眼球,其他的就好说多了。想要做好调查问卷的统计分析,首先要做的是将调查问卷的数据结果,好好做一番整理和展现。 如今无论是论文或报告,单靠文字是不够的,正确运用统计图表才能达到最后的效果。统计图大致可分为:单变量图、双变量图、多变量图等,具体分类如…

    2023年3月20日
    1900
  • 解读“调研工厂”应用场景(三):图解明察暗访操作流程

    大家心心念的明察暗访操作图解来喽 拿去收藏吧~    一、任务创建 1.注册登录【调研工厂】,点击“明察暗访”模块,然后点击“新建项目” 2.根据自身所需的检查项目,设置检查流程(下面演示的是第一种流程) 3.填写项目名称和项目说明,然后添加需要检查的点位(注意左边栏有详细的介绍和示例) 4.添加完一级检查点位后,可根据一级点位添加下级检…

    2022年12月18日
    10800
  • 百科 | 访问员必看:最详细的用户访问流程(二)

    访谈前准备: 三、场地选择深度访谈可以在很多地方进行。大部分考虑的是请用户到公司来,然后使用公司内部的会议室进行访谈,鉴于大多数公司的会议室很难订的情况,可以在一周内提前预定,灵活应变应付10~20人左右的访谈应该不是难事。另外需要注意的是,场所的选择也会对访谈有些影响,访谈环境对比,会议室就会给用户很强的压迫感。应该尽量塑造温馨舒适的氛围以消除用户的紧张感…

    2022年12月11日
    5800

客服热线:

138-2016-1375

企业 VIP 入驻

柴女士:185-1182-1229

工作时间:周一至周五,9:00-18:00,节假日休息

关注微信