大数据挖掘流程及方法
数据挖掘(Data Mining)是从大量的、不完全的、有噪声的、模糊的、随机的数据中提取隐含在其中的、人们事先不知道的、但又是潜在有用的信息和知识的过程。
一、数据挖掘对象
根据信息存储格式,用于挖掘的对象有关系数据库、面向对象数据库、数据仓库、文本数据源、多媒体数据库、空间数据库、时态数据库、异质数据库以及Internet等。
二、数据挖掘流程
定义问题:清晰地定义出业务问题,确定数据挖掘的目的。
数据准备:数据准备包括:选择数据–在大型数据库和数据仓库目标中 提取数据挖掘的目标数据集;数据预处理–进行数据再加工,包括检查数据的完整性及数据的一致性、去噪声,填补丢失的域,删除无效数据等。
数据挖掘:根据数据功能的类型和和数据的特点选择相应的算法,在净化和转换过的数据集上进行数据挖掘。
结果分析:对数据挖掘的结果进行解释和评价,转换成为能够最终被用户理解的知识。
三、数据挖掘分类
直接数据挖掘:目标是利用可用的数据建立一个模型,这个模型对剩余的数据,对一个特定的变量(可以理解成数据库中表的属性,即列)进行描述。
间接数据挖掘:目标中没有选出某一具体的变量,用模型进行描述;而是在所有的变量中建立起某种关系。
四、数据挖掘的方法
神经网络方法
神经网络由于本身良好的鲁棒性、自组织自适应性、并行处理、分布存储和高度容错等特性非常适合解决数据挖掘的问题,因此近年来越来越受到人们的关注。
遗传算法
遗传算法是一种基于生物自然选择与遗传机理的随机搜索算法,是一种仿生全局优化方法。遗传算法具有的隐含并行性、易于和其它模型结合等性质使得它在数据挖掘中被加以应用。
决策树方法
决策树是一种常用于预测模型的算法,它通过将大量数据有目的分类,从中找到一些有价值的,潜在的信息。它的主要优点是描述简单,分类速度快,特别适合大规模的数据处理。
粗集方法
粗集理论是一种研究不精确、不确定知识的数学工具。粗集方法有几个优点:不需要给出额外信息;简化输入信息的表达空间;算法简单,易于操作。粗集处理的对象是类似二维关系表的信息表。
覆盖正例排斥反例方法
它是利用覆盖所有正例、排斥所有反例的思想来寻找规则。首先在正例集合中任选一个种子,如果你对大数据开发感兴趣,想系统学习大数据的话,可以加入大数据技术学习交流扣扣君羊:522189307,欢迎添加,了解课程介绍,获取学习资源。到反例集合中逐个比较。与字段取值构成的选择子相容则舍去,相反则保留。按此思想循环所有正例种子,将得到正例的规则(选择子的合取式)。
统计分析方法
在数据库字段项之间存在两种关系:函数关系和相关关系,对它们的分析可采用统计学方法,即利用统计学原理对数据库中的信息进行分析。可进行常用统计、回归分析、相关分析、差异分析等。
模糊集方法
即利用模糊集合理论对实际问题进行模糊评判、模糊决策、模糊模式识别和模糊聚类分析。系统的复杂性越高,模糊性越强,一般模糊集合理论是用隶属度来刻画模糊事物的亦此亦彼性的。
五、数据挖掘任务
1、关联分析
两个或两个以上变量的取值之间存在某种规律性,就称为关联。数据关联是数据库中存在的一类重要的、可被发现的知识。关联分为简单关联、时序关联和因果关联。关联分析的目的是找出数据库中隐藏的关联网。一般用支持度和可信度两个阀值来度量关联规则的相关性,还不断引入兴趣度、相关性等参数,使得所挖掘的规则更符合需求。
2、聚类分析
聚类是把数据按照相似性归纳成若干类别,同一类中的数据彼此相似,不同类中的数据相异。聚类分析可以建立宏观的概念,发现数据的分布模式,以及可能的数据属性之间的相互关系。
3、分类
分类就是找出一个类别的概念描述,它代表了这类数据的整体信息,即该类的内涵描述,并用这种描述来构造模型,一般用规则或决策树模式表示。分类是利用训练数据集通过一定的算法而求得分类规则。分类可被用于规则描述和预测。
4、预测
预测是利用历史数据找出变化规律,建立模型,并由此模型对未来数据的种类及特征进行预测。预测关心的是精度和不确定性,通常用预测方差来度量。
5、时序模式
时序模式是指通过时间序列搜索出的重复发生概率较高的模式。与回归一样,它也是用己知的数据预测未来的值,但这些数据的区别是变量所处时间的不同。
6、偏差分析
在偏差中包括很多有用的知识,数据库中的数据存在很多异常情况,发现数据库中数据存在的异常情况是非常重要的。偏差检验的基本方法就是寻找观察结果与参照之间的差别。
大数据挖掘流程及方法相关推荐
- 基于电子病历的临床医疗大数据挖掘流程与方法
基于电子病历的临床医疗大数据挖掘流程与方法 阮彤1, 高炬2, 冯东雷3, 钱夕元1, 王婷1, 孙程琳1 1. 华东理工大学,上海 200237 2. 上海曙光医院,上海 200025 3. 万达信 ...
- 大数据实验报告总结体会_大数据挖掘流程及方法总结
是新朋友吗?记得先点蓝字关注我哦- 今日课程菜单 Java全栈开发 | Web前端+H5 大数据开发| 数据分析 人工智能+Python | 人工智能+物联网 来源:小职(z_zhizuobiao) ...
- 借用大数据挖掘客户需求方法是什么
借用大数据挖掘客户需求方法是什么 就目前而言,现在的大数据技术为绝大部分的业务提供了许多功能,同时还提高了效率和收入.当然除了这些以外,大数据分析还为公司的潜在客户和现有客户提供了许多好处,那么借用大 ...
- 经管文本分析 | 金融学文本大数据挖掘方法与研究进展阅读笔记
姚加权 张锟澎 罗平 <经济学动态>2020年第4期 沈艳 陈赟 黄卓 <经济学(季刊)> 2019年第4期 前言 本文是刊载于<经济学(季刊)>2019年第4期& ...
- 大数据类型主要分为哪几类,大数据挖掘商业价值方法主要分为哪几种?
互联网是个神奇的大网,大数据开发也是一种模式,你如果真想了解大数据,可以来这里,这个手机的开始数字是一八七中间的是三儿零最后的是一四二五零,按照顺序组合起来就可以找到,我想说的是,除非你想做或者了解这 ...
- New Internet:大数据挖掘
NewInternet:大数据挖掘(来自一线大数据挖掘企业的一手实战剖析) 谭磊 著 ISBN978-7-121-19670-6 2013年3月出版 定价:69.00元 376页 16开 编辑推荐 & ...
- 基于Hadoop/Mahout/Mllib的大数据挖掘培训开课
3月16日,由培训中心举办的"大数据分析挖掘-基于Hadoop/Mahout/MLlib的大数据挖掘"在北京厦门大厦开课.20位来自政府机关,金融保险.移动和互联网等大数据来源单位 ...
- 大数据挖掘方法有哪些
数据挖掘是指人们从事先不知道的大量不完整.杂乱.模糊和随机数据中提取潜在隐藏的有用信息和知识的过程.根据信息存储格式,用于挖掘的对象是关系数据库,面向对象的数据库,数据仓库,文本数据源,多媒体数据库, ...
- 大数据挖掘在销售管理中的应用价值
参与调研即可下载本期资料,包含ppt文档及视频链接:点击下载 大家下午好,我是来自西安荣峰软件科技有限公司CTO李昊泽,今天在这个秋分的日子里,由我和大家分享一下大数据在销售管理中的应用价值.下面我会 ...
最新文章
- asp与网站安全的初步构想(1)——操作系统安全
- 简单的MYSQL数据库
- ln -s 的一个坑
- 前端学习(2462):打包优化
- httpClient学习笔记1
- 不可思议的素数(上)(文末送书)
- 研究机构:苹果M1芯片代工订单占台积电5nm工艺25%产能
- java中long的包装类_Java中基本数据的包装类
- ubuntu 20.04 编译yocto 错误集锦
- php 函数传值_传址_函数参数,php函数的传值与传址
- 基于MSP430f5529的红外循迹小车
- Python自动化模拟键盘操作
- 4400php兑换美金是多少,美金换算人民币怎么算(美金换人民币怎样计算)
- v-model中修饰符lazy,number, trim的作用
- 手写实现乞丐版mybatis
- android 股票行情走势图K线控件 KLineView
- 心理学与计算机交叉学专业,心理学与计算机的交叉学科有哪些?
- uva 10306(完全背包)
- DLL注入与隐藏的学习
- 风火编程--python发邮件email