数据挖掘需要掌握高深的分析技能,高深的算法,需要掌握程序开发,这样,就能把数据挖掘工作做好,实际上不是这样的。着魔于高深的算法和程序开发,只能让你走火入魔。在工作中,最好的数据挖掘工程师是一定是最熟悉和理解业务的人。

2、数据挖掘与数据分析的区别

数据分析与数据挖掘的界定非常的模糊。但有一点可以确定,数据分析输出的是统计结果,比如总计,平均值等,数据挖掘输出的是模型或规则,工作中,仅此一点区别,而已。

(二)通过经典案例来学习数据挖掘,以达到触类旁通

对于数据挖掘的学习心得,jacky认为学习数据挖掘一定要结合业务背景、案例背景来学习,这样才是以解决问题为导向的学习方法。那么,大体上,数据挖掘经典案例有以下几种:

1、预测未来一段时间用户是否会流失

2、某个促销活动用户是否会响应参加

3、评估用户信用度是好还是差

4、细分现有的目标市场

5、对现有客户群进行群体细分

6、提升商品销售及交叉销售

7、一群用户购买了很多商品之后,哪些商品同时购买的几率比较高

8、预测未来的销量

9、天气预报中预测明天的气温是怎样的

10、国家的年底规划中,预测明年的GDP增长率是怎样的

数据挖掘要做的就是把上述类似的商业问题转化为数据挖掘问题

那么,问题来了,我们该如何把上述的商业问题转化为数据挖掘问题呢?我们可以对数据挖掘问题进行细分,分为四类问题:分类问题、聚类问题、关联问题、预测问题;

1、分类问题

用户流失预测、促销活动响应,评估用户度都属于数据挖掘的分类问题,我们需要掌握分类的特点,知道什么是有监督学习,掌握常见的分类方法:决策树、贝叶斯、KNN、支持向量机、神经网络和逻辑回归等;

2、聚类问题

细分市场,细分客户群体都属于数据挖掘的聚类问题,我们要掌握聚类特点,知道无监督学习的概念,了解常见的聚类算法,例如划分聚类、层次聚类、密度聚类、网格聚类、基于模型聚类等。

3、关联问题

交叉销售问题等属于关联问题,关联分析也叫购物篮分析,我们要掌握常见的关联分析算法:Aprior算法、Carma算法,序列算法等

4、预测问题

我们要掌握简单线性回归分析、多重线性回归分析、时间序列等

(三)用何种工具实操数据挖掘

能实现数据挖掘的工具和途径实在是太多了,SPSS、SAS、Python、R等等都可以,但是我们需要掌握哪个或者说我们要掌握哪几个,才算学会了数据挖掘呢?这需要看我们所处的层次和我们想要进阶的路径是怎样的。

1、达到理解入门层次

了解统计学和数据库即可

2、达到初级职场应用层次

数据库+统计学+SPSS(也可以是SPSS代替软件)

3、达到中级职场应用层次

SAS或R

4、达到数据挖掘师层次

SAS或R+Python(或其他编程语言)

(四)如何利用Python学习数据挖掘

只要能解决实际问题,用什么工具来学习数据挖掘都是无所谓的,这里jacky首推Python。那么,我们该如何利用Python来学习数据挖掘呢?我们需要掌握Python中的哪些知识呢?

1、Pandas库的操作

Panda是数据分析特别重要的一个库,我们要掌握以下三点:

1)pandas 分组计算;

2)pandas 索引与多重索引;

索引比较难,但是却是非常重要的

3)pandas 多表操作与数据透视表

2、numpy数值计算

numpy数据计算主要的应用是在数据挖掘,对于以后的机器学习,深度学习,这也是一个必须掌握的库,我们要掌握以下内容:

1)Numpy array理解;

2)数组索引操作;

3)数组计算;

4)Broadcasting(线性代数里面的知识)

3、数据可视化-matplotlib与seaborn

1)Matplotib语法

python最基本的可视化工具就是matplotlib。我们咋一看Matplotlib与matlib有点像,我们要搞清楚二者的关系是什么,这样我们学习起来才会比较轻松。

2)seaborn的使用

seaborn是一个非常漂亮的可视化工具。

3)pandas绘图功能

我们说过pandas是做数据分析的,但它也提供了一些绘图的API。

4、数据挖掘入门

这部分是最难也是最有意思的一部分,要掌握以下几个部分:

1)机器学习的定义

在这里跟数据挖掘先不做区别

2)代价函数的定义

3)Train/Test/Validate

4) Overfitting的定义与避免方法

5、数据挖掘算法

数据挖掘发展到现在,算法已经非常多了,下面只需掌握最简单的,最核心的,最常用的算法;

1)最小二乘算法;

2)梯度下降;

3)向量化;

4)极大似然估计;

5)Logistic Regression

6) Decision Tree

7) RandomForesr

8) XGBoost

6、数据挖掘实战

通过机器学习里面最著名的库scikit-learn来进行模型的理解。

以上,就是jacky为大家厘清的数据挖掘学习逻辑。可是,这还仅仅是开始,在通往数据挖掘师与数据科学家的道路上,我们还要学习文本处理与自然语言的知识、Linux与Spark的知识、深度学习的知识等等,我们要保持持续的兴趣来学习数据挖掘。
  人工智能、大数据、云计算和物联网的未来发展值得重视,均为前沿产业,多智时代专注于人工智能和大数据的入门和科谱,在此为你推荐几篇优质好文:
数据统计分析和数据挖掘有何区别?
http://www.duozhishidai.com/article-11047-1.html
数据挖掘的聚类算法和优势
http://www.duozhishidai.com/article-12942-1.html
如何通过自学,成为数据挖掘“高手”?
http://www.duozhishidai.com/article-9796-1.html


多智时代-人工智能和大数据学习入门网站|人工智能、大数据、物联网、云计算的学习交流网站

数据挖掘是什么,数据挖掘的学习路线是什么?相关推荐

  1. DS:机器学习之数据科学方向最强学习路线之数据分析、数据挖掘、机器学习工程化团队之详细攻略(更新中)

    DS:机器学习之数据科学方向最强学习路线之数据分析.数据挖掘.机器学习工程化团队之详细攻略(更新中) 目录 最强学习路线 DS市场岗位要求 DS应用领域 基本必备技能

  2. DS/ML:数据科学技术之数据科学生命周期(四大层次+机器学习六大阶段+数据挖掘【5+6+6+4+4+1】步骤)的全流程最强学习路线讲解之详细攻略

    DS/ML:数据科学技术之数据科学生命周期(四大层次+机器学习六大阶段+数据挖掘[5+6+6+4+4+1]步骤)的全流程最强学习路线讲解之详细攻略 导读:本文章是博主在数据科学和机器学习领域,先后实战 ...

  3. 【数据挖掘】数据挖掘简介 ( 6 个常用功能 | 数据挖掘结果判断 | 数据挖掘学习框架 | 数据挖掘分类 )

    文章目录 I . 数据挖掘 功能 II . 数据挖掘 结果判断 III . 数据挖掘 学习框架 IV . 数据挖掘 分类 I . 数据挖掘 功能 1 . 概念描述 ( Concept Descript ...

  4. 数据挖掘,机器学习,统计学习的区别与联系

    这三个领域或学科交叉和重叠部分很多,数据挖掘,机器学习和统计学习的概念一直有或多或少的混淆,希望同样有我这样的困惑的朋友读完下面的文字能够清晰一些. 数据库提供数据管理技术,机器学习和统计学提供数据分 ...

  5. 数据挖掘、机器学习、深度学习的区别

    数据挖掘 数据挖掘的定义 数据挖掘是指从数据库的大量数据中揭示出隐含的.先前未知的并有潜在价值的信息的非平凡过程.数据挖掘是一种决策支持过程,它主要基于人工智能.机器学习.模式识别.统计学.数据库.可 ...

  6. 哪本python入门书内容最详细-重磅 | 由浅入深的 AI 学习路线,最详细的资源整理!...

    原标题:重磅 | 由浅入深的 AI 学习路线,最详细的资源整理! [导读] 本文由知名开源平台,AI技术平台以及领域专家: Datawhale, ApacheCN, AI有道和 黄海广博士联合整理贡献 ...

  7. python学习路线-2020年 Python学习路线及学习目标规划 拿走不谢!

    找不到完整的学习路线?小编分享2020年Python学习路线及学习目标规划拿走不谢,Python作为今年来特别受欢迎的编程语言,是AI时代头牌语言AI领域的敲门砖,Python已经入驻小学生教材,将来 ...

  8. 10 门必修的机器学习名校公开课,旨在完善你的 AI 学习路线!

    点击上方"AI有道",选择"星标"公众号 重磅干货,第一时间送达 编辑 | 红色石头 本文将给大家介绍机器学习和数据科学领域 10 个全球知名的免费公开课!这些 ...

  9. 大数据学习路线copy自淘宝

    一.hadoop视频学习(入门到精通) 二.数据挖掘(入门到精通) 三.Hadoop学习路线 1.开发前期准备 首先,如果你没有Java和Linux基础,建议你先简单学一下这两门课程,此宝贝里面都为你 ...

  10. Hadoop生态系统学习路线

    主要介绍Hadoop家族产品,经常使用的项目包含Hadoop, Hive, Pig, HBase, Sqoop, Mahout, Zookeeper, Avro, Ambari, Chukwa.新添加 ...

最新文章

  1. C++11新特性之defaulted函数
  2. 用js判断时间的先后顺序
  3. docker run指定entrypiont
  4. python3.6入门到高阶(全栈) day015 初识面向对象
  5. Restrictions查询用法
  6. 兵马未至,数据先行,且看如何进行数据挖掘!
  7. MySQL text类型的最大长度
  8. poi导出excel 损坏_poi导出excel解决方法
  9. 芯片AD库转换之贸泽 Library Loader使用
  10. 一块硬盘装了黑苹果 一块硬盘装了win7_自己组装一台“iMac”是什么体验(下):AMD 平台也能吃上黑苹果...
  11. 剑指 Offer 46. 把数字翻译成字符串 【 c++/java详细题解 】
  12. arm-linux-gnueabihf-gcc -Wall -nostdlib -c -O2 -o start.o start.s 什么意思? 2020-11-21
  13. echarts中月份数据缺少怎么补齐呢?
  14. MX25上SD卡的插拨检测机制
  15. 70句计算机英语,70句成人英语日常口语大全
  16. python opencv imshow可以显示,但是imwrite却黑乎乎
  17. mysql-8.0.21-winx64数据库安装过程记录
  18. Description: A component required a bean of type ‘com.jia.dao.UserDao‘ that
  19. 无代码如何加速数字化转型?
  20. 分享 6 个百度出品的免费工具,你用过几个?

热门文章

  1. 史上最全recyclewView集合,下拉刷新,上拉加载,左滑删除,点击按钮滑动到指定位置
  2. 高电平输入好还是rca输入好_dsp高电平和低电平输入哪个好
  3. mac excel 换行 快捷键
  4. [USACO10HOL]牛的政治Cow Politics
  5. 利用python实现判断两条直线是否平行,若相交,输出交点。
  6. zabbix_proxy代理服务器搭建教程
  7. win7计算机里不显示摄像头,win7系统不显示摄像头的解决方法
  8. 【论文阅读】DeepIM: Deep Iterative Matching for 6D Pose Estimation
  9. 重力传感事件应用之一 手机摇一摇(摇一次得一分)
  10. Unity学习笔记(六)——顶点动画