[原文在http://blog.sina.com.cn/s/blog_4b700c4c0100rw2p.html,入门介绍,很生动,但几块内容杂糅在一起,还有两块重复的内容,我这里把它分开贴一下。这里面的"沈老师"不知道原作者从哪里炒过来的。。。随便看看那。。。]

数据分析也好,统计分析也好,数据挖掘也好、商业智能也好都需要在学习的时候掌握各种分析手段和技能,特别是要掌握分析软件工具!我曾经说过,沈老师的学习方法,一般是先学软件开始,再去应用,再学会理论和原理,因为是老师,再去教给别人!没有软件的方法就不去学了,因为学了也不能做,除非你自己会编程序

那么在数据分析领域,都有哪些软件分析工具呢?如何选择呢?其实很多领域或者说分析方法都有相应的软件工具,只要你想找就应该能够找到!

这里我把软件分成纵横四个层次的的象限图来表达!

第一维度:数据存储层——>数据报表层——>数据分析层——>数据展现层

第二维度:用户级——>部门级——>企业级——>BI级

首先,存储层:

我们必须能够存储数据,对个人来讲至少应该掌握一种数据库技术,当然也不一定要熟练操作,但至少要能够理解数据的存储和数据的基本结构和数据类型,比如数据的安全性、唯一性、冗余性,表的关系,粒度,容量等,最好能够理解SQL查询语言的基本结构和读取等等!

  • Access2003、Access07等:这是最基本的个人数据库,经常用于个人或部分基本的数据存储;
  • MySQL数据库,这个对于部门级或者互联网的数据库应用是必要的,这个时候关键掌握数据库的库结构和SQL语言的数据查询能力;
  • SQL Server 2005或更高版本,对中小企业,一些大型企业也可以采用SQL Server数据库,其实这个时候本身除了数据存储,也包括了数据报表和数据分析了,甚至数据挖掘工具都在其中了;
  • DB2,Oracle数据库都是大型数据库了,主要是企业级,特别是大型企业或者对数据海量存储需求的就是必须的了,一般大型数据库公司都提供非常好的数据整合应用平台;
  • BI级,实际上这个不是数据库,而是建立在前面数据库基础上的,这个主要是数据库的企业应用级了,一般这个时候的数据库都叫数据仓库了,Data Warehouse,建立在DW级上的数据存储基本上都是商业智能平台,或许整合了各种数据分析,报表、分析和展现!

第二:报表层
    当企业存储了数据后,首先要解决的报表,还不是分析问题,是要能够看到,看到报表,各种各样的报表!国内外有专门提供报表分析服务的企业和软件。

  • Crystal Report水晶报表,Bill报表,这都是全球最流行的报表工具,非常规范的报表设计思想,早期商业智能其实大部分人的理解就是报表系统,不借助IT技术人员就可以获取企业各种信息——报表。而且很多数据库内置的报表也是采用CR报表的开发版嵌入的!
  • Tableau软件,这个软件是近年来非常棒的一个软件,当然它已经不是单纯的数据报表软件了,而是更为可视化的数据分析软件,因为我经常用它来从数据库中进行报表和可视化分析,先暂列在报表层;

这个软件从3.0开始,现在已经有了5.1版本,两年的时间已经到了服务器和Web方式了!
    当然,如果企业有上万张报表,需要好好管理起来,还有安全性,并发请求等,就需要有Server版;
    博易智讯公司专门提供Crystal Report和Crystal Report Server版销售和软件服务;

第三:数据分析层
    这个层其实有很多分析工具,当然我们最常用的就是Excel,我经常用的就是统计分析和数据挖掘工具;

  • Excel软件,首先版本越高越好用这是肯定的;当然对Excel来讲很多人只是掌握了5%Excel功能,Excel功能非常强大,甚至可以完成所有的统计分析工作!但是我也常说,有能力把Excel玩成统计工具不如专门学会统计软件
  • SPSS软件:当前版本是18,名字也改成了PASW Statistics;我从3.0开始Dos环境下编程分析,到现在版本的变迁也可以看出SPSS社会科学统计软件包的变化,从重视医学、化学等开始越来越重视商业分析,现在已经成为了预测分析软件。
  • Clementine软件:当前版本13.0,数据挖掘工具,我从6.0开始用,到了13版,已经越来越多的提高了更多有好的建模工具,现在改名叫PASW Modeler 13建模器了。而且与SPSS统计功能有了更多的整合,数据处理也更加灵活和好用。
  • SAS软件:SAS相对SPSS其实功能更强大,SAS是平台化的,EM挖掘模块平台整合,相对来讲,SAS比较难学些,但如果掌握了SAS会更有价值,比如离散选择模型,抽样问题,正交实验设计等还是SAS比较好用,另外,SAS的学习材料比较多,也公开,会有收获的!

当然,我主要是采用SPSS和Clementine,有时候就是习惯,当然会了一种软件在学其他的也不是很困难!

  • JMP分析:SAS的一个分析分支
  • XLstat:Excel的插件,可以完成大部分SPSS统计分析功能
  • Ucinet社会网分析软件:SNA社会网络分析是非常流行和有价值的分析工具和方法,特别是从关系角度进行分析社会网络,关系分析非常重要,过去我们都是属性数据分析

第四:表现层
    最近我一直在研究数据可视化技术,一方面是因为Excel大家有需求,另一方面就是我第一个购买了Xcelsius,也写了《Excel高级应用与数据分析》和《数据展现的艺术——Xcelsius》。这个领域的软件,特别是一些小工具非常有价值!

  • PowerPoint软件:这个没得说了,大部分人都是用PPT写报告;
  • Visio、SmartDraw软件:这些都是非常好用的流程图、营销图表、地图等,而且从这里可以得到很多零件;
  • Swiff Chart软件:制作图表的软件,生成的是Flash;
  • Color Wheel软件:配色软件
  • Yed软件:网络关系图、流程图和图形分析软件,类似SNA分析,我经常用来设计流程图,还有就是分析优化关系图;
  • Netdraw软件:这是社会网络分析展现软件,主要是可视化网络关系图的,读取Ucinet软件;
  • Mindmanager软件:思维导图,非常好的软件,可以把非线性思维很快构建起来,并且项目组织管理、报告设计构想都可以应用,直接生成PPT等,当然这个软件功能非常强大,我的学生都用它来做笔记和会议记录;
  • Xcelsius软件:Dashboard制作和数据可视化报表工具,可以直接读取数据库,在Excel里建模,互联网展现,最大特色还是可以在PPT中实现动态报表;这个是我最希望应用的一个软件工具,非常有价值!

最后,需要说明的是,我这样的分层分类并不是区分软件,只是想说明软件的应用,其实每个层次的软件都是相互融合的,追求:平台化,整合化,智能化,可视化,专业化,都是各有特色;价格也不同,有免费的,有上百万的;有单机版的,有服务器版的;有正版的,有盗版的!
    有时候我们把数据库就用来进行报表分析,有时候报表就是分析,有时候分析就是展现;当然有时候展现就是分析,分析也是报表,报表就是数据存储了!
    没有最好,只有更好,适合你的就是最好的!

其实还有很多数据分析软件:
  • AMOS软件:结构方程式模型SEM,实证研究和理论模型的重要分析工具,从事学术研究的人,特别是社会科学工作者应该掌握;
  • Lisrel软件:结构方程式模型SEM,同上!
  • HLM软件:分层线性模型;

很多朋友问沈老师,我是学统计分析的,为什么我还是不知道如何应用呢?

问题:沈浩老师,我有些问题想跟您请教一下,我现在从事的工作是互联网行业数据分析工作,我以前学的专业是统计学,但是工作中有很多多元统计方法并没有应用,虽然学了很多方法,但是在实际中还是有点不知道如何运用?我应该从哪些方面着手?请指教!谢谢!

相信,这个朋友的问题带有普遍性,其实我在前面的文章中或多或少的解释了数据分析的学习方法,但是可能还是有些建议可以给朋友们,当然,我一直强调每个人都有自己的学习路径,适合自己的才是最好的。

我经常这么说:学数学的不一定会统计分析,学统计的不一定就会数据分析!   

为什么这么说呢?因为社会科学!特别是企业经营分析、市场研究等领域都属于社会科学。我们在大学学的数学或统计都是基础,也更多的都是理想数据分析,处理的变量大部分都是数量型的,高测量等级的变量,但是经营分析和市场研究大部分处理的都是非数量型变量,例如都是品牌、行业、地区、偏好、态度、价值观等!

对于社会科学研究,研究者必须在看到数据的时候,要看到数据后面的人,后面的消费者,后面的领导!

上面这张分析人员知识结构图较好的诠释我对从事经营分析、市场研究和统计分析人员的知识框架的理解,企业需要的复合型人才,虽然一个人不可能全部掌握,那就需要你有好的协助能力和团队精神,要有沟通技巧!

当然,对大部分人来讲,这些不是短期就可以积累的,需要不断的学习积累,要具有快速学习的能力。对已经工作的人来讲,实践是最好的老师,互联网是最好的学习资源;

最后,成为一名自信的高级数据分析人员,至少要2-3年的磨练!

沈浩老师:

您好!不知道您还记得我不,我是电信的一名新入职员工,在过年前给您写过一封E-mail.我期望自己能够在企业内从事跟数据挖掘的工作,期望通过数据挖掘这个工具来挖掘用户深层次的需求和研究用户的使用习惯及消费特点。
    我在网上查阅过一些从事数据挖掘的专家的博客,有人提到如果在企业内从事数据挖掘方面的应用工作,需要掌握相关的数理统计知识,懂得使用相关软件就可以了,请问是这样的吗?还需要掌握数据仓库和程序算法方面的知识吗?因为我从本科到研究生都是学习管理方向的,数学方面的基础相对薄弱,因此想请您指教一下。

另外,如果我要入门,从哪个方面入手比较好呢?有什么合适的参考书吗?请你不吝赐教。
    想必您平时的工作很忙,因此对这么唐突的给您写邮件请教而占用您的时间和精力表示歉意。期待您的回复!祝您工作顺利,身体健康!

沈浩的回答:
    抱歉,事情太多,如果不追着就忘了!我认为你作为企业员工对数据挖掘感兴趣,最主要的就是从应用和解决问题开始,所以我想把数据挖掘这个狭义定义的内容改成你应该对数据分析感兴趣,数据挖掘只是数据分析的一个重要工具和解决方法之一!

  • 数量统计知识方面:我认为统计思想是数学在实践中最重要的体现,但对于实际工作者最重要的是掌握统计思想,其实统计理论非常复杂,但实际应用往往是比较简单的!比如,很多人都在大学学了假设检验,但实际应用中假设就是看P值是否小于0.05,但是H0是什么?拒绝还是接受的是什么现实问题;要理解!
  • 掌握软件问题:从软件角度学,是非常好的思路,我基本上就是这样学的。我常说编软件的人最懂理论,否则编不出来,编软件的人最知道应用,否则软件买不出去;现在软件越来越友好,把软件自带案例做一遍,你会自觉不自觉的掌握软件解决问题的思路和能解决的问题类型;
  • 数据仓库问题:OLAP 和数据挖掘是数据仓库建立基础上的两个增值应用,从企业整体角度,数据挖掘应该建立在企业数据仓库完备的基础上。所以说数据仓库是针对企业级数据挖掘应用提出的,但我们应该记住,企业从来不是为了数据挖掘建立数据仓库,而是因为有了数据仓库后必然会提出数据挖掘的需求!现在随着数据挖掘软件的工具智能化,以及数据仓库和ETL工具的接口友好,对数据库层面的要求越来越少;
  • 数学不好可能反应了一个人思考问题的方式或深入理解问题的能力,但数学不是工具是脑具,不断解决问题的过程可以让我们思考问题更数学化!

沈浩老师建议:

  1. 不急,一步一步来!先把本职工作中的数据分析问题理解了,干好了!
  2. 熟练玩好Excel软件工具,这个可以看《Excel高级应用与数据分析》我写的书,当然有很多Excel论坛和网站,从我的博客就可以连接到。
  3. 学习好统计分析方法,我不是单指统计原理,而是统计分析方法,比如回归分析,因子分析等,不断进入统计分析解决问题的思考方式;这个可以看看SPSS软件方面的书和数据案例,通过软件学习解决数据分析的统计问题,这方面的书很多,当然你也可以关注我的博客,不断增加统计分析方法解决数据分析问题的思路,自己对照着完成!
  4. 在上述问题有了比较好的理解后,也就是你应该算是一个数据分析能手的时候,开始进入数据挖掘领域,你会发现用数据挖掘思想解决问题具有智能化、自动化的优势,接下来,你需要考虑数据建模的过程,通过学习Clementine软件或SAS的挖掘工具,不断理解数据挖掘与原来的数据分析工具有什么不同或优势!
  5. 当前面都是了解并且能够得心应手后,你就要有针对性的掌握你工作所在行业的问题,例如:电信行业的解决方案问题:客户流失、客户价值、客户离网、客户保持、客户响应、客户交叉销售等商业模型,同时与数据分析和数据挖掘统一在一起的解决方案!
  6. 接下来,你应该掌握数据库的一些原理和操作,特别是SQL语言的方式
  7. 你到了这个阶段,就应该有全面解决问题的能力,比如挖掘出来的知识或商业规则如何推送到营销平台上等等
  8. 梳理自己的知识结构,不仅会操作,现在你应该成为专家了,要能够宣扬你的知识能力和领导力,当然也要表明你在数据挖掘领域的专业特长
  9. 要经常帮助同事和行业朋友,比如帮助解决数据分析问题,帮助咨询,甚至给大家讲课,这对你的知识梳理和能力的提高非常重要,你的自信心会更强!
  10. 有兴趣,可以建立一个博客或什么,不断写点东西,经常思考和总结
  11. 结交广泛的朋友!
关于入门的教材:
  • 互联网,其实不用买什么书网络基本都有;要有好的搜索能力,当然包括搜各种软件!
  • SPSS和Clementine软件的说明和案例,都做一遍;
  • 《数据挖掘——客户关系管理的艺术》不错,当当网上查一下
  • 《调查研究中的统计分析法》——我和柯老师写的,当当网也有
  • 《Excel高级应用与数据分析》——我写的
  • 《数据展现的艺术》——我和博易智讯合作

数据挖掘的分析软件和展示工具相关推荐

  1. grafana官方使用文档_可视化监控展示工具之Grafana,安装部署和使用

    Grafana在前面整理监控工具之Prometheus的文章里,也有提到和使用过,但没有详细提及.这里专门列出一篇介绍Grafana工具,希望能帮助到需要的朋友. 一,简介 Grafana是一个开源的 ...

  2. grafana监控linux,Grafana –美观、强大的可视化监控指标展示工具 | Linux大学

    在之前的InfluxDB系列教程 中,我们给大家介绍了当下流行的一款时序数据库--InfluxDB. 接下来给大家带来一款强大的,与InfluxDB搭配使用的前端指标项展示项目--Grafana. G ...

  3. 可视化监控指标展示工具 grafana 简介

    目录 1.概述--美观.强大的可视化监控指标展示工具 1.1基本概念 2.全面瓦解 2.1登录grafana 2.2数据源配置 2.3仪表盘配置 3.特殊配置 3.1变量之interval 3.2变量 ...

  4. java owc_使用微软OWC中做为联机分析系统前端展示工具

    使用微软OWC中做为联机分析系统前端展示工具 我们在开发联机分析系统时,经常要在B/S结构下开发,也就是说:联机分析系统的前端展示工具需要能嵌入到浏览器中使用.当然你可以自己开发,但是,在一般的情况下 ...

  5. 阿里大数据分析展示工具DataV

    原文地址为: 阿里大数据分析展示工具DataV 应用场景 当我们把清理好的数据,放到了数据库中,浏览数据的时候,直接访问数据库,或者通过JDBC连接代码返回数据,很不方便,我们需要通过报表的形式,通过 ...

  6. 时间线展示工具Timeline

    时间线展示工具Timeline[1],可以实现网页上展示一个时间轴.在时间相关的数据展示中,有比较好的效果.测试了下,具体的用法是这样的. 1.编写html页面,引入JS脚本,引入JSON数据,设定待 ...

  7. Database-doc 数据库文档展示工具

    实用工具 Database-doc:数据库文档展示工具 简介 数据库文档展示工具(Database-doc),又叫数据库注释浏览工具,是一个简单的数据库展示各个字段注释的开源工具.在日常开发工作中,您 ...

  8. [转载]易上手的数据挖掘、可视化与机器学习工具: Orange介绍

    标签 PostgreSQL , Orange3 , 可视化 , 时空数据 背景 可视化分析会是一个让枯燥的数据说话的快捷途径,降低可视化分析门槛,同时又保留它的编程能力,是非常重要的. 如今数据种类越 ...

  9. WakaTime数据同步展示工具

    从16年知道 WakaTime 后就开始使用它来记录自己的编码时间,但作为免费版只能查看最近两周的数据,于是很久之前就写了一个程序同步自己的历史数据,不过一直没找到合适的图表插件像官网那样展示数据信息 ...

最新文章

  1. 使用正则表达式抽取新闻/BBS网页发表时间
  2. JSTL标签库的一些基础实例
  3. ISA2006英文版实验手册下载
  4. 命令行编译 WRK ,windbg 调试
  5. python面向对象编程138讲_Python面向对象编程简单讲解
  6. wordpress 文章页面 (single.php)
  7. 智能手机市场输家和赢家:Android手机厥后居上
  8. 软件分享,PicPick中文版 v5.1.4 滚动截图
  9. 「一本通 1.2 练习 2」扩散(loj10015)
  10. 机器学习基础随笔(3)
  11. 01-CSS属性:字体属性和文本属性
  12. ASP.NET 母版页(嵌套、访问母版页的控件和属性)
  13. 实现HttpClient重试
  14. 跳槽一次能涨多少?今天真正见识到了跳槽天花板。
  15. 二哥,你为什么要写作啊?
  16. 【优化求解】基于帝国主义竞争算法ICA求解单目标问题Matlab源码
  17. 我做了个GPT3键盘,用了两个月发现它有点傻
  18. Windows 录屏软件哪个好?据说这几款录制工具还不错!
  19. 考研还是工作?两战失败老道有话说
  20. C++中使用MySQL数据库

热门文章

  1. vue 实现tab切换动态加载不同的组件
  2. jQuery根据ID删除元素
  3. DDoS攻击的一些防护方法
  4. Java Import
  5. 迭代决策树GBDT(MART)【理论】
  6. 荨麻疹自我治理指南(民间版)
  7. 基于密度的聚类方法-OPTICS
  8. 如何批量合并Excel文件和工作表 - Excel合并器使用教程
  9. 页面生命周期:DOMContentLoaded, load, beforeunload, unload解析
  10. SaaS企业如何构建与自身增长目标相匹配的组织力?