Hadoop:大数据的特征4V
(一)大数据特征
目前来说,大数据的特征还存在一定的争议。但按照普遍被接受的4V,即规模性(volume)、多样性(variety)、价值密度(value)和 高速性(velocity)进行描述。
1:数据量大(volume)
非结构化数据的超大规模增长导致数据集合的规模不断扩大,数据单位已经从GB级到TB级再到PB级,甚至开始以EB和ZB来计数。
2:类型繁多(variety)
大数据的类型不仅包括网络日志等结构化数据,音频、视频、图片、地理位置信息等非结构化数据,甚至还包括半结构化数据,都具有异构性和多样性的特点。
3:价值密度低(value)
大数据价值密度相对较低。如随着物联网的广泛应用,信息感知无处不在,信息海量,但价值密度较低,存在大量不相关信息。因此需要对未来趋势与模式作可预测分析,利用机器学习、人工智能等进行深度复杂分析。而如何通过强大的机器算法更迅速地完成数据的价值提炼,是大数据时代亟待解决的难题。虽然单位数据的价值密度在不断降低,但是数据的整体价值在提高。
4:速度快时效高(velocity)
处理速度快,时效性要求高。需要实时分析而非批量式分析,数据的输入、处理和分析连贯性地处理,这是大数据区分于传统数据挖掘最显著的特征。
(二)大数据应用案例
将大量的原始数据汇集在一起, 通过数据挖掘等技术分析数据中潜在的规律,预测未来的发展趋势,有助于人们做出正确的决策,从而提高各个领域的运行效率,获得更大的收益。大数据冲击着许多行业,包括金融行业、互联网、 医疗行业、社交网络、零售行业和电子商务等,大数据在彻底地改变着人们的生活。
1.大数据在互联网企业的应用
互联网是最早利用大数据进行精准营销的行业,通过大数据不仅可以为企业进行精准销,还可以快速友好地对用户实施个性化解决方案。IBM大数据提供的服务包括数据分析。
2.大数据在医疗行业的应用
医疗行业拥有大量的病例、病理报告、治愈方案、药物报告等。如果这些数据可以被整理和应用将会极大地帮助医生和病人。人们面对的数目及种类众多的病菌、病毒,以及肿瘤细胞,都处于不断进化的过程中。在发现诊断疾病时,疾病的确诊和治疗方案的确定是最困难的。
3.大数据在金融行业的应用
金融行业的数据具有交易量大、安全级别高等特点。银行在做信贷风险分析的时候,需要大量数据进行相关性分析,但是很多数据来源于政府各个职能部门,包括工商税务、质量监督、检察院法院等,这些数据短期仍然是无法拿到的。
4. 大数据在零售行业的应用
零售行业大数据应用有两个层面:一个层面是零售行业可以 了解客户的消费喜好和趋势,购买的其他产品,扩大销售额,也属于精准营销范畴。另外,零售行业还可以通过大数据掌生产厂家是非常宝贵的,零售商的数据信息将会有助于资源的有效利用,降低产能过剩,厂握未来消费趋势,有利于热销商品的进货管理和过季商品的处理。
5. 大数据在农业的应用
大数据在农业的应用主要是指依据木来的商业需求预测来进行农牧产品的生产,降低电贱伤农的概率。同时大数据的分析将会更加精确预测木来的天气气候,帮助农牧民做好自售灾害的预防工作。大数据同时也会帮助农民依据消费者的消费习惯来决定增加哪些品种的科植,减少哪些品种的生产,提高单位种植面积的产值,同时有助F快速销售农产品,完成资金回流。
6.大数据在交通行业的应用
目前,交通的大数据应用主要在两个方面:一方面可以利用大数据传感器数据来了解车辆通行密度,合理进行道路规划包括单行线路规划:另一方面可以利用大数据来实现即时信号灯调度,提高已有线路通行能力。
7.大数据在教育行业的应用
教育行业中的考试数据、学籍数据、教师数据、事业数据、经费数据、人口数据、研究数据等都分散在不同的机构和政府部门,很难形成大数据,这是需要统筹考虑解决的问题。
8. 大数据在政府机构的应用
政府利用大数据技术可以了解各地区的经济发展情况、各产业发展情况、消费支出和产I效利用自然资源和社会资源,提高社会生产效率。
(三)大数据的机遇与挑战
随着近年来大数据的不断升温,人们也逐渐意识到大数据中提到的数据是全部数据,而不是随机采样:预测是大体方向,而不是精确制导。随着对大数据研究的不断深入,人们越来越意识到对数据的利用可以为其生产生活带来巨大的便利,同时也带来了不小的挑战。
1. 大数据的安全与隐私问题
在互联网上浏览网页,就会留下一连串的浏览痕迹:注册登录网站需要输入个人的重要信息,例如用户名、登录密码、手机号,甚至是身份证号、住址、银行卡等信息。通过相关的数据分析,就可以轻易挖掘出人们的行为习惯和个人重要信息。如果这些信息运用得当,可以帮助相关领域的企业随时了解客户的需求和习惯,便于企业调整相应的产品生产计划,取得更大的经济效益。但若是这些重要的信息被不良分子窃取,随之而来的就是个人信息泄露、财产丢失等安全性问题。
2. 对现有技术的挑战
(1)对现有数据库管理技术的挑战。
传统的数据库部署不能处理TB级别的数据,也不能很好地支持高级别的数据分析。急速膨胀的数据体量即将超越传统数据库的管理能力。如何构建全球级的分布式数据库,可以扩展到数百万的机器,数以百计的数据中心,上万亿行的数据,是今后大数据处理需要解决的问题。
(2)对经典数据库技术的挑战。
经典数据库并没有考虑数据的多类别,SQL(结构化数据查询语言)在设计的一开始是没有考虑非结构化数据的。
(3) 实时性的技术挑战。
传统的数据仓库系统和各类BI ( Business Intelligence)应用对处理时间的要求并不高,因此这类应用往往运行一两天获得结果依然是可行的。但实时处理的要求是区别大数据应用和传统数据仓库技术、BI 技术的关键差别之一。
(4)对网络架构、数据中心、运维的挑战。
人们每天创建的数据量正呈爆炸式增长,但就数据保存来说,我们的技术改进不大,而数据丢失的可能性却不断增加。如此庞大的数据量首先在存储上就会是一个 非常严重的问题,硬件的更新速度将是大数据发展的基石。
Hadoop:大数据的特征4V相关推荐
- Hadoop大数据平台搭建课程笔记
课程介绍 大数据基本介绍 4V特征 体量大:体量庞大 高速:数据产生速度快.存储速度快.处理速度快 多样化:数据的种类和来源多样化.结构化.非结构化.半结构化数据 价值:密度低.体量庞大,有价值的数据 ...
- Hadoop大数据零基础高端实战培训系列配文本挖掘项目
<Hadoop大数据零基础高端实战培训系列配文本挖掘项目(七大亮点.十大目标)> 课程讲师:迪伦 课程分类:大数据 适合人群:初级 课时数量:230课时 用到技术:部署Hadoop集群 涉 ...
- R+Hadoop大数据方案有哪些坑?
摘要: 为什么有些公司在机器学习业务方面倾向使用 R + Hadoop 方案?因为他们在不懂R和Hadoop的特征应用场景的情况下,恰好抓到了一根免费,开源的稻草.R:R的应用场景不在于无与伦比的统计 ...
- 大数据概论、大数据概念、大数据特点(4V)、Volume(大量)、Velocity(高速)、Variety(多样)、Value(低价值密度)、大数据应用场景、大数据发展前景、大数据部门间业务流程分析
文章目录 1.大数据概念 2.大数据特点(4V) 2.1Volume(大量) 2.2Velocity(高速) 2.3Variety(多样) 2.4Value(低价值密度) 3.大数据应用场景 4.大数 ...
- Hadoop大数据技术复习资料
Hadoop大数据技术复习资料 钟兴宇 1.选择题15空,共30分. Hadoop以HDFS(Hadoop Distributed File System,Hadoop 分布式文件系统)和MapR ...
- 大数据基础——Hadoop大数据平台搭建
文章目录 前言 Hadoop大数据平台搭建 一.Hadoop原理和功能介绍 二.Hadoop安装部署 三.Hadoop常用操作 总结 前言 分布式机器学习为什么需求大数据呢?随着海量用户数据的积累,单 ...
- Hadoop大数据入门
1.服务器架构的演变 以往的服务器架构一般是单体架构: 特点:将软件集中安装在一台服务器上 优势:简单.方便.成本低 缺点:单个服务器硬件资源有限,服务应用集中在单体服务器上,每个应用分到的硬件资源有 ...
- 八大行业Hadoop大数据应用回顾和展望
任何新技术的发展都会经历一个从被公众了解到最终普遍应用的过程.大数据技术作为一个新兴的数据处理技术,经过了近十年的发展,刚刚开始在各个行业得到应用.但从媒体和公众视野中,大数据技术总是带有神秘的色彩, ...
- 1.初始Hadoop大数据技术
1.1 大数据技术概要 1.1.1 大数据产生的背景 2001年后,互联网迅速发展,数据量成倍递增.进入2012年,大数据(big data)一词越来越多地被提及,人们用它来描述和定义信息爆炸时代产生 ...
最新文章
- 中外教育专家“支招”中国学生如何接轨国际教育
- Pycharm下载tensorflow问题
- 汉拓中国CRM评估报告简介
- MS08-025 win32k.sys NtUserFnOUTSTRING Privilege Escalation Exploit
- 【HTTP】另类的POST头数据 RFC1867协议格式简析
- 求你了,别再说数据库锁的只是索引了!!!
- 【python】Python的基本数据类型之数字类型与字符串类型
- 3Dmax建模教程详细步骤3D建模速成入门到高级教程 小白必看
- 空间几何变换知识点——摘自《机器视觉研究与发展》赵彭
- 神武4最新服务器,《神武4》亲自体验现版本新区后的新区告白
- html5微杂志源码,H5制作又一利器:分分钟制作一个H5页面
- 51nod 1278 相离的圆 二分+排序
- Windows系统的基础上装Ubuntu双系统系统分区问题
- Python技术交流群(持续更新……)
- 今年应避免的网站营销错误
- 家庭光纤宽带连接示意图
- 用户输入商品价格和商品数量,以及收货地址,可以自动打印订单信息 分析:
- 机器学习中的Bias和Variance是指什么
- 怎么保证在多线程任务都执行完后再执行某一动作 CountDownLatch
- 小老板、中老板和大老板的区别