Pig的安装和简单使用
1.Pig是基于hadoop的一个数据处理的框架。
MapReduce是使用java进行开发的,Pig有一套自己的数据处理语言,Pig的数据处理过程要转化为MR来运行。
2.Pig的数据处理语言是数据流方式的,类似于初中做的数学题。
3.Pig基本数据类型:int、long、float、double、chararray、bytearray
复合数据类型:Map、Tuple、Bag
Bag的类型如{('age',31),('name','张三')}
4.如何安装Pig(在hadoop0上安装)
4.1 把pig-0.11.1.tar.gz复制到/usr/local下
4.2 使用命令tar -zxvf pig-0.11.1.tar.gz解压缩
4.3 使用命令mv pig-0.11.1 pig 进行重命名
4.4 编辑文件vi /etc/profile 设置环境变量
export PIG_HOME=/usr/local/pig
export PATH =......:$PIG_HOME/bin....
保存,然后执行source /etc/profile
4.5 编辑文件$PIG_HOME/conf/pig.properties,增加两行如下内容
fs.default.name=hdfs://hadoop0:9000 (见/usr/local/hadoop/conf/core-site.xml)
mapred.job.tracker=hadoop0:9001 (见/usr/local/hadoop/conf/mapred-site.xml)
5.对wlan数据(手机上网日志)如何使用pig进行分析处理
5.1 把待处理的数据上传到HDFS中
hadoop fs -put HTTP.dat /wlan
5.2 把HDFS中的数据转换为pig可以处理的模式(执行pig命令,就进入到pig命令行模式下)
A = LOAD '/wlan' AS (t0:long, msisdn:chararray, t2:chararray, t3:chararray, t4:chararray, t5:chararray, t6:long, t7:long, t8:long, t9:long, t10:chararray);
DUMP A; ----查看
5.3 把里面的有用的字段抽取出来
B = FOREACH A GENERATE msisdn, t6, t7, t8, t9;
DUMP B;
5.4 分组数据
C = GROUP B BY msisdn;
DUMP C;
5.5 流量汇总
D = FOREACH C GENERATE group, SUM(B.t6), SUM(B.t7), SUM(B.t8), SUM(B.t9); -----group代表第一列手机号码的字段(汇总出同一个手机号码的流量)
DUMP D;
5.6 存储到HDFS中
STORE D INTO '/wlan_result';
查看HDFS:
hadoop fs -lsr /
hadoop fs -text /wlan_result/part-r-*
还可以排序:
E = ORDER D BY group;
DUMP E;
转载于:https://www.cnblogs.com/ahu-lichang/p/6681430.html
Pig的安装和简单使用相关推荐
- Pig安装及简单使用(pig0.12.0 hadoop2.2.0)
我们用MapReduce进行数据分析.当业务比较复杂的时候,使用MapReduce将会是一个很复杂的事情,比如你需要对数据进行很多预处理或转换,以便能够适应MapReduce的处理模式,另一方面,编写 ...
- docker-compose的安装与简单使用
docker-compose的安装与简单使用 docker-compose简介 屁话不这么多,直接开干 docker-compose安装步骤 由于docker-compose托管在github上面,所 ...
- 内核同步对性能的影响及perf的安装和简单的使用
更多文章目录:点击这里 GitHub地址:https://github.com/ljrkernel 内核同步对性能的影响及perf的安装和简单的使用 看了一篇关于多线程应用程序性能分析的外文,结合之前 ...
- cakephp 安装mysql_CakePHP的安装的简单方法
在对于CakePHP的作用有了初步认识后,我们可以下载CakePHP来进行一些使用.在安装前,要检查php的版本情况,防止CakePHP框架出现不适配的情况. 对于具体的框架组装,会涉及到依赖库和Co ...
- 怎么进入python官网-Python的安装及简单的使用
原标题:Python的安装及简单的使用 像我们想要抓住一门好的编程语言,如何开始学习呢?我来简单介绍下python Python特性:语法简单,入门上手快,很多女神也在学习,方便找个编程的妹纸---- ...
- 刚安装的python如何使用-Python requests的安装与简单运用
强烈推荐!requests官方文档已有了中文版,请见http://cn.python-requests.org/zh_CN/latest/ . requests是python的一个HTTP客户端库,跟 ...
- python requests的安装与简单运用
强烈推荐!requests官方文档已有了中文版,请见http://cn.python-requests.org/en/latest/. requests是python的一个HTTP客户端库,跟urll ...
- memcache的windows下的安装和简单使用
原文:memcache的windows下的安装和简单使用 memcache是为了解决网站访问量大,数据库压力倍增的解决方案之一,由于其简单实用,很多站点现在都在使用memcache,但是memcach ...
- Oracle数据库学习(一)安装和简单使用
新公司的新项目,需要用到Oracle数据库,所以现在便来解除此数据库,不得不说,这个数据库还这是麻烦. 安装倒是简单,就是中间会遇到各种问题. 安装步骤参考:https://blog.csdn.net ...
最新文章
- 如何将C# 7类库升级到C# 8?使用可空引用类型
- 017——VUE中v-fo指令的使用方法
- 流利的验证组件:FluentValidation
- D3可视化:(1)初次见面,SVG与D3的魅力
- typeError: unhashable type: 'list’问题分析
- 微信小程序 详解 小程序支付
- 大神开发的模板框架 包括常见的功能
- json串 转 list<class> 方法 List转JSONArray和JSONArray转List
- Ubuntu 环境下 vim 打造成 IDE
- c语言输出菱形for循环_c语言输出菱形(c语言for循环打印菱形)
- easyui filebox文件大小校验
- 服务都微了,编排怎么整?
- 纳人才,谋发展 | 人大金仓喜获“最佳雇主校招案例奖”
- 教你们如何快速建立一个完美的python项目
- 初学Android,图形图像之使用Canvas,Paint绘图(二十五)
- win11打不开菜单怎么办?win11打不开开始菜单的9种解决方法
- _kbhit()以及_getch()函数的用法
- 三维分析之开敞度分析
- 2021年吴文俊人工智能科学技术奖公布 华为云田奇获杰出贡献奖
- 各大电商平台API接口调用、拼多多API接口获得淘宝商品详情
热门文章
- 最新软件测试岗位职责大全,看看哪些你还没掌握?
- 【译】混沌工程与区块链
- 广播的最佳实践——实现强制下线功能(Android_Broadcast)...
- Leetcode 166. Fraction to Recurring Decimal
- 回文树(回文自动机) - URAL 1960 Palindromes and Super Abilities
- c# WINFORM SOCKET编程-简单聊天程序(服务端)
- TensorFlow ImportError: (‘Failed to import pydot. You must `pip install pydot`)
- OpenCV 自适应的直方图均衡化
- java udp 服务器_Java UDP 服务器与客户端的问题
- jenkins(4): jenkins 插件