1.Pig是基于hadoop的一个数据处理的框架。
  MapReduce是使用java进行开发的,Pig有一套自己的数据处理语言,Pig的数据处理过程要转化为MR来运行。
2.Pig的数据处理语言是数据流方式的,类似于初中做的数学题。
3.Pig基本数据类型:int、long、float、double、chararray、bytearray
       复合数据类型:Map、Tuple、Bag
                                            Bag的类型如{('age',31),('name','张三')}

4.如何安装Pig(在hadoop0上安装)
4.1 把pig-0.11.1.tar.gz复制到/usr/local下
4.2 使用命令tar -zxvf pig-0.11.1.tar.gz解压缩
4.3 使用命令mv pig-0.11.1 pig 进行重命名
4.4 编辑文件vi /etc/profile 设置环境变量
    export PIG_HOME=/usr/local/pig
    export PATH =......:$PIG_HOME/bin....
    保存,然后执行source /etc/profile
4.5 编辑文件$PIG_HOME/conf/pig.properties,增加两行如下内容
    fs.default.name=hdfs://hadoop0:9000 (见/usr/local/hadoop/conf/core-site.xml)
    mapred.job.tracker=hadoop0:9001 (见/usr/local/hadoop/conf/mapred-site.xml)

5.对wlan数据(手机上网日志)如何使用pig进行分析处理
5.1 把待处理的数据上传到HDFS中
    hadoop fs -put HTTP.dat /wlan
5.2 把HDFS中的数据转换为pig可以处理的模式(执行pig命令,就进入到pig命令行模式下)
    A = LOAD '/wlan' AS (t0:long, msisdn:chararray, t2:chararray, t3:chararray, t4:chararray, t5:chararray, t6:long, t7:long, t8:long, t9:long, t10:chararray);
    DUMP A; ----查看

     

5.3 把里面的有用的字段抽取出来
    B = FOREACH A GENERATE msisdn, t6, t7, t8, t9;
    DUMP B;

     

5.4 分组数据
    C = GROUP B BY msisdn;
    DUMP C;

    

5.5 流量汇总
    D = FOREACH C GENERATE group, SUM(B.t6), SUM(B.t7), SUM(B.t8), SUM(B.t9); -----group代表第一列手机号码的字段(汇总出同一个手机号码的流量)
    DUMP D;

    

5.6 存储到HDFS中
    STORE D INTO '/wlan_result';
    查看HDFS:
      hadoop fs -lsr /
      hadoop fs -text /wlan_result/part-r-*

      

还可以排序:
  E = ORDER D BY group;
  DUMP E;

转载于:https://www.cnblogs.com/ahu-lichang/p/6681430.html

Pig的安装和简单使用相关推荐

  1. Pig安装及简单使用(pig0.12.0 hadoop2.2.0)

    我们用MapReduce进行数据分析.当业务比较复杂的时候,使用MapReduce将会是一个很复杂的事情,比如你需要对数据进行很多预处理或转换,以便能够适应MapReduce的处理模式,另一方面,编写 ...

  2. docker-compose的安装与简单使用

    docker-compose的安装与简单使用 docker-compose简介 屁话不这么多,直接开干 docker-compose安装步骤 由于docker-compose托管在github上面,所 ...

  3. 内核同步对性能的影响及perf的安装和简单的使用

    更多文章目录:点击这里 GitHub地址:https://github.com/ljrkernel 内核同步对性能的影响及perf的安装和简单的使用 看了一篇关于多线程应用程序性能分析的外文,结合之前 ...

  4. cakephp 安装mysql_CakePHP的安装的简单方法

    在对于CakePHP的作用有了初步认识后,我们可以下载CakePHP来进行一些使用.在安装前,要检查php的版本情况,防止CakePHP框架出现不适配的情况. 对于具体的框架组装,会涉及到依赖库和Co ...

  5. 怎么进入python官网-Python的安装及简单的使用

    原标题:Python的安装及简单的使用 像我们想要抓住一门好的编程语言,如何开始学习呢?我来简单介绍下python Python特性:语法简单,入门上手快,很多女神也在学习,方便找个编程的妹纸---- ...

  6. 刚安装的python如何使用-Python requests的安装与简单运用

    强烈推荐!requests官方文档已有了中文版,请见http://cn.python-requests.org/zh_CN/latest/ . requests是python的一个HTTP客户端库,跟 ...

  7. python requests的安装与简单运用

    强烈推荐!requests官方文档已有了中文版,请见http://cn.python-requests.org/en/latest/. requests是python的一个HTTP客户端库,跟urll ...

  8. memcache的windows下的安装和简单使用

    原文:memcache的windows下的安装和简单使用 memcache是为了解决网站访问量大,数据库压力倍增的解决方案之一,由于其简单实用,很多站点现在都在使用memcache,但是memcach ...

  9. Oracle数据库学习(一)安装和简单使用

    新公司的新项目,需要用到Oracle数据库,所以现在便来解除此数据库,不得不说,这个数据库还这是麻烦. 安装倒是简单,就是中间会遇到各种问题. 安装步骤参考:https://blog.csdn.net ...

最新文章

  1. 如何将C# 7类库升级到C# 8?使用可空引用类型
  2. 017——VUE中v-fo指令的使用方法
  3. 流利的验证组件:FluentValidation
  4. D3可视化:(1)初次见面,SVG与D3的魅力
  5. typeError: unhashable type: 'list’问题分析
  6. 微信小程序 详解 小程序支付
  7. 大神开发的模板框架 包括常见的功能
  8. json串 转 list<class> 方法 List转JSONArray和JSONArray转List
  9. Ubuntu 环境下 vim 打造成 IDE
  10. c语言输出菱形for循环_c语言输出菱形(c语言for循环打印菱形)
  11. easyui filebox文件大小校验
  12. 服务都微了,编排怎么整?
  13. 纳人才,谋发展 | 人大金仓喜获“最佳雇主校招案例奖”
  14. 教你们如何快速建立一个完美的python项目
  15. 初学Android,图形图像之使用Canvas,Paint绘图(二十五)
  16. win11打不开菜单怎么办?win11打不开开始菜单的9种解决方法
  17. _kbhit()以及_getch()函数的用法
  18. 三维分析之开敞度分析
  19. 2021年吴文俊人工智能科学技术奖公布 华为云田奇获杰出贡献奖
  20. 各大电商平台API接口调用、拼多多API接口获得淘宝商品详情

热门文章

  1. 最新软件测试岗位职责大全,看看哪些你还没掌握?
  2. 【译】混沌工程与区块链
  3. 广播的最佳实践——实现强制下线功能(Android_Broadcast)...
  4. Leetcode 166. Fraction to Recurring Decimal
  5. 回文树(回文自动机) - URAL 1960 Palindromes and Super Abilities
  6. c# WINFORM SOCKET编程-简单聊天程序(服务端)
  7. TensorFlow ImportError: (‘Failed to import pydot. You must `pip install pydot`)
  8. OpenCV 自适应的直方图均衡化
  9. java udp 服务器_Java UDP 服务器与客户端的问题
  10. jenkins(4): jenkins 插件