案例2-1、3-1 Pelican 商店

本案例之中主要涉及到Pandas和pyecharts的一些功能,比如利用pandas进行数据筛选,百分比频数统计,将数据进行分组,分组统计,相关性分析等。另外还涉及到了pyecharts的饼图,直方图,散点图的绘制。

读入数据

import pandas as pd
import numpy as np
data = pd.read_csv("PelicanStores.csv")
data = data.iloc[:,:8]#过滤数据选择前8列
data.head()#看一下前五行

问题1 主要变量的百分数频数分布

#Items(购买商品的总件数)百分数频数分布
Items_percent_frequency_distribution = (pd.value_counts(data["Items"])/np.size(data["Items"]))*100
Items_percent_frequency_distribution

#Net Sales(净销售额)百分数频数分布
bins = [0, 50, 100, 150, 200, 250, 300]
data["Net Sales Group"] = pd.cut(data["Net Sales"], bins, right=False)#对数据进行分组
Net_Sales_percent_frequency_distribution = (pd.value_counts(data["Net Sales Group"])/np.size(data["Net Sales Group"]))*100
Net_Sales_percent_frequency_distribution

#Age(年龄)百分数频数分布
bins = [20, 30, 40, 50, 60, 70, 80]
data["Age_Group"] = pd.cut(data["Age"], bins, right=False)
Age_percent_frequency_distribution = (pd.value_counts(data["Age_Group"])/np.size(data["Age_Group"]))*100
Age_percent_frequency_distribution

问题2:条形图或饼形图,以显示顾客使用各种付款方式的购物数量

#购物数量有两个维度,购买商品的总件数和销售额
M_P_Items_Net_Sales = data.groupby(by=["Method of Payment"])["Items","Net Sales"].agg({"Items":np.sum,"Net Sales":np.sum})
M_P_Items_Net_Sales = M_P_Items_Net_Sales.sort_values(by="Net Sales",ascending=False)
M_P_Items_Net_Sales

#条形图
from pyecharts import Bar, Grid
x_line = [i for i in M_P_Items_Net_Sales.index.format()]
y_line_Items = [i[0] for i in M_P_Items_Net_Sales.values]
y_line_NS = [i[1] for i in M_P_Items_Net_Sales.values]
bar1 = Bar("Items",title_text_size=26, title_top=10, title_pos=10, width=1000, height=400, background_color="rgb(255,255,255)")
bar1.add("", x_line, y_line_Items ,xaxis_label_textsize=12,bar_category_gap='20%')
bar2 = Bar("Net Sales",title_text_size=26, title_top=300, title_pos=10, width=1000, height=400, background_color="rgb(255,255,255)")
bar2.add("", x_line, y_line_NS ,xaxis_label_textsize=12,bar_category_gap='20%')
grid = Grid(height=600, width=1000)
grid.add(bar1, grid_bottom="60%")
grid.add(bar2, grid_top="60%")
grid

#饼图
from pyecharts import Pie
pie1 = Pie("Items", title_text_size=26, title_top=10, title_pos=10)
pie1.add("", x_line, y_line_Items, is_label_show=True, is_legend_show=False, label_text_size=10,center=[30,50], radius=[0,45])
pie2 = Pie("Net Sales", title_text_size=26, title_top=10, title_pos=500)
pie2.add("", x_line, y_line_NS, is_label_show=True, is_legend_show=False, label_text_size=10,legend_orient='vertical',center=[70,50], radius=[0,45])
grid = Grid(height=600, width=1000)
grid.add(pie1, grid_left="60%")
grid.add(pie2, grid_right="60%")
grid

问题3:顾客类型(普通或促销)与净销售额的交叉分组表,对相似性与差异性进行评价

data_CN_table = data.pivot_table(values=["Net Sales"], index=["Age_Group"], columns=["Type of Customer"], aggfunc=[np.sum], fill_value=0)
data_CN_table

  • ①促销所产生的净销售额在20至70岁这个区间是比普通顾客要多一些的,其中以50到60岁这个区间较为明显。
  • ②40到50岁,50到60岁这两个年龄区间的人促销所产生的净销售额相近。
  • ③超过30岁的人,随着年龄的增加,消费能力是一直下降的。
  • ④50到70岁的人更倾向只在促销的时候购买商品。

问题4 探索净销售额与顾客年龄关系的散点图

from pyecharts import Scatter
data_NS_Age = data[["Net Sales", "Age"]]
x_line_age = [i[1] for i in data_NS_Age.values]
y_line_NS = [i[0] for i in data_NS_Age.values]
scatter = Scatter()
scatter.add("", x_line_age, y_line_NS)

问题5 净销售额的描述统计量和顾客的各种不同分类的净销售额的描述统计量

data["Net Sales"].describe()#净销售额的描述统计量

data.groupby(["Type of Customer"])["Net Sales"].describe() #分组进行统计描述

问题6 关于年龄与净销售额之间关系的描述统计量

#相关性分析
data_NS_Age.corr()

年龄与净销售额之间有一个负的相关关系,证明年龄越大可能所消费的金额更小。

.net bitmap rgb数据_Python商务与经济统计学-数据描述相关推荐

  1. 地区的json数据_Python 连接开放航空交通数据,轻松构建航班跟踪应用!

    作者 | geomatics译者 | 弯月,责编 | 郑丽媛头图 | CSDN 下载自视觉中国出品 | CSDN(ID:CSDNnews) 以下为译文: 我喜欢跟踪位置这个主题,因为感觉像是我有第六感 ...

  2. python从txt拿取数据_python从txt文件读取数据

    (作为一个python初学者,记录一点学习期间的笔记,方便日后查阅,若有错误或者更加便捷的方法,望指出!) 1.读取TXT文件数据,并对其中部分数据进行划分.一部分作为训练集数据,一部分作为测试集数据 ...

  3. python怎么批量处理数据_python如何批量处理excel数据?_后端开发

    php赋值运算符有哪些_后端开发 php赋值运算符有:1.[=]赋值运算符:2.[+=]加运算符:3.[-=]减运算符:4.[*=]乘运算符:5.[/=]除运算符:6.[.=]连接字符运算符:7.[% ...

  4. python读取grib2数据_python读取grib grib2气象数据

    GRIB是WMO开发的一种用于交换和存储规则分布数据的二进制文件格式,主要用来表示数值天气预报的产品资料.现行的GRIB 码版本有GRIB1 和GRIB2 两种格式.由于小编只接触过GRIB1数据,所 ...

  5. python爬表格数据_python爬虫,爬取表格数据

    python爬虫,爬取表格数据 python爬虫,爬取表格数据 python爬虫,爬取全国空气质量指数 编程环境:Jupyter Notebook 所要爬取的网页数据内容如下图 python爬虫代码及 ...

  6. python 通达信数据_Python读取通达信本地数据

    一.介绍 python获取股票数据的方法很多,其中 Tushare 财经数据接口包很好用,当然,也可以通过通达信本地的数据获取,这样更为方便. 日线数据存在这路径下 D:\通达信\vipdoc\sh\ ...

  7. 如何用python获取通达信数据_Python读取通达信本地数据

    一.介绍 python获取股票数据的方法很多,其中 Tushare 财经数据接口包很好用,当然,也可以通过通达信本地的数据获取,这样更为方便. 日线数据存在这路径下 D:\通达信\vipdoc\sh\ ...

  8. java爬取网页数据_Python网络爬虫实战(二)数据解析

    Python网络爬虫实战 (二)数据解析 本系列从零开始阐述如何编写Python网络爬虫,以及网络爬虫中容易遇到的问题,比如具有反爬,加密的网站,还有爬虫拿不到数据,以及登录验证等问题,会伴随大量网站 ...

  9. python处理多个excel数据_python 读取多个excel数据写入同一个excel中

    一.将excel数据源存储到同一个excel的不同sheet 中 例如A.xlsx 中有test1,test2 两张sheet.B.xlsx中有test3 一张sheet,存储到C.xlsx中后,C有 ...

最新文章

  1. MBR和GPT概要学习
  2. 注意力机制~Attention Mechanism
  3. boost::hana::type_c用法的测试程序
  4. 链表面试笔试题目总结
  5. 作了一件超人品的事情,看到的各位都有好运
  6. 基于JAVA+SpringMVC+MYSQL的报价管理系统
  7. python session模块_Python requests模块session代码实例
  8. 谁说导航一定要用地图?谷歌DeepMind的强化学习模型靠街景认路
  9. (day 36 - 滑动窗口)剑指 Offer 57 - II. 和为s的连续正数序列
  10. 阶段5 3.微服务项目【学成在线】_day02 CMS前端开发_24-CMS前端页面查询开发-使用钩子方法实现立即查询...
  11. java学生选课系统_java实现学生选课系统
  12. html中的分页条怎么写,html如何制作分页
  13. Springboot项目中添加Quartz定时任务
  14. mysql 临时表空间占用太高_MySQL 临时表空间数据过多的问题排查-爱可生
  15. oracle append parallel,oracle 优化之parallel和append
  16. 【Python 实战基础】如何绘制直方图分析张三成绩数据
  17. 有哪些不错的电子书管理软件?免费项目管理软件推荐
  18. 疫情下的科技内卷:租房被卷进“网购”时代
  19. 硬件原理图Checklist检查表(通用版)
  20. 每股收益再创新高,增长速度趋于减缓:上市公司半年报业绩波澜不惊

热门文章

  1. julia 数组类型转换_在Julia中确定类型的超类型
  2. c ++查找字符串_C ++朋友功能| 查找输出程序| 套装1
  3. nginx服务器配置安全维护,Nginx服务器相关的一些安全配置建议
  4. crontab 日志_liunx 中定时清理过期日志文件
  5. Linux系统中输出输入的管理
  6. php分布式的锁,laravel分布式并发锁
  7. 机器学习 导论_机器学习导论
  8. uint32_t 是常数吗_UINT_MAX常数,带C ++示例
  9. 再见收费的Navicat!操作所有数据库靠它就够了!
  10. 面试官:你说说互斥锁、自旋锁、读写锁、悲观锁、乐观锁的应用场景?