2000万条直播数据,揭秘斗鱼主播生存现状
作者 | 朱小五
来源 | 凹凸玩数据(ID:alltodata)
分析一下。
获取数据
data = []
doc = get_json(url)
jobs=doc['data']['rl']
for job in jobs:
dic = {}
dic['user_name']=jsonpath.jsonpath(job,'$..nn')[0] #用户名
dic['user_id']= jsonpath.jsonpath(job,'$..uid')[0] #用户ID
dic['room_name']=jsonpath.jsonpath(job,'$..rn')[0] #房间名
dic['room_id']=jsonpath.jsonpath(job,'$..rid')[0] #房间ID
dic['redu']=jsonpath.jsonpath(job,'$..ol')[0] #热度
dic['c2name']=jsonpath.jsonpath(job,'$..c2name')[0] #分区
dic['time']= stampToTime(time.time())
data.append(dic)
return data
from sqlalchemy import create_engine
engine = create_engine('mysql+mysqldb://root:***密码***@localhost:3306/demo?charset=utf8mb4')
final_result.to_sql('data_douyu',con=engine, index=False, index_label=False,if_exists='append', chunksize=1000)
数据分析
data = data[['c2name', 'redu', 'room_id', 'room_name', 'time','user_id', 'user_name']].drop_duplicates()
#筛选时间
data = data.loc[(data['time'] <= '2019-08-07') & (data['time'] >= '2019-08-01')]
data_abc['hour'] = data_abc['time_num']/ 42 #每十分钟一次,七天
data_abc.head()
数据可视化
import matplotlib as mpl #配置字体
mpl.rcParams['font.sans-serif'] = ['SimHei'] # 指定默认字体
mpl.rcParams['axes.unicode_minus']
plt.figure(figsize=(8,8))
plt.xticks(fontsize=12)
plt.yticks(fontsize=12)
sns.scatterplot(data_test["hour"],data_test["av_redu"],hue=data_test["c2name"])
plt.figure(figsize=(10,6))
plt.xticks(fontsize=13)
plt.yticks(fontsize=13)
sns.distplot(data_abc.loc[(data_abc['av_redu'] > 10000)]["hour"],kde=True,rug=False,color='y')
plt.show()
图中可以发现较大的主播每天直播时长集中在5小时左右,这5个小时的游戏并非我们平时玩的那么简单。主播直播时往往既需要全神贯注玩游戏,又要和观众一起互动交流。
而较小主播直播时长则大部分在1小时左右,不能持续直播,导致观众少;观看人数少,主播没动力,久而久之,也就难以出头,形成恶性循环。
上图中有一些异常值,即平均每日直播时长超过20小时的直播间,这样的直播大部分为“一起看”分区,可以24小时连续播放电影电视剧之类的视频,余下都是游戏或者比赛的官方频道,用来循环播放官方视频。
那么主播们大部分在什么时间直播呢?
他们的观众也是同一时间准时观看吗?
https://t.zsxq.com/iQRjeeY
(*本文为Python大本营转载文章,转载请联系原作者)
◆
精彩推荐
◆
由易观携手CSDN联合主办的第三届易观算法大赛正在火热进行中!冠军奖3万元,每人最多邀请5位用户组队参赛。本次比赛主要预测访问平台的相关事件的PV,UV流量(包括Web端,移动端等),大赛将会提供相应事件的流量数据,以及对应时间段内的所有事件明细表和用户属性表等数据,进行模型训练,并用训练好的模型预测规定日期范围内的事件流量。
推荐阅读
如何用爬虫技术帮助孩子秒到心仪的幼儿园(基础篇)
干货 | Python后台开发的高并发场景优化解决方案
2019年最新华为、BAT、美团、头条、滴滴面试题目及答案汇总
阿里巴巴杨群:高并发场景下Python的性能挑战
2000万条直播数据,揭秘斗鱼主播生存现状相关推荐
- 真实数据揭秘游戏主播能否月入100万
她那时候还太年轻,不知道命运赠送的礼物,早已暗中标好了价格. --<断头王后> 社会在发展,时代在进步.伴随着未曾停息的拥护声和反对声,电竞行业逐渐被接受,被认可,走进大众视野,不再是&q ...
- 直播场控助手 | 为什么说直播场控比主播更重要?
在竞争白热化的直播时代,作为主播最亲密的伙伴,场控的作用不容忽视. 优秀的场控掌握着关键成交节点,实时帮助主播带节奏.促转化.在精细化直播运营中,优秀的场控能力胜过十位主播,让直播间轻松实现销量翻倍. ...
- 天猫双12爬虫(福利:266万条商品数据免费下载)
前言: 继:<天猫双11爬虫(福利:212万条商品数据免费下载)>. 天猫双12商品原始数据\color{red}{天猫双12商品原始数据} 链接:http://pan.baidu.com ...
- 斗鱼直播画面怎么弄到自己网页上_“集战!创界山勇者”斗鱼主播招募活动开始啦!...
关注微信公众号:梦幻模拟战手游 Langrisser传说,由你书写! <梦幻模拟战>x<魔神英雄传>联动活动火热来袭!"小救星"战部渡与伙伴剑部武一郎.忍部 ...
- 天猫双11爬虫(福利:212万条商品数据免费下载)
2016年12月12日更新:<天猫双12爬虫(福利:266万条商品数据免费下载)> 背景: 2016年11月11日,中午刷了一下天猫,突然来了兴致想要把天猫上参与双11活动的商品都爬下来. ...
- 500万条微博数据来源分析
最近项目不是特别忙,想做一些微博方面的分析和处理工作,如果自己现爬取微博数据,积累数据比较慢,恰好看到北理工张华平老师分享的500万条微博数据,直接借用他的数据分析.下载地址是:http://www. ...
- 移动直播之网红主播怎样将直播内容推到斗鱼直播平台的方案
移动直播之网红主播怎样在没有电脑的情况下将直播内容推到斗鱼直播平台 1. 概要 斗鱼直播平台支持第三方推流,本文描述如何用ENC1编码器推流给斗鱼直播平台 1.1 设备连接 准备4G模块[参考链接] ...
- 直播画面已被主播锁定!输入正确的密码后可解锁画面。斗鱼直播主播锁定画面解锁方法(网页版)
解决斗鱼网页版:直播画面已被主播锁定,输入正确的密码后可解锁画面 的问题 注意:此博客仅供技术交流参考,擅自操作造成的一切法律责任自负!!! 问题描述 问题分析 解决思路 具体方法 1.网页空白处点击 ...
- 魔兽世界9.0主播最多的服务器,斗鱼主播服务器分布揭秘!魔兽世界怀旧服精彩不间断...
魔兽世界怀旧服一经推出便吸引了诸多新老玩家的目光,斗鱼平台打造的"斗鱼魔兽怀旧服大事件"活动更是让不少玩家纷纷加入冲级行列,如今斗鱼直播平台不仅坐拥首位怀旧服满级玩家,还有MC首杀 ...
最新文章
- 一天1300 Star量,GitHub上新官方命令行工具
- 解决spark中遇到的数据倾斜问题
- 尤雨溪开发的 vue-devtools 如何安装,为何打开文件的功能鲜有人知?
- android fastboot常见命令
- 输出绝对值(信息学奥赛一本通-T1040)
- 海南计算机考研和培训哪个比较好,海南考研集训营前十排名
- 《Webservice的应用与开发》学习笔记 ·001【Web服务、XML文档】
- 组合数取模模板(2)
- xp sp3 java_windows xp sp3简体中文正式版官网下载
- xp系统怎样添加桌面计算机,如何为XP系统计算机设置桌面
- ubb html编辑器,GitHub - ibone/ubb-editor: web编辑器
- Maven下载sources时报错java.lang.RuntimeException: Cannot reconnect
- DSB2017第一名代码复现
- 微信公众平台接口调试工具json格式不对怎么搞_一步步教你打造微信公众号文章爬虫(3)-批量下载...
- 运行javac 报告javac不是内部或外部命令,但是运行java、java-version正常
- 【模型评价指标】分析模型评价常用指标
- 12种高效的管理方法
- BAT大厂面试题以及答案(一)
- mysql start with递归_关于各个数据库递归(start with connect by prior)的相互转换
- POJ 3348 Cows(二维凸包)