作者 | Mika

出品 | CDA数据分析师(ID:cdacdacda)

今天我们来聊聊最近火到不行的综艺——《乘风破浪的姐姐》,Python分析弹幕部分请看第四部分。点击下方视频,先睹为快:

如果说最近最热门的综艺,那《乘风破浪的姐姐》(下文简称《姐姐》)可谓实至名归。30位出道多年的姐姐辈女艺人,一个个风格各异、个性鲜明。她们将通过合宿生活与舞台竞演,最终选出5位组成逆龄女团。

《乘风破浪的姐姐》就这样突然定档、突然播出、播出前无宣发的情况下爆了,一经播出就抢占各大热搜榜。

今天,我们带大家就用数据来盘一盘这些姐姐们:

主要从以下几点展开:

  • 乘风破浪的姐姐?NO!是兴风作浪的姑奶奶

  • 出道时长十年起,这些姐姐们都有谁?

  • 豆瓣8.3分,姐姐们的实力妥妥的

  • Python分析9万条弹幕,谁才是真正的C位?

乘风破浪的姐姐?

NO!是兴风作浪的姑奶奶

既然是选最特别的女团,哪些人参加自然是关注的焦点。宁静、伊能静、钟丽缇、张雨绮、万茜、黄圣依…光是听到这些选手的名字就让人太期待了!

姐姐们很“任性”

不同于一般的女团选秀,漂亮妹妹们都得听从节目组的安排,而这次的姐姐们普遍很“不服管教”,毕竟都是在自己领域出道多年的资深前辈,她们非常有底气,知道自己想要什么。

节目组让做自我介绍,宁静霸气的回复:“还要介绍我是谁?那我这几十年不是白干了?”

节目组导演让伊能静挡一下膝盖,伊能静说:“这是裤子,我挡不了。你配合我一下,别让我配合你们”。

问万茜为何来参加节目,万茜回答:“经纪人逼我来的”。这也太真性情了吧,简直不是乘风破浪的姐姐,而是兴风作浪的姑奶奶们呀。

端水大师——黄晓明

这些姐姐们,也让在中餐厅里“我不要你觉得 我要我觉得”的霸道总裁黄教主秒变暖心的小明同学——“我不要你觉得,我要您觉得”人送称号端水大师,满满的求生欲。

凭实力挨骂——杜华

在点评环节中,作为评审之一杜华也是各种凭实力挨骂。依然以评选20多岁女团的刻板标准评价姐姐们,让不少观众都看得满头问号,越看越气。

出道时长十年起,唱跳演样样精通

姐姐们到底有多强?

下面让我们看到数据部分。我们搜集了百度百科和维基百科的选手数据。

姐姐们年龄分布

先看到年龄分布,可以看到29-33这个年龄段的姐姐最多共有11位,占比36.67%。其次是34-37岁,共10位,占比33.33%。

姐姐们都来自哪儿?

然后是地区分布,姐姐们都来自哪里呢?其中来自湖南和上海的最多,各有五位。阿朵、万茜、刘芸、沈梦辰、孟佳都是我们湖南湘妹子。然后四川、辽宁、山东的各两位。

姐姐们都是哪些职业

在职业方面呢,我们可以看到,她们大多数演员和歌手出身,艺人中身兼数职的情况比较普遍,30人中至少有17人身兼多职,其中13人既是演员、也是歌手。

初舞台得分的关键因素

《乘风破浪的姐姐》初评分数由个人特质、成团潜力、声乐表现力和舞台表现构成,每项25分,总分100分。

我们通过Python计算数值型变量之间的pearson相关系数。对于系数r的取值,根据经验可将相关程度分为以下几种情况,|r|>=0.8时,可视为高相关,0.5<=|r|<0.8,可视为中度相关,0.3<=|r|<0.5时,可视为低度相关,|r|<0.3,可视为不相关。根据相关系数数值,在95%的置信程度水平情况下:

控制其他影响因素的情况下,个人特质打分对初舞台分数的影响最大。

  • 初评舞台分数和年龄、出道年数没有显著相关关系。

  • 年龄和个人特质、成团潜力的分数间存在低度负相关关系,年龄越大,个人特质和成团潜力的得分也就越低;

  • 个人特质和成团潜力的打分之间存在高度正相关,即两者得分存在高则同高,低则同低的情况。

豆瓣8.3分,姐姐们的实力妥妥的

目前这部综艺在豆瓣的评分为8.3分,很不错的成绩,已有7万2千余人进行评价。

豆瓣总体评分分布

看到具体评分分布,给出四星的最多,为38.2%;其次是5星 占比25%。看来观众普遍还是十分认可姐姐们的表现的。

短评词云图

可以看到词云主要围绕的是"姐姐"、"节目"、"女团"展开。其中在需选手中宁静、万茜被提到的频率最高。

当然也有不少吐槽的点,大家的吐槽主要集中在:

  • 评委杜华:不公平;30+的女性岁月积淀了魅力,评审却按照20岁女团的标准来;给丁当打分真是要气炸。

  • 黄晓明:从霸道总裁秒怂变小明,让人感觉尴尬不已

  • 节目组:场景布置令人寒酸,摄影差,灯光差,布景差。

也有吐槽选手的

  • 黄圣依:等黄圣依淘汰了我再改成五星,谢谢。

Python分析9万条弹幕 

谁才是真正的C位一姐?

我们统计了芒果tv第一期的弹幕数据,共94575条。

下面展示芒果Tv弹幕爬虫部分代码,分析部分代码暂略。数据获取的具体思路如下:

  1. 分析网页,弹幕数据是动态加载的,因此通过Chrome浏览器进行抓包分析并获取真实的URL请求地址;

  2. 使用selenium请求网页数据;

  3. 使用正则表达式re将文本中的HTML提取出来,使用json进行解析;

  4. 使用pandas进行数据的保存。

一、弹幕在哪里找?

打开《乘风破浪的姐姐》选取一集,观看我们要抓取的弹幕,可以看出弹幕是在视频播放之后才滚动加载的,所以我们可以判断视频是通过JS异步加载的。

按照经验,我们切换到network-XHR下面查看,如下图所示,很容易发现了弹幕请求的地址:

https://bullet-ws.hitv.com/bullet/2020/06/21/104556/8337559/0.json

其中:2020/06/21代表日期,104556和8337559参数每集不一样,通过抓包获取即可。

二、获取并解析数据

具体代码如下:

# 导入包
import pandas as pd
import time
import re
import json
from selenium import webdriver# 打开Chrome(需配置webdriver)
browser = webdriver.Chrome()def get_mgtv_danmu(month_num, day_num, num1, num2):step = 1df_all = pd.DataFrame()while True:try:# 第一集URLdanmu_url = 'https://bullet-ws.hitv.com/bullet/2020/{}/{}/{}/{}/{}.json'.format(month_num, day_num, num1, num2, step)# 打印进度print('正在获取第{}页的信息'.format(step))step += 1# 获取弹幕browser.get(danmu_url)# 休眠3秒time.sleep(3)# 提取数据pattern1 = re.compile(r'<html><head></head><body><pre style="word-wrap: break-word; white-space: pre-wrap;">')pattern2 = re.compile(r'</pre></body></html>')data1 = re.sub(pattern1, '', browser.page_source)data2 = re.sub(pattern2, '', data1)# 解析数据js_data = json.loads(data2)# 获取数据all_data = js_data['data']['items']# iddanmu_id = [i.get('id') for i in all_data]# unameuname = [i.get('uname') for i in all_data]# 内容content = [i.get('content') for i in all_data]# 时间danmu_time = [i.get('time') for i in all_data]# 点赞up_count = [i.get('v2_up_count') for i in all_data]# 分钟danmu_minites = step-1# 保存数据df_one = pd.DataFrame({'danmu_id': danmu_id,'uname': uname,'content': content,'danmu_time': danmu_time,'up_count': up_count,'danmu_minites': danmu_minites})# 循环追加df_all = df_all.append(df_one, ignore_index=True)except Exception as e:print(e)print('没有此页面, 爬虫结束')breakreturn df_allif __name__ == '__main__':# df_1 = get_mgtv_danmu(month_num='06', day_num='21', num1=104556, num2=8337559)

获取的数据以数据表的形式存储,如下所示:

df.head()

结论部分

选手弹幕热度排名

在排名数据上,占据前四位的分别是宁静、万茜、吴昕和张雨绮。

下面,分别看到她们的个人弹幕词云图。

宁静-弹幕词云

喜欢宁静的,都喜欢她那种强大的大姐大气场,感觉静姐这哪里是来出道当女团的,明明是来选妃的。

万茜-弹幕词云

再看到万茜,淡雅的性格配上努力勤奋换来的过硬实力,在节目里,万茜也堪称人气王,除了观众爱她,姐姐们也都爱她。关于她的弹幕都是各种"喜欢"、"可爱"、"性格圈粉"等等。

吴昕-弹幕词云

吴昕这次在节目中给了人眼前一亮的感觉,不再是快乐家族中没啥台词的小透明,从用心准备的节目,到谈吐性格都让人感觉十分舒服,非常圈粉。

张雨绮-弹幕词云

最后再看到张雨绮,她真的是反差萌担当了,以为是高冷霸总,结果却是个可爱憨憨,从赛前采访就开始搞笑。带来的节目是《粉红色的回忆》,理由是这是自己唯一能唱完的歌,也是十分可爱了。

结语:

这么多个性十足的姐姐们真是让人爱了爱了,特别是《乘风破浪的姐姐》的开场旁白,非常让人印象深刻:

三十而励!三十而立!三十而骊!

30岁以后,人生的见证者越来越少,但还可以自我见证!

30岁以后,所有的可能性不断褪却,但还可以越过时间,越过自己!

不要轻易用年龄定义自己,只要有追逐梦想的心,无论什么年龄段都有属于自己的精彩!

《乘风破浪的姐姐》数据+代码:

链接: https://pan.baidu.com/s/12XsJ-GrzagDU3LdI5nrsOA

提取码: ywv8

更多精彩推荐
☞国士无双:卖掉美国房子,回国创办姚班,他只为培养一流的程序员!
☞对话 SmartX:领跑超融合中高端市场之道——用专注加专业构筑企业云基础
☞过分了!耗资 5600 万、4 年开发的网络商城成“烂尾楼”,404 无法打开
☞不知道路由器工作原理?没关系,来这看看!看不懂你捶我 | 原力计划
☞万字长文带你入门 GCN
☞赠书 | 基于区块链法定货币的支付体系,应该怎么做?
你点的每个“在看”,我都认真当成了喜欢

9 万条弹幕告诉你,《乘风破浪的姐姐》里谁才是真正的C位?相关推荐

  1. 讲python讲得好的评价_分析20万条弹幕告诉你,8.9分的高分剧《隐秘的角落》到底好看在哪儿?...

    CDA数据分析师 出品作者:Mika 数据:真达 后期:泽龙 Show me data,用数据说话 今天我们聊一聊 <隐秘的角落> 点击下方视频,先睹为快: 最近这部<隐秘的角落&g ...

  2. 分析20万条弹幕告诉你,8.9分的高分剧《隐秘的角落》到底好看在哪儿?

    最近这部<隐秘的角落>彻底火了,目前在豆瓣高达8.9分,有45万余人进行了评论. 一时间剧中张东升那句「爬山」.「你说我还有机会吗」 承包了6月份的梗.各种表情包和段子齐飞. 作为主演秦昊 ...

  3. 太敢拍了!20万条弹幕告诉你,《扫黑风暴》为何能掀起收视热潮?

    CDA数据分析师 出品 作者:Mika 数据:曹鑫 2021年暑期档热度最高.最出圈的电视剧莫过于<扫黑风暴>了. 这部扫黑题材的电视剧<扫黑风暴>一开播就火了.开播仅六小时播 ...

  4. 9万条弹幕告诉你,《乘风破浪的姐姐》里谁才是真正的C位?

     CDA数据分析师 出品   作者:Mika 数据:真达   后期:泽龙 [导语]:今天我们来聊聊最近火到不行的综艺--<乘风破浪的姐姐>,Python分析弹幕部分请看第四部分. 获取数据 ...

  5. Python 分析 10 万条弹幕告诉你:《古董局中局2》到底好不好看?

    作者 | 泽龙.Mika 来源 | CDA数据分析师 今天我们聊一聊<古董局中局2> 点击下方视频,先睹为快: 上周日,有一部鉴宝题材的剧静悄悄上线了,那就是夏雨.魏晨等主演的古董局中局系 ...

  6. 分析10万条弹幕告诉你:《古董局中局2》这部鉴宝题材剧究竟拍的怎么样?

     CDA数据分析师 出品   [导语]:今天我们来聊一聊鉴宝题材网剧<古董局中局2>,Python技术部分请看第四部分. 获取数据代码: 扫描下方公众号 回复关键字"古董&quo ...

  7. Python分析《青你2》67万条弹幕,看看有没有你Pick的小姐姐

    ** CDA数据分析师 出品  ** 作者:泽龙.Mika **数据:真达  ** **后期:泽龙 ** 今天我们来聊一聊选秀节目<青春有你2>. Show me data,用数据说话 淡 ...

  8. 利用python对b站某GPT-4解说视频的近万条弹幕进行爬取、数据挖掘、数据分析、弹幕数量预测及情绪分类

    目录 一.利用Python爬取弹幕 二.利用几行代码直接生成词云 三.将弹幕属性和内容放入mysql当中 四.分析弹幕在视频各节点的数量 1.分析视频各个片段出现的弹幕数量 2.分析视频各大章节出现的 ...

  9. 我分析了b站10万条弹幕,发现了歪嘴战神的终极奥义!(文末重磅福利)

    大家好,我是小z~ 天气太热,今天文末一次性送出5本很nice商业智能可视化书籍,给大家解解暑. 最近,歪嘴战神血洗b站,靠着"耐克式微笑"成功出圈,迷倒众生. 这次,小z爬取了1 ...

最新文章

  1. NIO中那些奇怪的Buffer
  2. 函数实现十进制转二进制
  3. Spark2.1.0之内置RPC框架
  4. 题目1033:继续xxx定律
  5. 用Flash创建一个类似Nano War游戏的教程
  6. 2018.09.30 bzoj2288:生日礼物(贪心+线段树)
  7. Codeforces 365C - Matrix(hash + yy)
  8. html仿苹果浏览器,完美仿iPhone风格主题 领航浏览器体验
  9. python dataframe删除重复行_详解pandas使用drop_duplicates去除DataFrame重复项参数
  10. Dubbo服务端暴露全流程
  11. div自定义下拉框组件
  12. 实战|朝阳医院药品销售分析案例
  13. 支付宝手机网站支付接口集成的经验小结
  14. FRM 5.1 现代投资组合理论
  15. Vmware私有云平台搭建(1)
  16. 概率论与数理统计浙江大学笔记和课后答案
  17. sqlite数据库的版本更替
  18. Hive中的left semi join和left anti join
  19. 像计算机科学家一样思考在线,如何像计算机科学家一样思考?(女生篇)
  20. vb读取计算机mac地址,Re:在VB中如何取得网卡的mac地址?

热门文章

  1. Echarts 曲线数少于图例数解决方法
  2. canvas 之星空动画
  3. C# 使用Process调用外部程序中所遇到的参数问题
  4. android4.3 Bluetooth分析之扫描分析
  5. C#-WinForm-布局-Anchor-锁定布局、Dock-填充布局、工具箱中的容器
  6. MPMoviePlayerController属性,方法,通知整理
  7. 模拟,贪心,枚举(二)
  8. JS 仿淘宝幻灯片 非完整版 小案例
  9. [PyTorch] 安装
  10. 【库安装】windows下Python安装protobuf