python多线程爬表情包,斗图斗够瘾~
前言
嗨喽!大家好,这里是魔王。
什么?群里又在斗图 (+_+)? 别动让我来(>人<;)
教你一招爬取海量表情包图片, 从此告别图慌 !!!
课 题:python爬取海量表情包
课程亮点:
- 系统分析目标网页
- html标签数据解析方法
- 海量图片数据一键保存
环境介绍:
- python 3.8
- pycharm
模块使用:
- requests >>> pip install requests
- parsel >>> pip install parsel
- time 时间模块 记录运行时间
流程:
一. 分析我们想要的数据内容 是可以从哪里获取
- 表情包 >>> 图片url地址 以及 图片名字
- 对于开发者工具的使用 >>>
二. 代码实现步骤
发送请求
确定一下发送请求 url地址
请求方式是什么 get请求方式 post请求方式
请求头参数 : 防盗链 cookie …
获取数据
获取服务器返回的数据内容
response.text 获取文本数据
response.json() 获取json字典数据
response.content 获取二进制数据 保存图片/音频/视频/特定格式文件内容 都是获取二进制数据内容
解析数据
提取我们想要的数据内容
I. 可以直接解析处理
II. json字典数据 键值对取值
III. re正则表达式
IV. css选择器
V. xpath
保存数据
文本
csv
数据库
本地文件夹
导入模块
import requests # 数据请求模块 第三方模块 pip install requests
import parsel # 数据解析模块 第三方模块 pip install parsel
import re # 正则表达式模块
import time # 时间模块
import concurrent.futures
单线程爬取10页数据
1. 发送请求
start_time = time.time()for page in range(1, 11):url = f'https://fabiaoqing.com/biaoqing/lists/page/{page}html'headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/95.0.4638.54 Safari/537.36'}response = requests.get(url=url, headers=headers)# <Response [200]> response 对象 200状态码 表示请求成功
2. 获取数据, 获取文本数据 / 网页源代码
# 在开发者工具上面 元素面板 看到有相应标签数据, 但是我发送请求之后 没有这样的数据返回
# 我们要提取数据, 要根据服务器返回数据内容
# xpath 解析方法 parsel 解析模块 parsel这个模块里面就可以调用xpath解析方法
# print(response.text)
3. 解析数据
# 解析速度 bs4 解析速度会慢一些 如果你想要对于字符串数据内容 直接取值 只能正则表达式selector = parsel.Selector(response.text) # 把获取下来html字符串数据内容 转成 selector 对象title_list = selector.css('.ui.image.lazy::attr(title)').getall()img_list = selector.css('.ui.image.lazy::attr(data-original)').getall()
# 把获取下来的这两个列表 提取里面元素 一一提取出来
# 提取列表元素 for循环 遍历for title, img_url in zip(title_list, img_list):
4. 保存数据
# split() 字符串分割的方法 根据列表索引位置取值
# img_name_1 = img_url[-3:] # 通过字符串数据 进行切片
# 从左往右 索引位置 是从 0 开始 从右往左 是 -1开始# print(title, img_url)title = re.sub(r'[\/:*?"<>|\n]', '_', title)# 名字太长 报错img_name = img_url.split('.')[-1] # 通过split() 字符串分割的方法 根据列表索引位置取值img_content = requests.get(url=img_url).content # 获取图片的二进制数据内容with open('img\\' + title + '.' + img_name, mode='wb') as f:f.write(img_content)print(title)
多线程爬取10页数据
def get_response(html_url):"""发送请求"""headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/95.0.4638.54 Safari/537.36'}response = requests.get(url=html_url, headers=headers)return response
def get_img_info(html_url):"""获取图片url地址 以及 图片名字"""response = get_response(html_url)selector = parsel.Selector(response.text) # 把获取下来html字符串数据内容 转成 selector 对象title_list = selector.css('.ui.image.lazy::attr(title)').getall()img_list = selector.css('.ui.image.lazy::attr(data-original)').getall()zip_data = zip(title_list, img_list)return zip_data
def save(title, img_url):"""保存数据"""title = re.sub(r'[\/:*?"<>|\n]', '_', title)# 名字太长 报错img_name = img_url.split('.')[-1] # 通过split() 字符串分割的方法 根据列表索引位置取值img_content = requests.get(url=img_url).content # 获取图片的二进制数据内容with open('img\\' + title + '.' + img_name, mode='wb') as f:f.write(img_content)print(title)
多进程爬取10页数据
def main(html_url):zip_data = get_img_info(html_url)for title, img_url in zip_data:save(title, img_url)
if __name__ == '__main__':start_time = time.time()exe = concurrent.futures.ThreadPoolExecutor(max_workers=10)for page in range(1, 11):# 1. 发送请求url = f'https://fabiaoqing.com/biaoqing/lists/page/{page}html'exe.submit(main, url)exe.shutdown()end_time = time.time()use_time = int(end_time - start_time)print('程序耗时: ', use_time)
单线程爬取10页数据 61秒时间
多线程爬取10页数据 19秒时间 >>> 13
多进程爬取10页数据 21秒时间 >>> 18
好了,我的这篇文章写到这里就结束啦!
希望你在python这条路上依心而行,别回头,别四顾。一如既往不改初见的模样,未来的路很长,不管怎样,一定要相信自己一直走下去。
有更多建议或问题可以评论区或私信我哦!一起加油努力叭(ง •_•)ง
喜欢就关注一下博主,或点赞收藏一下我的文章叭!!!
python多线程爬表情包,斗图斗够瘾~相关推荐
- Python自动生成表情包,从此斗图无敌手!
作为一个数据分析师,应该信奉一句话--"一图胜千言".不过这里要说的并不是数据可视化,而是一款全民向的产品形态--表情包!!!! 表情包不仅仅是一种符号,更是一种文化,是促进社交乃 ...
- Python | 自动生成表情包,从此斗图无敌手!
来源:CSDN ID:CSDnews 作为一个数据分析师,应该信奉一句话--"一图胜千言".不过这里要说的并不是数据可视化,而是一款全民向的产品形态--表情包!!!! 表情包不仅仅 ...
- python多线程下载表情包
threading模块 简单使用 import threading,time ''' 想要学习Python?Python学习交流群:973783996满足你的需求,资料都已经上传群文件,可以自行下载! ...
- Python多线程爬虫教你如何快速下载表情包,告别斗图斗不赢的烦恼!
前言 在QQ斗图中,为什么有些人总有斗不完的图,今天,这里有了这个斗图小程序,终于可以告别斗图斗不赢的痛了. 文章目录 1.完成这个小程序需要导入的模块 2.了解两个HTTP状态码 3.怎样实现 4. ...
- python多线程爬取斗图啦数据
python多线程爬取斗图啦网的表情数据 使用到的技术点 requests请求库 re 正则表达式 pyquery解析库,python实现的jquery threading 线程 queue 队列 ' ...
- 群里又会python的吗_自从会了Python在群里斗图就没输过,Python批量下载表情包!...
原标题:自从会了Python在群里斗图就没输过,Python批量下载表情包! 导语 最近图慌,于是随便写了个表情包批量下载的脚本,没什么技术含量,纯娱乐性质. 让我们愉快地开始吧~ 开发工具 Pyth ...
- python表情包多样化图形化聊天室_Python还有这功能:自动生成表情包,从此斗图无敌手!...
原标题:Python还有这功能:自动生成表情包,从此斗图无敌手!
- python恶搞表情包-Python自动生成表情包,python在手,从此斗图无敌手
作为一个数据分析师,应该信奉一句话----"一图胜千言".不过这里要说的并不是数据可视化,而是一款全民向的产品形态----表情包!!!! 表情包不仅仅是一种符号,更是一种文化:是促 ...
- python从入门到入土表情包-Python自动生成表情包,python在手,从此斗图无敌手
作为一个数据分析师,应该信奉一句话----"一图胜千言".不过这里要说的并不是数据可视化,而是一款全民向的产品形态----表情包!!!! 表情包不仅仅是一种符号,更是一种文化:是促 ...
最新文章
- python的翻译-python写的翻译代码
- WindowsForm 计算器
- Nginx+Tomcat出现session丢失问题
- windows 客户端的Navicat PL/SQL 连接Oracle 数据库
- CF1042E Vasya and Magic Matrix 期望dp + 推公式
- vue 组件库发布_如何创建和发布Vue组件库
- Linux 4.15 rc7,Linux学习之十五(sed命令)-2017-4-23
- 单点登录的原理与简单实现
- java月实训小结800字_Java实训小结
- IBM连续20个季度营收下滑,但这可能是个好信号
- 《JSP实用教程(第2版)/耿祥义》错误之处理汉字乱码
- linux 新建文件夹命令
- 程序员面试需要出示身份证和毕业证原件吗
- linux学习(三)输入输出重定向和管道功能、cat命令、more命令
- android x86 安装到u盘分区,安卓X86 U盘启动盘制作教程 PC体验Android x86 4.0系统
- socketTCP协程文件+信息传递 - TCP聊天文件服务器v1.9 - 划时代的版本更新(4.6万字)
- 联想笔记本一键还原出现 “系统分区结构发生改变,无法进行恢复操作”怎样处理。
- 通过PyQt5+PyQtWebEngine+pyecharts建立自己的收入支出记账软件
- 卓训教育:孩子叛逆厌学怎么办?孩子不想去上学怎么办?
- 深入理解Java虚拟机开篇