前言

嗨喽!大家好,这里是魔王。

什么?群里又在斗图 (+_+)? 别动让我来(>人<;)

教你一招爬取海量表情包图片, 从此告别图慌 !!!

课 题:python爬取海量表情包

课程亮点:

  • 系统分析目标网页
  • html标签数据解析方法
  • 海量图片数据一键保存

环境介绍:

  • python 3.8
  • pycharm

模块使用:

  • requests >>> pip install requests
  • parsel >>> pip install parsel
  • time 时间模块 记录运行时间

流程:

一. 分析我们想要的数据内容 是可以从哪里获取

  1. 表情包 >>> 图片url地址 以及 图片名字
  2. 对于开发者工具的使用 >>>

二. 代码实现步骤

  1. 发送请求
    确定一下发送请求 url地址
    请求方式是什么 get请求方式 post请求方式
    请求头参数 : 防盗链 cookie …

  2. 获取数据
    获取服务器返回的数据内容
    response.text 获取文本数据
    response.json() 获取json字典数据
    response.content 获取二进制数据 保存图片/音频/视频/特定格式文件内容 都是获取二进制数据内容

  3. 解析数据
    提取我们想要的数据内容
    I. 可以直接解析处理
    II. json字典数据 键值对取值
    III. re正则表达式
    IV. css选择器
    V. xpath

  4. 保存数据
    文本
    csv
    数据库
    本地文件夹

导入模块

import requests  # 数据请求模块 第三方模块 pip install requests
import parsel  # 数据解析模块 第三方模块 pip install parsel
import re  # 正则表达式模块
import time  # 时间模块
import concurrent.futures

单线程爬取10页数据

1. 发送请求

start_time = time.time()for page in range(1, 11):url = f'https://fabiaoqing.com/biaoqing/lists/page/{page}html'headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/95.0.4638.54 Safari/537.36'}response = requests.get(url=url, headers=headers)# <Response [200]> response 对象 200状态码 表示请求成功

2. 获取数据, 获取文本数据 / 网页源代码

# 在开发者工具上面 元素面板 看到有相应标签数据, 但是我发送请求之后 没有这样的数据返回
# 我们要提取数据, 要根据服务器返回数据内容
# xpath 解析方法 parsel 解析模块  parsel这个模块里面就可以调用xpath解析方法
# print(response.text)

3. 解析数据

# 解析速度 bs4 解析速度会慢一些 如果你想要对于字符串数据内容 直接取值 只能正则表达式selector = parsel.Selector(response.text) # 把获取下来html字符串数据内容 转成 selector 对象title_list = selector.css('.ui.image.lazy::attr(title)').getall()img_list = selector.css('.ui.image.lazy::attr(data-original)').getall()
# 把获取下来的这两个列表 提取里面元素 一一提取出来
# 提取列表元素 for循环 遍历for title, img_url in zip(title_list, img_list):

4. 保存数据

# split() 字符串分割的方法 根据列表索引位置取值
# img_name_1 = img_url[-3:] # 通过字符串数据 进行切片
# 从左往右 索引位置 是从 0 开始 从右往左 是 -1开始# print(title, img_url)title = re.sub(r'[\/:*?"<>|\n]', '_', title)# 名字太长 报错img_name = img_url.split('.')[-1]   # 通过split() 字符串分割的方法 根据列表索引位置取值img_content = requests.get(url=img_url).content # 获取图片的二进制数据内容with open('img\\' + title + '.' + img_name, mode='wb') as f:f.write(img_content)print(title)

多线程爬取10页数据

def get_response(html_url):"""发送请求"""headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/95.0.4638.54 Safari/537.36'}response = requests.get(url=html_url, headers=headers)return response
def get_img_info(html_url):"""获取图片url地址 以及 图片名字"""response = get_response(html_url)selector = parsel.Selector(response.text)  # 把获取下来html字符串数据内容 转成 selector 对象title_list = selector.css('.ui.image.lazy::attr(title)').getall()img_list = selector.css('.ui.image.lazy::attr(data-original)').getall()zip_data = zip(title_list, img_list)return zip_data
def save(title, img_url):"""保存数据"""title = re.sub(r'[\/:*?"<>|\n]', '_', title)# 名字太长 报错img_name = img_url.split('.')[-1]  # 通过split() 字符串分割的方法 根据列表索引位置取值img_content = requests.get(url=img_url).content  # 获取图片的二进制数据内容with open('img\\' + title + '.' + img_name, mode='wb') as f:f.write(img_content)print(title)

多进程爬取10页数据

def main(html_url):zip_data = get_img_info(html_url)for title, img_url in zip_data:save(title, img_url)
if __name__ == '__main__':start_time = time.time()exe = concurrent.futures.ThreadPoolExecutor(max_workers=10)for page in range(1, 11):# 1. 发送请求url = f'https://fabiaoqing.com/biaoqing/lists/page/{page}html'exe.submit(main, url)exe.shutdown()end_time = time.time()use_time = int(end_time - start_time)print('程序耗时: ', use_time)

单线程爬取10页数据 61秒时间

多线程爬取10页数据 19秒时间 >>> 13

多进程爬取10页数据 21秒时间 >>> 18

好了,我的这篇文章写到这里就结束啦!

希望你在python这条路上依心而行,别回头,别四顾。一如既往不改初见的模样,未来的路很长,不管怎样,一定要相信自己一直走下去。

有更多建议或问题可以评论区或私信我哦!一起加油努力叭(ง •_•)ง

喜欢就关注一下博主,或点赞收藏一下我的文章叭!!!

python多线程爬表情包,斗图斗够瘾~相关推荐

  1. Python自动生成表情包,从此斗图无敌手!

    作为一个数据分析师,应该信奉一句话--"一图胜千言".不过这里要说的并不是数据可视化,而是一款全民向的产品形态--表情包!!!! 表情包不仅仅是一种符号,更是一种文化,是促进社交乃 ...

  2. Python | 自动生成表情包,从此斗图无敌手!

    来源:CSDN ID:CSDnews 作为一个数据分析师,应该信奉一句话--"一图胜千言".不过这里要说的并不是数据可视化,而是一款全民向的产品形态--表情包!!!! 表情包不仅仅 ...

  3. python多线程下载表情包

    threading模块 简单使用 import threading,time ''' 想要学习Python?Python学习交流群:973783996满足你的需求,资料都已经上传群文件,可以自行下载! ...

  4. Python多线程爬虫教你如何快速下载表情包,告别斗图斗不赢的烦恼!

    前言 在QQ斗图中,为什么有些人总有斗不完的图,今天,这里有了这个斗图小程序,终于可以告别斗图斗不赢的痛了. 文章目录 1.完成这个小程序需要导入的模块 2.了解两个HTTP状态码 3.怎样实现 4. ...

  5. python多线程爬取斗图啦数据

    python多线程爬取斗图啦网的表情数据 使用到的技术点 requests请求库 re 正则表达式 pyquery解析库,python实现的jquery threading 线程 queue 队列 ' ...

  6. 群里又会python的吗_自从会了Python在群里斗图就没输过,Python批量下载表情包!...

    原标题:自从会了Python在群里斗图就没输过,Python批量下载表情包! 导语 最近图慌,于是随便写了个表情包批量下载的脚本,没什么技术含量,纯娱乐性质. 让我们愉快地开始吧~ 开发工具 Pyth ...

  7. python表情包多样化图形化聊天室_Python还有这功能:自动生成表情包,从此斗图无敌手!...

    原标题:Python还有这功能:自动生成表情包,从此斗图无敌手!

  8. python恶搞表情包-Python自动生成表情包,python在手,从此斗图无敌手

    作为一个数据分析师,应该信奉一句话----"一图胜千言".不过这里要说的并不是数据可视化,而是一款全民向的产品形态----表情包!!!! 表情包不仅仅是一种符号,更是一种文化:是促 ...

  9. python从入门到入土表情包-Python自动生成表情包,python在手,从此斗图无敌手

    作为一个数据分析师,应该信奉一句话----"一图胜千言".不过这里要说的并不是数据可视化,而是一款全民向的产品形态----表情包!!!! 表情包不仅仅是一种符号,更是一种文化:是促 ...

最新文章

  1. python的翻译-python写的翻译代码
  2. WindowsForm 计算器
  3. Nginx+Tomcat出现session丢失问题
  4. windows 客户端的Navicat PL/SQL 连接Oracle 数据库
  5. CF1042E Vasya and Magic Matrix 期望dp + 推公式
  6. vue 组件库发布_如何创建和发布Vue组件库
  7. Linux 4.15 rc7,Linux学习之十五(sed命令)-2017-4-23
  8. 单点登录的原理与简单实现
  9. java月实训小结800字_Java实训小结
  10. IBM连续20个季度营收下滑,但这可能是个好信号
  11. 《JSP实用教程(第2版)/耿祥义》错误之处理汉字乱码
  12. linux 新建文件夹命令
  13. 程序员面试需要出示身份证和毕业证原件吗
  14. linux学习(三)输入输出重定向和管道功能、cat命令、more命令
  15. android x86 安装到u盘分区,安卓X86 U盘启动盘制作教程 PC体验Android x86 4.0系统
  16. socketTCP协程文件+信息传递 - TCP聊天文件服务器v1.9 - 划时代的版本更新(4.6万字)
  17. 联想笔记本一键还原出现 “系统分区结构发生改变,无法进行恢复操作”怎样处理。
  18. 通过PyQt5+PyQtWebEngine+pyecharts建立自己的收入支出记账软件
  19. 卓训教育:孩子叛逆厌学怎么办?孩子不想去上学怎么办?
  20. 深入理解Java虚拟机开篇

热门文章

  1. blender基础,制作台灯,花瓶,椅子,吉普车
  2. mybatis 一对多 两种查询方式
  3. 库存平衡与调拨系统的算法架构
  4. 机器人动力学与控制学习笔记(九)————基于模糊自适应增益调整的机器人滑模控制
  5. vue 移动端布局方案
  6. 斯坦福大学自然语言处理研究的《信息检索》课程
  7. Excel -- 批量删除字符大于某值的单元格
  8. Virbox 编译器,支持全平台全架构的源代码加密
  9. Android通讯录管理(获取联系人、通话记录、短信消息)(二)
  10. PyQt5 | PyQt5打开图片、视频、摄像头