Python爬虫 | 批量爬取今日头条街拍美图
点击上方“Python爬虫与数据挖掘”,进行关注
回复“书籍”即可获赠Python从入门到进阶共10本电子书
今日鸡汤浮云一别后,流水十年间。
专栏作者:霖hero,在职爬虫工程师,熟悉JS逆向与分布式爬虫。喜欢钻研,热爱学习,乐于分享。公众号后台回复入群,拉你进技术群与大佬们近距离交流。
01前言
大家好,我是J哥????
在以前的文章中我们学了Ajax数据爬取,这篇文章我们以今日头条为例,通过分析Ajax请求来抓取今日头条的街拍美图,并将图片下载到本地保存下来。准备好没,我们现在开始!
02
网页分析
在抓取之前,首先分析抓取的逻辑。打开今日头条的街拍美图https://so.toutiao.com/search?dvpf=pc&source=input&keyword=%E8%A1%97%E6%8B%8D,如下图:
我们点击第一个,这个请求的URL是:
随后我们打开开发者工具,切换到Network选项卡,重新刷新页面并下滑,可以发现这里出现了很多的条目,点击‘search?keyword=%’开头的条目,可以发现里面有很多图片信息的数据,其中img_small_url、img_url是图片链接,如下图:
我们只需要用Python来模拟这个Ajax请求,然后提取相关美图链接并下载下来就可以了,但是在这之前,我们还需要分析一下URL的规律。
切换回Headers选项卡,观察一下它的请求URL和Headers信息,如下图:
可以看到,这是一个GET请求,请求URL的参数有keyword、pd、dvpf、aid、page_num、search_json、rawJSON、search_id。我们需要找到这些参数的规律,这样才可以方便地用程序构造出来。
接下来,滑动页面,多加载一些新结果。在加载的同时可以发现,Network中又出现了许多Ajax请求。如下图:
观察后续链接的参数,可以发现发生变化的参数只有page_num,其他参数都没有变化,而且page_num的偏移量为1,因此我们可以用page_num参数来控制数据分页,这样一来,我们就可以通过接口批量获取数据了,然后将数据解析,将图片下载下来即可。
03
爬虫实战
定义一个get_page()方法,实现加载单个Ajax请求的结果。其中唯一变化的参数就是page_num,所以我们将它当作参数传递,实现代码如下:
def get_page(page_num):global headersheaders = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/91.0.4472.77 Safari/537.36',}params = {'keyword':urllib.parse.unquote('%E8%A1%97%E6%8B%8D'),'pd':'atlas','dvpf':'pc','aid':4916,'page_num':page_num,'search_json':'%7B%22from_search_id%22%3A%22202106100003510102121720341003A4ED%22%2C%22origin_keyword%22%3A%22%E8%A1%97%E6%8B%8D%22%2C%22image_keyword%22%3A%22%E8%A1%97%E6%8B%8D%22%7D','rawJSON': 1,'search_id':'202106100004290101500200495C05B763'}url='https://so.toutiao.com/search?'+urlencode(params)try:response=requests.get(url,headers=headers,params=params)if response.status_code==200:return response.json()except requests.ConnectionError:return None
这里我们用urlencode()方法构造请求的GET参数,然后用requests请求这个链接,如果返回状态码为200,则调用response的json()方法将结果转为JSON格式,然后返回。
接下来,再实现一个解析方法:提取每条数据的img_url字段的图片链接,将图片链接返回,此时我们通过构造器来实现,实现代码如下:
def get_images(json):images=json.get('rawData').get('data')for image in images:link = image.get('img_url')yield link
接下来,实现一个保存图片的方法saving_images(),其中link是前面get_images()方法返回的图片链接,实现代码如下:
def saving_img(link):global nameprint(f'-------正在打印第{name}张图片')data=requests.get(link,headers=headers).contentwith open(f'image1/{name}.jpg','wb')as f:f.write(data)name+=1
最后,只需要构造一个page_num数组,遍历page_num,提取图片链接,并将其下载即可,具体代码如下:
def main(paga_num):json=get_page(paga_num)for link in get_images(json):saving_img(link)
if __name__ == '__main__':for i in range(0,2):main(i)
这样整个程序就完成了,运行之后可以发现街拍美图保存下载下来了,这里我们只遍历了两个page_num,爬取了80张图片,如下图:
04
小结
好了,Python爬虫——今日头条街拍美图的爬取就讲解到这里,感谢观看!当然,该程序仍有很多可以完善的地方,例如:使用多进程的进程池来实现多进程下载。
------------------- End -------------------
往期精彩文章推荐:
一篇文章教会你用Python抓取抖音app热点数据
手把手教你进行pip换源,让你的Python库下载嗖嗖的
手把手教你用免费代理ip爬数据
欢迎大家点赞,留言,转发,转载,感谢大家的相伴与支持
想加入Python学习群请在后台回复【入群】
万水千山总是情,点个【在看】行不行
/今日留言主题/
随便说一两句吧!
Python爬虫 | 批量爬取今日头条街拍美图相关推荐
- python爬虫今日头条_python爬虫—分析Ajax请求对json文件爬取今日头条街拍美图
python爬虫-分析Ajax请求对json文件爬取今日头条街拍美图 前言 本次抓取目标是今日头条的街拍美图,爬取完成之后,将每组图片下载到本地并保存到不同文件夹下.下面通过抓取今日头条街拍美图讲解一 ...
- [Python3网络爬虫开发实战] --分析Ajax爬取今日头条街拍美图
[Python3网络爬虫开发实战] --分析Ajax爬取今日头条街拍美图 学习笔记--爬取今日头条街拍美图 准备工作 抓取分析 实战演练 学习笔记–爬取今日头条街拍美图 尝试通过分析Ajax请求来抓取 ...
- python爬取今日头条_Python3网络爬虫实战-36、分析Ajax爬取今日头条街拍美图
本节我们以今日头条为例来尝试通过分析 Ajax 请求来抓取网页数据的方法,我们这次要抓取的目标是今日头条的街拍美图,抓取完成之后将每组图片分文件夹下载到本地保存下来. 1. 准备工作 在本节开始之前请 ...
- 爬取今日头条街拍美图
相关背景: 本篇文章是基于爬虫实践课程–分析Ajax请求并抓取今日头条街拍美图 其实我最开始也只想在CSDN上面找一篇文章看看结果都是分析没有实操,没办法最后只能自己写了,本篇文章里面的问题也是我遇到 ...
- python爬虫今日头条街拍美图开发背景_【Python3网络爬虫开发实战】6.4-分析Ajax爬取今日头条街拍美图...
[摘要] 本节中,我们以今日头条为例来尝试通过分析Ajax请求来抓取网页数据的方法.这次要抓取的目标是今日头条的街拍美图,抓取完成之后,将每组图片分文件夹下载到本地并保存下来. 1. 准备工作 在本节 ...
- Python爬虫:爬取今日头条“街拍”图片(修改版)
前言 在参考<Python3网络爬虫开发实战>学习爬虫时,练习项目中使用 requests ajax 爬取今日头条的"街拍"图片,发现书上的源代码有些已经不适合现在了, ...
- 转:【Python3网络爬虫开发实战】6.4-分析Ajax爬取今日头条街拍美图
[摘要] 本节中,我们以今日头条为例来尝试通过分析Ajax请求来抓取网页数据的方法.这次要抓取的目标是今日头条的街拍美图,抓取完成之后,将每组图片分文件夹下载到本地并保存下来. 1. 准备工作 在本节 ...
- Python3网络爬虫开发实战分析Ajax爬取今日头条街拍美图
本节中,我们以今日头条为例来尝试通过分析Ajax请求来抓取网页数据的方法.这次要抓取的目标是今日头条的街拍美图,抓取完成之后,将每组图片分文件夹下载到本地并保存下来. 1. 准备工作 很多人学习pyt ...
- 【Python3网络爬虫开发实战】6.4-分析Ajax爬取今日头条街拍美图
[摘要] 本节中,我们以今日头条为例来尝试通过分析Ajax请求来抓取网页数据的方法.这次要抓取的目标是今日头条的街拍美图,抓取完成之后,将每组图片分文件夹下载到本地并保存下来. 1. 准备工作 在本节 ...
最新文章
- AtCoder Grand Contest 002 (AGC002) F - Leftmost Ball 动态规划 排列组合
- OpenYurt 深度解读|开启边缘设备的云原生管理能力
- 详细解读CSS优先级——Web前端系列学习笔记
- html权重值_史上最全的web前端面试题汇总及答案HtmlCss(二)
- ubuntu man手册完善
- svn java注释_svn 强制用户添加注释 和 允许用户修改注释
- linux安装KVM
- MySQL反斜杠 ‘\\‘ 插入数据库丢失
- cmd命令打开文本文档_Windows常用cmd命令总结
- UEditor的使用
- 联想服务器万全T260G3系统,联想万全T260G3服务器电子教室更易管理
- Python 打印九九乘法表
- 笔记本一直提示计算机内存不足怎么办,笔记本电脑内存不足怎么解决
- 二层交换机与三层交换机交换原理
- 学习Nginx这一篇就够了(非本人原创文章)
- 猫哥教你写爬虫 040--存储数据-作业
- Zabbix安装错误解决方案
- x64dbg 实现插件Socket反向通信
- Windows睡眠或者休眠后无法唤醒问题的解决方案
- javaweb课程设计景点门票销售系统
热门文章
- 智慧电力大屏可视化决策系统
- 信息学奥赛一本通 1373池塘钓鱼
- UG/NX二次开发Siemens官方NXOPEN实例解析—2.7 DiameterSymbol(标注符号)
- 硬件钱包linux安装,Multibit HD钱包安装使用教程
- .Net 托管代码和非托管代码的区别
- MYSQL数据备份之mysqldump命令详解(附脚本定时备份)
- ADSL拨号中出现的错误代码含义
- 《液晶显示器和液晶电视维修核心教程》——1.3 液晶屏的最初应用
- 如何操作拆分Word文档?干货来啦!怎样上下拆分Word文档?
- 这4点微不足道的改变,正在带我起飞