今天咱们用 Jupyter-Notebook 并结合框架(Selenium)模拟浏览器抓取微博图片并将图片保存本地。

Selenium 是一个用电脑模拟人的操作浏览器网页,可以实现自动化测试,模拟浏览器抓取数据等工作。

环境部署

安装 Jupyter notebook

这里只需要在命令行中输入:jupyter notebook 启动跳转到浏览器编辑界面即可。

浏览器页面:

安装 Selenium

安装 Selenium 非常简单,只需要用命令 'pip install Selenium' 即可,安装成功提示信息如下:

下载浏览器驱动

下载驱动地址如下:

Firefox浏览器驱动

Chrome浏览器驱动:chromedriver

IE浏览器驱动:IEDriverServer

Edge浏览器驱动:MicrosoftWebDriver

需要把浏览器驱动放入系统路径中,或者直接告知 selenuim 的驱动路径。

环境都搭建好后就可以直接开始爬取数据了。

抓取微博数据

首先导入包,模拟浏览器访问微博主页,详细代码如下:

from selenium import webdriver
driver = webdriver.Chrome()
driver.get('https://weibo.com/')

此时浏览器会打开一个新页面,如下图所示:

接下来开始分析页面数据:微博页面搜索奥运会关键字后出现新的页面,然后复制网址,抓取和奥运会相关的图片保存于本地,搜索界面如下:

输入网址获取网页内容:

driver.get('https://s.weibo.com/weibo/%25E5%25A5%25A5%25E8%25BF%2590%25E4%25BC%259A?topnav=1&wvr=6&b=1')
contents = driver.find_elements_by_xpath(r'//p[@class="txt"]')
print(len(contents))

输出内容如下:

查看网页详细信息:

for i in range(0,3):print("==============================")print(contents[i].get_attribute('innerHTML'))

获取图片信息:

contents = driver.find_elements_by_xpath(r'//img[@action-type="fl_pics"]')print(len(contents))for i in range(0,20):print("==============================")print(contents[i].get_attribute('src'))

下载图片在本地:

import os
import urllib.requestfor i in range(0,20):print("==============================")image_url=contents[i].get_attribute('src')file_name="downloads//p"+str(i)+".jpg"print(image_url,file_name)urllib.request.urlretrieve(image_url, filename=file_name)

至此微博页面关于奥运会的相关图片已保存于本地,图片保存详情如下:

汇总代码如下

from selenium import webdriver
import urllib.requestdriver = webdriver.Chrome()
driver.get('https://weibo.com/')driver.get('https://s.weibo.com/weibo/%25E5%25A5%25A5%25E8%25BF%2590%25E4%25BC%259A?topnav=1&wvr=6&b=1')contents = driver.find_elements_by_xpath(r'//p[@class="txt"]')for i in range(0,3):print("==============================")print(contents[i].get_attribute('innerHTML'))contents = driver.find_elements_by_xpath(r'//img[@action-type="fl_pics"]')print(len(contents))for i in range(0,20):print("==============================")print(contents[i].get_attribute('src'))for i in range(0,20):print("==============================")image_url=contents[i].get_attribute('src')file_name="downloads//p"+str(i)+".jpg"print(image_url,file_name)urllib.request.urlretrieve(image_url, filename=file_name)

以上汇总代码给没有安装 Jupyter Notebook 的朋友们使用,希望对大家有帮助。

总结

今天的文章主要讲解用 Jupyter Notebook 工具和 Selenium 框架抓取微博数据,希望对大家有所帮助。

用 Jupyter Notebook 爬取微博图片保存本地!相关推荐

  1. 爬取美女图片保存本地与入MySQL库(宅男福利)

    本文详细记录如何爬取美女图片,并将图片下载保存在本地,同时将图片url进行入库.保存在本地肯定是为了没事能拿出来养养眼啊,那入库就是为了定位图片啊,要懂点技术的话,还能搬运搬运做个小图片网站,不为别的 ...

  2. Python爬取网页图片至本地

    Python爬取网页图片至本地 爬取网页上的图片至本地 参考代码如下: # -*- codeing = utf-8 -*- import requests import rephotos = [] h ...

  3. Python爬虫——批量爬取微博图片(不使用cookie)

    引言:刚开始我想要爬取微博的照片,但是发现网上大多数的blog都是需要一个cookie的东西,当时我很难得到,偶然翻到一个个人的技术博客: http://www.omegaxyz.com/2018/0 ...

  4. 如何用python爬取图片数据_“python爬取微博图片教程“用Python爬虫爬取的图片怎么知道图片有没有水印...

    怎样用python爬新浪微博大V所有数据 我是个微博重度,工作之余喜欢刷刷timeline看看有什么新鲜事发也因此认识了高质量的原创大V,有分享技术资料的,比如好东西传送门:有时不时给你一点人生经验的 ...

  5. python爬取微博图片教程_Python爬取微博实例分析

    引言 利用Ajax分析微博并爬取其内容如微博内容,点赞数,转发数,评论数等. 分析 打开陈一发微博网站:https://m.weibo.cn/p/1005051054009064,并同时打开开发者工具 ...

  6. 爬虫图片mysql_爬取微博图片数据存到Mysql中遇到的各种坑\爬取微博图片\Mysql存储图片\微博爬虫...

    本人长期出售超大量微博数据.旅游网站评论数据,并提供各种指定数据爬取服务,Message to YuboonaZhang@Yahoo.com.同时欢迎加入社交媒体数据交流群:99918768 前言 由 ...

  7. 爬取图片到mysql数据库_爬取微博图片数据存到Mysql中遇到的各种坑\mysql存储图片\爬取微博图片...

    前言 由于硬件等各种原因需要把大概170多万2t左右的微博图片数据存到Mysql中.之前存微博数据一直用的非关系型数据库mongodb,由于对Mysql的各种不熟悉,踩了无数坑,来来回回改了3天才完成 ...

  8. Python 爬虫多线程爬取美女图片保存到本地

    Wanning 我们不是生产者,我们只是搬运工 资源来至于qiubaichengren ,代码基于Python 3.5.2 友情提醒:血气方刚的骚年.请 谨慎 阅图 !!! 谨慎 阅图 !!! 谨慎 ...

  9. python Scrapy Selenium PhantomJS 爬取微博图片

    1,创建项目 scrapy startproject weibo #创建工程 scrapy genspider -t basic weibo.com weibo.com #创建spider 目录结构 ...

最新文章

  1. HDR sensor 原理介绍
  2. MMDetection3D:新一代通用3D目标检测平台
  3. Linux系统中退出vim的编辑器3种情况
  4. python上传excel文件_flask上传excel文件,无须存储,直接读取内容
  5. kali利用msf工具对ms08-067漏洞入侵靶机(win xp2)
  6. Effective Java~3. 私有Constructor 或Enum 强化单例
  7. Lucene第一讲——概述与入门
  8. vue 执行函数this_在vue中使用回调函数,this调用无效的解决
  9. python字符串的内建函数_Python 的字符串内建函数
  10. 内核引导参数IOMMU与INTEL_IOMMU有何不同?
  11. 18个有用的 .htaccess 文件使用技巧
  12. 2012怎么设置index.php,配置伪静态.htaccess去掉wordpress固定连接里的index.php
  13. 谷歌浏览器安装JSON格式化插件
  14. 关于电的计算机公式,电功率计算公式大全
  15. PKU ACM 1008 玛雅历
  16. Swift-Moya 源码解析
  17. JAVA实现雪花飘落
  18. IBM ServerGuide 8.50
  19. OpenCV图像处理 空间域图像增强(图像锐化 1 基于拉普拉斯算子)
  20. windows下虚拟机ping不通主机的原因+我的解决办法

热门文章

  1. Scrapy 豆瓣搜索页爬虫
  2. Qt面试笔试题问答经验总结
  3. windows系统如何使用命令检测网络
  4. UVA1593 代码对齐 输入输出控制
  5. percona toolkit系列(gh-ost)
  6. 如何查询主机IP地址
  7. Jquery.city-picker 实现省市区三级联动
  8. linux操作系统. 80188,Materials-Studio5.5在Linux服务器上安装与测算讨论 - 第一原理 - 小木虫 - 学术 科研 互动社区...
  9. 5·29“爱脚日”,双驰“个性化量脚制鞋”以爱之名给你呵护
  10. 三国皇帝的寡妇秘史(1)