2019独角兽企业重金招聘Python工程师标准>>>

Scrapy-Splash是一个Scrapy中支持JavaScript渲染的工具,本节来介绍它的安装方式。

Scrapy-Splash的安装分为两部分。一个是Splash服务的安装,具体是通过Docker,安装之后,会启动一个Splash服务,我们可以通过它的接口来实现JavaScript页面的加载。另外一个是Scrapy-Splash的Python库的安装,安装之后即可在Scrapy中使用Splash服务。

1. 相关链接

  • GitHub:https://github.com/scrapy-plugins/scrapy-splash
  • PyPI:https://pypi.python.org/pypi/scrapy-splash
  • 使用说明:https://github.com/scrapy-plugins/scrapy-splash#configuration
  • Splash官方文档:http://splash.readthedocs.io

2. 安装Splash

Scrapy-Splash会使用Splash的HTTP API进行页面渲染,所以我们需要安装Splash来提供渲染服务。这里通过Docker安装,在这之前请确保已经正确安装好了Docker。

安装命令如下:

docker run -p 8050:8050 scrapinghub/splash

安装完成之后,会有类似的输出结果:

2017-07-03 08:53:28+0000 [-] Log opened.
2017-07-03 08:53:28.447291 [-] Splash version: 3.0
2017-07-03 08:53:28.452698 [-] Qt 5.9.1, PyQt 5.9, WebKit 602.1, sip 4.19.3, Twisted 16.1.1, Lua 5.2
2017-07-03 08:53:28.453120 [-] Python 3.5.2 (default, Nov 17 2016, 17:05:23) [GCC 5.4.0 20160609]
2017-07-03 08:53:28.453676 [-] Open files limit: 1048576
2017-07-03 08:53:28.454258 [-] Can't bump open files limit
2017-07-03 08:53:28.571306 [-] Xvfb is started: ['Xvfb', ':1599197258', '-screen', '0', '1024x768x24', '-nolisten', 'tcp']
QStandardPaths: XDG_RUNTIME_DIR not set, defaulting to '/tmp/runtime-root'
2017-07-03 08:53:29.041973 [-] proxy profiles support is enabled, proxy profiles path: /etc/splash/proxy-profiles
2017-07-03 08:53:29.315445 [-] verbosity=1
2017-07-03 08:53:29.315629 [-] slots=50
2017-07-03 08:53:29.315712 [-] argument_cache_max_entries=500
2017-07-03 08:53:29.316564 [-] Web UI: enabled, Lua: enabled (sandbox: enabled)
2017-07-03 08:53:29.317614 [-] Site starting on 8050
2017-07-03 08:53:29.317801 [-] Starting factory <twisted.web.server.Site object at 0x7ffaa4a98cf8>

这样就证明Splash已经在8050端口上运行了。这时我们打开http://localhost:8050,即可看到Splash的主页,如图1所示。

图1 运行页面

当然,Splash也可以直接安装在远程服务器上。我们在服务器上以守护态运行Splash即可,命令如下:

docker run -d -p 8050:8050 scrapinghub/splash

这里多了-d参数,它代表将Docker容器以守护态运行,这样在中断远程服务器连接后,不会终止Splash服务的运行。

3. Scrapy-Splash的安装

成功安装Splash之后,接下来再来安装其Python库,命令如下:

pip3 install scrapy-splash

命令运行完毕后,就会成功安装好此库,后面会详细介绍它的用法。

转载于:https://my.oschina.net/u/3720876/blog/1620922

芝麻HTTP:Scrapy-Splash的安装相关推荐

  1. Scrapy中的splash的安装应用

    Scrapy中的splash的安装应用 因为要去抓取部分经过JavaScript渲染的网页数据,所以使用scrapy中的Request返回的是没有经过渲染的网页代码, 因此我们就要运用Scrapy中的 ...

  2. 利用scrapy+splash+redis实现对JS动态生成网页的增量爬取

    文章目录 一.任务内容 二.Scrapy安装.配置.调试 三.splash安装.配置.调试 开启hyper-v 安装Docker Desktop 拉取和开启Splash 安装scrapy-splash ...

  3. python spider 安装_Python爬虫(11):Scrapy框架的安装和基本使用

    大家好,本篇文章我们来看一下强大的Python爬虫框架Scrapy.Scrapy是一个使用简单,功能强大的异步爬虫框架,我们先来看看他的安装. Scrapy的安装 Scrapy的安装是很麻烦的,对于一 ...

  4. Crawler之Scrapy:Scrapy简介、安装、使用方法之详细攻略

    Crawler之Scrapy:Scrapy简介.安装.使用方法之详细攻略 目录 scrapy简介 Scrapy进行安装 Scrapy使用方法 scrapy简介 Scrapy是Python开发的一个快速 ...

  5. Python3.5在Windows7环境下Scrapy库的安装

    Python3.5在Windows7环境下Scrapy库的安装 忙活了一下午,总算是把Scrapy库给装完了,记下来给需要帮助的人 首先安装的环境:Windows7 64位 Python的版本是:3. ...

  6. python的scrapy框架的安装_Python爬虫基础(四)--Scrapy框架的安装及介绍

    Scrapy框架的介绍 安装: pip3 install Scrapy 安装测试: cmd命令行界面,输入:scrapy -h 框架安装完成: scrapy框架: 分为五个模块+两个中间件(5+2结构 ...

  7. Python爬虫——Scrapy 简介和安装

    文章目录 Python爬虫--Scrapy 简介和安装 1.Scrapy 简介 2.Scrapy 下载安装 Python爬虫--Scrapy 简介和安装 1.Scrapy 简介 Scrapy 简介 S ...

  8. Python爬虫入门——3.7 Scrapy爬虫框架安装

    声明:参考资料<从零开始学Python网络爬虫 >作者:罗攀,蒋仟    机械工业出版社    ISBN: 9787111579991 参考资料<精通Python网络爬虫:核心技术. ...

  9. Mac环境下Docker及Splash的安装运行教程

    一.前言 由于最近使用Python爬虫框架scrapy练习爬虫,在爬取动态网页的时候,需要用到splash,进行对动态网页进行JavaScript渲染,但是使用splash又必须安装Docker.因为 ...

最新文章

  1. android DataBind LiveData ViewModel 使用详解
  2. 创建、编辑、删除目录
  3. 有兴趣吗?程序员分手手册,教你如何恢复单身
  4. SpringBoot_数据访问-整合MyBatis(一)-基础环境搭建
  5. 对现有的所能找到的DDOS代码(攻击模块)做出一次分析----ICMP篇
  6. js ajax通用方法,ajax的四种实现方式介绍
  7. Node.js模块以及模块加载机制
  8. 挣钱其实是一门学问也一个门道
  9. linux之curl使用技巧
  10. java开发工程师面试问题大全及答案大全
  11. qlistview 自定义控件_QT中QListView中放置自定义控件并添加滚动条
  12. Android适配 - 桌面快捷方式
  13. 离散数学之集合笔记一
  14. 北京东莞企业邮箱注册,外贸邮箱用哪个比较好?
  15. ESP8266 接入阿里物联网平台实现远程控制LED
  16. ipv6的 bind dns 正向解析与反向解析
  17. 深度学习(3)--ResNetResNext
  18. linux malloc错误,如何规避GCC中“尝试使用中毒的malloc / calloc”错误?
  19. mysql备份恢复与集群部署
  20. 关于dateadd与datediff的使用方法

热门文章

  1. 机器学习算法(3:决策树算法)
  2. .NET环境下有关打印页面设置、打印机设置、打印预览对话框的实现
  3. 《为iPad而设计:打造畅销App》——大胆创意
  4. 代码解说Android Scroller、VelocityTracker
  5. [PHP] Phalcon操作示范
  6. sql按条件进行批量查询或update的关键字in
  7. 如何在OS X中打印到PDF文件
  8. 输出程序运行的时间(精确到微秒)
  9. Ubuntu 10.10 安装 libx11-dev
  10. MVP模式的相关知识