芝麻HTTP:Scrapy-Splash的安装
2019独角兽企业重金招聘Python工程师标准>>>
Scrapy-Splash是一个Scrapy中支持JavaScript渲染的工具,本节来介绍它的安装方式。
Scrapy-Splash的安装分为两部分。一个是Splash服务的安装,具体是通过Docker,安装之后,会启动一个Splash服务,我们可以通过它的接口来实现JavaScript页面的加载。另外一个是Scrapy-Splash的Python库的安装,安装之后即可在Scrapy中使用Splash服务。
1. 相关链接
- GitHub:https://github.com/scrapy-plugins/scrapy-splash
- PyPI:https://pypi.python.org/pypi/scrapy-splash
- 使用说明:https://github.com/scrapy-plugins/scrapy-splash#configuration
- Splash官方文档:http://splash.readthedocs.io
2. 安装Splash
Scrapy-Splash会使用Splash的HTTP API进行页面渲染,所以我们需要安装Splash来提供渲染服务。这里通过Docker安装,在这之前请确保已经正确安装好了Docker。
安装命令如下:
docker run -p 8050:8050 scrapinghub/splash
安装完成之后,会有类似的输出结果:
2017-07-03 08:53:28+0000 [-] Log opened.
2017-07-03 08:53:28.447291 [-] Splash version: 3.0
2017-07-03 08:53:28.452698 [-] Qt 5.9.1, PyQt 5.9, WebKit 602.1, sip 4.19.3, Twisted 16.1.1, Lua 5.2
2017-07-03 08:53:28.453120 [-] Python 3.5.2 (default, Nov 17 2016, 17:05:23) [GCC 5.4.0 20160609]
2017-07-03 08:53:28.453676 [-] Open files limit: 1048576
2017-07-03 08:53:28.454258 [-] Can't bump open files limit
2017-07-03 08:53:28.571306 [-] Xvfb is started: ['Xvfb', ':1599197258', '-screen', '0', '1024x768x24', '-nolisten', 'tcp']
QStandardPaths: XDG_RUNTIME_DIR not set, defaulting to '/tmp/runtime-root'
2017-07-03 08:53:29.041973 [-] proxy profiles support is enabled, proxy profiles path: /etc/splash/proxy-profiles
2017-07-03 08:53:29.315445 [-] verbosity=1
2017-07-03 08:53:29.315629 [-] slots=50
2017-07-03 08:53:29.315712 [-] argument_cache_max_entries=500
2017-07-03 08:53:29.316564 [-] Web UI: enabled, Lua: enabled (sandbox: enabled)
2017-07-03 08:53:29.317614 [-] Site starting on 8050
2017-07-03 08:53:29.317801 [-] Starting factory <twisted.web.server.Site object at 0x7ffaa4a98cf8>
这样就证明Splash已经在8050端口上运行了。这时我们打开http://localhost:8050,即可看到Splash的主页,如图1所示。
图1 运行页面
当然,Splash也可以直接安装在远程服务器上。我们在服务器上以守护态运行Splash即可,命令如下:
docker run -d -p 8050:8050 scrapinghub/splash
这里多了-d
参数,它代表将Docker容器以守护态运行,这样在中断远程服务器连接后,不会终止Splash服务的运行。
3. Scrapy-Splash的安装
成功安装Splash之后,接下来再来安装其Python库,命令如下:
pip3 install scrapy-splash
命令运行完毕后,就会成功安装好此库,后面会详细介绍它的用法。
转载于:https://my.oschina.net/u/3720876/blog/1620922
芝麻HTTP:Scrapy-Splash的安装相关推荐
- Scrapy中的splash的安装应用
Scrapy中的splash的安装应用 因为要去抓取部分经过JavaScript渲染的网页数据,所以使用scrapy中的Request返回的是没有经过渲染的网页代码, 因此我们就要运用Scrapy中的 ...
- 利用scrapy+splash+redis实现对JS动态生成网页的增量爬取
文章目录 一.任务内容 二.Scrapy安装.配置.调试 三.splash安装.配置.调试 开启hyper-v 安装Docker Desktop 拉取和开启Splash 安装scrapy-splash ...
- python spider 安装_Python爬虫(11):Scrapy框架的安装和基本使用
大家好,本篇文章我们来看一下强大的Python爬虫框架Scrapy.Scrapy是一个使用简单,功能强大的异步爬虫框架,我们先来看看他的安装. Scrapy的安装 Scrapy的安装是很麻烦的,对于一 ...
- Crawler之Scrapy:Scrapy简介、安装、使用方法之详细攻略
Crawler之Scrapy:Scrapy简介.安装.使用方法之详细攻略 目录 scrapy简介 Scrapy进行安装 Scrapy使用方法 scrapy简介 Scrapy是Python开发的一个快速 ...
- Python3.5在Windows7环境下Scrapy库的安装
Python3.5在Windows7环境下Scrapy库的安装 忙活了一下午,总算是把Scrapy库给装完了,记下来给需要帮助的人 首先安装的环境:Windows7 64位 Python的版本是:3. ...
- python的scrapy框架的安装_Python爬虫基础(四)--Scrapy框架的安装及介绍
Scrapy框架的介绍 安装: pip3 install Scrapy 安装测试: cmd命令行界面,输入:scrapy -h 框架安装完成: scrapy框架: 分为五个模块+两个中间件(5+2结构 ...
- Python爬虫——Scrapy 简介和安装
文章目录 Python爬虫--Scrapy 简介和安装 1.Scrapy 简介 2.Scrapy 下载安装 Python爬虫--Scrapy 简介和安装 1.Scrapy 简介 Scrapy 简介 S ...
- Python爬虫入门——3.7 Scrapy爬虫框架安装
声明:参考资料<从零开始学Python网络爬虫 >作者:罗攀,蒋仟 机械工业出版社 ISBN: 9787111579991 参考资料<精通Python网络爬虫:核心技术. ...
- Mac环境下Docker及Splash的安装运行教程
一.前言 由于最近使用Python爬虫框架scrapy练习爬虫,在爬取动态网页的时候,需要用到splash,进行对动态网页进行JavaScript渲染,但是使用splash又必须安装Docker.因为 ...
最新文章
- android DataBind LiveData ViewModel 使用详解
- 创建、编辑、删除目录
- 有兴趣吗?程序员分手手册,教你如何恢复单身
- SpringBoot_数据访问-整合MyBatis(一)-基础环境搭建
- 对现有的所能找到的DDOS代码(攻击模块)做出一次分析----ICMP篇
- js ajax通用方法,ajax的四种实现方式介绍
- Node.js模块以及模块加载机制
- 挣钱其实是一门学问也一个门道
- linux之curl使用技巧
- java开发工程师面试问题大全及答案大全
- qlistview 自定义控件_QT中QListView中放置自定义控件并添加滚动条
- Android适配 - 桌面快捷方式
- 离散数学之集合笔记一
- 北京东莞企业邮箱注册,外贸邮箱用哪个比较好?
- ESP8266 接入阿里物联网平台实现远程控制LED
- ipv6的 bind dns 正向解析与反向解析
- 深度学习(3)--ResNetResNext
- linux malloc错误,如何规避GCC中“尝试使用中毒的malloc / calloc”错误?
- mysql备份恢复与集群部署
- 关于dateadd与datediff的使用方法