Python爬虫基础讲解(二十三):scrapy框架简介
Python爬虫、数据分析、网站开发等案例教程视频免费在线观看
https://space.bilibili.com/523606542
Python学习交流群:1039649593
scrapy是一个使用Python语言(基于Twisted框架)编写的开源网络爬虫框架,目前由
scrapinghub Ltd维护。Scrapy简单易用、灵活易拓展、开发社区活跃,并且是跨平台的。在Linux、MaxOS以及windows平台都可以使用。
网络爬虫
网络爬虫是指在互联网上自动爬取网站内容信息的程序,也被称作网络蜘蛛或网络机器人。大型的爬虫程序被广泛应用于搜索引擎、数据挖掘等领域,个人用户或企业也可以利用爬虫收集对自身有价值的数据。
一个网络爬虫程序的基本执行流程可以总结三个过程:请求数据,解析数据,保存数据
数据请求
请求的数据除了普通的HTML之外,还有json数据、字符串数据、图片、视频、音频等。
解析数据
当一个数据下载完成后,对数据中的内容进行分析,并提取出需要的数据,提取到的数据可以以多种形式保存起来,数据的格式有非常多种,常见的有csv、json、pickle等
保存数据
最后将数据以某种格式(CSV、JSON)写入文件中,或存储到数据库(MySQL、MongoDB)中。同时保存为一种或者多种。
通常,我们想要获取的数据并不只在一个页面中,而是分布在多个页面中,这些页面彼此联系,一个页面中可能包含一个或多个到其他页面的链接,提取完当前页面中的数据后,还要把页面中的某些链接也提取出来,然后对链接页面进行爬取(循环1-3步骤)。
设计爬虫程序时,还要考虑防止重复爬取相同页面(URL去重)、网页搜索策略(深度优先或广度优先等)、爬虫访问边界限定等一系列问题。
从头开发一个爬虫程序是一项烦琐的工作,为了避免因制造轮子而消耗大量时间,在实际应用中我们可以选择使用一些优秀的爬虫框架,使用框架可以降低开发成本,提高程序质量,让我们能够专注于业务逻辑(爬取有价值的数据)。接下来,就带你学习目前非常流行的开源爬虫框架Scrapy。
scrapy安装
scrapy官网:https://scrapy.org/
scrapy中文文档:https://www.osgeo.cn/scrapy/intro/overview.html
安装方式
在任意操作系统下,可以使用pip安装Scrapy,例如:
pip install scrapy
安装完成后我们需要测试安装是否成功,通过如下步骤确认:
在终端中测试能否执行scrapy这条命令
scrapy 2.4.0 - no active projectusage:scrapy <command>[options] [args]Available commands :bench Run quick benchmark testfetch Fetch a URL using the scrapy down1oadergenspider Generate new spider using pre-defined temp1atesrunspider Run a self-contained spider (without creating a project)settings Get settings valuesshe11 Interactive scraping consolestartproject create new projectversion Print scrapy versionview open URL in browser,as seen by scrapy[ more ] More commands available when run from project directoryuse "scrapy <command> -h" to see more info about a command
输入scrapy bench测试连通性,如果出现以下情况表示安装成功:
通过了以上两项检测,说明Scrapy安装成功了。如上所示,我们安装的是当前最新版本2.4.0。
注意:
在安装Scrapy的过程中可能会遇到缺少VC++等错误,可以安装缺失模块的离线包
成功安装后,在CMD下运行scrapy出现上图不算真正成功,检测真正是否成功使用scrapybench测试,如果没有提示错误,就代表成功安装。
全局命令
scrapy 2.4.0 - no active projectusage:scrapy <command>[options] [args]Available commands :bench Run quick benchmark test #测试电脑性能fetch Fetch a URL using the scrapy down1oader#将源代码下载下来并显示出来genspider Generate new spider using pre-defined temp1ates#创建一个新的spider文件runspider Run a self-contained spider (without creating a project)# 这个和通过craw1启动爬虫不同,scrapy runspider爬虫文件名称settings Get settings values#获取当前的配置信息she11 Interactive scraping console#进入scrapy 的交互模式startproject create new project#创建爬虫项目version Print scrapy version#显示scrapy框架的版本view open URL in browser,as seen by scrapy#将网页document内容下载下来,并且在浏览器显示出来[ more ] More commands available when run from project directory
use "scrapy <command> -h" to see more info about a command
项目命令
scrapy startproject projectname
创建一个项目scrapy genspider spidername domain
创建爬虫。创建好爬虫项目以后,还需要创建爬虫。scrapy crawl spidername
运行爬虫。注意该命令运行时所在的目录。
Python爬虫基础讲解(二十三):scrapy框架简介相关推荐
- Python爬虫实战之二 - 基于Scrapy框架抓取Boss直聘的招聘信息
Python爬虫实战之三 - 基于Scrapy框架抓取Boss直聘的招聘信息 ---------------readme--------------- 简介:本人产品汪一枚,Python自学数月,对于 ...
- python爬虫基础小案例, scrapy框架,思路和经验你全都有。
目录 一.scrapy介绍 二.爬取步骤 三.代码 1.创建爬虫项目 scrapy startproject 项目名字 注意: 项目名字不能出现中文,也不能以数字开 ...
- python爬虫基础(二)
文章目录 python爬虫 1.异步爬虫 异步爬虫之多进程and多线程(不建议使用) 异步爬虫之线程池and进程池(适当使用) 单线程+异步协程(推荐) 补充:回调函数 补充:yield 多任务异步协 ...
- python的scrapy框架的安装_Python爬虫基础(四)--Scrapy框架的安装及介绍
Scrapy框架的介绍 安装: pip3 install Scrapy 安装测试: cmd命令行界面,输入:scrapy -h 框架安装完成: scrapy框架: 分为五个模块+两个中间件(5+2结构 ...
- Python爬虫第十课:Scrapy框架(1)
前面的关卡中,我们学习了如何用协程来提升爬虫的速度,并且通过项目实操,将协程运用于抓取HI运动的食物数据. 不知道你会不会有这样一种感觉:要写出一个完整的爬虫程序需要做很多琐碎的工作.比如,要针对不同 ...
- Python爬虫基础操作二
目录 四.爬虫数据存储csv/excel 五.session与cookies 六.selenium库:控制浏览器操作 七.定时与邮件 上一篇爬虫操作基础,本篇讲解爬虫数据存储.cookies,sess ...
- Python爬虫入门实例九之Scrapy框架爬取股票信息(亲测有效)
文章目录 写在前面 一.准备工作 二.具体步骤 1.建立工程和Spider模板 2.编写Spider 3.编写pipelines 4.更改settings 5.运行爬虫 三.注意事项 1.文件内容为空 ...
- 「Python爬虫系列讲解」十四、基于开发者工具 Network 的数据抓包技术
本专栏是以杨秀璋老师爬虫著作<Python网络数据爬取及分析「从入门到精通」>为主线.个人学习理解为主要内容,以学习笔记形式编写的. 本专栏不光是自己的一个学习分享,也希望能给您普及一些关 ...
- 爬虫基础(五)-----scrapy框架简介
---------------------------------------------------摆脱穷人思维 <五> :拓展自己的视野,适当做一些眼前''无用''的事情,防止进入只关 ...
最新文章
- 自动驾驶寒冬与否,关键看“芯”
- java中布局管理器flowlayout,在Java中下列()方法可以把JFrame的布局管理器设为FlowLayout类型。...
- BZOJ 2434: [Noi2011]阿狸的打字机 [AC自动机 Fail树 树状数组 DFS序]
- android 延迟2秒执行_每天30秒让你更懂汽车(10自动变速器2执行装置)
- Linux(Ubuntu)版本Idea软件字体模糊解决办法
- MySQL的日志管理
- spss回归分析_回归分析中的简单斜率检验:用SPSS或jamovi实现
- Digital System Design_VHDL设计
- C:\WINDOWS\Installer文件夹的安全清理
- 千寻位置 开发demo_CICV2019:博世相对高精度定位与千寻绝对高精度定位
- C接口与实现---之一
- 单片机牛人的学习经历
- C语言标准输入输出stdio.h
- 采用Minitab进行logistic回归分析
- Delphi 编译的程序在win10中怎样默认以管理员身份运行
- bash: No such file or directory
- bat脚本--android adb一键截图
- R语言LR逻辑回归实例
- python pandas excel 排序_Python pandas对excel的操作实现示例
- ETHA Lend 项目介绍