首先，在教程（二）（http://blog.csdn.net/u012150179/article/details/32911511）中，研究的是爬取单个网页的方法。在教程（三）（http://blog.csdn.net/u012150179/article/details/34441655）中，讨论了Scrapy核心架构。现在在（二）的基础上，并结合在（三）中提到的爬取多网页的原理方法，进而进行自动多网页爬取方法研究。

并且，为了更好的理解Scrapy核心架构以及数据流，在这里仍采用scrapy.spider.Spider作为编写爬虫的基类。

首先创建project:

[python] view plain copy

scrapy startproject CSDNBlog

一. items.py编写

在这里为清晰说明，只提取文章名称和文章网址。

[python] view plain copy

# -*- coding:utf-8 -*-
from scrapy.item import Item, Field
class CsdnblogItem(Item):
"""存储提取信息数据结构"""
article_name = Field()
article_url = Field()

二. pipelines.py编写

[python] view plain copy

import json
import codecs
class CsdnblogPipeline(object):
def __init__(self):
self.file = codecs.open('CSDNBlog_data.json', mode='wb', encoding='utf-8')
def process_item(self, item, spider):
line = json.dumps(dict(item)) + '\n'
self.file.write(line.decode("unicode_escape"))
return item

其中，构造函数中以可写方式创建并打开存储文件。在process_item中实现对item处理，包含将得到的item写入到json形式的输出文件中。

三. settings.py编写

对于setting文件，他作为配置文件，主要是至执行对spider的配置。一些容易被改变的配置参数可以放在spider类的编写中，而几乎在爬虫运行过程中不改变的参数在settings.py中进行配置。

[python] view plain copy

# -*- coding:utf-8 -*-
BOT_NAME = 'CSDNBlog'
SPIDER_MODULES = ['CSDNBlog.spiders']
NEWSPIDER_MODULE = 'CSDNBlog.spiders'
#禁止cookies,防止被ban
COOKIES_ENABLED = False
ITEM_PIPELINES = {
'CSDNBlog.pipelines.CsdnblogPipeline':300
}
# Crawl responsibly by identifying yourself (and your website) on the user-agent
#USER_AGENT = 'CSDNBlog (+http://www.yourdomain.com)'

这里将COOKIES_ENABLED参数置为True，使根据cookies判断访问的站点不能发现爬虫轨迹，防止被ban。

ITEM_PIPELINES类型为字典，用于设置启动的pipeline，其中key为定义的pipeline类，value为启动顺序，默认0-1000。

四. 爬虫编写

爬虫编写始终是重头戏。原理是分析网页得到“下一篇”的链接，并返回Request对象。进而继续爬取下一篇文章，直至没有。

上码：

[python] view plain copy

#!/usr/bin/python
# -*- coding:utf-8 -*-
# from scrapy.contrib.spiders import CrawlSpider,Rule
from scrapy.spider import Spider
from scrapy.http import Request
from scrapy.selector import Selector
from CSDNBlog.items import CsdnblogItem
class CSDNBlogSpider(Spider):
"""爬虫CSDNBlogSpider"""
name = "CSDNBlog"
#减慢爬取速度为1s
download_delay = 1
allowed_domains = ["blog.csdn.net"]
start_urls = [
#第一篇文章地址
"http://blog.csdn.net/u012150179/article/details/11749017"
]
def parse(self, response):
sel = Selector(response)
#items = []
#获得文章url和标题
item = CsdnblogItem()
article_url = str(response.url)
article_name = sel.xpath('//div[@id="article_details"]/div/h1/span/a/text()').extract()
item['article_name'] = [n.encode('utf-8') for n in article_name]
item['article_url'] = article_url.encode('utf-8')
yield item
#获得下一篇文章的url
urls = sel.xpath('//li[@class="next_article"]/a/@href').extract()
for url in urls:
print url
url = "http://blog.csdn.net" + url
print url
yield Request(url, callback=self.parse)

慢慢分析：

（1）download_delay参数设置为1，将下载器下载下一个页面前的等待时间设置为1s，也是防止被ban的策略之一。主要是减轻服务器端负载。

（2）从response中抽取文章链接与文章题目，编码为utf-8。注意yield的使用。

（3）抽取“下一篇”的url，由于抽取后缺少http://blog.csdn.net部分，所以补充。两个print只为调试，无实际意义。重点在于

[python] view plain copy

yield Request(url, callback=self.parse)

也就是将新获取的request返回给引擎，实现继续循环。也就实现了“自动下一网页的爬取”。

五. 执行

[python] view plain copy

scrapy crawl CSDNBlog

部分存储数据截图：

原创，转载注明：http://blog.csdn.net/u012150179/article/details/34486677

scrapy 简单教程相关推荐

python scrapy 简单教程_python之scrapy入门教程
看这篇文章的人,我假设你们都已经学会了python(派森),然后下面的知识都是python的扩展(框架). 在这篇入门教程中,我们假定你已经安装了Scrapy.如果你还没有安装,那么请参考安装指南. ...
python scrapy 简单教程_Scrapy的简单使用教程
在这篇入门教程中,我们假定你已经安装了python.如果你还没有安装,那么请参考安装指南. 首先第一步:进入开发环境,workon article_spider 进入这个环境: 安装Scrapy,在安 ...
linux下scrapy安装教程,linux centos7安装scrapy
linux centos7安装scrapy 时间:2018-01-02 17:41作者:scrapy中文网阅读: 本scrapy中文教程主要介绍,centos7 linux下scrapy的安装,pyt ...
ASP.NET Core 异常和错误处理 - ASP.NET Core 基础教程 - 简单教程，简单编程
原文:ASP.NET Core 异常和错误处理 - ASP.NET Core 基础教程 - 简单教程,简单编程 ASP.NET Core 异常和错误处理上一章节中,我们学习了 ASP.NET Cor ...
idea 从svn导入多个项目_IDEA导入项目简单教程
该教程用于IDEA初学者导入eclipse项目,或者导入其他已经写好的Java源程序的简单教程. 我们用IDEA打开一个已经写好的项目源文件时,如果没有配置好,就会出现:JDK配置失误报错.程序无法启 ...
scrapy爬虫储存到mysql_详解Python之Scrapy爬虫教程NBA球员数据存放到Mysql数据库
获取要爬取的URL 爬虫前期工作用Pycharm打开项目开始写爬虫文件字段文件items # Define here the models for your scraped items # # S ...
expect简单教程
expect简单教程一.概述 expect是Unix系统中用来进行自动化控制和测试的软件工具,由Don Libes制作,作为Tcl脚本语言的一个扩展,应用在交互式软件中如telnet,ftp,Pas ...
ASP.NET Core macOS 环境配置 - ASP.NET Core 基础教程 - 简单教程，简单编程
ASP.NET Core macOS 环境配置 - ASP.NET Core 基础教程 - 简单教程,简单编程原文:ASP.NET Core macOS 环境配置 - ASP.NET Core 基础 ...
Git和Github简单教程
网络上关于Git和GitHub的教程不少,但是这些教程有的命令太少不够用,有的命令太多,使得初期学习的时候需要额外花不少时间在一些当前用不到的命令上. 这篇文章主要的目标是用较少的时间学习Git和Gi ...

scrapy 简单教程

首先创建project:

一. items.py编写

二. pipelines.py编写

三. settings.py编写

四. 爬虫编写

慢慢分析：

五. 执行

scrapy 简单教程相关推荐

最新文章

热门文章