Scrapy框架(持久化,去重,深度控制,cookie)

1. 持久化
       目前缺点：
           - 无法完成爬虫刚开始：打开连接；爬虫关闭时：关闭连接；
           - 分工明确
       pipeline/items
           a. 先写pipeline类
               class XXXPipeline(object):
                   def process_item(self, item, spider):
                       return item

           b. 写Item类
               class XdbItem(scrapy.Item):
                   href = scrapy.Field()
                   title = scrapy.Field()

           c. 配置
               ITEM_PIPELINES = {
                   'xdb.pipelines.XdbPipeline': 300,
               }

           d. 爬虫，yield每执行一次，process_item就调用一次。

               yield Item对象

       编写pipeline：
           from scrapy.exceptions import DropItem

class FilePipeline(object):

def __init__(self,path):
self.f = None
self.path = path

@classmethod
               def from_crawler(cls, crawler):
                   """
                   初始化时候，用于创建pipeline对象
                   :param crawler:
                   :return:
                   """
                   print('File.from_crawler')
                   path = crawler.settings.get('HREF_FILE_PATH')
                   return cls(path)

def open_spider(self,spider):
                   """
                   爬虫开始执行时，调用
                   :param spider:
                   :return:
                   """
                   print('File.open_spider')
                   self.f = open(self.path,'a+')

def process_item(self, item, spider):
                   # f = open('xx.log','a+')
                   # f.write(item['href']+'\n')
                   # f.close()
                   print('File',item['href'])
                   self.f.write(item['href']+'\n')

                   # return item     # 交给下一个pipeline的process_item方法
                   raise DropItem()# 后续的 pipeline的process_item方法不再执行

def close_spider(self,spider):
                   """
                   爬虫关闭时，被调用
                   :param spider:
                   :return:
                   """
                   print('File.close_spider')
                   self.f.close()

注意：pipeline是所有爬虫公用，如果想要给某个爬虫定制需要使用spider参数自己进行处理。


2. 去重规则


   a. 编写类
       from scrapy.dupefilter import BaseDupeFilter
       from scrapy.utils.request import request_fingerprint

class XdbDupeFilter(BaseDupeFilter):

def __init__(self):
self.visited_fd = set()

@classmethod
def from_settings(cls, settings):
return cls()

def request_seen(self, request):
               fd = request_fingerprint(request=request)
               if fd in self.visited_fd:
                   return True
               self.visited_fd.add(fd)

def open(self): # can return deferred
print('开始')

def close(self, reason): # can return a deferred
print('结束')

# def log(self, request, spider): # log that a request has been filtered
# print('日志')

b. 配置
       # 修改默认的去重规则
       # DUPEFILTER_CLASS = 'scrapy.dupefilter.RFPDupeFilter'
       DUPEFILTER_CLASS = 'xdb.dupefilters.XdbDupeFilter'

c. 爬虫使用：
       class ChoutiSpider(scrapy.Spider):
           name = 'chouti'
           allowed_domains = ['chouti.com']
           start_urls = ['https://dig.chouti.com/']

def parse(self, response):
               print(response.request.url)
               # item_list = response.xpath('//div[@id="content-list"]/div[@class="item"]')
               # for item in item_list:
               #     text = item.xpath('.//a/text()').extract_first()
               #     href = item.xpath('.//a/@href').extract_first()

page_list = response.xpath('//div[@id="dig_lcpage"]//a/@href').extract()
               for page in page_list:
                   from scrapy.http import Request
                   page = "https://dig.chouti.com" + page
                   # yield Request(url=page,callback=self.parse,dont_filter=False) # https://dig.chouti.com/all/hot/recent/2
                   yield Request(url=page,callback=self.parse,dont_filter=True) # https://dig.chouti.com/all/hot/recent/2

   注意：
       - request_seen中编写正确逻辑
       - dont_filter=False

3. 深度
   配置文件：
       # 限制深度
       DEPTH_LIMIT = 3

4. cookie
   方式一：
       - 携带
           Request(
               url='https://dig.chouti.com/login',
               method='POST',
               body="phone=8613121758648&password=woshiniba&oneMonth=1",# # body=urlencode({})"phone=8615131255555&password=12sdf32sdf&oneMonth=1"
               cookies=self.cookie_dict,
               headers={
                   'Content-Type': 'application/x-www-form-urlencoded; charset=UTF-8'
               },
               callback=self.check_login
           )

       - 解析：
               from scrapy.http.cookies import CookieJar
               cookie_dict
               cookie_jar = CookieJar()
               cookie_jar.extract_cookies(response, response.request)

# 去对象中将cookie解析到字典
               for k, v in cookie_jar._cookies.items():
                   for i, j in v.items():
                       for m, n in j.items():
                           cookie_dict[m] = n.value
   方式二：meta

转载于:https://www.cnblogs.com/l-jie-n/p/10022406.html

Scrapy框架(持久化,去重,深度控制,cookie)相关推荐

爬虫Spider 08 - chromedriver设置无界面模式 | selenium - 键盘操作 | 鼠标操作 | 切换页面 | iframe子框架 | scrapy框架
文章目录 Spider 07回顾 cookie模拟登陆三个池子 selenium+phantomjs/chrome/firefox Spider 08 笔记 chromedriver设置无界面模式 ...
1月17日学习内容整理：Scrapy框架补充之pipeline，去重规则
@@@老师博客::: 关于高性能和scrapy框架 http://www.cnblogs.com/wupeiqi/articles/6229292.html 关于scrapy-reids组件 http ...
dataObject可以去重吗java_python爬虫scrapy框架之增量式爬虫的示例代码
scrapy框架之增量式爬虫一 .增量式爬虫什么时候使用增量式爬虫: 增量式爬虫:需求当我们浏览一些网站会发现,某些网站定时的会在原有的基础上更新一些新的数据.如一些电影网站会实时更新最近热门的 ...
python cookie池_Python爬虫scrapy框架Cookie池(微博Cookie池)的使用
下载代码Cookie池(这里主要是微博登录,也可以自己配置置其他的站点网址) 下载代码GitHub:https://github.com/Python3WebSpider/CookiesPool 下载 ...
爬虫之scrapy框架的数据持久化存储/保存为scv,json文件
文章目录前情回顾 selenium+phantomjs/chrome/firefox execjs模块使用今日笔记 scrapy框架小试牛刀猫眼电影案例知识点汇总数据持久化存储(MySQL ...
Scrapy框架--使用cookie
CookieMiddleware class scrapy.downloadermiddlewares.cookies.CookieMiddlewar 该中间件使得爬取需要cookie(例如使用ses ...
爬虫----Scrapy框架
一介绍 Scrapy一个开源和协作的框架,其最初是为了页面抓取 (更确切来说, 网络抓取 )所设计的,使用它可以以快速.简单.可扩展的方式从网站中提取所需的数据.但目前Scrapy的用途十分广泛,可 ...
爬虫第六讲 Scrapy框架
文章目录爬虫第六讲 Scrapy框架一.Scrapy框架 Scrapy简介工作流程 Scrapy入门 pipline使用 1.scrapy.Request知识点 2.item的介绍和使用 3. ...
scrapy框架讲解
简介: Scrapy是一个基于Python的开源异步爬虫框架,它被广泛用于从网页或App中,提取数据并将其保存到本地或数据库.由2.8版本以后提供了 http2.0协议的爬虫支持. 扩展: scrap ...

Scrapy框架(持久化,去重,深度控制,cookie)

Scrapy框架(持久化,去重,深度控制,cookie)相关推荐

最新文章

热门文章