python写采集程序_Python爬虫小说采集程序

开发工具：python3.4

操作系统：win8

主要功能：去指定小说网页爬小说目录，按章节保存到本地，并将爬过的网页保存到本地配置文件。

被爬网站：http://www.22pq.com/

小说名称：武道宗师

代码出处：本人亲自码的

import urllib.request

import http.cookiejar

import socket

import time

import re

timeout = 20

socket.setdefaulttimeout(timeout)

sleep_download_time = 10

time.sleep(sleep_download_time)

def makeMyOpener(head = {

'Connection': 'Keep-Alive',

'Accept': 'text/html, application/xhtml+xml, */*',

'Accept-Language': 'en-US,en;q=0.8,zh-Hans-CN;q=0.5,zh-Hans;q=0.3',

'User-Agent': 'Mozilla/5.0 (Windows NT 6.3; WOW64; Trident/7.0; rv:11.0) like Gecko'

}):

cj = http.cookiejar.CookieJar()

opener = urllib.request.build_opener(urllib.request.HTTPCookieProcessor(cj))

header = []

for key, value in head.items():

elem = (key, value)

header.append(elem)

opener.addheaders = header

return opener

def saveFile(save_path,txts):

f_obj = open(save_path,'w+')

for item in txts:

f_obj.write(item+'\n')

f_obj.close()

#get_code_list

code_list='http://www.22pq.com/book/10/10969/'

oper = makeMyOpener()

uop = oper.open(code_list,timeout=1000)

data = uop.read().decode('gbk','ignore')

pattern = re.compile('

(.*?)',re.S)

items = re.findall(pattern,data)

print ('获取列表完成')

url_path='url_file.txt'

url_r=open(url_path,'r')

url_arr=url_r.readlines(100000)

url_r.close()

print (len(url_arr))

url_file=open(url_path,'a')

print ('获取已下载网址')

for tmp in items:

save_path = tmp[1].replace(' ','')+'.txt'

url = code_list+tmp[0]

if url+'\n' in url_arr:

continue

print('写日志：'+url+'\n')

url_file.write(url+'\n')

opene = makeMyOpener()

op1 = opene.open(url,timeout=1000)

data = op1.read().decode('gbk','ignore')

opene.close()

pattern = re.compile(' (.*?)
',re.S)

txts = re.findall(pattern,data)

saveFile(save_path,txts)

url_file.close()

虽然代码还是有点瑕疵，还是分享给大家，一起改进

python写采集程序_Python爬虫小说采集程序相关推荐

python写简单购物车_python简单的购物车程序（含代码）
效果图片:\u201C在2017年9月4日@author: len\u201Cproduct_list =[(\u201C机器人\u201D,200000年),(\u201CMacPro\u201D, ...
python加油代码_python入门教程NO.5 用python写个自动选择加油站的小程序
本文涉及的python基础语法为:if条件分支 Python条件分支是通过一条或者多条语句的执行结果True或者False来决定是否执行相应的代码块. if单向条件语法结构 if 判断条件: 代码块 ...
python自动填写小程序表单_新年好！教大家用Python写一个自动回复拜年信息的小程序！...
原标题:新年好!教大家用Python写一个自动回复拜年信息的小程序! 过年期间,想必大家都收到很多拜年信息吧!有没有也被拜年短信(大部分是群发)搞得很焦虑?不回复似乎显得很没有礼貌,一一回复又累心劳神 ...
Python入门教程NO.5 用python写个自动选择加油站的小程序
本文涉及的 python 基础语法为:if 条件分支 Python 条件分支是通过一条或者多条语句的执行结果 True或者 False来决定是否执行相应的代码块. if 单向条件语法结构 if 单向条 ...
python写采集程序_python实现简易采集爬虫
#!/usr/bin/python#-*-coding:utf-8-*- #简易采集爬虫#1.采集Yahoo!Answers,parseData函数修改一下,可以采集任何网站#2.需要sqlite3或 ...
python 访问网页重定向_Python数据网络采集5--处理Javascript和重定向
Python数据网络采集5--处理Javascript和重定向到目前为止,我们和网站服务器通信的唯一方式,就是发出HTTP请求获取页面.有些网页,我们不需要单独请求,就可以和网络服务器交互(收发信息 ...
自动采集的网站源码-自动采集发布的电影小说新闻网站程序源码
自动采集网站源码,有不少SEO的同伴们都在找可以自动采集网站源码,但是这种源码真的好吗?首先可以自动采集的网站源码程序,规则也是别人写好的,采集的内容也是别人用过的,对于网站收录肯定不是那么友好.我们 ...
使用python爬虫为wordpress采集内容 felix_python爬虫自动采集并上传更新网站 requests wordpress_xmlrpc wordpress实战...
爬虫用的 bs4+requests 上传用的 wordpress_xmlrpc #coded by 伊玛目的门徒 #coding=utf-8 from wordpress_xmlrpc import ...
python 正则表达式提取数据_Python爬虫教程-19-数据提取-正则表达式(re)
本篇主页内容:match的基本使用,search的基本使用,findall,finditer的基本使用,匹配中文,贪婪与非贪婪模式 Python爬虫教程-19-数据提取-正则表达式(re) 正则表达式 ...
python 爬视频下载_Python爬虫进阶之爬取某视频并下载的实现
这篇文章我们来讲一下在网站建设中,Python爬虫进阶之爬取某视频并下载的实现.本文对大家进行网站开发设计工作或者学习都有一定帮助,下面让我们进入正文. 这几天在家闲得无聊,意外的挖掘到了一个资源网站 ...

python写采集程序_Python爬虫小说采集程序

python写采集程序_Python爬虫小说采集程序相关推荐

最新文章

热门文章