python爬虫——带你爬取古诗名句，考试什么的不就是轻轻松松

本文的文字及图片来源于网络,仅供学习、交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理

以下文章来源于腾讯云作者：py3study

( 想要学习Python？Python学习交流群：1039649593，满足你的需求，资料都已经上传群文件流，可以自行下载！还有海量最新2020python学习资料。 )

一. 概要

1.通过python爬虫循环爬取古诗词网站古诗名句
2.落地到本地数据库

二. 页面分析

首先通过firedebug进行页面定位：

其次源码定位：

最终生成lxml etree定位div标签源码：

response = etree.HTML(data)
for row in response.xpath('//div[@class="left"]/div[@class="sons"]/div[@class="cont"]'):content = row.xpath('a/text()')[0]origin = row.xpath('a/text()')[-1]self.db.add_new_row('mingJuSpider', {'content': content, 'origin': origin, 'createTime': str(date.today())})

三. 执行结果

四. 脚本源码

#!/usr/bin/env python
# -*- coding: utf-8 -*-
'''
@Date    : 2017/12/21 12:35
@Author  : kaiqing.huang
@File    : mingJuSpider.py
'''
from utils import MySpider, MongoBase
from datetime import date
from lxml import etree
import sysclass mingJuSpider():def __init__(self):self.db = MongoBase()self.spider = MySpider()def download(self):for pageId in range(1,117):url = 'http://so.gushiwen.org/mingju/Default.aspx?p={}&c=&t='.format(pageId)print urldata = self.spider.get(url)if data:self.parse(data)def parse(self, data):response = etree.HTML(data)for row in response.xpath('//div[@class="left"]/div[@class="sons"]/div[@class="cont"]'):content = row.xpath('a/text()')[0]origin = row.xpath('a/text()')[-1]self.db.add_new_row('mingJuSpider', {'content': content, 'origin': origin, 'createTime': str(date.today())})if __name__ == '__main__':sys.setrecursionlimit(100000)do = mingJuSpider()do.download()

python爬虫——带你爬取古诗名句，考试什么的不就是轻轻松松相关推荐

Python爬虫带你爬取美剧网站
本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理以下文章来源于腾讯云,作者:哲洛不闹一直有爱看美剧的习惯,一方面锻炼一下英语听力 ...
python爬虫lxml解析爬取诗词名句
原创:仅用于学习Python爬虫,请勿商业或恶意爬取数据文件夹和文件都是程序创建,我只爬了这些数据用于测试仅用了两个for循环,并没有搞的太难(函数),适合新手操练,有大量注释易于理解 from ...
Python爬虫-带你爬取高清美女图片
本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理以下文章来源于腾讯云作者:明天依旧可好 ( 想要学习Python?Python学 ...
【Python爬虫】从零开始爬取Sci-Hub上的论文(串行爬取)
[Python爬虫]从零开始爬取Sci-Hub上的论文(串行爬取) 维护日志项目简介步骤与实践 STEP1 获取目标内容的列表 STEP2 利用开发者工具进行网页调研 2.1 提取文章链接和分页链 ...
python爬虫，记录爬取全球所有国家-首都的简单爬虫
python爬虫,记录爬取全球所有国家-首都的简单爬虫本来以为简单至极,没想到获取数据还是花费了大把功夫.先上图 <table> <tr> <td> <st ...
Python爬虫项目：爬取JSON数据存储Excel表格与存储图片
随着网络的迅速发展,万维网成为大量信息的载体,如何有效地提取并利用这些信息成为一个巨大的挑战.搜索引擎(Search Engine),例如传统的通用搜索引擎AltaVista,Yahoo!和Googl ...
python爬虫——使用selenium爬取微博数据（一）
python爬虫--使用selenium爬取微博数据(二) 写在前面之前因为在组里做和nlp相关的项目,需要自己构建数据集,采用selenium爬取了几十万条微博数据,学习了很多,想在这里分享一下如 ...
Python爬虫实战之爬取糗事百科段子
Python爬虫实战之爬取糗事百科段子完整代码地址:Python爬虫实战之爬取糗事百科段子程序代码详解: Spider1-qiushibaike.py:爬取糗事百科的8小时最新页的段子.包含的信息 ...
Python爬虫入门 | 4 爬取豆瓣TOP250图书信息
先来看看页面长啥样的:https://book.douban.com/top250 我们将要爬取哪些信息:书名.链接.评分.一句话评价-- 1. 爬取单个信息我们先来尝试爬取书名,利用之 ...