爬虫神器之PyQuery实用教程(二),50行代码爬取穷游网

前言

上篇文章 PyQuery (一) 回顾。今天来介绍具体 PyQuery 的使用方法。

穷游网目标与分析

开始之前,按照之前的套路一步步来。

一、先确立目标。

我们要爬取的目标是:

  1. 日本的城市
  2. 去过的人数
  3. 城市的详情景点

二、看源码,分析元素节点。

F12 查看当前网页源代码:

https://place.qyer.com/japan/citylist-0-0-1/

选中下图区域,可以看到这是一个 ul 标签,class 为 plcCitylist 。

  • ul:unordered list,“无序列表”的意思。

class 为 plcCitylist ,全局检索一下,ul 标签的 class 值唯一:

在这个无序标签里,有许多 li 标签,class 为 item+数字。

  • li:list item,“列表项”的意思。

继续分析。

有了上面两个基础结构,来看下其中要提取的详细信息,下图:

城市名字:包含在 a 标签中。

去过的人数:包含在 h3 标签中,且在 p 标签中,class 为 beenton 中。

详情景点:包含在 h3 标签中,且在 p 标签中,class 为 pois 中,且在 a 标签中。

  • h3:给文本增加主标题的语义。(显示在页面上标题变粗)
  • p:段落标签

以上分析完了,其实单纯分析节点很简单。重点在于代码如何使用。

PyQuery代码详讲

依然是分步骤来提取我们想要的。

回忆一下,用 PyQuery 请求到源代码,拿到实例对象。

from pyquery import PyQuery as pq
doc = pq('https://place.qyer.com/japan/citylist-0-0-1')

1. css选择器,提取外层 ul

ul_city = doc('.plcCitylist')

基于 css 选择器,获取 class="plcCitylist" 的 ul 节点元素。因为 class 值唯一,上面说过了。

在 JQuery 的语法中, . 代表着类选择器的写法,而 # 代表着 id 选择器的写法。所以直接用 .值 ,直接可以获取当前标签元素节点,如下:

当然,如果当标签不唯一时,你也可以这样操作,在.前面声明具体标签:

ul_city = doc('ul.plcCitylist')

2. 提取 ul 里层 li 节点元素

lis = ul_city('li')

根据 ul_city 得到的节点变量,用括号加子标签的形式即可获取。

但需要注意的是,尽管我们 print 打印是你看到的文字,它们实际上并不是 str 类型的字符串,而是 PyQuery 这个类型。

3. 遍历单独的 li 元素节点

当我们获取 ul 下面的 li 元素节点时,匹配到的肯定是多个。此时想要逐个解析 li ,并且获取到 li 中的城市名称等抓取信息如何做呢?

for li in lis.items():

通过调用 PyQuery 对象的 items 方法,即可逐层遍历相同元素,就像我们的 list 一样。

4. 标签多个 class 确定唯一值的选择器写法

仔细看我们 li 节点中的 h3 标签,class 里面是有两个值的。

<h3 class = "title fontYaHei">.............

通过这两个值的唯一性,我们可以直接定位到 h3 元素。

h3 = li('.title.fontYaHei')

5. PyQuery 属性选择节点

如果你用不惯以上的所有获取节点元素的方法, PyQuery 还提供了一个便利的方法,即通过标签元素的属性进行定位元素。

a_city = h3('a').attr('data-bn-ipg', 'place-citylist-mix-name-1')

h3('a') 获取的是 h3 标签里 a 标签的元素节点。 使用 .attr 时,后面两个参数说明 a 标签原本的属性由如下组成:

<a data-bn-ipg = "place-citylist-mix-name-1">.............

attr 第一个参数是标签属性的名字,第二个参数则是属性具体的值。

6. PyQuery 节点元素提取文本内容

以上内容操作的都是标签元素的节点,而非本文内容,想要提取文本内容,则调用 xx.text() 方法,节点转为字符串。

p_person_nums = li('p')('.beento')
print(p_person_nums.text())

成果展示

最终的成果展示如下:

写入 Excel 之后,可以看到第二行的数据都在一行,不方便美观,即使我代码中做了换行的操作。

所以程序跑完后,需要手动操作下 Excel ,让换行符生效,如下操作:

选中一列,然后数据 -> 分列:

选成文本,完成即可,自己就换行显示了。

获取到的信息写入 Excel 中。比如你想去哪个国家游玩,自己查攻略,通过这种方式来解决信息的整理,也是一种不错的高效方法。

总结

以上提到的 6 点,便是 PyQuery 常用到的基础方法。如果还有想了解具体详情的小伙伴,可以自行去官网查阅具体使用技巧。

实战中进步,学完 PyQuery 的用法,是否觉得学会了一个高效的解析节点的方法库呢?

关于本篇文章的全部源代码,去除空行约 50 行,非常简短,已经上传到 github 了。

有想学习的朋友,可以后台回复 "穷游" 二字,即可获取源码地址。

pyquery获取不到网页完整源代码_爬虫神器之PyQuery实用教程(二),50行代码爬取穷游网...相关推荐

  1. python pyquery不规则数据的抓取_爬虫神器之PyQuery实用教程(二),50行代码爬取穷游网...

    爬虫神器之PyQuery实用教程(二),50行代码爬取穷游网 前言 上篇文章 PyQuery (一) 回顾.今天来介绍具体 PyQuery 的使用方法. 穷游网目标与分析 开始之前,按照之前的套路一步 ...

  2. pyquery获取不到网页完整源代码_python动态网页爬取:爬取pexel上的图片

    前言 同样的,我们在写一个爬虫前要明确自己想要爬取的东西是什么,明确下载目标数据在浏览器的操作如何 对于动态网页的爬取,在网页地址不变的情况下,我们首先要明确如何获取AJAX请求 首先我们看看这个网站 ...

  3. pyquery获取不到网页完整源代码_PyQuery 详解

    在之前写的爬虫入门里,PyQuery一笔带过,这次详细地讲一下. 为什么选择PyQuery? Python爬虫解析库,主流的有 PyQuery Beautifulsoup Scrapy Selecto ...

  4. python爬上市公司信息_实战项目 1:5 行代码爬取国内所有上市公司信息

    实战项目 1:5 行代码爬取国内所有上市公司信息 Python入门爬虫与数据分析 在正式开始这门专栏课的学习之前,我们先来看一个简单的爬虫案例.兴趣是最好的老师,当你对爬虫产生兴趣的时候,才会更有动力 ...

  5. python获取虎牙弹幕_教你用20行代码爬取直播平台弹幕(附源码)

    前言 本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,如有问题请及时联系我们以作处理. Python爬虫.数据分析.网站开发等案例教程视频免费在线观看 https://space. ...

  6. python爬取网页汉字_程序小技巧:Python3借助requests类库3行代码爬取网页数据!快来...

    爬取网页数据是python很长干的一件事情,不过做起来基本上都是很冗长的一段代码,看起来复杂,不宜理解.今天给大家分享一个小诀窍,利用python3中的requests类库进行爬取网页数据. 我们先看 ...

  7. 爬虫神器之 PyQuery 实用教程(一)

    咪哥杂谈 本篇阅读时间约为 4 分钟.接下来的教程,短小而精悍. 1 前言 今年 5 月份的时候,后台有小伙伴留言,询问过 PyQuery 的用法,当时没怎么接触过 PyQuery ,只是大致看了下官 ...

  8. python爬取付费直播的视频_教你用20行代码爬取直播平台弹幕(附源码)

    前言 本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,如有问题请及时联系我们以作处理. Python爬虫.数据分析.网站开发等案例教程视频免费在线观看 https://space. ...

  9. python 爬取图片环绕_用python几行代码爬取秀美图上图片(福利)

    废话少说上代码 当然还有多线程爬虫python学习文件以及demo 请移步gitee:https://gitee.com/xuanyuan9528/yande_pider.git 其中需要先添加包,详 ...

最新文章

  1. Linux 环境下如何安装部署 RocketMQ 教程
  2. Maximal Continuous Rest
  3. Java基础学习(一)—方法
  4. 构建iscsi网络存储服务
  5. 【渝粤教育】国家开放大学2018年秋季 8177-21T (1)工程经济与管理 参考试题
  6. linux备份mysql部分表数据,linux mysql 数据按表名称备份
  7. JDK 18 / Java 18 GA 发布
  8. 使用Python打造一款间谍程序
  9. nginx 代理到其他端口_「从单体架构到分布式架构」请求增多,单点变集群(2):Nginx...
  10. 【原/转】UITableview性能优化总结
  11. 吴恩达神经网络和深度学习-学习笔记-8-梯度消失与爆炸 + 梯度检测
  12. 记一次天猫商城系统高并发的优化
  13. html 滑动门效果,怎样用DW做滑动门的效果
  14. oracle 数据库怎么启动,Oracle数据库:启动操作
  15. 这是 iPhone 6主板?包含 802.11ac WiFi、NFC 芯片
  16. 航摄像片生成DSM(Pix4d)2021.5.21
  17. JWT 帮助类 JWTHelper
  18. 高德地图获取城市所有小区的POI
  19. 教师资格证面试考试详细流程来了
  20. 06【连词】 Conjunction

热门文章

  1. 【洛谷 P3304】[SDOI2013]直径(树的直径)
  2. Python rabbitmq的使用(五)
  3. Axure快速原型教程02--创建页面和设置界面
  4. 思科交换机开机后显示switch:
  5. 2007-11-7学习EXT第一天:EXT简介
  6. 大学学了一个学期的 C 语言,我们应该明白哪些知识点?别像没学一样!
  7. 可缺一台洗衣机的ykcchf
  8. 【转载】他是个残疾人 mynote V1.01发布
  9. 模拟ctrl+alt+delete三键
  10. 如今编程成为了一个越来越重要的「技能」,如何自学编程我来教你