爬虫神器之PyQuery实用教程(二),50行代码爬取穷游网

前言

上篇文章 PyQuery (一) 回顾。今天来介绍具体 PyQuery 的使用方法。

穷游网目标与分析

开始之前,按照之前的套路一步步来。

一、先确立目标。

我们要爬取的目标是:日本的城市

去过的人数

城市的详情景点

二、看源码,分析元素节点。

F12 查看当前网页源代码:

选中下图区域,可以看到这是一个 ul 标签,class 为 plcCitylist 。ul:unordered list,“无序列表”的意思。

class 为 plcCitylist ,全局检索一下,ul 标签的 class 值唯一:

在这个无序标签里,有许多 li 标签,class 为 item+数字。li:list item,“列表项”的意思。

继续分析。

有了上面两个基础结构,来看下其中要提取的详细信息,下图:

城市名字:包含在 a 标签中。

去过的人数:包含在 h3 标签中,且在 p 标签中,class 为 beenton 中。

详情景点:包含在 h3 标签中,且在 p 标签中,class 为 pois 中,且在 a 标签中。h3:给文本增加主标题的语义。(显示在页面上标题变粗)

p:段落标签

以上分析完了,其实单纯分析节点很简单。重点在于代码如何使用。

PyQuery代码详讲

依然是分步骤来提取我们想要的。

回忆一下,用 PyQuery 请求到源代码,拿到实例对象。

from pyquery import PyQuery as pq

doc = pq('https://place.qyer.com/japan/citylist-0-0-1')

1. css选择器,提取外层 ul

ul_city = doc('.plcCitylist')

基于 css 选择器,获取 class="plcCitylist" 的 ul 节点元素。因为 class 值唯一,上面说过了。

在 JQuery 的语法中, . 代表着类选择器的写法,而 # 代表着 id 选择器的写法。所以直接用 .值 ,直接可以获取当前标签元素节点,如下:

当然,如果当标签不唯一时,你也可以这样操作,在.前面声明具体标签:

ul_city = doc('ul.plcCitylist')

2. 提取 ul 里层 li 节点元素

lis = ul_city('li')

根据 ul_city 得到的节点变量,用括号加子标签的形式即可获取。

但需要注意的是,尽管我们 print 打印是你看到的文字,它们实际上并不是 str 类型的字符串,而是 PyQuery 这个类型。

3. 遍历单独的 li 元素节点

当我们获取 ul 下面的 li 元素节点时,匹配到的肯定是多个。此时想要逐个解析 li ,并且获取到 li 中的城市名称等抓取信息如何做呢?

for li in lis.items():

通过调用 PyQuery 对象的 items 方法,即可逐层遍历相同元素,就像我们的 list 一样。

4. 标签多个 class 确定唯一值的选择器写法

仔细看我们 li 节点中的 h3 标签,class 里面是有两个值的。

.............

通过这两个值的唯一性,我们可以直接定位到 h3 元素。

h3 = li('.title.fontYaHei')

5. PyQuery 属性选择节点

如果你用不惯以上的所有获取节点元素的方法, PyQuery 还提供了一个便利的方法,即通过标签元素的属性进行定位元素。

a_city = h3('a').attr('data-bn-ipg', 'place-citylist-mix-name-1')

h3('a') 获取的是 h3 标签里 a 标签的元素节点。 使用 .attr 时,后面两个参数说明 a 标签原本的属性由如下组成:

.............

attr 第一个参数是标签属性的名字,第二个参数则是属性具体的值。

6. PyQuery 节点元素提取文本内容

以上内容操作的都是标签元素的节点,而非本文内容,想要提取文本内容,则调用 xx.text() 方法,节点转为字符串。

p_person_nums = li('p')('.beento')

print(p_person_nums.text())

成果展示

最终的成果展示如下:

写入 Excel 之后,可以看到第二行的数据都在一行,不方便美观,即使我代码中做了换行的操作。

所以程序跑完后,需要手动操作下 Excel ,让换行符生效,如下操作:

选中一列,然后数据 -> 分列:

选成文本,完成即可,自己就换行显示了。

获取到的信息写入 Excel 中。比如你想去哪个国家游玩,自己查攻略,通过这种方式来解决信息的整理,也是一种不错的高效方法。

总结

以上提到的 6 点,便是 PyQuery 常用到的基础方法。如果还有想了解具体详情的小伙伴,可以自行去官网查阅具体使用技巧。

实战中进步,学完 PyQuery 的用法,是否觉得学会了一个高效的解析节点的方法库呢?

关于本篇文章的全部源代码,去除空行约 50 行,非常简短,已经上传到 github 了。

有想学习的朋友,可以后台回复 "穷游" 二字,即可获取源码地址。

python pyquery不规则数据的抓取_爬虫神器之PyQuery实用教程(二),50行代码爬取穷游网...相关推荐

  1. pyquery获取不到网页完整源代码_爬虫神器之PyQuery实用教程(二),50行代码爬取穷游网...

    爬虫神器之PyQuery实用教程(二),50行代码爬取穷游网 前言 上篇文章 PyQuery (一) 回顾.今天来介绍具体 PyQuery 的使用方法. 穷游网目标与分析 开始之前,按照之前的套路一步 ...

  2. 50 行代码爬取链家租房信息

    最近自己开始学习数据分析的技术,但数据分析最重要的就是数据.没有数据怎么办?那就自己爬一些数据.大家一定要记得爬虫只是获取数据的一种手段,但如果不用一系列科学的方式去分析这些数据,那么爬去下来的数据是 ...

  3. 真厉害用python只要50行代码爬取黑丝美眉纯欲高清图

    要说最美好的欲望莫过于看黑丝美眉. 一.技术路线 requests:网页请求 BeautifulSoup:解析html网页 re:正则表达式,提取html网页信息 os:保存文件 import re ...

  4. python爬虫实战:利用scrapy,短短50行代码下载整站短视频

    近日,有朋友向我求助一件小事儿,他在一个短视频app上看到一个好玩儿的段子,想下载下来,可死活找不到下载的方法.这忙我得帮,少不得就抓包分析了一下这个app,找到了视频的下载链接,帮他解决了这个小问题 ...

  5. python爬上市公司信息_实战项目 1:5 行代码爬取国内所有上市公司信息

    实战项目 1:5 行代码爬取国内所有上市公司信息 Python入门爬虫与数据分析 在正式开始这门专栏课的学习之前,我们先来看一个简单的爬虫案例.兴趣是最好的老师,当你对爬虫产生兴趣的时候,才会更有动力 ...

  6. 教你用python实现34行代码爬取东方财富网信息,爬虫之路,永无止境!!

    教你用python实现34行代码爬取东方财富网信息,爬虫之路,永无止境!! 代码展示: 开发环境: windows10 python3.6 开发工具: pycharm weddriver 库: sel ...

  7. Python爬虫利用18行代码爬取虎牙上百张小姐姐图片

    Python爬虫利用18行代码爬取虎牙上百张小姐姐图片 下面开始上代码 需要用到的库 import request #页面请求 import time #用于时间延迟 import re #正则表达式 ...

  8. Python25行代码爬取豆瓣排行榜数据

    Python25行代码爬取豆瓣排行榜数据 只需要用到requests, re ,csv 三个库即可. code import re import requests import csv url = ' ...

  9. python:利用20行代码爬取网络小说

    文章目录 前言 一.爬虫是什么? 二.实现过程 总结 提示:文章写完后,目录可以自动生成,如何生成可参考右边的帮助文档 前言 今天,来给大家一个分享一下如何使用20爬虫行代码爬取网络小说(这里我们以龙 ...

最新文章

  1. linux中怎么退出执行过程,(进程)处理过程中的Linux:从执行到退出
  2. 蔚蓝 游戏 android,永远的蔚蓝星球
  3. 【转】解决IIS 用localhost需要用户名密码!
  4. js中常用的算法排序
  5. python绘制3d动态模型_怎么用python把*.obj文件里面的3D模型特征提取出来?
  6. MATLAB调用Python自定义函数(类、函数等) Python调用MATLAB
  7. 针对SharePointFarm场时安装部署OWA的步骤
  8. php随笔10-thinkphp 3.1.3 模板继承 布局
  9. freebsd mysql tmp_FREEBSD MYSQL数据库备份
  10. Java 任务调度,分布式定时任务XXL-JOB,elastic-job
  11. 牛客寒假算法集训营(4)
  12. sterm机器人编程_STEAM智能编程机器人
  13. 博途v14电脑要求_博途V14或者V15,大家现在用的电脑-工业支持中心-西门子中国...
  14. 汇川500et变频器源码,说明书,解析文档等
  15. postgis 栅格数据_postGIS教程
  16. Unity小游戏算法分析与实现(Unity+XR+游戏开发+算法+MVC+斗地主+耳轮跳+见缝插针+王者荣耀+绝地求生+立钻哥哥+==)
  17. 我的科四刷题笔记,记完就能过
  18. 【胖虎的逆向之路】Android 7.0 上Magisk配合Xposed的相关问题
  19. orge_src版编译与安装
  20. Stegano之StegSolve、StegDetect、InvisibleSecrets

热门文章

  1. 三剑齐发 蓄势出击:亚信新一代PaaS产品重磅发布
  2. vue 环形进度条 组件封装
  3. DC竞赛 国能日新功率预测题 rank21 解决方案(适合新手)
  4. uniapp微信小程序开发者工具-真机调试报错:message:Error: /XXX.bak.js does not exists
  5. android音视频介绍(一)
  6. 时间序列分析的表示学习时代来了?
  7. WIN7以上系统WDDM虚拟显卡开发
  8. 8、核心交换机、DHCP
  9. 2022年全景安全摄像机市场深度分析及发展研究预测报告
  10. mooc计算机系统基础(一)测验答案及部分解析