前言

本来打算写的标题是XPath语法,但是想了一下Python中的解析库lxml,使用的是Xpath语法,同样也是效率比较高的解析方法,所以就写成了XPath语法和lxml库的用法

XPath 即为 XML 路径语言,它是一种用来确定 XML(标准通用标记语言的子集)文档中某部分位置的语言。

XPath 基于 XML 的树状结构,提供在数据结构树中找寻节点的能力。 XPath 同样也支持HTML。

XPath 是一门小型的查询语言。

python 中 lxml库 使用的是 Xpath 语法,是效率比较高的解析方法。

下面话不多说了,来一起看看详细的介绍吧

安装

为什么要用这个库呢,因为要写爬虫啊,利用lxml库来解析 HTML 代码,同时lxml也继承了libxml2的特性自动修正HTML代码,利用pip安装即可

pip install lxml

XPath语法

XPath是一门在XML文档中查找信息的语言,可以用于在XML文档中通过元素和属性进行导航

举个栗子 �

我们可以使用XPath提取网站地图中的所有链接,也就是说可以使用XPath去找我们HTML中的一些具体的东西

节点关系

在XPath中,有七种类型的节点:元素、属性、文本、命名空间、处理指令、注释以及文档节点(或称为根节点)

再举个栗子 �

https://qq52o.me

2018-04-28T19:00:42+00:00

daily

1.0

第一个:父(Parent)

每个元素以及属性都有一个父

url元素是 loc、lastmod、changefreq以及 priority元素的父

第二个:子(Children)

元素节点可有零个、一个或多个子

loc、lastmod、changefreq以及 priority元素都是url元素的子

第三个:同胞(Sibling)

拥有相同的父的节点

loc、lastmod、changefreq以及 priority元素都是url元素的同胞

第四个:先辈(Ancestor)

某节点的父、父的父,等等

loc元素的先辈是 url元素和 urlset元素

第五个:后代(Descendant)

某个节点的子,子的子,等等

urlset的后代是url、loc、lastmod、changefreq以及 priority元素

如果你分不清楚,就按照子元素从上到下的去找元素节点

选取节点

XPath使用路径表达式在 XML 文档中选取节点,节点是通过沿着路径或者 step 来选取的,也就是上面所说的按照子元素从上到下去找元素节点

这些是最有用的路径表达式 �

表达式

描述

nodename

选取此节点的所有子节点

/

从根节点选取

//

从匹配选择的当前节点选择文档中的节点,而不考虑它们的位置

.

选取当前节点

..

选取当前节点的父节点

@

选取属性

实例

路径表达式

结果

urlset

选取urlset元素的所有子节点

/urlset

选取根元素 urlset

urlset/url

选取属于urlset的子元素的所有url元素

//url

选取所有url子元素,而不管它们在文档中的位置

urlset//url

选择属于urlset元素的后代的所有url元素,而不管它们位于urlset之下的什么位置

//@href

选取名为href的所有属性

其他XPath语法请参考w3school

XPath实例测试

提取本站网站地图中id属性为content的的子元素h3的内容以及子元素a的href属性,F12去看代码找这个属性

div的id属性,下面的子元素h3的内容,直接利用 text 方法来获取元素的内容,然后输出

这里的子元素层级关系必须按顺序写好,不然会报错的

IndexError: list index out of range

这就说明你的XPath规则没写好,list是一个空的,没有一个元素

XPath 是一个非常好用的解析方法,同时也是作为爬虫学习的基础

总结

以上就是这篇文章的全部内容了,希望本文的内容对大家的学习或者工作具有一定的参考学习价值,如果有疑问大家可以留言交流,谢谢大家对脚本之家的支持。

python xpath语法-Python爬虫基础之XPath语法与lxml库的用法详解相关推荐

  1. python的reshape方法_numpy库reshape用法详解

    numpy.reshape(重塑) 给数组一个新的形状而不改变其数据 numpy.reshape(a, newshape, order='C')参数: a:array_like 要重新形成的数组. n ...

  2. Django基础(11): 表单集合Formset的高级用法详解

    Formset(表单集)是多个表单的集合.Formset在Web开发中应用很普遍,它可以让用户在同一个页面上提交多张表单,一键添加多个数据,比如一个页面上添加多个用户信息.今天小编我就介绍下Djang ...

  3. 爬虫(八十八)lxml库的用法

    春季,四季之一.春,代表着温暖.生长.春季,阴阳之气开始转变,万物随阳气上升而萌牙生长,大地呈现春和景明之象. lxml官网:https://lxml.de/ 围绕三个问题: 问题1:有一个XML文件 ...

  4. Python笔记:网络爬虫之模拟人人网登录及获取数据的过程详解

    概述 使用urllib模拟人人网的登录的过程 使用urllib模拟人人网登录后获取个人数据的过程 使用urllib模拟登录及获取个人数据的过程 使用requests模拟登录及获取个人数据的过程 重点了 ...

  5. 【Python教程】 re 模块中findall() 函数返回值展现方式的用法详解

    findall 函数: 在字符串中找到正则表达式所匹配的所有子串,并返回一个列表,如果没有找到匹配的,则返回空列表. 注意: match 和 search 是匹配一次 findall 匹配所有,mat ...

  6. python循环语句for计数_Bash For循环(递增计数)与for循环用法详解

    先来看for循环的例子: 用Bash Shell的for循环,每次递增数是500. 复制代码 代码示例: #!/bin/bash # #每次递增的数 ADD_NUM=500 #递增1的话取消下行注释, ...

  7. Java基础篇(04):日期与时间API用法详解

    本文源码:GitHub·点这里 || GitEE·点这里 一.时间和日期 在系统开发中,日期与时间作为重要的业务因素,起到十分关键的作用,例如同一个时间节点下的数据生成,基于时间范围的各种数据统计和分 ...

  8. 【零基础】极星9.3止盈止损用法详解

    交流Q群1064240775 一.前言 止盈止损是期货交易中比较基础的部分了,但从设置上来说还是有点复杂性的,所以这篇就好好写明白极星9.3的止盈止损. 二.为啥会有止盈止损 首先得搞明白,为啥会有止 ...

  9. 【JS基础】var formdata=new FormData() 【FormData用法详解 】

    FormData用法详解 简介 FormData 对象的使用: 1.用一些键值对来模拟一系列表单控件:即将form 中表单元素的 name 与 value 组装成一个 queryString 2.异步 ...

最新文章

  1. 如何才能建立起似然函数
  2. SQL Server:分离和重新附加数据库
  3. JavaFX将Node导出为图片
  4. android之微信分享音频
  5. c语言 字符串相似度,某课程设计---文件相似度判断
  6. Android 手机常见问答
  7. 蓝桥杯2018年第九届C/C++省赛B组第六题-递增三元组
  8. PCB设计中电源与地之间电容的作用(具体放置面积, 大小等等)
  9. RealSense D435i深度相机介绍
  10. 在Arduino上使用433MHz发送和接收模块
  11. javascript 属性的特性 二十五
  12. html页面太大了怎么调小,html – 如何在调整浏览器窗口大小时保持绝对定位的元素...
  13. 张爱玲的 因为懂得,所以慈悲 如何理解
  14. 华为交换机接口绑定mac案例
  15. 2012二级c语言上机,2012全国计算机等级考试-二级C语言-上机考试-填空题-分类总结...
  16. FP7195大功率零压差全程无频闪调光DC-DC恒流芯片
  17. 第一次参与国际空间站ISS 的SSTV活动
  18. 安装arosics做自动几何校正
  19. ECCV2020Workshop-PAN-270k参数量SISR网络 | Efficient Image Super-Resolution Using Pixel Attention
  20. 数据结构初学之循环队列补充

热门文章

  1. Java---- 静态内部类与非静态内部类的区别
  2. pandas demo 示例
  3. poj1564 Sum It Up dfs水题
  4. 【LaTeX】E喵的LaTeX新手入门教程(4)图表
  5. git版本控制工具(二)----本地版本库的常用操作
  6. Linuxnbsp;Oracle服务启动amp;停止脚本与开机自启动
  7. image shadow
  8. 使用 Microsoft .NET Framework 精简版中的 MessageWindow 类
  9. JavaScript面向对象的支持(7)
  10. DevExpress控件使用的一点小问题