本来打算写的标题是XPath语法,但是想了一下Python中的解析库lxml,使用的是Xpath语法,同样也是效率比较高的解析方法,所以就写成了XPath语法和lxml库的用法

安装

为什么要用这个库呢,因为要写爬虫啊,利用lxml库来解析 HTML 代码,同时lxml也继承了libxml2的特性自动修正HTML代码,利用pip安装即可

pip install lxml

XPath语法

XPath是一门在XML文档中查找信息的语言,可以用于在XML文档中通过元素和属性进行导航

举个栗子 �

我们可以使用XPath提取网站地图中的所有链接,也就是说可以使用XPath去找我们HTML中的一些具体的东西

节点关系

在XPath中,有七种类型的节点:元素、属性、文本、命名空间、处理指令、注释以及文档节点(或称为根节点)

再举个栗子 �

https://qq52o.me

2018-04-28T19:00:42+00:00

daily

1.0

第一个:父(Parent)

每个元素以及属性都有一个父

url元素是 loc、lastmod、changefreq以及 priority元素的父

第二个:子(Children)

元素节点可有零个、一个或多个子

loc、lastmod、changefreq以及 priority元素都是url元素的子

第三个:同胞(Sibling)

拥有相同的父的节点

loc、lastmod、changefreq以及 priority元素都是url元素的同胞

第四个:先辈(Ancestor)

某节点的父、父的父,等等

loc元素的先辈是 url元素和 urlset元素

第五个:后代(Descendant)

某个节点的子,子的子,等等

urlset的后代是url、loc、lastmod、changefreq以及 priority元素

如果你分不清楚,就按照子元素从上到下的去找元素节点

选取节点

XPath使用路径表达式在 XML 文档中选取节点,节点是通过沿着路径或者 step 来选取的,也就是上面所说的按照子元素从上到下去找元素节点

这些是最有用的路径表达式 �

表达式

描述

nodename

选取此节点的所有子节点

/

从根节点选取

//

从匹配选择的当前节点选择文档中的节点,而不考虑它们的位置

.

选取当前节点

..

选取当前节点的父节点

@

选取属性

实例

路径表达式

结果

urlset

选取urlset元素的所有子节点

/urlset

选取根元素 urlset

urlset/url

选取属于urlset的子元素的所有url元素

//url

选取所有url子元素,而不管它们在文档中的位置

urlset//url

选择属于urlset元素的后代的所有url元素,而不管它们位于urlset之下的什么位置

//@href

选取名为href的所有属性

其他XPath语法请参考w3school

XPath实例测试

提取本站网站地图中id属性为content的的子元素h3的内容以及子元素a的href属性,F12去看代码找这个属性

div的id属性,下面的子元素h3的内容,直接利用 text 方法来获取元素的内容,然后输出

这里的子元素层级关系必须按顺序写好,不然会报错的

IndexError: list index out of range

这就说明你的XPath规则没写好,list是一个空的,没有一个元素

XPath 是一个非常好用的解析方法,同时也是作为爬虫学习的基础

沈唁志,一个PHPer的成长之路!

任何个人或团体,未经允许禁止转载本文:《Python爬虫之XPath语法和lxml库的用法》,谢谢合作!

python xpath语法-Python爬虫之XPath语法和lxml库的用法相关推荐

  1. python xpath语法-Python爬虫基础之XPath语法与lxml库的用法详解

    前言 本来打算写的标题是XPath语法,但是想了一下Python中的解析库lxml,使用的是Xpath语法,同样也是效率比较高的解析方法,所以就写成了XPath语法和lxml库的用法 XPath 即为 ...

  2. python xpath语法-XPath语法和lxml模块(数据提取)

    XPath语法和lxml模块 XPath lxml库 1.什么是XPath? XPath (XML Path Language) 是一门在 XML 文档中查找信息的语言,可用来在 XML 文档中对元素 ...

  3. html文件xpath解析语法,数据解析之XPath语法和lxml模块

    什么是XPath? xpath(XML Path Language)是一门在XML和HTML文档中查找信息的语言,可用来在XML和HTML文档中对元素和属性进行遍历. XPath开发工具 Chrome ...

  4. python基础语法--python语言及其应用

    python基础语法 python引言 python python语言是一种高级动态.完全面向对象的语言. python中函数.模块.数字.字符串都是对象. python完全支持继承.重载.派生.多继 ...

  5. Python 爬虫利器三之 Xpath 语法与 lxml 库的用法

    原文链接https://cuiqingcai.com/2621.html 前言 前面我们介绍了 BeautifulSoup 的用法,这个已经是非常强大的库了,不过还有一些比较流行的解析库,例如 lxm ...

  6. python xpath语法-Python Xpath语法

    一.python数据提取xpath 1.beautifulsoup xpath 正则表达式 2.xpath是一种在XML和HTML文档中查找信息的语言,可用来在XML和HTML中对元素进行遍历 Chr ...

  7. python中xpath语法怎么用_Python Xpath语法

    一.python数据提取xpath 1.beautifulsoup xpath 正则表达式 2.xpath是一种在XML和HTML文档中查找信息的语言,可用来在XML和HTML中对元素进行遍历  Ch ...

  8. python xpath语法-python xpath 基本用法

    发布时间: pythonercn 8 months, 3 weeks ago 在进行网页抓取的时候,分析定位html节点是获取抓取信息的关键,目前我用的是lxml模块(用来分析XML文档结构的,当然也 ...

  9. python xpath语法-Python xpath表达式如何实现数据处理

    xpath表达式 1. xpath语法 ? 1 2 3 4 5 6 7 8 9 10 Harry Potter 999 Learning XML 888 1.1 选取节点 XPath 使用路径表达式来 ...

最新文章

  1. select chosen-jquery.js下拉列表的层被覆盖
  2. Apache 配置的性能调优
  3. apache-tomcat-6.0.39的配置
  4. 征名公布|Qtum量子链企业版—Unita 中文名征集圆满落幕
  5. JVM系列一:Java虚拟机与操作系统结构比较
  6. .Net平台开源作业调度框架Quartz.Net
  7. python获取图片某像素点位置_如何在python中获取图像中指定区域内的所有像素坐标?...
  8. Python 基础 —— docstring
  9. 基于电能计量芯片HLW8012计量插座方
  10. 北京车辆过户外迁,北京车辆外迁流程
  11. 20211104 为什么相似矩阵的迹相同
  12. java邮件抄送_JAVA实现邮件抄送,密送,多个附件发送
  13. 用Watir测试QTP的Demo程序Mercury Tours
  14. SLAM中双目三角化
  15. SQLite 命令行客户端 sqlite3 使用指南
  16. 1-丁基-3-甲基咪唑六氟磷酸盐离子液体[BMIM]PF6修饰碳纳米管(CNTs/[BMIM]PF6)试剂
  17. 游戏建模师的现状如何?
  18. 10进制转2进制,js实现
  19. 《斯坦福高效睡眠法》书中的精髓:如何用好黄金90分钟睡眠法则,利用生理特征让我们晚上快速入睡,并在白天的时候保持清醒。
  20. 基于ESP32的磁流体音箱

热门文章

  1. 穿过代理服务器取远程用户真实IP地址
  2. vue项目如何部署到Tomcat中
  3. java maven compiler设置默认1.8
  4. 红帽RHCE培训-课程3笔记目录
  5. Java设计模式(1)——创建型模式之简单工厂模式(Simple Factory)
  6. 【SRM 716 DIV 1 A】 ConstructLCS
  7. django(权限、认证)系统—— 基于Authentication backends定制
  8. C# Message 消息处理
  9. ThinkServer TD340服务器安装操作系统[转]
  10. winform修改、打开窗体、构造函数传值