一文掌握Python爬虫XPath语法

一、问题描述

1.什么是XPath？

xpath是一门在XML和HTML文档中查找信息的语言，可用来在XML和HTML文档中对元素和属性进行遍历，XPath 通过使用路径表达式来选取 XML 文档中的节点或者节点集。这些路径表达式和在常规的电脑文件系统中看到的表达式非常相似。

二、解决方案

1.XPath语法

想要学好xpath，首先要搞明白html文档中的节点。

<div>
     <ul>
          <li class="item-0"><a href="https://www.freexyz.cn/dev/link1.html" rel="external nofollow" >first item</a></li>
          <li class="item-1"><a href="https://www.freexyz.cn/dev/link2.html" rel="external nofollow" >second item</a></li>
          <li class="item-inactive"><a href="https://www.freexyz.cn/dev/link3.html" rel="external nofollow" >third item</a></li>
          <li class="item-1"><a href="https://www.freexyz.cn/dev/link4.html" rel="external nofollow" >fourth item</a></li>
          <li class="item-0"><a href="https://www.freexyz.cn/dev/link5.html" rel="external nofollow" >fifth item</a> # 注意，此处缺少一个 </li> 闭合标签
      </ul>
  </div>

以上是在网上随便找的一段html的文本，可以观察得到，div的标签下是ul标签，而ul标签下是li标签，于是发现html的标签是一级一级如树状的。Xpath正是通过这样的方式去寻找。以生活中举例，要确定一个人的位置，首先确定他在中国，然后确定他在某个省份，哪座城市，那个小区，最后找到他。

表达式	描述
Nodename	选取此节点的所有子节点 bookstore 选取bookstore下所有的子节点
/	如果是在最前面，代表从根节点选取。否则选择某节点下的某个节点 /bookstore 选取根元素下所有的bookstore节点
//	从全局节点中选择节点，随便在哪个位置 //book 从全局节点中找到所有的book节点
@	选取某个节点的属性 //book[@price] 选择所有拥有price属性的book节点
.	当前节点
Text()	获取标签中的文本

同级标签可以用li[1] ,li[2] ,li[3]的方式获取

2.lxml库

简单介绍一下lxml库，接下来会用到它

lxml是一个HTML/XML的解析器，主要的功能是如何解析和提取HTML/XML 数据。

lxml和正则一样，也是用C实现的，是一款高性能的PythonHTML/XML解析器，可以利用之前学习的XPath语法，来快速的定位特定元素以及节点信息。

3.实际案例

随便爬取一个网站，找到找到网站的html文本

如下图：

一文掌握Python爬虫XPath语法

要找到title和href，仔细观察可以得到路径分别是//div[@id="resultList"]/div[@class="el"]/p/span/a/@title

//div[@id="resultList"]/div[@class="el"]/p/span/a/@href

运行如下：

一文掌握Python爬虫XPath语法

三、结语

Xpath，是在爬虫中常见的提取数据的方式之一，相比于正则，它更加简单一些，便于操作，xpath的难点在于准确的确定数据所在的位置。

声明：本站所有文章，如无特殊说明或标注，均为本站原创发布。任何个人或组织，在未征得本站同意时，禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益，可联系我们进行处理。

一文掌握Python爬虫XPath语法

目录

一、问题描述

1.什么是XPath？

二、解决方案

1.XPath语法

2.lxml库

3.实际案例

三、结语

评论(0)

提示：请文明发言取消回复

作者信息

本站推荐

OpenCV全攻略C++计算机视觉项目实践含源码

何伟元素流瑜伽系统基础师资培训67GB

移动端APP渗透测试（价值199元）网络攻防

Python高级编程实战及应用[前后端开发]

清栀老师AI风景短视频剪辑自学课入门到进阶

阿炳老师·2026Coze平台搭建智能体课程

热门资源

苹果cms海螺影视模板/大橙子模板/仿B站模板/v7模板/带手机移动端+详细安装使用说明

【已测】修复版H5骰子微信竞猜游戏骰宝免公众号版修复登录ID相同完美全套源码对接免签支付

网页游戏卧龙吟一键服务端加远程工具带架设教程

邪风曲单机版 2D回合制网络游戏源码一键安装即玩服务端公益服+GM工具

完整可用版本去水印小程序源码带教程源码

仙侠H5【苍穹剑诀】一键即玩端+授权后台+外网教程

一文掌握Python爬虫XPath语法

目录

一、问题描述

1.什么是XPath？

二、解决方案

1.XPath语法

2.lxml库

3.实际案例

三、结语

评论(0)

提示：请文明发言 取消回复

相关文章

作者信息

本站推荐

热门资源

提示：请文明发言取消回复