没有合适的资源?快使用搜索试试~ 我知道了~
Python爬虫基础之XPath语法与lxml库的用法详解
10 下载量 158 浏览量
2020-09-20
02:43:07
上传
评论
收藏 159KB PDF 举报
温馨提示
主要给大家介绍了关于Python爬虫基础之XPath语法与lxml库用法的相关资料,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧
资源推荐
资源详情
资源评论
Python爬虫基础之爬虫基础之XPath语法与语法与lxml库的用法详解库的用法详解
主要给大家介绍了关于Python爬虫基础之XPath语法与lxml库用法的相关资料,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学
习价值,需要的朋友们下面随着小编来一起学习学习吧
前言前言
本来打算写的标题是XPath语法,但是想了一下Python中的解析库lxml,使用的是Xpath语法,同样也是效率比较高的解析方法,所以就写成了XPath语法和lxml库的用法
XPath 即为 XML 路径语言,它是一种用来确定 XML(标准通用标记语言的子集)文档中某部分位置的语言。
XPath 基于 XML 的树状结构,提供在数据结构树中找寻节点的能力。 XPath 同样也支持HTML。
XPath 是一门小型的查询语言。
python 中 lxml库 使用的是 Xpath 语法,是效率比较高的解析方法。
下面话不多说了,来一起看看详细的介绍吧
安装安装
为什么要用这个库呢,因为要写爬虫啊,利用lxml库来解析 HTML 代码,同时lxml也继承了libxml2的特性自动修正HTML代码,利用pip安装即可
pip install lxml
XPath语法语法
XPath是一门在XML文档中查找信息的语言,可以用于在XML文档中通过元素和属性进行导航
举个栗子举个栗子
我们可以使用XPath提取网站地图中的所有链接,也就是说可以使用XPath去找我们HTML中的一些具体的东西
节点关系节点关系
在XPath中,有七种类型的节点:元素、属性、文本、命名空间、处理指令、注释以及文档节点(或称为根节点)
再举个栗子再举个栗子
<urlset>
<url>
<loc>https://qq52o.me</loc>
<lastmod>2018-04-28T19:00:42+00:00</lastmod>
<changefreq>daily</changefreq>
<priority>1.0</priority>
</url>
</urlset>
第一个:父(Parent)
每个元素以及属性都有一个父
url元素是 loc、lastmod、changefreq以及 priority元素的父
第二个:子(Children)
元素节点可有零个、一个或多个子
loc、lastmod、changefreq以及 priority元素都是url元素的子
第三个:同胞(Sibling)
拥有相同的父的节点
loc、lastmod、changefreq以及 priority元素都是url元素的同胞
第四个:先辈(Ancestor)
某节点的父、父的父,等等
loc元素的先辈是 url元素和 urlset元素
第五个:后代(Descendant)
某个节点的子,子的子,等等
urlset的后代是url、loc、lastmod、changefreq以及 priority元素
如果你分不清楚,就按照子元素从上到下的去找元素节点
选取节点选取节点
XPath使用路径表达式在 XML 文档中选取节点,节点是通过沿着路径或者 step 来选取的,也就是上面所说的按照子元素从上到下去找元素节点
这些是最有用的路径表达式
表达式表达式 描述描述
nodename 选取此节点的所有子节点
/ 从根节点选取
// 从匹配选择的当前节点选择文档中的节点,而不考虑它们的位置
. 选取当前节点
.. 选取当前节点的父节点
@ 选取属性
实例
路径表达式路径表达式 结果结果
urlset 选取urlset元素的所有子节点
/urlset 选取根元素 urlset
urlset/url 选取属于urlset的子元素的所有url元素
资源评论
weixin_38638312
- 粉丝: 6
- 资源: 957
上传资源 快速赚钱
- 我的内容管理 展开
- 我的资源 快来上传第一个资源
- 我的收益 登录查看自己的收益
- 我的积分 登录查看自己的积分
- 我的C币 登录后查看C币余额
- 我的收藏
- 我的下载
- 下载帮助
安全验证
文档复制为VIP权益,开通VIP直接复制
信息提交成功