9、XPath 学习记录——节点

来源:互联网 发布:mac上如何编辑pdf 编辑:程序博客网 时间:2024/04/26 17:13

先理一下思路:

1、先写了一些关于Selenium 环境搭建,元素定位,基本控件处理的文章,发现我们能自动化的处理一些网页操作,很是欣慰,但是遇到的问题更多,比如说如何手写元素的xpath路径?想要弄明白xpath,我们需要掌握点XML的知识;了解XML,我们需要了解点HTML的基础。So...

2、我们学习了HTML 基础,更清晰的了解一个web页面及元素是怎么产生的;

3、学习XML 了解网页数据内容存储的形式;

4、接下来终于可以学习的 XPath 了。


一、XPath 术语

1、节点

在 XPath 中,有七种类型的节点:元素、属性、文本、命名空间、处理指令、注释以及文档(根)节点。XML 文档是被作为节点树来对待的。树的根被称为文档节点或者根节点。

<bookstore>  <book>    <title lang="en">Harry Potter</title>    <author>J K. Rowling</author>    <year>2005</year>    <!--<price>29.99</price>-->  </book></bookstore>
上面的XML 文档中,

<bookstore>、<book>、<title>、<author>、<year> 都是元素(元素节点),其中<bookstore> 是根节点(文档节点)

元素<title>有个属性 lang,有个文本为Harry Potter


2、节点的关系

(1)父(Parent)
根节点是无父节点,其它元素都有一个父节点。
在上面的例子中,book 元素是 title、author、year 以及 price 元素的父;bookstore 是 book的父

(2)子(Children)
元素节点可有零个、一个或多个子,book元素有4个子节点 title、author、year 以及 price(注释掉了)

(3)同胞(Sibling)
拥有相同的父的节点
在上面的例子中,title、author、year 以及 price 元素都是同胞,也叫兄弟节点

(4)先辈(Ancestor)
某节点的父、父的父,等等。
在上面的例子中,title 元素的先辈是 book 元素和 bookstore 元素

(5)后代(Descendant)
某个节点的子,子的子,等等。
在上面的例子中,bookstore 的后代是 book、title、author、year 以及 price 元素。


二、XPath 语法

XPath 使用路径表达式来选取 XML 文档中的节点或节点集。节点是通过沿着路径 (path) 或者步 (steps) 来选取的。

XML实例:

<bookstore><book>  <title lang="eng">Harry Potter</title>  <price>29.99</price></book><book>  <title lang="eng">Learning XML</title>  <price>39.95</price></book></bookstore>

1、选取节点
XPath 使用路径表达式在 XML 文档中选取节点。节点是通过沿着路径或者 step 来选取的。 下面列出了有用的路径表达式:


示例:



2、谓语(Predicates)
谓语用来查找某个特定的节点或者包含某个指定的值的节点。
谓语被嵌在方括号中。
在下面的表格中,我们列出了带有谓语的一些路径表达式,以及表达式的结果:



3、选取未知节点
XPath 通配符可用来选取未知的 XML 元素。



4、选取若干路径
通过在路径表达式中使用"|"运算符,您可以选取若干个路径。
在下面的表格中,我们列出了一些路径表达式,以及这些表达式的结果:



小结:

上面我们介绍了如何通过xpath 来取XML文件的元素,但是口说无凭,下一章节,我们将通过xpath来取HTML页面元素,然后打印出来,以证明我并没有骗你。

原创粉丝点击