[转]python对XML的解析

来源:互联网 发布:js选择排序 编辑:程序博客网 时间:2024/06/06 00:06

转自:http://blog.csdn.net/yueguanghaidao/article/details/7265246

 

python有三种方法解析XML,SAX,DOM,以及ElementTree
###1.SAX (simple API for XML )
       pyhton 标准库包含SAX解析器,SAX是一种典型的极为快速的工具,在解析XML时,不会占用大量内存。
但是这是基于回调机制的,因此在某些数据中,它会调用某些方法进行传递。这意味着必须为数据指定句柄,
以维持自己的状态,这是非常困难的。


###2.DOM(Document Object Model)
       与SAX比较,DOM典型的缺点是比较慢,消耗更多的内存,因为DOM会将整个XML数读入内存中,并为树
中的第一个节点建立一个对象。使用DOM的好处是你不需要对状态进行追踪,因为每一个节点都知道谁是它的
父节点,谁是子节点。但是DOM用起来有些麻烦。


###3.ElementTree(元素树)
     ElementTree就像一个轻量级的DOM,具有方便友好的API。代码可用性好,速度快,消耗内存少,这里主要
介绍ElementTree。


下面是一个转载的例子:

test.xml如下:

[html] view plaincopyprint?
  1. <spanstyle="font-size: 13px;"><?xmlversion="1.0"encoding="utf-8"?> 
  2. <root> 
  3. <personage="18"> 
  4.     <name>hzj</name> 
  5.     <sex>man</sex> 
  6. </person> 
  7. <personage="19"des="hello"> 
  8.     <name>kiki</name> 
  9.     <sex>female</sex> 
  10. </person> 
  11. </root></span> 

1.加载xml文件

    加载XML文件共有2种方法,一是加载指定字符串,二是加载指定文件

2.获取element的方法

  a) 通过getiterator

  b) 过 getchildren

  c) find方法

  d) findall方法

[python] view plaincopyprint?
  1. <span style="font-size: 13px;">#-*- coding:utf-8 -*- 
  2. from xml.etree import ElementTree 
  3. def print_node(node): 
  4.     '''''打印结点基本信息''' 
  5.     print "==============================================" 
  6.     print "node.attrib:%s" % node.attrib 
  7.     if node.attrib.has_key("age") >0
  8.         print "node.attrib['age']:%s" % node.attrib['age'
  9.     print "node.tag:%s" % node.tag 
  10.     print "node.text:%s" % node.text 
  11. def read_xml(text): 
  12.     '''''读xml文件''' 
  13.     # 加载XML文件(2种方法,一是加载指定字符串,二是加载指定文件)    
  14.     # root = ElementTree.parse(r"D:/test.xml") 
  15.     root = ElementTree.fromstring(text) 
  16.      
  17.     # 获取element的方法 
  18.     # 1 通过getiterator  
  19.     lst_node = root.getiterator("person"
  20.     for node in lst_node: 
  21.         print_node(node) 
  22.          
  23.     # 2通过 getchildren 
  24.     lst_node_child = lst_node[0].getchildren()[0
  25.     print_node(lst_node_child) 
  26.          
  27.     # 3 .find方法 
  28.     node_find = root.find('person'
  29.     print_node(node_find) 
  30.      
  31.     #4. findall方法 
  32.     node_findall = root.findall("person/name")[1
  33.     print_node(node_findall) 
  34.      
  35. if __name__ == '__main__'
  36.      read_xml(open("test.xml").read()) 
  37. </span> 


想想为什么?不明白,请看下面

[python] view plaincopyprint?
  1. #encoding=utf-8 
  2. from xml.etree import ElementTree as ET 
  3. #要找出所有人的年龄 
  4. per=ET.parse('test.xml'
  5. p=per.findall('/person'
  6. for x in p: 
  7.     print x.attrib 
  8. print 
  9. for oneper in p: #找出person节点 
  10.     for child in oneper.getchildren():#找出person节点的子节点 
  11.         print child.tag,':',child.text 
  12.  
  13.     print 'age:',oneper.get('age'
  14.     print '############' 

结果如下:
[python] view plaincopyprint?
  1. {'age': '18'
  2. {'age': '19','des': 'hello'
  3.  
  4. name : hzj 
  5. sex : man 
  6. age: 18 
  7. ############ 
  8. name : kiki 
  9. sex : female 
  10. age: 19 
  11. ############