当前位置: 开发笔记 > 编程语言 > 正文

开发笔记:pythonxml.dom模块解析xml

作者：flower_hj | 来源：互联网 | 2023-09-25 10:57

篇首语：本文由编程笔记#小编为大家整理，主要介绍了pythonxml.dom模块解析xml相关的知识，希望对你有一定的参考价值。

篇首语：本文由编程笔记#小编为大家整理，主要介绍了python xml.dom模块解析xml相关的知识，希望对你有一定的参考价值。

阅读目录

1. 什么是xml？有何特征？

2. 获得标签属性

3. 获得子标签

4. 获得标签属性值

5. 获得标签对之间的数据

6. 例子

7. 总结

回到顶部

1. 什么是xml？有何特征？

xml即可扩展标记语言，它可以用来标记数据、定义数据类型，是一种允许用户对自己的标记语言进行定义的源语言。

例子：del.xml

xml version="1.0" encoding="utf-8"?>
<catalog>
<maxid>4maxid>
<login username="pytest" passwd=\'123456\'>
<caption>Pythoncaption>
<item id="4">
<caption>testcaption>
item>
login>
<item id="2">
<caption>Zopecaption>
item>
catalog>

从结构上，很像HTML超文本标记语言。但他们被设计的目的是不同的，超文本标记语言被设计用来显示数据，其焦点是数据的外观。它被设计用来传输和存储数据，其焦点是数据的内容。

那么它有如下特征：

它是有标签对组成，

标签可以有属性：

标签对可以嵌入数据：abc

标签可以嵌入子标签（具有层级关系）

回到顶部

2. 获得标签属性

#coding: utf-8
import xml.dom.minidom
dom = xml.dom.minidom.parse("del.xml") #打开xml文档

root = dom.documentElement #得到xml文档对象
print "nodeName:", root.nodeName #每一个结点都有它的nodeName，nodeValue，nodeType属性
print "nodeValue:", root.nodeValue #nodeValue是结点的值，只对文本结点有效
print "nodeType:", root.nodeType
print "ELEMENT_NODE:", root.ELEMENT_NODE

nodeType是结点的类型。catalog是ELEMENT_NODE类型

现在有以下几种：

\'ATTRIBUTE_NODE\'

\'CDATA_SECTION_NODE\'

\'COMMENT_NODE\'

\'DOCUMENT_FRAGMENT_NODE\'

\'DOCUMENT_NODE\'

\'DOCUMENT_TYPE_NODE\'

\'ELEMENT_NODE\'

\'ENTITY_NODE\'

\'ENTITY_REFERENCE_NODE\'

\'NOTATION_NODE\'

\'PROCESSING_INSTRUCTION_NODE\'

\'TEXT_NODE\'

运行结果

nodeName: catalog

nodeValue: None

nodeType: 1

ELEMENT_NODE: 1

回到顶部

3. 获得子标签

#coding: utf-8
import xml.dom.minidom
dom = xml.dom.minidom.parse("del.xml")
root = dom.documentElement
bb = root.getElementsByTagName(\'maxid\')
print type(bb)
print bb
b = bb[0]
print b.nodeName
print b.nodeValue

运行结果

\'xml.dom.minicompat.NodeList\'>

[0x2707a48>]

maxid

None

回到顶部

4. 获得标签属性值

#coding: utf-8
import xml.dom.minidom
dom = xml.dom.minidom.parse("del.xml")
root = dom.documentElement
itemlist = root.getElementsByTagName(\'login\')
item = itemlist[0]
print item.getAttribute("username")
print item.getAttribute("passwd")
itemlist = root.getElementsByTagName("item")
item = itemlist[0] #通过在itemlist中的位置区分
print item.getAttribute("id")
item2 = itemlist[1] #通过在itemlist中的位置区分

print item2.getAttribute("id")

运行结果

pytest

123456

4

2

回到顶部

5. 获得标签对之间的数据

#coding: utf-8
import xml.dom.minidom
dom = xml.dom.minidom.parse("del.xml")
root = dom.documentElement
itemlist = root.getElementsByTagName(\'caption\')
item = itemlist[0]
print item.firstChild.data
item2 = itemlist[1]
print item2.firstChild.data

运行结果

Python

test

回到顶部

6. 例子

xml version="1.0" encoding="UTF-8" ?>
<users>
<user id="1000001">
<username>Adminusername>
<email>admin@live.cnemail>
<age>23age>
<sex>boysex>
user>
<user id="1000002">
<username>Admin2username>
<email>admin2@live.cnemail>
<age>22age>
<sex>boysex>
user>
<user id="1000003">
<username>Admin3username>
<email>admin3@live.cnemail>
<age>27age>
<sex>boysex>
user>
<user id="1000004">
<username>Admin4username>
<email>admin4@live.cnemail>
<age>25age>
<sex>girlsex>
user>
<user id="1000005">
<username>Admin5username>
<email>admin5@live.cnemail>
<age>20age>
<sex>boysex>
user>
<user id="1000006">
<username>Admin6username>
<email>admin6@live.cnemail>
<age>23age>
<sex>girlsex>
user>

把name、email、age、sex输出

参考代码

# -*- coding:utf-8 -*-
from xml.dom import minidom
def get_attrvalue(node, attrname):
return node.getAttribute(attrname) if node else \'\'
def get_nodevalue(node, index = 0):
return node.childNodes[index].nodeValue if node else \'\'
def get_xmlnode(node, name):
return node.getElementsByTagName(name) if node else []
def get_xml_data(filename = \'user.xml\'):
doc = minidom.parse(filename)
root = doc.documentElement
user_nodes = get_xmlnode(root, \'user\')
print "user_nodes:", user_nodes
user_list=[]
for node in user_nodes:
user_id = get_attrvalue(node, \'id\')
node_name = get_xmlnode(node, \'username\')
node_email = get_xmlnode(node, \'email\')
node_age = get_xmlnode(node, \'age\')
node_sex = get_xmlnode(node, \'sex\')
user_name =get_nodevalue(node_name[0])
user_email = get_nodevalue(node_email[0])
user_age = int(get_nodevalue(node_age[0]))
user_sex = get_nodevalue(node_sex[0])
user = {}
user[\'id\'] , user[\'username\'] , user[\'email\'] , user[\'age\'] , user[\'sex\'] = (
int(user_id), user_name , user_email , user_age , user_sex
)
user_list.append(user)
return user_list
def test_load_xml():
user_list = get_xml_data()
for user in user_list :
print \'-----------------------------------------------------\'
if user:
user_str=\'No.:\\t%d\\nname:\\t%s\\nsex:\\t%s\\nage:\\t%s\\nEmail:\\t%s\' % (int(user[\'id\']) , user[\'username\'], user[\'sex\'] , user[\'age\'] , user[\'email\'])
print user_str
if __name__ == "__main__":
test_load_xml()

结果

C:\\Users\\jihite\\Desktop\\xml>python user.py

user_nodes: [0x2758c48>, 0x2756288>,

 0x2756888>, 0x2756e88>, 

t: user at 0x275e4c8>, 0x275eac8>]

-----------------------------------------------------

No.:    1000001

name:   Admin

sex:    boy

age:    23

Email:  admin@live.cn

-----------------------------------------------------

No.:    1000002

name:   Admin2

sex:    boy

age:    22

Email:  admin2@live.cn

-----------------------------------------------------

No.:    1000003

name:   Admin3

sex:    boy

age:    27

Email:  admin3@live.cn

-----------------------------------------------------

No.:    1000004

name:   Admin4

sex:    gril

age:    25

Email:  admin4@live.cn

-----------------------------------------------------

No.:    1000005

name:   Admin5

sex:    boy

age:    20

Email:  admin5@live.cn

-----------------------------------------------------

No.:    1000006

name:   Admin6

sex:    gril

age:    23

Email:  admin6@live.cn

回到顶部

7. 总结

minidom.parse(filename)

加载读取XML文件

doc.documentElement

获取XML文档对象

node.getAttribute(AttributeName)

获取XML节点属性值

node.getElementsByTagName(TagName)

获取XML节点对象集合

node.childNodes #返回子节点列表。

node.childNodes[index].nodeValue

获取XML节点值

node.firstChild

#访问第一个节点。等价于pagexml.childNodes[0]

doc = minidom.parse(filename)

doc.toxml(\'UTF-8\')

返回Node节点的xml表示的文本

Node.attributes["id"]

a.name #就是上面的 "id"

a.value #属性的值

访问元素属性

推荐阅读

process
Spring源码解密之默认标签的解析方式分析

本文分析了Spring源码解密中默认标签的解析方式。通过对命名空间的判断，区分默认命名空间和自定义命名空间，并采用不同的解析方式。其中，bean标签的解析最为复杂和重要。 ... [详细]

蜡笔小新 2023-12-14 17:24:50
list
CSS3选择器的使用方法详解，提高Web开发效率和精准度

本文详细介绍了CSS3新增的选择器方法，包括属性选择器的使用。通过CSS3选择器，可以提高Web开发的效率和精准度，使得查找元素更加方便和快捷。同时，本文还对属性选择器的各种用法进行了详细解释，并给出了相应的代码示例。通过学习本文，读者可以更好地掌握CSS3选择器的使用方法，提升自己的Web开发能力。 ... [详细]

蜡笔小新 2023-12-14 14:37:52
python
使用 Ubuntu 中的 Python 获取浏览器历史记录

使用Ubuntu中的Python获取浏览器历史记录原文: ... [详细]

蜡笔小新 2023-12-14 08:57:59
const
关于cuowu类的错误提示和使用AdjustmentListener的问题

本文讨论了一个关于cuowu类的问题，作者在使用cuowu类时遇到了错误提示和使用AdjustmentListener的问题。文章提供了16个解决方案，并给出了两个可能导致错误的原因。 ... [详细]

蜡笔小新 2023-12-13 22:09:56
const
向QTextEdit拖放文件的方法及实现步骤

本文介绍了在使用QTextEdit时如何实现拖放文件的功能，包括相关的方法和实现步骤。通过重写dragEnterEvent和dropEvent函数，并结合QMimeData和QUrl等类，可以轻松实现向QTextEdit拖放文件的功能。详细的代码实现和说明可以参考本文提供的示例代码。 ... [详细]

蜡笔小新 2023-12-14 16:06:38
list
C#学习教程：在Console中工作但在Windows窗体中不工作的异步代码分享

本文分享了一个关于在C#中使用异步代码的问题，作者在控制台中运行时代码正常工作，但在Windows窗体中却无法正常工作。作者尝试搜索局域网上的主机，但在窗体中计数器没有减少。文章提供了相关的代码和解决思路。 ... [详细]

蜡笔小新 2023-12-14 15:56:00
text
Linux重启网络命令实例及关机和重启示例教程

本文介绍了Linux系统中重启网络命令的实例，以及使用不同方式关机和重启系统的示例教程。包括使用图形界面和控制台访问系统的方法，以及使用shutdown命令进行系统关机和重启的句法和用法。 ... [详细]

蜡笔小新 2023-12-14 15:52:52
python
开发笔记:加密&json&StringIO模块&BytesIO模块

篇首语：本文由编程笔记#小编为大家整理，主要介绍了加密&json&StringIO模块&BytesIO模块相关的知识，希望对你有一定的参考价值。一、加密加密 ... [详细]

蜡笔小新 2023-12-14 15:18:35
const
android listview OnItemClickListener失效原因

最近在做listview时发现OnItemClickListener失效的问题，经过查找发现是因为button的原因。不仅listitem中存在button会影响OnItemClickListener事件的失效，还会导致单击后listview每个item的背景改变，使得item中的所有有关焦点的事件都失效。本文给出了一个范例来说明这种情况，并提供了解决方法。 ... [详细]

蜡笔小新 2023-12-14 14:25:50
main
Java容器中的compareto方法排序原理解析

本文从源码解析Java容器中的compareto方法的排序原理，讲解了在使用数组存储数据时的限制以及存储效率的问题。同时提到了Redis的五大数据结构和list、set等知识点，回忆了作者大学时代的Java学习经历。文章以作者做的思维导图作为目录，展示了整个讲解过程。 ... [详细]

蜡笔小新 2023-12-14 13:53:31
list
XML介绍与使用的概述及标签规则

本文介绍了XML的基本概念和用途，包括XML的可扩展性和标签的自定义特性。同时还详细解释了XML标签的规则，包括标签的尖括号和合法标识符的组成，标签必须成对出现的原则以及特殊标签的使用方法。通过本文的阅读，读者可以对XML的基本知识有一个全面的了解。 ... [详细]

蜡笔小新 2023-12-13 17:39:50
list
java 数据同步分页_JAVA的数据分页显示

importjava.util.ArrayList;publicclassPageIndex{privateintpageSize;每页要显示的行privateintpageNum ... [详细]

蜡笔小新 2023-12-13 16:40:13
main
Golang如何使用Cookie跟踪位置

关键词：Golang, Cookie, 跟踪位置, net/http/cookiejar, package main, golang.org/x/net/publicsuffix, io/ioutil, log, net/http, net/http/cookiejar ... [详细]

蜡笔小新 2023-12-13 15:47:22
config
在重复造轮子的情况下用ProxyServlet反向代理来减少工作量

像不少公司内部不同团队都会自己研发自己工具产品，当各个产品逐渐成熟，到达了一定的发展瓶颈，同时每个产品都有着自己的入口，用户 ... [详细]

蜡笔小新 2023-12-13 15:19:01
list
java 模拟get post请求_Java后台模拟发送http的get和post请求，并测试

个人学习使用：谨慎参考1Client类importcom.thoughtworks.gauge.Step;importcom.thoughtworks.gauge.T ... [详细]

蜡笔小新 2023-12-13 14:20:23