lxml学习笔记

问题1：有一个XML文件，如何解析
问题2：解析后，如果查找、定位某个标签
问题3：定位后如何操作标签，比如访问属性、文本内容等

from lxml import etree -> 导入模块，该库常用的XML处理功能都在lxml.etree中

requests + lxml解析小

from lxml import etree  
import requests  
  
page = 1  
url = 'http://www.jikexueyuan.com/course/?pageNum=' + str(page)  
html = requests.get(url)  
  
selector = etree.HTML(html.text)  
content_field = selector.xpath('//div[@class="lesson-list"]/ul/li')  
print(content_field)

Element类

Element是XML处理的核心类，Element对象可以直观的理解为XML的节点，大部分XML节点的处理都是围绕该类进行的。这部分包括三个内容：节点的操作、节点属性的操作、节点内文本的操作。

1. 节点操作

创建Element对象
使用Element方法，参数即节点名称。

>>> root = etree.Element('root')
>>> print(root)
<Element root at 0x2da0708>

获取节点名称
使用tag属性，获取节点的名称。

>>> print(root.tag)
root

输出XML内容
使用tostring方法输出XML内容，参数为Element对象。

>>> print(etree.tostring(root))
b'<root><child1/><child2/><child3/></root>'

添加子节点
使用SubElement方法创建子节点，第一个参数为父节点（Element对象），第二个参数为子节点名称。

>>> child1 = etree.SubElement(root, 'child1')
>>> child2 = etree.SubElement(root, 'child2')
>>> child3 = etree.SubElement(root, 'child3')

删除子节点
使用remove方法删除指定节点，参数为Element对象。clear方法清空所有节点。

>>> root.remove(child1)  # 删除指定子节点
>>> print(etree.tostring(root))
b'<root><child2/><child3/></root>'
>>> root.clear()  # 清除所有子节点
>>> print(etree.tostring(root))
b'<root/>'

以列表的方式操作子节点
可以将Element对象的子节点视为列表进行各种操作：

>>> child = root[0]  # 下标访问
>>> print(child.tag)
child1

>>> print(len(root))  # 子节点数量
3

>>> root.index(child2)  # 获取索引号
1

>>> for child in root:  # 遍历
...     print(child.tag)
child1
child2
child3

>>> root.insert(0, etree.Element('child0'))  # 插入
>>> start = root[:1]  # 切片
>>> end = root[-1:]

>>> print(start[0].tag)
child0
>>> print(end[0].tag)
child3

>>> root.append( etree.Element('child4') )  # 尾部添加
>>> print(etree.tostring(root))
b'<root><child0/><child1/><child2/><child3/><child4/></root>'

获取父节点
使用getparent方法可以获取父节点。

>>> print(child1.getparent().tag)
root

属性操作

属性是以key-value的方式存储的，就像字典一样。

1. 创建属性

可以在创建Element对象时同步创建属性，第二个参数即为属性名和属性值：

>>> root = etree.Element('root', interesting='totally')
>>> print(etree.tostring(root))
b'<root interesting="totally"/>'
也可以使用set方法给已有的Element对象添加属性，两个参数分别为属性名和属性值：

>>> root.set('hello', 'Huhu')
>>> print(etree.tostring(root))
b'<root interesting="totally" hello="Huhu"/>'

2. 获取属性

属性是以key-value的方式存储的，就像字典一样。直接看例子

# get方法获得某一个属性值
>>> print(root.get('interesting'))
totally

# keys方法获取所有的属性名
>>> sorted(root.keys())
['hello', 'interesting']

# items方法获取所有的键值对
>>> for name, value in sorted(root.items()):
...     print('%s = %r' % (name, value))
hello = 'Huhu'
interesting = 'totally'

也可以用attrib属性一次拿到所有的属性及属性值存于字典中：

>>> attributes = root.attrib
>>> print(attributes)
{'interesting': 'totally', 'hello': 'Huhu'}

>>> attributes['good'] = 'Bye'  # 字典的修改影响节点
>>> print(root.get('good'))
Bye

文本操作

标签及标签的属性操作介绍完了，最后就剩下标签内的文本了。可以使用text和tail属性、或XPath的方式来访问文本内容。

1. text和tail属性

一般情况，可以用Element的text属性访问标签的文本。

>>> root = etree.Element('root')
>>> root.text = 'Hello, World!'
>>> print(root.text)
Hello, World!
>>> print(etree.tostring(root))
b'<root>Hello, World!</root>'```

XML的标签一般是成对出现的，有开有关，但像HTML则可能出现单一的标签，如下面这段代码中的`<br/>`。

`<html><body>Text<br/>Tail</body></html>`  

Element类提供了tail属性支持单一标签的文本获取。
```python
>>> html = etree.Element('html')
>>> body = etree.SubElement(html, 'body')
>>> body.text = 'Text'
>>> print(etree.tostring(html))
b'<html><body>Text</body></html>'

>>> br = etree.SubElement(body, 'br')
>>> print(etree.tostring(html))
b'<html><body>Text<br/></body></html>'

# tail仅在该标签后面追加文本
>>> br.tail = 'Tail'
>>> print(etree.tostring(br))
b'<br/>Tail'

>>> print(etree.tostring(html))
b'<html><body>Text<br/>Tail</body></html>'

# tostring方法增加method参数，过滤单一标签，输出全部文本
>>> print(etree.tostring(html, method='text'))
b'TextTail'

2. XPath方式

# 方式一：过滤单一标签，返回文本
>>> print(html.xpath('string()'))
TextTail

# 方式二：返回列表，以单一标签为分隔
>>> print(html.xpath('//text()'))
['Text', 'Tail']

方法二获得的列表，每个元素都会带上它所属节点及文本类型信息，如下：

>>> texts = html.xpath('//text()'))

>>> print(texts[0])
Text
# 所属节点
>>> parent = texts[0].getparent()  
>>> print(parent.tag)
body

>>> print(texts[1], texts[1].getparent().tag)
Tail br

# 文本类型：是普通文本还是tail文本
>>> print(texts[0].is_text)
True
>>> print(texts[1].is_text)
False
>>> print(texts[1].is_tail)
True

文件解析与输出

这部分讲述如何将XML文件解析为Element对象，以及如何将Element对象输出为XML文件。

1. 文件解析

文件解析常用的有fromstring、XML和HTML三个方法。接受的参数都是字符串。

>>> xml_data = '<root>data</root>'

# fromstring方法
>>> root1 = etree.fromstring(xml_data)
>>> print(root1.tag)
root
>>> print(etree.tostring(root1))
b'<root>data</root>'

# XML方法，与fromstring方法基本一样
>>> root2 = etree.XML(xml_data)
>>> print(root2.tag)
root
>>> print(etree.tostring(root2))
b'<root>data</root>'

# HTML方法，如果没有<html>和<body>标签，会自动补上
>>> root3 = etree.HTML(xml_data)
>>> print(root3.tag)
html
>>> print(etree.tostring(root3))
b'<html><body><root>data</root></body></html>'

2. 输出

输出其实就是前面一直在用的tostring方法了，这里补充xml_declaration和encoding两个参数，前者是XML声明，后者是指定编码。

>>> root = etree.XML('<root><a><b/></a></root>')

>>> print(etree.tostring(root))
b'<root><a><b/></a></root>'

# XML声明
>>> print(etree.tostring(root, xml_declaration=True))
b"<?xml version='1.0' encoding='ASCII'?>\n<root><a><b/></a></root>"

# 指定编码
>>> print(etree.tostring(root, encoding='iso-8859-1'))
b"<?xml version='1.0' encoding='iso-8859-1'?>\n<root><a><b/></a></root>"

ElementPath

讲ElementPath前，需要引入ElementTree类，一个ElementTree对象可理解为一个完整的XML树，每个节点都是一个Element对象。而ElementPath则相当于XML中的XPath。用于搜索和定位Element元素。

这里介绍两个常用方法，可以满足大部分搜索、查询需求，它们的参数都是XPath语句：
findall()：返回所有匹配的元素，返回列表
find()：返回匹配到的第一个元素

>>> root = etree.XML("<root><a x='123'>aText<b/><c/><b/></a></root>")

# 查找第一个b标签
>>> print(root.find('b'))
None
>>> print(root.find('a').tag)
a

# 查找所有b标签，返回Element对象组成的列表
>>> [ b.tag for b in root.findall('.//b') ]
['b', 'b']

# 根据属性查询
>>> print(root.findall('.//a[@x]')[0].tag)
a
>>> print(root.findall('.//a[@y]'))
[]

原文地址：

Python lxml教程-SKYue

参考资料

最后编辑于：2017.12.04 06:13:09

人面猴
序言：七十年代末，一起剥皮案震惊了整个滨河市，随后出现的几起案子，更是在滨河造成了极大的恐慌，老刑警刘岩，带你破解...
沈念sama阅读 203,271评论 5赞 476
死咒
序言：滨河连续发生了三起死亡事件，死亡现场离奇诡异，居然都是意外死亡，警方通过查阅死者的电脑和手机，发现死者居然都...
沈念sama阅读 85,275评论 2赞 380
救了他两次的神仙让他今天三更去死
文/潘晓璐我一进店门，熙熙楼的掌柜王于贵愁眉苦脸地迎上来，“玉大人，你说我怎么就摊上这事。” “怎么了？”我有些...
开封第一讲书人阅读 150,151评论 0赞 336
道士缉凶录：失踪的卖姜人
文/不坏的土叔我叫张陵，是天一观的道长。经常有香客问我，道长，这世上最难降的妖魔是什么？我笑而不...
开封第一讲书人阅读 54,550评论 1赞 273
港岛之恋（遗憾婚礼）
正文为了忘掉前任，我火速办了婚礼，结果婚礼上，老公的妹妹穿的比我还像新娘。我一直安慰自己，他们只是感情好，可当我...
茶点故事阅读 63,553评论 5赞 365
恶毒庶女顶嫁案：这布局不是一般人想出来的
文/花漫我一把揭开白布。她就那样静静地躺着，像睡着了一般。火红的嫁衣衬着肌肤如雪。梳的纹丝不乱的头发上，一...
开封第一讲书人阅读 48,559评论 1赞 281
城市分裂传说
那天，我揣着相机与录音，去河边找鬼。笑死，一个胖子当着我的面吹牛，可吹牛的内容都是我干的。我是一名探鬼主播，决...
沈念sama阅读 37,924评论 3赞 395
双鸳鸯连环套：你想象不到人心有多黑
文/苍兰香墨我猛地睁开眼，长吁一口气：“原来是场噩梦啊……” “哼！你这毒妇竟也来了？” 一声冷哼从身侧响起，我...
开封第一讲书人阅读 36,580评论 0赞 257
万荣杀人案实录
序言：老挝万荣一对情侣失踪，失踪者是张志新（化名）和其女友刘颖，没想到半个月后，有当地人在树林里发现了一具尸体，经...
沈念sama阅读 40,826评论 1赞 297
护林员之死
正文独居荒郊野岭守林人离奇死亡，尸身上长有42处带血的脓包…… 初始之章·张勋以下内容为张勋视角年9月15日...
茶点故事阅读 35,578评论 2赞 320
白月光启示录
正文我和宋清朗相恋三年，在试婚纱的时候发现自己被绿了。大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
茶点故事阅读 37,661评论 1赞 329
活死人
序言：一个原本活蹦乱跳的男人离奇死亡，死状恐怖，灵堂内的尸体忽然破棺而出，到底是诈尸还是另有隐情，我是刑警宁泽，带...
沈念sama阅读 33,363评论 4赞 318
日本核电站爆炸内幕
正文年R本政府宣布，位于F岛的核电站，受9级特大地震影响，放射性物质发生泄漏。R本人自食恶果不足惜，却给世界环境...
茶点故事阅读 38,940评论 3赞 307
男人毒药：我在死后第九天来索命
文/蒙蒙一、第九天我趴在偏房一处隐蔽的房顶上张望。院中可真热闹，春花似锦、人声如沸。这庄子的主人今日做“春日...
开封第一讲书人阅读 29,926评论 0赞 19
一桩弑父案，背后竟有这般阴谋
文/苍兰香墨我抬头看了看天上的太阳。三九已至，却和暖如春，着一层夹袄步出监牢的瞬间，已是汗流浃背。一阵脚步声响...
开封第一讲书人阅读 31,156评论 1赞 259
情欲美人皮
我被黑心中介骗来泰国打工，没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留，地道东北人。一个月前我还...
沈念sama阅读 42,872评论 2赞 349
代替公主和亲
正文我出身青楼，却偏偏与公主长得像，于是被迫代替她去往敌国和亲。传闻我的和亲对象是个残疾皇子，可洞房花烛夜当晚...
茶点故事阅读 42,391评论 2赞 342