Python etree.xpath不能准确定位HTML

256 阅读 0 评论 169 点赞

我是靠谱客的博主魔幻狗，这篇文章主要介绍Python etree.xpath不能准确定位HTML，现在分享给大家，希望可以做个参考。

最近做毕设的时候需要用Python通过XPath从HTML中获取一些值

在大多数网站中是很好用的，今天突然发现在搜狐视频上就获取的不是很正常了

测试代码：

<span style="font-size:18px;">#coding:utf8
from lxml import etree
f = open('sohu.html', 'r')
html = f.read()
f.close()
tree = etree.HTML(html)
container = tree.xpath("//*")
print container</span>

输出结果：

<span style="font-size:18px;">[<Element html at 0x25b0b08>, <Element head at 0x25b0b48>, <Element script at 0x25b0f08>, <Element meta at 0x25b0048>, <Element meta at 0x25b00c8>, <Element meta at 0x25b0108>, <Element meta at 0x25b0208>]</span>

可以明显发现只能获取到几个节点，跟优酷的结果完全不同

一直以为是自己xpath写错了，后来发现是搜狐视频首页的编码是GBK，其他能正常获取节点的编码都是UTF-8

改了一下代码：

<span style="font-size:18px;">#coding:utf8
from lxml import etree
import re
f = open('sohu.html', 'r')
html = f.read()
f.close()
html = re.sub(r'charset=(w*)', 'charset=UTF-8', html)
tree = etree.HTML(html)
container = tree.xpath("//*")
print len(container)</span>

最后输出：

<span style="font-size:18px;">3216</span>

搞定！~(≧▽≦)/~

最后

以上就是魔幻狗最近收集整理的关于Python etree.xpath不能准确定位HTML的全部内容，更多相关Python内容请搜索靠谱客的其他文章。

本图文内容来源于网友提供，作为学习参考使用，或来自网络收集整理，版权属于原作者所有。

本文分类：python
浏览次数：256 次浏览
发布日期：2023-10-05 17:45:32

Python etree.xpath不能准确定位HTML

最后

评论列表共有 0 条评论

发表评论取消回复

Python etree.xpath不能准确定位HTML

最后

相关文章

评论列表共有 0 条评论

发表评论 取消回复

发表评论取消回复