Python etree.xpath不能准确定位HTML
来源:互联网 发布:手机电池损耗检测软件 编辑:程序博客网 时间:2024/05/17 03:29
最近做毕设的时候需要用Python通过XPath从HTML中获取一些值
在大多数网站中是很好用的,今天突然发现在搜狐视频上就获取的不是很正常了
测试代码:
<span style="font-size:18px;">#coding:utf8from lxml import etreef = open('sohu.html', 'r')html = f.read()f.close()tree = etree.HTML(html)container = tree.xpath("//*")print container</span>输出结果:
<span style="font-size:18px;">[<Element html at 0x25b0b08>, <Element head at 0x25b0b48>, <Element script at 0x25b0f08>, <Element meta at 0x25b0048>, <Element meta at 0x25b00c8>, <Element meta at 0x25b0108>, <Element meta at 0x25b0208>]</span>
可以明显发现只能获取到几个节点,跟优酷的结果完全不同
一直以为是自己xpath写错了,后来发现是搜狐视频首页的编码是GBK,其他能正常获取节点的编码都是UTF-8
改了一下代码:
<span style="font-size:18px;">#coding:utf8from lxml import etreeimport ref = open('sohu.html', 'r')html = f.read()f.close()html = re.sub(r'charset=(\w*)', 'charset=UTF-8', html)tree = etree.HTML(html)container = tree.xpath("//*")print len(container)</span>最后输出:
<span style="font-size:18px;">3216</span>
搞定!~\(≧▽≦)/~
0 0
- Python etree.xpath不能准确定位HTML
- Python中 etree.xpath实践
- python lxml库etree解析html
- python selenium使用Xpath定位
- python selenium xpath定位方式
- python selenium使用xpath定位
- html锚点定位不准确问题
- python 使用xpath解析html
- xpath: Python网页爬虫定位辅助利器
- Selenium2+python自动化7-xpath定位
- python - xml.etree
- Python-lxml.etree
- lxml.etree--用Xpath获取静态文本
- <Python>页面元素定位方式:xpath----轴定位方式
- XPath定位
- xpath定位
- xpath定位
- python 使用lxml解析html(xpath)
- poj 3096
- C++包含关系实现has-a(面向对象)例子
- C# 编码规范
- 关于获取本机外网ip
- mysql 创建用户及赋权
- Python etree.xpath不能准确定位HTML
- codeforces 83E Two Subsequences (状态dp,难)
- POJ 2503 - Babelfish(STL)
- Linked List Cycle
- Android的Gradle插件(2):依赖管理
- the difference between “adduser” and “useradd”
- 手把手教你建立微信公众平台
- 领导力与团队管理上课笔记--上
- 递归:递归法解决排列问题