彻底解决 HtmlParser 乱码问题! 总结

来源:互联网 发布:刀锋铁骑血量数据 编辑:程序博客网 时间:2024/06/06 03:53

     公司让写爬去,抓取网页的js文件,结果用了HtmlParser 却老是乱码,追究其原因是多方面的,其中最主要的原因是,web上的编码是多种多样,在抓取时手动设置编码解决不了各种编码问题,会报HtmlParser org.htmlparser.util.EncodingChangeException 异常,查了很多资料终于解决,不过在网页中的中文仍然会乱码,但是不会报这个异常!

     解决办法:重写InputStreamSource 和 Page 类 ,主要思想是,在抓取时获得页面编码,然后再以这种编码抓取内容,重写的两个类文件url

http://download.csdn.net/source/2574509

 

 

原创粉丝点击