程序博客网 > 飞腾排版软件课件

网页信息抓取进阶支持Js生成数据 Jsoup的不足之处

来源：互联网发布：飞腾排版软件课件编辑：程序博客网时间：2024/05/16 08:02

转载请标明出处：http://blog.csdn.net/lmj623565791/article/details/23866427

今天又遇到一个网页数据抓取的任务，给大家分享下。

说道网页信息抓取，相信Jsoup基本是首选的工具，完全的类JQuery操作，让人感觉很舒服。但是，今天我们就要说一说Jsoup的不足。

1、首先我们新建一个页面

[html] view plaincopy

<!DOCTYPE HTML PUBLIC "-//W3C//DTD HTML 4.01 Transitional//EN">
<html>
<head>
<title>main.html</title>
<meta http-equiv="keywords" content="keyword1,keyword2,keyword3">
<meta http-equiv="description" content="this is my page">
<meta http-equiv="content-type" content="text/html; charset=UTF-8">
<style type="text/css">
a {
line-height: 30px;
margin: 20px;
}
</style>
<script type="text/javascript">
var datas = [ {
href : "http://news.qq.com/a/20140416/017800.htm",
title : "高校一保安长相酷似作家莫言"
}, {
href : "http://news.qq.com/a/20140416/015167.htm",
title : "男子单臂托举悬空女半小时"
}, {
href : "http://news.qq.com/a/20140416/013808.htm",
title : "女子上门讨房租遭强奸拍裸照"
}, {
href : "http://news.qq.com/a/20140416/016805.htm",
title : "澳洲骆驼爱喝冰镇啤酒解暑"
} ];
window.onload = function() {
var infos = document.getElementById("infos");
for( var i = 0 ; i < datas.length ; i++)
{
var a = document.createElement("a");
a.href = datas[i].href ;
a.innerText = datas[i].title;
infos.appendChild(a);
infos.appendChild(document.createElement("br"))
}
}
</script>
</head>
<body>
Hello Main HttpUnit!
<br>
<div id="infos"
style="width: 60%; border: 1px solid green; border-radius: 10px; margin: 0 auto;">
</div>
</body>
</html>

页面上观察是这样显示的：

我们审查元素：

如果你看到这样的页面，你会觉得拿Jsoup来抓取，简直就是呵呵，小菜一叠，于是我们写了这样的代码：

[java] view plaincopy

@Test
ublic void testUserJsoup() {
try {
Document doc = Jsoup.connect(
"http://localhost:8080/strurts2fileupload/main.html")
.timeout(5000).get();
Elements links = doc.body().getElementsByTag("a");
for (Element link : links) {
System.out.println(link.text() + " " + link.attr("href"));
}
} catch (IOException e) {
e.printStackTrace();
}

你会觉得就这几行代码，轻轻松松搞定，快快乐乐下班。于是运行发现，其实什么的抓取不到。

于是我们再回到页面，打开页面源代码，也就是上面的HTML代码，你恍然大悟，我靠，body里面根本没有数据，难怪抓不到。这就是Jsoup的不足，如果Jsoup去抓取的页面的数据，全都是页面加载完成后，ajax获取形成的，是抓取不到的。

下面给大家推荐另一个开源项目：htmlunit，看名字是用于测试的，但是用来抓取数据也不错

我们开始编写类似Jsoup的代码：

[java] view plaincopy

@Test
public void testUserHttpUnit() throws FailingHttpStatusCodeException,
MalformedURLException, IOException {
/** HtmlUnit请求web页面 */
WebClient wc = new WebClient(BrowserVersion.CHROME);
wc.getOptions().setUseInsecureSSL(true);
wc.getOptions().setJavaScriptEnabled(true); // 启用JS解释器，默认为true
wc.getOptions().setCssEnabled(false); // 禁用css支持
wc.getOptions().setThrowExceptionOnScriptError(false); // js运行错误时，是否抛出异常
wc.getOptions().setTimeout(100000); // 设置连接超时时间，这里是10S。如果为0，则无限期等待
wc.getOptions().setDoNotTrackEnabled(false);
HtmlPage page = wc
.getPage("http://localhost:8080/strurts2fileupload/main.html");
DomNodeList<DomElement> links = page.getElementsByTagName("a");
for (DomElement link : links) {
System.out
.println(link.asText() + " " + link.getAttribute("href"));
}
}

再看一下运行结果：

完美解决，htmlunit其实就相当于一个没有UI的浏览器，它可以让页面上的js执行完成后，再抓取信息，具体的介绍，google一下就行。主要给大家介绍一种方案！

如果你觉得这篇文章对你有用，就顶一个~

0 0

飞腾排版软件课件

飞腾排版软件课件

原创粉丝点击

热门问题 老师的惩罚人脸识别我在镇武司摸鱼那些年重生之率土为王我在大康的咸鱼生活盘龙之生命进化天生仙种凡人之先天五行春回大明朝姑娘不必设防，我是瞎子深圳区域划分图深圳离广州多远深圳人才招聘网深圳公交车查询深圳有什么地方深圳景点推荐深圳有多少个区深圳有多少人口深圳电子厂招工深圳到处一游必去之地深圳公交线路查询深圳车祸今天深圳仁爱医院地址深圳坐车网公交车查询深圳第一现场重播深圳东火车站深圳医院招聘深圳著名景点深圳有哪些好玩的地方北京大学深圳医院深圳特产有哪些深圳之窗首页深圳地理位置深圳市长是谁深圳是广东的吗深圳发展前景深圳有哪些区深圳世界之窗图片深圳免费景点深圳面积多大深圳旅游攻略深圳的特产是什么深圳城市图片深圳必去免费景点深圳哪个区工资高深圳站是哪个站深圳好玩的地方排行榜深圳工作好找吗深圳晚上哪里好玩深圳海洋公园深圳哪里好找工作