CrawlScript语言轻松实现网络爬虫——轻松爬取整站信息
来源:互联网 发布:数据库营销成功案例 编辑:程序博客网 时间:2024/05/20 23:58
CrawlScript语言在beta0.3版本中集成了整站爬虫的功能,只需要简单几句,就可以完成对整站的爬取。
首先下载CrawlScript beta 0.3: CrawlScript beta 0.3版及demo下载。
下载后解压,在CrawlScript-bin文件夹中有一个demo.js,这个代码虽然只有几行,但是实现了对整个新华网的新闻正文的爬取和抽取,一个完整的网络爬虫。
运行方式:用命令行进入CrawlScript-bin文件夹,输入命令:
java -jar crawlscript.jar demo.js
爬虫的启动可能需要半分钟(这是因为这里的爬虫是允许在中断后继续爬取的,所以需要预处理很多信息)。然后就会发现不断刷新新信息。查看CrawlScript-bin下的download文件夹,会发现新华网的新闻在不断地加入:
想了解更多,加入QQ讨论群或者发邮件咨询:
CrawlScript爬虫脚本语言官方QQ群:250108697
CrawlScript爬虫脚本语言官方邮箱:briefcopy@126.com
注:CrawlScript是开源软件,不会向您索要任何费用。
0 0
- CrawlScript语言轻松实现网络爬虫——轻松爬取整站信息
- CrawlScript语言————一门用javascript语法在JAVA环境下,快捷开发网络爬虫的脚本语言
- 自己动手做网络爬虫系列——2 CrawlScript基本语法。
- Scrapy 轻松定制网络爬虫
- Scrapy 轻松定制网络爬虫
- Scrapy 轻松定制网络爬虫
- Scrapy 轻松定制网络爬虫
- Scrapy轻松定制网络爬虫
- python Scrapy 轻松定制网络爬虫
- 黄聪:Scrapy 轻松定制网络爬虫
- 轻松实现检测Windows肉鸡系统信息
- 轻松实现检测Windows肉鸡系统信息
- 【转】黄聪:Scrapy 轻松定制网络爬虫
- 用SNMP实现对大型网络的轻松管理!——gjp0731 的BLOG
- Android 轻松实现网络交互模板
- Android 轻松实现网络交互模板
- 轻松实现Ecshop商城多语言切换
- 轻松.....
- 回调机制深入剖析
- Eclipse : Maven search dependencies doen't work
- andriod-api翻译(二)--Services
- <c:forEach varStatus="status">中 varStatus的属性简介
- MySQL 体系架构 Oracle体系架构 PostgreSQL体系架构
- CrawlScript语言轻松实现网络爬虫——轻松爬取整站信息
- Tiled源码分析(三): Undo/Redo实现
- Principles of Continuous Integration
- windows下em启动问题
- ZeroMQ阅读笔记
- Java多线程系列--“JUC锁”03之 公平锁(一)
- JAVA深复制与浅复制
- 《C++ Primer》学习笔记1-第一章快速入门
- Leetcode Palindrome Partitioning II