基于selenium-java封装chrome、firefox、phantomjs实现爬虫
来源:互联网 发布:js onload 编辑:程序博客网 时间:2024/05/16 08:54
2017年一直以来在公司负责爬虫项目相关工程,主要业务有预定、库存、在开发中也遇到很多问题,随手记录一下,后续会持续更新。
chrome、firefox、phantomjs插件安装和版本说明
基于selenium-java封装chrome、firefox、phantomjs实现爬虫
项目下载地址
maven版本说明
<!-- +++|selenium|+++ --> <dependency> <groupId>org.seleniumhq.selenium</groupId> <artifactId>selenium-java</artifactId> <version>3.5.1</version> </dependency> <!-- +++|phantomjsdriver|+++ --> <dependency> <groupId>com.github.detro.ghostdriver</groupId> <artifactId>phantomjsdriver</artifactId> <version>1.1.0</version> </dependency>
chrome插件配置
- 下载地址:chromedriver下载地址选择本地系统对应的chrome版本安装,工程下面有一个 对应的目录是:
Plugin/chromedriver_win32.zip
,对应chrmoe版本是Supports Chrome v60-62
直接运行项目中示例
public class ChromeTest {public static void main(String[] args) { WebDriver webDriver = null; try { webDriver = WebDriverUtil.createChromeWebDriver("D:\\webdrvier\\chromedriver.exe");//修改路径 webDriver.get("https://www.baidu.com/"); System.out.println(webDriver.getTitle()); } catch (Exception e) { e.printStackTrace(); } finally { if (webDriver != null) { webDriver.close(); } }}}
- chrome配置插件是最简单的,linux上面只需要把插件换成linux版本即可
firefox
- 下载插件地址:geckodriver下载地址,选择本地系统对应的firefox版本安装,工程下面有一个 对应的目录是:
Plugin/geckodriver-v0.18.0-win64.zip
,对应firefox版本是Firefox Setup 50.0(64位)
、其他版本没有测试过 - firefox下载地址、
selenium-java版本和geckodriver版本更新迭代不一致,导致在搭建环境时很容易出现一系列问题。
- 直接运行项目中示例
public class FireFoxTest { public static void main(String[] args) { WebDriver webDriver = null; try { webDriver = WebDriverUtil.createFirefoxWebDriver("D:\\webdrvier\\Firefox\\geckodriver_18.exe"); webDriver.get("https://book.douban.com/tag/"); Set<String> tagSet = new HashSet<>(); //获取豆瓣标签 List<WebElement> divWebElement = webDriver.findElements(By.cssSelector("#content > div > div.article > div:nth-child(2) > div")); for (WebElement webElement : divWebElement) { List<WebElement> aWebElement = webElement.findElements(By.cssSelector("a")); for (WebElement element : aWebElement) { tagSet.add(element.getText()); } } System.out.println(tagSet); //点击小说标签 WebElement webElement = webDriver.findElement(By.cssSelector("#content > div > div.article > div:nth-child(2) > div:nth-child(1) > table > tbody > tr:nth-child(1) > td:nth-child(1) > a")); webElement.click(); System.out.println(webDriver.getTitle()); } catch (Exception e) { e.printStackTrace(); } finally { if (webDriver != null) { webDriver.quit(); webDriver.close(); } } }}
phantomjs
- 下载插件地址phantomjs插件地址1、phantomjs插件地址2、下载有些慢。phantomjs是没有界面的,所以只需要下载插件即可。
直接运行项目中示例
public class PhantomjsTest {public static void main(String[] args) { WebDriver webDriver = null; try { webDriver = WebDriverUtil.createPhantomjsWebDriver("D:/webdrvier/phantomjs-1.9.8-windows/phantomjs.exe"); webDriver.get("https://www.baidu.com/"); System.out.println(webDriver.getTitle()); } catch (Exception e) { e.printStackTrace(); } finally { if (webDriver != null) { webDriver.close(); } }}}
阅读全文
0 0
- 基于selenium-java封装chrome、firefox、phantomjs实现爬虫
- Selenium+Chrome(PhantomJs) Python爬虫
- 学习用java基于webMagic+selenium+phantomjs实现爬虫Demo爬取淘宝搜索页面
- selenium phantomjs 实现新浪微博爬虫
- python+selenium+phantomjs实现爬虫功能
- Java爬虫进阶-Selenium+PhantomJs的运用
- Java爬虫进阶-Selenium+PhantomJs的运用
- 爬虫利器:Selenium+PhantomJS
- phantomjs+selenium+python爬虫
- 爬虫-08-selenium & phantomjs
- [Python爬虫] Selenium自动访问Firefox和Chrome并实现搜索截图
- python+selenium调用浏览器(IE-Chrome-Firefox)实现爬虫功能
- Selenium + PhantomJS + python 简单实现爬虫的功能
- Java之网络爬虫WebCollector+selenium+phantomjs(一)
- Java之网络爬虫WebCollector+selenium+phantomjs(二)
- Java之网络爬虫WebCollector+selenium+phantomjs(三)
- Java之网络爬虫WebCollector+selenium+phantomjs(一)
- Java之网络爬虫WebCollector+selenium+phantomjs(二)
- 迁移学习之caffe训练的层设置
- 2017.11.15笔记
- Go搭建简单服务器及http包源码分析
- 全景VR酷炫演示
- GreenDao的使用简介
- 基于selenium-java封装chrome、firefox、phantomjs实现爬虫
- C++编译后报Error spawning 'rc.exe'.错误
- matplotlib如何不显示图片只保存图片
- Github学习(1)——Git的安装与配置
- 设计模式六大原则之----依赖倒置原则
- svn提交403forbidden
- Linux服务器上监控网络带宽的18个常用命令
- MAC OS X 命令行提交本地项目到git
- Java四种线程池的使用