【使用JSOUP实现网络爬虫】解析一个HTML字符串
来源:互联网 发布:里海和黑海相通吗 知乎 编辑:程序博客网 时间:2024/04/29 03:34
存在问题
来自用户输入,一个文件或一个网站的HTML字符串,你可能需要对它进行解析并取其内容,或校验其格式是否完整,或想修改它。怎么办?jsonu能够帮你轻松解决这些问题
解决方法
使用静态Jsoup.parse(String html)
方法或 Jsoup.parse(String html, String baseUri)
示例代码:
- String html = "<html><head><title>First parse</title></head>"
- + "<body><p>Parsed HTML into a doc.</p></body></html>";
- Document doc = Jsoup.parse(html);
描述
parse(String html, String baseUri)
这方法能够将输入的HTML解析为一个新的文档 (Document),参数 baseUri 是用来将相对 URL 转成绝对URL,并指定从哪个网站获取文档。如这个方法不适用,你可以使用 parse(String html)
方法来解析成HTML字符串如上面的示例。.
只要解析的不是空字符串,就能返回一个结构合理的文档,其中包含(至少) 一个head和一个body元素。
一旦拥有了一个Document,你就可以使用Document中适当的方法或它父类 Element
和Node
中的方法来取得相关数据。
阅读更多JSOUP相关文章,请看专栏:《使用JSOUP实现网络爬虫》
版权声明:本文为博主原创文章,未经博主允许不得转载。
0 1
- 【使用JSOUP实现网络爬虫】解析一个HTML字符串
- 【使用JSOUP实现网络爬虫】解析一个HTML字符串
- 【使用JSOUP实现网络爬虫】入门:解析和遍历一个HTML文档
- 【使用JSOUP实现网络爬虫】入门:解析和遍历一个HTML文档
- 【使用JSOUP实现网络爬虫】解析一个body片断
- 【使用JSOUP实现网络爬虫】解析一个body片断
- 【使用JSOUP实现网络爬虫】解析一个body片断
- 【使用JSOUP实现网络爬虫】修改数据-设置一个元素的HTML内容
- 【使用JSOUP实现网络爬虫】修改数据-设置一个元素的HTML内容
- 【jsoup】解析一个HTML字符串
- 使用JSOUP实现网络爬虫
- 使用JSOUP实现网络爬虫
- 网络爬虫2----JSoup解析HTML
- 网络爬虫--数据处理,jsoup工具解析html,dom4j解析xml
- jsoup官方解析一个HTML字符串
- 【Jsoup学习礼记】解析一个HTML字符串
- 【使用JSOUP实现网络爬虫】处理URLs
- 【使用JSOUP实现网络爬虫】处理URLs
- 生活中的观察者模式——一壶水的故事
- 了解Hibernate中CRUD操作
- Android studio 导入github工程
- OJ---串中取3个不重复字母
- 怎么判断软键盘是否显示
- 【使用JSOUP实现网络爬虫】解析一个HTML字符串
- HDU1272 小希的迷宫 - 并查集
- 对彩色YUV视频进行二进制文件读写时候的注意事项
- 关于大型网站技术演进的思考(五)--存储的瓶颈(5)
- Tiny210 android系统中的gpio按键
- Cocos2dx游戏屏幕适配
- Spring 集成的 RabbitMQ 的练习
- 如何将library项目打包成jar文件
- Android SDK Android NDK Android Studio 官方下载地址