pathon爬虫,制作云图
来源:互联网 发布:域名转让骗局 编辑:程序博客网 时间:2024/05/10 21:49
转载请标明出处:
http://blog.csdn.net/forezp/article/details/70198541
本文出自方志朋的博客
今天一时兴起,想用Python爬爬自己的博客,通过数据聚合,制作高逼格的云图(对词汇出现频率视觉上的展示),看看最近我到底写了啥文章。
一、直接上几张我的博客数据的云图
1.1 爬取文章的标题的聚合
1.2 爬取文章的摘要的聚合
1.3 爬取文章的标题+摘要的聚合
我最近写了SpringCloud系列教程,还有一些微服务架构方面,从云图上看,基本吻合。你若不信,可以进我的博客看看,数据还是非常准确的
二、技术栈
- 开发工具: pycharm
- 爬虫技术:bs64、requsts、jieba
- 分析工具:wordArt
三、爬虫构架设计
整个爬虫架构非常简单:
- 爬取我的博客:http://blog.csdn.net/forezp
- 获取数据
- 将数据用“结巴”库,分词。
- 将得到的数据在在artword上制作云图。
- 将制作出来的云图展示给用户。
四、具体实现
先根据博客地址爬去数据:
- 1
- 2
- 3
- 4
- 5
- 6
- 7
- 8
- 9
- 10
- 11
- 12
- 13
- 14
- 15
- 16
- 17
- 1
- 2
- 3
- 4
- 5
- 6
- 7
- 8
- 9
- 10
- 11
- 12
- 13
- 14
- 15
- 16
- 17
解析标题
- 1
- 2
- 3
- 4
- 5
- 6
- 7
- 8
- 9
- 1
- 2
- 3
- 4
- 5
- 6
- 7
- 8
- 9
解析摘要:
- 1
- 2
- 3
- 4
- 5
- 6
- 7
- 8
- 9
- 10
- 1
- 2
- 3
- 4
- 5
- 6
- 7
- 8
- 9
- 10
用“结巴”分词,”激8”分词怎么用,看这里:https://github.com/fxsjy/jieba/
- 1
- 2
- 3
- 4
- 5
- 6
- 7
- 8
- 9
- 10
- 11
- 1
- 2
- 3
- 4
- 5
- 6
- 7
- 8
- 9
- 10
- 11
因为数据比较少,所以我直接打印在控制台,并把它复制下来,更好的方法是存在MongoDB中。
制作云图:
用 artword在线工具,地址:https://wordart.com
首先:
导入从控制台复制过来的数据:
令人尴尬的是,这个网站在绘制图的时候不支持中文,需要你从c:/windows/fonts下选择一个支持中文的字体,mac 用户从windows拷下文件夹也可以,或者在网上下。
然后点击Visulize就可以生成高逼格的云图了。讲解完毕,有什么需要改进的请大家留言。
源码下载:https://github.com/forezp/ZhihuSpiderMan/tree/master/blogspider
五、文章参考
超简单:快速制作一款高逼格词云图
优秀文章推荐:
- 如何爬取百万知乎用户信息,并做了简单的分析
0 0
- pathon爬虫,制作云图
- pathon爬虫对象版
- 云图制作
- Python爬虫入门-python之jieba库制作词云图
- Pathon 【iOS程序员如何用Pathon写爬虫】
- pathon爬虫(三)之post请求
- Python爬虫,看看我最近博客都写了啥,带你制作高逼格的数据聚合云图
- 【云图】如何制作全国KTV查询系统?
- 【云图】如何制作东莞酒店地图?
- 【云图】如何制作中国贪官落马图?
- 【实战】词频统计及词云图制作
- R学习笔记——wordcloud包制作词云图
- 【云图】如何制作官网上的实体店分布图?
- R学习笔记——wordcloud包制作词云图
- 用echarts3和worldcloud制作炫酷的字符云图
- Echarts.js制作字符云图报表出错问题
- 2.python连接mongodb,利用微博数据制作云图
- pathon教程
- SuperMap iServer正式版war包在linux上的部署
- 记一次蛋疼的mongo to hive导数过程
- 第五节,添加焦点事件
- 使用Mysql 数据库 查询不懂时间段(如:今天、昨天、本周、本月、上一月 、今年)
- Unity 之第一人称无重力控制器
- pathon爬虫,制作云图
- Linux GDB调试的一些记录
- ORA-01795: 列表中的最大表达式数为 1000
- 计算机网络 3 数据链路层
- 稳定排序和不稳定排序
- 第一次面试之去哪啊
- 手机端页面自适应解决方案—rem布局
- jquery中attr和prop的区别
- 数据库操作(使用FMDB)