Python裸奔也疯狂:批量爬取中国工程院院士信息
来源:互联网 发布:sql 截取字符串函数 编辑:程序博客网 时间:2024/06/05 05:04
中国工程院院士,是中国设立的工程科学技术方面的最高学术称号,为终身荣誉,由选举产生。在工程科学技术方面作出重大的、创造性的成就和贡献,热爱祖国,学风正派,品行端正,具有中国国籍的高级工程师、研究员、教授或具有同等职称的专家,可被提名并当选为中国工程院院士。
增选院士每两年进行一次,必要时,可提前或延后进行。每次的增选院士名额,由中国工程院主席团讨论决定。
为更好地膜拜众位男神女神,了解其在相关领域做出的杰出贡献,本文代码用于从中国工程院官方网站公开的信息中进行快速提取,主要用来演示Python标准库os、re、urllib的用法以及网络爬虫的原理,没有使用任何扩展库。本文涉及到的内容严禁用于不良用途,违者后果自负。
首先,打开工程院官方网站,查看全部院士名单,查看源代码,进行简单分析,得到规律,以便后面设计正则表达式,图中红框内是我们感兴趣的内容:
接下来打开任意一位院士的链接,进一步分析,得到数据组织的规则,以方便设计正则表达式:
所有规则都清晰之后,就可以编写代码进行爬取了:
----------相关阅读----------
Python爬虫扩展库scrapy选择器用法入门(一)
Python使用Scrapy爬虫框架爬取天涯社区小说“大宗师”全文
Python不使用scrapy框架而编写的网页爬虫程序
Python爬虫扩展库BeautifulSoup4用法精要
祝所有程序员1024节日快乐
学会提问,你就成功了一大半!
盘点那些让人上火的提问方式(论如何让交流更高效)
----------喜大普奔----------
1、继《Python程序设计基础》(2017年9月第5次印刷)、《Python程序设计(第2版)》(2017年9月第4次印刷)、《Python可以这样学》(2017年7月第3次印刷)系列图书之后,董付国老师新书《Python程序设计开发宝典》已于2017年8月1日在清华大学出版社出版,并于2017年9月进行了第2次印刷。为庆祝新书《Python程序设计开发宝典》全面上架,清华大学出版社联合“赣江图书专营”淘宝店推出特价优惠活动,《Python程序设计开发宝典》原价69元,新书上架期间超低价39.8元,可以复制下面的链接使用浏览器打开查看图书详情和购买:
https://detail.tmall.com/item.htm?spm=a1z10.3-b-s.w4011-14464369246.84.46f16db0roWfX4&id=557107249812&rn=339cbc9df2bac424664103917dedfbd2&abbucket=8&tbpm=3
2、董付国老师新作《中学生可以这样学Python》已正式出版,很快会在各大书城全面上架。
3、董付国老师6本Python系列图书阅读指南
- Python裸奔也疯狂:批量爬取中国工程院院士信息
- 中国工程院新增选54名院士
- 中国工程院停止李宁院士资格
- python爬取网页信息
- python 爬取淘宝信息
- Python爬取国家信息
- Python-爬取网页信息
- Python爬取天气信息
- python爬取网页信息
- 中国工程院院士张尧学:透明计算/云计算操作系统
- 中国工程院院士:Windows 10挑战中国网络安全 已加强审查
- 比尔•盖茨当选中国工程院外籍院士!(附名单)
- 使用python批量爬取apk文件
- python+selenium批量爬取ieeexplore论文
- 中国科学院院士和中国工程院院士投票评选的2007年世界十大科技进展新闻
- Python爬取信息的方法
- python爬取豆瓣电影信息
- python 登录并爬取淘宝信息
- linux 系统中的常用命令
- Mac下忘记Mysql root密码重置
- mysql数据库:微信用户昵称emoji 怎么保存到数据库中。
- 1900页Python系列PPT分享一:基础知识(106页)
- 【COS上传文件】实现文件重命名
- Python裸奔也疯狂:批量爬取中国工程院院士信息
- Spring Boot 快速上手(五)集成Redis
- 冈萨雷斯数字图像处理学习4:频率域图像高通滤波3
- Dubbo传输base64加密后的流,接收方文件损坏
- Bootstrap学习笔记 04
- 曲线检测资源
- 国外建站平台wix多模板选用
- 只有Python基础竟成为无人驾驶工程师,她是怎么做到的?
- React中的Mixin