Python爬取知乎日报,推送到kindle
来源:互联网 发布:淘宝网全球购是正品吗 编辑:程序博客网 时间:2024/04/29 20:56
最近刷知乎上瘾,刚好手头有一台kindle,搞一波事情。
1.分析页面
知乎日报 的网页端结果比较清晰,每篇的文章的链接都在 link-button 这个 a 标签中。用requests + BeautifulSoup 库可以比较轻松的解析。
import requestsimport refrom bs4 import BeautifulSoupimport osimport os.pathimport pdfkitfrom save_as_pdf import save_pdffrom os_test import send_email def __init__(self): self.home_url = 'http://daily.zhihu.com' self.headers = {'User-Agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/60.0.3112.101 Safari/537.36'} def home_html(self): content = requests.get(self.home_url,headers = self.headers) all_href = BeautifulSoup(content.text,'html5lib').find_all('a',class_ = 'link-button') for href in all_href: url = self.home_url + href['href'] self.story_html(url)
2.保存页面到本地
很多答案都有图片,所以保存为txt文件答案会不完整,这里选择直接保存为pdf文件,关于pdf有很多第三方库,这里主要用了 pdfkit 这个库,关于这个库的使用可以参考官方文档.可以直接通过网址制作pdf文件。
import pdfkitimport osdef save_pdf(url,path): os.chdir(r'G:\python\zhihu\ribao\content') file_name = str(path) + '.pdf' if os.path.exists(file_name): pass else: print(file_name) pdfkit.from_url(url,file_name)
3.推送文件至kindle
- kindle可以由邮件推送或usb传输,这里模拟通过邮件推送。
- 通过邮件推送时,将邮件标题设置为‘convert’ ,amazon云端就会自动将pdf格式转换,但是文件大小不能超过50mb
- kindle的邮件推送就是由绑定的邮箱发送相应的附件。
- 关于kindel邮箱的绑定可以参考amazon的帮助页面
- Python 内置了对SMTP的支持,可以发送纯文本邮件、HTML邮件以及带附件的邮件。可以参考廖雪峰的博客
- 不同邮箱的smtp设置不同,这里以qq邮箱为例
import os.pathimport smtplibfrom email.mime.multipart import MIMEMultipartfrom email.mime.text import MIMETextfrom email.mime.application import MIMEApplicationfrom email import encoders_user = "123123@qq.com"_pwd = "********"_to = "******@kindle.cn"def send_email(): path = r'G:\python\zhihu\ribao\content' for file in os.listdir(path): file_path = os.path.join(path,file) msg = MIMEMultipart() msg['Subject'] = 'convert' #邮件标题 msg['From'] = _user #显示发件人 msg['To'] = _to #接收邮箱 attfile = file_path basename = os.path.basename(file_path) print(basename) fp = open(attfile,'rb') att = MIMEText(fp.read(),'base64','gbk') att['Content-Type'] = 'application/octer-stream' att.add_header('Content-Disposition', 'attachment',filename=('gbk', '', basename)) encoders.encode_base64(att) msg.attach(att) s = smtplib.SMTP_SSL("smtp.qq.com", 465,timeout = 30)#连接smtp邮件服务器,qq邮箱端口为465 s.login(_user, _pwd)#登陆服务器 s.sendmail(_user, _to, msg.as_string())#发送邮件 s.close()
记得关掉飞行模式,连接上网络(逃 ..
之后就可以在kindle上看日报啦~~
阅读全文
0 0
- Python爬取知乎日报,推送到kindle
- 推送网页到kindle
- 如何推送电子书到kindle
- 如何设置kindle推送,如何推送网页到kindle
- 程序:推送水木文章到Kindle
- calibre 推送到kindle失败解决办法
- 如何推送喜欢的书籍到kindle
- Rss订阅推送到Kindle的几种方法
- 右键推送文件到Kindle(类似Send to Kindle for PC)
- 使用Python和BitTorrentSync定期给Kindle推送电子书
- python实现kindle每天推送博客1----kindle推送原理,python实现qq邮箱登录及邮件发送
- python实现kindle每天推送博客2----python实现爬取博客内容
- 【开源一个小工具】一键将网页内容推送到Kindle
- 搭建kindleEAR为kindle推送RSS订阅
- python 爬虫(二) 爬虫知乎 制作成电子书发送到kindle
- [python]modules for kindle[update...]
- 电脑操作:把文件上传到kindle,kindle上传文件 ,upload文件到kindle
- 给你的Kindle做一个RSS推送服务器
- Qt画箭头
- typedef在结构体定义中的使用
- 什么是XP,介绍XP,敏捷扫盲XP(Extreme Programming)。
- hdu 6197 最长上升子序列 o(nlog(n))版
- CODEVS--1203判断浮点数是否相等
- Python爬取知乎日报,推送到kindle
- C#实现求n个元素的全排列
- ssh框架中ajax对用户名查重的代码
- SGISTL源码探究-deque容器(上)
- 腾讯云服务端对接流程(独立模式)
- 类与对象
- Path使用--二阶贝塞尔曲线实现水波效果
- mysql引擎、索引、事务、锁、sql注入及java操作
- 最全Pycharm教程(12)——Pycharm调试器之Java脚本调试