最近刷知乎上瘾,刚好手头有一台kindle,搞一波事情。

1.分析页面

知乎日报 的网页端结果比较清晰,每篇的文章的链接都在 link-button 这个 a 标签中。用requests + BeautifulSoup 库可以比较轻松的解析。

import requests

import re

from bs4 import BeautifulSoup

import os

import os.path

import pdfkit

from save_as_pdf import save_pdf

from os_test import send_email

def __init__(self):

self.home_url = 'http://daily.zhihu.com'

self.headers = {'User-Agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/60.0.3112.101 Safari/537.36'}

def home_html(self):

content = requests.get(self.home_url,headers = self.headers)

all_href = BeautifulSoup(content.text,'html5lib').find_all('a',class_ = 'link-button')

for href in all_href:

url = self.home_url + href['href']

self.story_html(url)

2.保存页面到本地

很多答案都有图片,所以保存为txt文件答案会不完整,这里选择直接保存为pdf文件,关于pdf有很多第三方库,这里主要用了 pdfkit 这个库,关于这个库的使用可以参考官方文档.可以直接通过网址制作pdf文件。

import pdfkit

import os

def save_pdf(url,path):

os.chdir(r'G:\python\zhihu\ribao\content')

file_name = str(path) + '.pdf'

if os.path.exists(file_name):

pass

else:

print(file_name)

pdfkit.from_url(url,file_name)

3.推送文件至kindle

kindle可以由邮件推送或usb传输,这里模拟通过邮件推送。

通过邮件推送时,将邮件标题设置为‘convert’ ,amazon云端就会自动将pdf格式转换,但是文件大小不能超过50mb

kindle的邮件推送就是由绑定的邮箱发送相应的附件。

关于kindel邮箱的绑定可以参考amazon的帮助页面

Python 内置了对SMTP的支持,可以发送纯文本邮件、HTML邮件以及带附件的邮件。可以参考廖雪峰的博客

不同邮箱的smtp设置不同,这里以qq邮箱为例

import os.path

import smtplib

from email.mime.multipart import MIMEMultipart

from email.mime.text import MIMEText

from email.mime.application import MIMEApplication

from email import encoders

_user = "123123@qq.com"

_pwd = "********"

_to = "******@kindle.cn"

def send_email():

path = r'G:\python\zhihu\ribao\content'

for file in os.listdir(path):

file_path = os.path.join(path,file)

msg = MIMEMultipart()

msg['Subject'] = 'convert' #邮件标题

msg['From'] = _user #显示发件人

msg['To'] = _to #接收邮箱

attfile = file_path

basename = os.path.basename(file_path)

print(basename)

fp = open(attfile,'rb')

att = MIMEText(fp.read(),'base64','gbk')

att['Content-Type'] = 'application/octer-stream'

att.add_header('Content-Disposition', 'attachment',filename=('gbk', '', basename))

encoders.encode_base64(att)

msg.attach(att)

s = smtplib.SMTP_SSL("smtp.qq.com", 465,timeout = 30)#连接smtp邮件服务器,qq邮箱端口为465

s.login(_user, _pwd)#登陆服务器

s.sendmail(_user, _to, msg.as_string())#发送邮件

s.close()

记得关掉飞行模式,连接上网络(逃 ..

之后就可以在kindle上看日报啦~~

python爬取知乎文章_Python爬取知乎日报,推送到kindle相关推荐

  1. python爬取公众号文章_python爬取微信公众号历史文章

    前几天,朋友有一个爬取某些指定微信公众号的历史文章的需求,刚好自己闲的没事,也就试了一试.不算完美解决问题了吧,但是自己也无能为力了,毕竟腾讯那么牛,斗不过斗不过. 一.思路 看了一些别人的文章,综合 ...

  2. python爬虫知乎图片_Python爬虫入门教程 25-100 知乎文章图片爬取器之一

    1. 知乎文章图片爬取器之一写在前面 今天开始尝试爬取一下知乎,看一下这个网站都有什么好玩的内容可以爬取到,可能断断续续会写几篇文章,今天首先爬取最简单的,单一文章的所有回答,爬取这个没有什么难度. ...

  3. Python爬虫入门教程 26-100 知乎文章图片爬取器之二

    1. 知乎文章图片爬取器之二博客背景 昨天写了知乎文章图片爬取器的一部分代码,针对知乎问题的答案json进行了数据抓取,博客中出现了部分写死的内容,今天把那部分信息调整完毕,并且将图片下载完善到代码中 ...

  4. 用calibre抓取RSS新闻制作电子书及推送到kindle

    calibre可以从RSS源抓取内容,转换成它所支持格式的电子书,还可以推送到阅读器设备.下面来看看在calibre图形界面和命令行下如何实现这些功能. 在图形界面抓取新闻 自定义新闻来源 看看我们自 ...

  5. python爬虫知乎图片_python 爬取知乎图片

    先上完整代码 1 importrequests2 importtime3 importdatetime4 importos5 importjson6 importuuid7 from pyquery ...

  6. 如何用python爬取公众号文章_Python+fiddler:爬取微信公众号的文章

    这几天师父有个小项目,挺有意思,如何使用python爬微信公众号中的新闻信息.大体流程如下.图1:流程 其实我们看到,这里并没有想象中的"智能"--依然需要手动刷公众号文章,然后才 ...

  7. python爬取论文全文数据_Python爬取微信公众号历史文章进行数据分析

    思路: 1. 安装代理AnProxy,在手机端安装CA证书,启动代理,设置手机代理: 2. 获取目标微信公众号的__biz; 3. 进入微信公众号的历史页面: 4. 使用Monkeyrunner控制滑 ...

  8. python爬取网页json数据_python爬取json数据库

    手把手教你使用Python抓取QQ音乐数据(第一弹) [一.项目目标] 获取 QQ 音乐指定歌手单曲排行指定页数的歌曲的歌名.专辑名.播放链接. 由浅入深,层层递进,非常适合刚入门的同学练手. [二. ...

  9. python爬取虎扑评论_Python爬取NBA虎扑球员数据

    虎扑是一个认真而有趣的社区,每天有众多JRs在虎扑分享自己对篮球.足球.游戏电竞.运动装备.影视.汽车.数码.情感等一切人和事的见解,热闹.真实.有温度. 受害者地址 https://nba.hupu ...

最新文章

  1. 入门Web前端有哪些误区?该如何避免?
  2. 华为无盘服务器,无盘服务器操作系统
  3. 一套代码两端运行不靠谱?是时候放弃 C++ 跨 Android、iOS 端开发!
  4. Unity创建字体库给TextMeshPro
  5. 计算机组成原理唐朔飞第八章ppt,计算机组成原理唐朔飞课件
  6. HighNewTech:一文了解计算机思维、数学思维的本质区别,以及算法和程序的认知比较
  7. 带音效的计算机软件,普通电脑WIN7上安装杜比音效增强软件Dolby Home TheaterV4教程...
  8. 多变量微积分(4)——多重积分之三重积分
  9. 数据分析~中国五大城市PM2.5数据分析02
  10. 《秘密》BY东野圭吾
  11. 搞前端开发的比后端多两倍,这意味着哪一个更有前途?
  12. 惠州电子计算机职业学校,惠州市十大中专学校排名
  13. 实验matlab滤波器心得,数字滤波器实验总结
  14. 快速入门JavaScript(一)
  15. Python实现三轴加速度计步功能
  16. 中科院90多科研人员集体辞职后续:已低调处理,被质疑所长新添重要职务
  17. 服务器电源维修接灯泡,再谈行电路串接200W灯泡检修方法
  18. 笔记本内存不够用怎么扩大
  19. 如何使用XManager5远程桌面连接到Linux服务器
  20. RTKLIB专题学习(三)---矩阵应用

热门文章

  1. xp2系统下AMD的CPU双核完整补丁及其安装步骤
  2. spring boot 中使用 POP3协议读取并解析邮件
  3. 三星sec.android.soagent,【图片】(原贴删)原不用ROOT禁用系统软件的方法,加详细教程。【note4吧】_百度贴吧...
  4. Python生成词云图,TIIDF方法文本挖掘: 词频统计,词云图
  5. ThinkServer RD640 设置RAID1
  6. 07-19 解决灰鸽子新变种 Rootkit Vanti gen等及www 58111 com劫持 第5版
  7. aigo U盘修复 被分成3个区,插入就显示格式化,raw无法修复系列问题一并解决
  8. 怎么解压linux镜像文件,linux 怎么解压文件
  9. 2021年高考志愿填报计算机类专业历年分数报考分析
  10. 学校的论文答辩---问题准备