本篇分享将实现在新浪微盘上下载周杰伦的歌曲,一共190首,下载的网页网址为http://vdisk.weibo.com/s/arjVBmagFKiLy,页面如下:
  
  先定一个小目标:下载本页面中的所有190首歌曲!怎么样,有没有一点心动的感觉呢?哈哈,当然讲解爬虫前,需要一些准备工作:

  • 安装Anaconda以及Selenium模块;
  • 安装Chrome浏览器驱动
  • 一些基础的Python编程知识;
  • 一颗好奇的心.

  首先在Anaconda官网上下载适合自己电脑的Anaconda版本。下载完后打开Anaconda Prompt,输入pip install selenium安装selenium模块。
  
  耐心等待安装,安装完后再输入conda list selenium,如出现以下信息,则表示安装成功。
  
  接下来安装Chrome浏览器驱动,可以在http://npm.taobao.org/mirrors/chromedriver/2.31/ 上下载,Windows系统选择chromedriver_win32.zip 文件。这是一个压缩包,解压后存到一个目录中,然后把该目录添加到环境变量。
  在Spyder上运行Python程序源代码(或者在码云网站上下载Python源代码Chrome_song_download_with_Class.py),源代码如下:

import os
import re
import bs4
import time
import datetime
import urllib.request
from bs4 import BeautifulSoup
from selenium import webdriver
from selenium.webdriver.common.keys import Keys
from selenium.common.exceptions import TimeoutException
from selenium.webdriver.common.action_chains import ActionChainsclass download_songs(object):def __init__(self,url,save_file_name):self.url = urlself.save_file_name = save_file_namedef get_song_names(self):html = urllib.request.urlopen(self.url)  content = html.read()  html.close()print("已获得该页面!")soup = BeautifulSoup(content, "lxml")print("页面解析完毕!进入歌曲下载...")        song_lst = soup.find_all('a', class_="short_name")print("一共找到%d首歌曲!\n"% len(song_lst))song_names = [song.string for song in song_lst]return song_namesdef get_songs(self):#设置Chrome浏览器,并启动chrome_options = webdriver.ChromeOptions()# 不加载图片(提升加载速度);设置默认保存文件径路prefs = {"profile.managed_default_content_settings.images":2,\"download.default_directory": '%s' %self.save_file_name}chrome_options.add_experimental_option("prefs",prefs)browser = webdriver.Chrome(chrome_options=chrome_options) #启动浏览器print("浏览器已启动")song_names = self.get_song_names()browser.maximize_window() #窗口最大化browser.set_page_load_timeout(30) # 最大等待时间为30s#当加载时间超过30秒后,自动停止加载该页面try:browser.get(self.url)except TimeoutException:browser.execute_script('window.stop()')#遍历所有的tags,下载歌曲for i in range(len(song_names)):#当开始的12首歌下载完后,需要下拉网页内嵌的滚动条if i >= 12:#找到网页内嵌的滚动条Drag = browser.find_element_by_class_name("jspDrag")#获取滚动槽的高度groove = browser.find_element_by_class_name("jspTrack")height_of_groove = int(re.sub("\D","",str(groove.get_attribute("style"))))#利用鼠标模拟拖动来下拉该滚动条move_of_y = i * height_of_groove/len(song_names) #每次下拉的滚动条的高度ActionChains(browser).drag_and_drop_by_offset(Drag, 0, move_of_y).perform() elem_lst = browser.find_elements_by_class_name("short_name") #所有歌的tagselem= elem_lst[i]elem.click()  #点击该tag,切换到该歌曲的下载页面time.sleep(5)button = browser.find_element_by_id("download_big_btn") #按下下载按钮print("已找到第%d首歌: %s"%(i+1, song_names[i]))button.click()print("%s 正在下载中..."%song_names[i])file_exit_flg = len(os.listdir(r"%s"%self.save_file_name))time.sleep(8)#歌曲是否存在处理,如果存在,输出“下载成功”,否则等待15秒,再次判断后决定是否刷新页面if len(os.listdir(r"%s"%self.save_file_name)) == file_exit_flg +1:print("%s 下载成功!\n"%song_names[i])else:exit_flag = 0 #退出标志,尝试下载5次,5次下载仍未成功后输出“下载失败!”while True:time.sleep(8)if len(os.listdir(r"%s"%self.save_file_name)) == file_exit_flg +1:print("%s 下载成功!\n"%song_names[i])breakprint("%s 下载未成功,再次尝试下载!"%song_names[i])browser.refresh() #等待15秒后,文件还未下载,则刷新网页time.sleep(5)print("已刷新网页!")#刷新网页后执行刚才的操作button = browser.find_element_by_id("download_big_btn")button.click()print("%s 正在下载中..."%song_names[i])file_exit_flg = len(os.listdir(r"%s"%self.save_file_name))time.sleep(8)exit_flag += 1if exit_flag == 2:print("%s 下载失败!\n"%song_names[i])breakbrowser.back() # 网页后退time.sleep(8)browser.close() #操作结束,关闭Chrome浏览器print("\n本页面操作已经结束!请前往下载位置(%s)查看下载文件.  Y(^O^)Y "% self.save_file_name)def main():d1 = datetime.datetime.now()#下载歌曲的网页网址url = 'http://vdisk.weibo.com/s/arjVBmagFKiLy'#保存文件的目录save_file_name = "F:\music\music_of_周杰伦"for_test = download_songs(url,save_file_name)try:for_test.get_songs()except TimeoutException:sum_of_files = len(os.listdir(save_file_name))print("下载超时啦!!!此次操作共下载了%d首歌(可能有重复或未下载完的),到此就结束了哦 ^o^" % sum_of_files)d2 = datetime.datetime.now()print("开始时间:",d1)print("结束时间:",d2)print("一共用时:",d2-d1)main()

  笔者利用空余时间,在自己的电脑上运行后的结果如下:
  
  190首歌曲下载花了102.5分钟,平均每首歌32.2s,运行结果还是相当可以的,how exiting!!!
  该程序适合下载新浪微盘上分享的歌曲,类似于本例,这样的网址还是很多的,可以在码云网站上下载新浪微盘网址文档.txt.欢迎大家进行测试,可以单个测试,也可以写成字典dict测试。


  由于笔者时间仓促和技术水平有限,代码中可能会存在一些错误和不足之处,希望广大网友能批评指导!!!欢迎大家下载代码,欢迎大家一起交流~~
注意:本人现已开通两个微信公众号: 因为Python(微信号为:python_math)以及轻松学会Python爬虫(微信号为:easy_web_scrape), 欢迎大家关注哦~~

Python爬虫——利用新浪微盘下载周杰伦的歌曲(共190首)相关推荐

  1. Python爬虫——百度+新浪微盘下载歌曲

    本篇分享将讲解如何利用Python爬虫在百度上下载新浪微盘里自己想要的歌手的歌曲,随便你喜欢的歌手! 首先我们先探索一下我们操作的步骤(以下载Westlife的歌曲为例):打开百度,输入"W ...

  2. python 微盘下载_Python爬虫——百度+新浪微盘下载歌曲

    # -*- coding: utf-8 -*- """ Created on Mon Aug 7 09:22:12 2017 @author: JClian " ...

  3. 解决新浪微盘下载没反应下载中断

    解决新浪微盘下载没反应下载中断      最近发现,用浏览器下载新浪微盘的资料,要么点击没反应,要么下载到一般就中断,下载失败.用了好多办法都不能解决.起初以为是服务器的问题,后来发现是浏览器的问题. ...

  4. 使用Python调用新浪微盘接口,创建自己的云盘应用

    我们可以使用新浪微博提供的微盘API接口,开发自己的云盘应用.下面一起来看一下吧. 1.首先到新浪微盘的开发者平台上创建自己的应用,然后可以获得你的APP_KEY和APP_SECRET. 2.新浪微盘 ...

  5. mysql新浪微盘_Android62期视频教程全集下载

    Android62期视频教程全集下载 课程介绍: 此套Android62期视频教程全集包括包括79部分的学习内容,视频和源码都有,资料比较多,下面我们就不一一做介绍了,简单的目录介绍一下,有需要学习完 ...

  6. 善于使用搜索引擎、百度网盘、华为网盘、新浪微盘找资源的方法总结

    1.百度网盘.华为网盘搜索书名 http://pan.btbook.net/ 2.新浪微盘搜索书名 http://vdisk.weibo.com/ 3.google.百度.360.搜狗.bing搜索 ...

  7. Python爬虫实例--新浪热搜榜[xpath语法]

    Python爬虫实例--新浪热搜榜[xpath语法] 1.基础环境配置: requests-->版本:2.12.4 lxml-->版本:3.7.2 2.网页分析 很容易从html源码中看到 ...

  8. Python爬虫实例--新浪热搜榜[正则表达式]

    Python爬虫实例--新浪热搜榜[正则表达式] 1.基础环境配置: requests-->版本:2.12.4 re-->:Python自带,无需安装 2.网页分析 很容易从html源码中 ...

  9. 新浪微盘项目的“病危通知”

    据来自新浪微盘官方微薄的消息, 新浪微盘将关闭对免费用户的服务. 借口是"配合监管部门专项整治行动".但知情网友透露,"监管部门"这次实际上是被"黑锅 ...

  10. 淘宝上倒卖新浪微盘事件来龙去脉——谈谈巧用IMEI

    这是一个老黄历的事件,曾记得淘宝上的卖家卖10元卖50g网络硬盘,并且卖的相当的火,一个月就卖了500个账号.由于我也是那个事件的亲身经历者之一,这里就看到了IMEI号在项目中防止作弊是何其的重要. ...

最新文章

  1. 实现无线AP无缝漫游
  2. Exchange 2016 先决条件
  3. Leetcode 64 最小路径和 (每日一题 20210721)
  4. 成功解决Instructions for updating: Use `tf.global_variables_initializer` instead.
  5. win10 HADOOP_HOME and hadoop.home.dir are unset
  6. .NET MD5加密解密代码
  7. bootstrap-table 刷新页面数据
  8. 对”命令“操作的命令
  9. 古文观止 —— 千古名篇
  10. oracle 创建视图_Oracle 中视图的创建和处理方法
  11. PyQt主窗口、对话框
  12. 用java编写球体的体积,编写一个程序,提示用户输入球体的半径并打印其体积...
  13. Windows系统远程连接Linux系统操作
  14. (四)国产数据库-达梦DCA实操(创建用户、权限)
  15. 【solidity】函数修饰器(Function Modifiers)
  16. 耳机在macOS系统电脑上怎么听不到任何声音怎么办?
  17. AGC001E BBQ Hard 组合计数
  18. 华为5年自动化测试工程详细解说:unittest单元测试框架
  19. CA周记 - 在 Azure ML 上用 .NET 跑机器学习
  20. 有一篇文章,共有 3 行文字,每行有 80 个字符。编写程序分别统计出其中英文大写 字母、英文小写字母、数字、空格以及其他字符的个数

热门文章

  1. 自由幻想怎么找服务器账号,自由幻想手游服务器列表公示公告
  2. 通过Linux+SNMP+zabbix的实验理解SNMP协议
  3. 图解:最短路径之迪杰斯特拉算法
  4. 美团实习经验(基础架构部)
  5. Windows批处理命令:start、call 的区别
  6. python opencv颜色通道_【Python+OpenCV之五】 分离颜色通道多通道图像混合
  7. OpenCV——分离颜色通道,图像对比度,亮度调整,离散傅里叶变换(10)
  8. 推理和论证(证明)的区别
  9. 复变函数——一到三章总结
  10. 对promise、resolve和reject的简单理解