Python抓取视频内容

Python 是一种面向对象、解释型计算机程序设计语言，由Guido van Rossum于1989年底发明，第一个公开发行版发行于1991年。Python语法简洁而清晰，具有丰富和强大的类库。它常被昵称为胶水语言，它能够把用其他语言制作的各种模块（尤其是C/C++）很轻松地联结在一起。

从上一篇文章的评论中看出似乎很多童鞋都比较关注爬虫的源代码。所有本文就使用Python编写简单网络爬虫抓取视频下载资源做了很详细的记录，几乎每一步都介绍给大家，希望对大家能有所帮助

我第一次接触爬虫这东西是在今年的5月份，当时写了一个博客搜索引擎，所用到的爬虫也挺智能的，起码比电影来了这个站用到的爬虫水平高多了！

回到用Python写爬虫的话题。

Python一直是我主要使用的脚本语言，没有之一。Python的语言简洁灵活，标准库功能强大，平常可以用作计算器，文本编码转换，图片处理，批量下载，批量处理文本等。总之我很喜欢，也越用越上手，这么好用的一个工具，一般人我不告诉他。。。

因为其强大的字符串处理能力，以及urllib2，cookielib，re，threading这些模块的存在，用Python来写爬虫就简直易于反掌了。简单到什么程度呢。我当时跟某同学说，我写电影来了用到的几个爬虫以及数据整理的一堆零零散散的脚本代码行数总共不超过1000行，写电影来了这个网站也只有150来行代码。因为爬虫的代码在另外一台64位的黑苹果上，所以就不列出来，只列一下VPS上网站的代码，tornadoweb框架写的

[xiaoxia@307232 movie_site]$ wc -l *.py template/*156 msite.py92 template/base.html79 template/category.html94 template/id.html47 template/index.html77 template/search.html

下面直接show一下爬虫的编写流程。以下内容仅供交流学习使用，没有别的意思。

以某湾的最新视频下载资源为例，其网址是

http://某piratebay.se/browse/200

因为该网页里有大量广告，只贴一下正文部分内容：

对于一个python爬虫，下载这个页面的源代码，一行代码足以。这里用到urllib2库。

>>> import urllib2
>>> html = urllib2.urlopen('http://某piratebay.se/browse/200').read()
>>> print 'size is', len(html)
size is 52977

当然，也可以用os模块里的system函数调用wget命令来下载网页内容，对于掌握了wget或者curl工具的同学是很方便的。

使用Firebug观察网页结构，可以知道正文部分html是一个table。每一个资源就是一个tr标签。

而对于每一个资源，需要提取的信息有：

1、视频分类
2、资源名称
3、资源链接
4、资源大小
5、上传时间

就这么多就够了，如果有需要，还可以增加。

首先提取一段tr标签里的代码来观察一下。

<tr><td class="vertTh"><center><a href="/browse/200" title="此目录中更多">视频</a><br />(<a href="/browse/205" title="此目录中更多">电视</a>)</center></td><td>
<div class="detName">   <a href="/torrent/7782194/The_Walking_Dead_Season_3_Episodes_1-3_HDTV-x264" class="detLink" title="细节 The Walking Dead Season 3 Episodes 1-3 HDTV-x264">The Walking Dead Season 3 Episodes 1-3 HDTV-x264</a>
</div>
<a href="magnet:?xt=urn:btih:4f63d58e51c1a4a997c6f099b2b529bdbba72741&dn=The+Walking+Dead+Season+3+Episodes+1-3+HDTV-x264&tr=udp%3A%2F%2Ftracker.openbittorrent.com%3A80&tr=udp%3A%2F%2Ftracker.publicbt.com%3A80&tr=udp%3A%2F%2Ftracker.istole.it%3A6969&tr=udp%3A%2F%2Ftracker.ccc.de%3A80" title="Download this torrent using magnet"><img src="//static.某piratebay.se/img/icon-magnet.gif" alt="Magnet link" /></a>   <a href="//torrents.某piratebay.se/7782194/The_Walking_Dead_Season_3_Episodes_1-3_HDTV-x264.7782194.TPB.torrent" title="下载种子"><img src="//static.某piratebay.se/img/dl.gif" class="dl" alt="下载" /></a><img src="//static.某piratebay.se/img/11x11p.png" /><img src="//static.某piratebay.se/img/11x11p.png" /><font class="detDesc">已上传 <b>3 分钟前</b>, 大小 2 GiB, 上传者 <a class="detDesc" href="/user/paridha/" title="浏览 paridha">paridha</a></font></td><td align="right">0</td><td align="right">0</td></tr>

下面用正则表达式来提取html代码中的内容。对正则表达式不了解的同学，可以去 http://docs.python.org/2/library/re.html 了解一下。

为何要用正则表达式而不用其他一些解析HTML或者DOM树的工具是有原因的。我之前试过用BeautifulSoup3来提取内容，后来发觉速度实在是慢死了啊，一秒钟能够处理100个内容，已经是我电脑的极限了。。。而换了正则表达式，编译后处理内容，速度上直接把它秒杀了！

提取这么多内容，我的正则表达式要如何写呢？

根据我以往的经验，“.*?”或者“.+?”这个东西是很好使的。不过也要注意一些小问题，实际用到的时候就会知道

对于上面的tr标签代码，我首先需要让我的表达式匹配到的符号是

<tr>

表示内容的开始，当然也可以是别的，只要不要错过需要的内容即可。然后我要匹配的内容是下面这个，获取视频分类。

(<a href="/browse/205" title="此目录中更多">电视</a>)

接着我要匹配资源链接了，

再到其他资源信息，

font class="detDesc">已上传 <b>3 分钟前</b>, 大小 2 GiB, 上传者

最后匹配

</tr>

大功告成！

当然，最后的匹配可以不需要在正则表达式里表示出来，只要开始位置定位正确了，后面获取信息的位置也就正确了。

对正则表达式比较了解的朋友，可能知道怎么写了。我Show一下我写的表达式处理过程，

就这么简单，结果出来了，自我感觉挺欢喜的。

当然，这样设计的爬虫是有针对性的，定向爬取某一个站点的内容。也没有任何一个爬虫不会对收集到的链接进行筛选。通常可以使用BFS（宽度优先搜索算法）来爬取一个网站的所有页面链接。

完整的Python爬虫代码，爬取某湾最新的10页视频资源：

# coding: utf8
import urllib2
import re
import pymysql
db = pymysql.Connection().test
url = 'http://某piratebay.se/browse/200/%d/3'
find_re = re.compile(r'<tr>.+?(.+?">(.+?)</a>.+?class="detLink".+?">(.+?)</a>.+?<a href="(magnet:.+?)" .+?已上传 <b>(.+?)</b>, 大小 (.+?),', re.DOTALL)
# 定向爬去10页最新的视频资源
for i in range(0, 10):u = url % (i)# 下载数据html = urllib2.urlopen(u).read()# 找到资源信息for x in find_re.findall(html):values = dict(category = x[0],name = x[1],magnet = x[2],time = x[3],size = x[4])# 保存到数据库db.priate.save(values)
print 'Done!'

转载于:https://www.cnblogs.com/think90/p/7063578.html

Python抓取视频内容相关推荐

python抓取视频违法吗,科学网—【python爬虫】抓取B站视频相关信息（一） - 管金昱的博文...
昨天我在B站上写了这么一篇文章,但是被他们锁住了.无奈之下我复制到知乎上先保存起来在这篇名为<三天学会用python进行简单地爬取B站网页视频数据>文章中我主要提到了两点在已知aid的情 ...
【数据分析大作业爬虫+数据清洗+可视化分析】Python抓取视频评论并生成词云、情感指数柱状图、性别比例饼图及评论信息表格
目录一些将BV号转化为AV号的变量设置词云屏蔽词设置使用代理IP(直接从IP网站复制的) 爬虫的函数将结果写入表格中下面是主函数,首先看看能不能抓取到,还有一些变量设置开始循环爬评论对一 ...
python抓取视频中的人物动作，并生成3D的bvh
视频中的人物抓取查看视频时,看到很多人的动作特别潇洒.就想做动作抓取参考了别人的案例,自己进行布局特别感谢作者:StubbornHuang <我的开源项目 – 3DPoseEstimat ...
python抓取视频_python实现超简单的视频对象提取功能
视频对象提取与其说是视频对象提取,不如说是视频颜色提取,因为其本质还是使用了OpenCV的HSV颜色物体检测.下面话不多说了,来一起看看详细的介绍吧. HSV介绍 HSV分别代表,色调(H:hue) ...
python抓取视频真实地址_快手批量获取真实地址python
import requests from bs4 import BeautifulSoup import re import xlrd import xlwt class KSNoMark(): # ...
模拟器+Appium+Python抓取App内容
目录环境配置连接夜神模拟器连接Appium 使用Python操作App 环境配置 jdk (设置好环境变量) android sdk (设置好环境变量) 连接夜神模拟器先打开夜神模拟器打开c ...
blob的真实地址怎么获得_使用Python抓取m3u8加密视频续：获得index.m3u8 地址
之前写<使用Python抓取m3u8加密视频>笔记的原因,是自己有几个视频想保存,但对于m3u8, .ts 文件拼接不熟悉,就尝试写个脚本练手. 今天看了回复,有同学想知道如何从视频网站上 ...
python 爬取加密视频_使用Python抓取m3u8加密视频续：获得index.m3u8 地址
之前写<使用Python抓取m3u8加密视频>笔记的原因,是自己有几个视频想保存,但对于m3u8, .ts 文件拼接不熟悉,就尝试写个脚本练手. 今天看了回复,有同学想知道如何从视频网站上 ...
用python爬虫下载视频_使用Python编写简单网络爬虫抓取视频下载资源
我第一次接触爬虫这东西是在今年的5月份,当时写了一个博客搜索引擎,所用到的爬虫也挺智能的,起码比电影来了这个站用到的爬虫水平高多了! 回到用Python写爬虫的话题. Python一直是我主要使用的脚 ...

Python抓取视频内容

Python抓取视频内容

Python抓取视频内容相关推荐

最新文章

热门文章