最近准备深入学习Python相关的爬虫知识了,如果说在使用Python爬取相对正规的网页使用"urllib2 + BeautifulSoup + 正则表达式"就能搞定的话;那么动态生成的信息页面,如Ajax、JavaScript等就需要通过"Phantomjs + CasperJS + Selenium"来实现了。所以先从安装和功能介绍入门,后面在介绍一些Python相关的爬虫应用。

一. 介绍

PhantomJS
        PhantomJS是一个服务器端的 JavaScript API 的WebKit(开源的浏览器引擎)。其支持各种Web标准: DOM 处理, CSS 选择器, JSON, Canvas 和 SVG。PhantomJS可以用于页面自动化,网络监测,网页截屏,以及无界面测试等。
        Selenium
        Selenium是一个用于Web应用程序测试的工具。Selenium测试直接运行在浏览器中,就像真正的用户在操作一样。支持的浏览器包括IE(7、8、9)、Mozilla Firefox、Mozilla Suite等。这个工具的主要功能包括:测试与浏览器的兼容性、测试系统功能,它ThoughtWorks专门为Web应用程序编写的一个验收测试工具。
        PIP
        在介绍介绍它们之前,需要安装PIP软件。正如xifeijian大神所说:“作为Python爱好者,如果不知道easy_install或者pip中的任何一个的话,那么......”。
        easy_insall的作用和perl中的cpan,ruby中的gem类似,都提供了在线一键安装模块的傻瓜方便方式,而pip是easy_install的改进版,提供更好的提示信息,删除package等功能。老版本的python中只有easy_install,没有pip。常见的具体用法如下:

easy_install的用法:
1) 安装一个包  $ easy_install <package_name>  $ easy_install "<package_name>==<version>"
2) 升级一个包  $ easy_install -U "<package_name>>=<version>"  pip的用法
1) 安装一个包  $ pip install <package_name>  $ pip install <package_name>==<version>
2) 升级一个包 (如果不提供version号,升级到最新版本)  $ pip install --upgrade <package_name>>=<version>
3)删除一个包  $ pip uninstall <package_name>  

二. 安装PIP

PS:你可以使用easy_install pip 直接安装pip软件,这更加方便。
        第一步:下载PIP软件
        可以在官网http://pypi.python.org/pypi/pip#downloads下载,同时cd切换到PIP目录,在通过python setup.py install安装。而我采用的是下载pip-Win_1.7.exe进行安装,下载地址如下:
        https://sites.google.com/site/pydatalog/python/pip-for-windows
        第二步:安装PIP软件

        当提示"pip and virtualenv installed"表示安装成功,那怎么测试PIP安装成功呢?
        第三步:配置环境变量
        此时在cmd中输入pip指令会提示错误“不是内部或外部命令”。

所以需要添加path环境变量。PIP安装完成后,会在Python安装目录下添加python\Scripts目录,即在python安装目录的Scripts目录下,将此目录加入环境变量中即可!过程如下:

        第四步:使用PIP命令
        下面在CMD中使用PIP命令,“pip list outdate”列举Python安装库的版本信息。

        PIP常用的命令如下所示: (参考pip安装使用详解)

Usage:     pip <command> [options]  Commands:  install                     安装软件.  uninstall                   卸载软件.  freeze                      按着一定格式输出已安装软件列表  list                        列出已安装软件.  show                        显示软件详细信息.  search                      搜索软件,类似yum里的search.  wheel                       Build wheels from your requirements.  zip                         不推荐. Zip individual packages.  unzip                       不推荐. Unzip individual packages.  bundle                      不推荐. Create pybundles.  help                        当前帮助.  General Options:  -h, --help                  显示帮助.  -v, --verbose               更多的输出,最多可以使用3次  -V, --version               现实版本信息然后退出.  -q, --quiet                 最少的输出.  --log-file <path>           覆盖的方式记录verbose错误日志,默认文件:/root/.pip/pip.log  --log <path>                不覆盖记录verbose输出的日志.  --proxy <proxy>             Specify a proxy in the form [user:passwd@]proxy.server:port.  --timeout <sec>             连接超时时间 (默认15秒).  --exists-action <action>    默认活动当一个路径总是存在: (s)witch, (i)gnore, (w)ipe, (b)ackup.  --cert <path>               证书.  

三. 安装Phantomjs+Selenium

通过pip命令安装Selenium:

        官网http://phantomjs.org/下载PhantomJS解压后如下图所示:

        调用时可能会报错“Unable to start phantomjs with ghostdriver”如图:

        此时可以设置下Phantomjs的路径,同时如果你配置了Scripts目录环境变量,可以解压Phantomjs到该文件夹下。
        参考:Selenium with GhostDriver in Python on Windows - stackoverflow

四. 测试代码


        设置executable_path路径后的代码如下:

from selenium import webdriver
driver = webdriver.PhantomJS(executable_path="F:\Python\phantomjs-1.9.1-windows\phantomjs.exe")
driver.get("http://www.baidu.com")
data = driver.title
print data

运行结果如下图所示:

        获取"百度一下,你就知道",对应HTML源码:
        <title>百度一下,你就知道</title>
        但是总会弹出PhantomJS的黑框,怎么办呢?同时如何通过Python直接调用Phantomjs运行JS呢?
        同时下面的代码可以进行截图:

from selenium import webdriver
driver=webdriver.PhantomJS(executable_path="F:\Python\phantomjs-1.9.1-windows\phantomjs.exe")
driver.get("http://www.csdn.net")
data = driver.title
driver.save_screenshot('csdn.png')
print data

输出如下图所示,图片太长仅仅部分:

>>>
CSDN.NET - 全球最大中文IT社区,为IT专业技术人员提供最全面的信息传播和服务平台
>>> 

PS:我准备使用C#调用PhantomJS.exe完成页面截图功能,但是没有成功,而且使用WebBrowser中DrawToBitmap函数获取图片,由于ActiveX 控件不支持DrawToBitmap方法,获取总是空白的,各种问题。

参考资料:
        数据抓取的艺术(一):Selenium+Phantomjs数据抓取环境配置(强推)
        数据抓取的艺术(二):数据抓取程序优化
        Python使用Selenium/PhantomJS(强推)
        Python selenium的js扩展实现
        使用python+phantomjs抓取动态页面
        用phantomjs 进行网页整页截屏
        Selenium-webdriver系列教程(15)——万能的截图(强推)
        pyspider 爬虫教程(三):使用 PhantomJS 渲染带 JS 的页面
       【PHP】【.NET】【JS】【AJAX】关于抓取网页源代码的问题
        使用python/casperjs编写终极爬虫-客户端App的抓取
        Python 爬虫如何获取 JS 生成的 URL 和网页内容-知乎
        通过 WebBrowser 获取网页截图 - C#
        Control.DrawToBitmap 方法不支持Ajax - 官网
        IE浏览器整页截屏程序(二) - C#
        C# 网络编程之最简单浏览器实现 - 自己

         最后希望该篇基础性文章对你有所帮助吧!如果有不足之处,还请海涵~
      (By:Eastmount 2015-8-19 晚上8点   http://blog.csdn.net/eastmount/)

[Python爬虫] 在Windows下安装PIP+Phantomjs+Selenium相关推荐

  1. [Python爬虫] 在Windows下安装PhantomJS和CasperJS及入门介绍(上)

    最近在使用Python爬取网页内容时,总是遇到JS临时加载.动态获取网页信息的困难.例如爬取CSDN下载资源评论.搜狐图片中的"原图"等,此时尝试学习Phantomjs和Caspe ...

  2. 【Python 笔记】Linux下安装pip方法的全总结

    本文研究记录了 Linux 下安装 pip 的全部方法. 文章目录 1. 通过 Linux 系统的包管理工具安装 1.1 apt 包管理工具安装 pip 1.1.1 安装 1.1.2 升级 1.1.3 ...

  3. python安装rarfile模块_python windows下安装pip及rarfile

    python之所以被广泛使用,倒不见得是本身语法简单,而是而nodejs/javascript一样把三方库的依赖管理简化了,而不用和java一样非得通过maven管理,而且还得打包后在classpat ...

  4. python开发工具及环境配置_python_在windows下安装配置python开发环境及Ulipad开发工具...

    最近开始学习Python,在网上寻找一下比较好的IDE.因为以前用C#做开发的,用Visual Studio作为IDE,鉴于用惯了VS这么强大的IDE,所以对IDE有一定的依赖性. Python的ID ...

  5. windows下安装python scrapy爬虫环境

    windows下安装python scrapy爬虫环境 安装python 根据你的需求下载python安装包,安装python(本文基于python27)https://www.python.org/ ...

  6. 在windows下安装python包管理器pip及使用

      从来没有在Windows下用过pip,今天试了下,原来pip也可以在Windows下安装,使用也和Linux下一样简单. 先从下面的地址下载pip源码: http://pypi.python.or ...

  7. 在python中requests模块怎么安装_Python requests模块在Windows下安装

    发现一个爬虫库太方便了,而且支持python3! 安装方法在http://docs.python-requests.org/en/latest/user/install/#install很详细 只不过 ...

  8. windows下安装python+scrapy

    windows下安装python+scrapy 赞  |   0收藏  |  0 1.5k 次浏览 最近忽然有了想要学习python爬虫的想法,但是首先需要安装工具.python安装倒是很轻松,只要傻 ...

  9. Windows下安装Python扩展模块提示“Unable to find vcvarsall.bat”的问题(转载)

    Unable to find vcvarsall.bat的问题描述 问题分析 总结 提示: 如果你只是想知道自己需要安装哪个版本的Visual Studio请直接查看本文最后一个小节的内容. 一.问题 ...

最新文章

  1. Java调用C/C++编写的第三方dll动态链接库(zz)
  2. python unicode编码转换中文_python unicode转中文及转换默认编码
  3. numpy.random.randint详解
  4. IBASE logical view和physical view
  5. 纯css实现给图片加标签
  6. 把握初期企业的发展战略规划
  7. JavaScript之String总汇
  8. 史上最全的微信小程序代码大全
  9. Adobe illustrator如何修改默认字体
  10. 如何在电脑表格中用计算机,如何制表(如何使用电脑制作表格)
  11. BCH5月硬分叉,如果做成了支付,会超越BTC吗?
  12. codeforces_946D_Timetable(分组背包)
  13. EasyExcel一单元格导出多图片
  14. 百万点赞怎么来?Python批量制作抖音的卡点视频原来这么简单!
  15. CCR炒币机器人:炒币分三类人
  16. 在office2016中,安装mathtype6.9后出现的dll文件缺失问题
  17. 安国论—富国篇:金融战争与美元霸权(1)
  18. 【英语-同义词汇词组】by、through、via的用法及区别
  19. linux内核中的设计模式
  20. DeepCas:an end-to-end predictorof information Cascades

热门文章

  1. mongoDB add user in v3.0 问题的解决(Property 'addUser' of object admin is not a func)
  2. 舍本求末的运维自动化技术热潮
  3. 【易网库】周年庆幸运大抽奖, 有机会获3年免费主机空间
  4. 撩课-Python-每天5道面试题-第2天
  5. 2018.07.11 线段树基本模板复习
  6. WPF自定义产品框架
  7. hihocoder 1015 : KMP算法(kmp)
  8. 《数据结构与算法Python语言描述》习题第二章第二题(python版)
  9. getopt()和getopt_long()用法
  10. flag push tcp 作用_TCP/IP协议到底在讲什么?