说到做爬虫,大家都可能第一时间想到的是python,其实php也是可以用来写爬虫程序的。php一贯简洁、易用,亲测使用PHPspider框架10分钟就能写出一个简单的爬虫程序。

一、PHP环境安装

和python一样,PHP也需要环境,可以使用官网下载的PHP,也可以使用XAMPP、PHPstudy等集成环境下的PHP。比较推荐集成环境,省去单独安装Mysql数据库。

二、composer安装

composer是PHP下的依赖包管理工具,类似于Python中的PIP。

中文官网为https://www.phpcomposer.com/

下载安装即可,win+R运行cmd,输入composer命令,出现如下图所示说明安装成功了。

三、PHPspider安装

在任意位置建立一个文件夹,例如我们要抓取简书的数据,我们可以在D盘建立jianshu文件夹,然后cmd命令进入该文件夹,运行命令

composer require owner888/phpspider

如下结果便是成功安装了。

四、开始写第一个爬虫

现在打开jianshu文件夹,会发现里面多了一些东西,不用管它,建立一个php文件,开始打代码。

开发文档在这:https://doc.phpspider.org/demo-start.html

这边不讲基础,直接上代码,因为咱们是做的10分钟快速教程。

匹配方式使用XPach语法。

<?phprequire '/vendor/autoload.php';use phpspider\core\phpspider;/* Do NOT delete this comment *//* 不要删除这段注释 */$configs = array('name' => '简书','log_show' =>false,'tasknum' => 1,//数据库配置'db_config' => array('host' => '127.0.0.1','port' => 3306,'user' => 'root','pass' => '','name' => 'demo',),'export' => array('type' => 'db','table' => 'jianshu', // 如果数据表没有数据新增请检查表结构和字段名是否匹配),//爬取的域名列表 'domains' => array( 'jianshu', 'www.jianshu.com'), //抓取的起点'scan_urls' => array( 'https://www.jianshu.com/c/V2CqjW?utm_medium=index-collections&utm_source=desktop'),//列表页实例'list_url_regexes' => array( "https://www.jianshu.com/c/\d+"),//内容页实例// \d+ 指的是变量'content_url_regexes' => array( "https://www.jianshu.com/p/\d+",),'max_try' => 5,'fields' => array( array( 'name' => "title", 'selector' => "//h1[@class='title']", 'required' => true, ), array( 'name' => "content", 'selector' => "//div[@class='show-content-free']", 'required' => true, ),),);$spider = new phpspider($configs);$spider->start();

稍微解释一下一下句法的含义:

//h1[@class='title']

获取所有class值为title的h1节点

//div[@class='show-content-free']

获取所有class值为show-content-free的div节点

具体为什么这么写呢?自己看简书的html源码吧。

打完代码后,记得根据要抓取的内容建立对应的数据库、数据表,字段要能对对上。

接着cmd,输入

php -f d:\jianshu\spider.php

运行如下

打开数据看一下,是不是都抓取到了呢?

最后,想学习Python的小伙伴们!

请关注+私信回复:“学习”就可以拿到一份我为大家准备的Python学习资料!

pytyhon学习资料

python学习资料

本文仅代表作者个人观点,不代表SEO研究协会网官方发声,对观点有疑义请先联系作者本人进行修改,若内容非法请联系平台管理员,邮箱cxb5918@163.com。更多相关资讯,请到SEO研究协会网www.seoxiehui.cn学习互联网营销技术请到巨推学院www.jutuiedu.com。

python的spider程序下载_PHPspider爬虫10分钟快速教程(内附python教程分享)相关推荐

  1. python爬虫十分钟速学教程_PHPspider爬虫10分钟快速教程

    说到做爬虫,大家都可能第一时间想到的是python,其实php也是可以用来写爬虫程序的.php一贯简洁.易用,亲测使用PHPspider框架10分钟就能写出一个简单的爬虫程序. 一.PHP环境安装 和 ...

  2. 文字识别软件测试初学者,【只要10分钟 快速掌握文字识别】

    [只要10分钟 快速掌握文字识别] 教程 1.获取接口权限       2.下载接口调用工具       3.进行接口调用 具体步骤如下: 1.获取接口权限 1.1  登录网址:ai.baidu.co ...

  3. pythonhelloworld项目,10分钟搭建一个小型网页(python django)(hello world!)

    10分钟搭建一个小型网页(python django)(hello world!) 1.安装django pip install django 安装成功后,在Scripts目录下存在django-ad ...

  4. python操作excel-python操作excel(内附python教程分享)

    今天学习了下xlwings这个库,目的是为了让计算机自动化操作excel表,当某天需要做一些很繁琐的事情,就可以派上用场啦. python操作excel(内附python教程分享) 基本对象 网上刮来 ...

  5. 【华为云技术分享】10分钟快速在华为云鲲鹏弹性云服务器上部署一个自己的弹幕网站!

    摘要:从零代码开始,10分钟快速开发一个可以发送弹幕的网站,并将其部署在华为云服务器上:学完本期教程,将知道如何使用Nginx.如何将自己的网站部署到云服务器上. 直播相信大家都不陌生了吧,大家经常会 ...

  6. 10分钟快速配置sublime2支持jQuery开发

    昨天介绍了javascript的开发工具sublime 2 edit,今天我们将介绍如何10分钟快速配置sublime2支持jQuery开发.希望大家能喜欢着款jQuery开发工具. 相关介绍:使用s ...

  7. 【工具篇】10分钟快速学会React图表搭建

    10分钟快速学会React图表搭建 本次紧着之前的antd,接着学习有关react图表以及富文本编辑器的搭建. 本次的功能实现基于上次的[工具篇]10分钟学会Ant Design of React用法 ...

  8. 11月二开版PHP零距离泛目录程序源码,开源无限制,最强泛解析站群,内附安装教程

    csdn下载: https://download.csdn.net/download/dujiangdu123/13117609 泛解析站群,内附安装教程,此程序在域名方面,做了泛解析操作,任何前缀, ...

  9. 打卡小程序源码,签到小程序,微擎后端,内附安装教程

    导航路径 个人中心 /bh_rising/pages/my/my 商城 /bh_rising/pages/goodsconvert/goodsconvert 好友 /bh_rising/pages/f ...

最新文章

  1. 浅谈Angular如何自定义创建指令@Directive
  2. 零基础学习前端——html5
  3. js 数组 实现 完全树_算法和数据结构 | 树状数组(Binary Indexed Tree)
  4. Redis:安装、配置、操作和简单代码实例(C语言Client端)[转]
  5. el-table 行背景颜色_用手机拍花卉怎样使背景变黑?
  6. MongoDB的使用技巧(转)
  7. vue 方法获取返回值_vue中子组件怎么获取父组件中的方法的返回值
  8. 奥的斯服务器显示chc,奥的斯服务器查看故障清除故障
  9. fastDFS 命令笔记
  10. Spring Cloud(7.2):配置Producer Server
  11. 【SCIR笔记】ACL20 让模型“事半功倍”,探究少样本序列标注方法
  12. hdu 3829 最大独立集
  13. Linux内核开发者大会 开始报名啦~
  14. 【预测模型】基于matlab RNN循环神经网络预测【含Matlab源码 363期】
  15. spyder python下载_Spyder Python软件-Spyder Python下载-最火手机站
  16. 关闭Win 11自动更新工具
  17. 路径详解(绝对路径,相对路径,根相对路径)
  18. c语言中shift的作用,Shift是什么意思?Shift键都有什么作用?
  19. The Sixty-first Of Word-Day
  20. Spring MVC 406

热门文章

  1. 渐变色彩艺术海报背景素材|感官刺激、个性突出
  2. 平面设计师必备素材|中国/国潮风格
  3. matlab怎么设clim,Python Matplotlib.pyplot.clim()用法及代码示例
  4. oracle jvm禁用,java-如何减少Sun / Oracle JVM内部开销?
  5. java 狗带风波_养狗风波作文
  6. 牛客网编程题07--提取不重复的整数
  7. Python极其简易音乐播放器
  8. asp.net 添加权限
  9. cuSPARSE库:(十二)cusparseDestroyMatDescr()
  10. qcow2 磁盘在线扩容方法