抓取数据不管用什么编程语言几乎都是可以实现了,今天我们需要采集安居客的小区数据,下面我们来看一个python抓取安居客小区数据的程序代码了,希望下文能够对大家有帮助。

某功能需要一套城市所有小区的位置信息数据,一开始是使用的百度地图api来进行关键词搜索,勉强能用,但数据量非常少,还是有大量的社区/小区搜不到。

周末在家上网时发现安居客上直接就有每个城市的小区大全,欣喜若狂,于是就立即写了个爬虫试试。

以下贴代码,python2.7,lxml+request库。#coding=utf-8

#author : zx

#date : 2015/07/27

import requests

import MySQLdb

import time

import string

import random

from lxml import etree

#ua头信息 get时可以随机使用

headers = [

{ "User-Agent":"Mozilla/5.0 (Linux; U; Android 4.1; en-us; GT-N7100 Build/JRO03C) AppleWebKit/534.30 (KHTML, like Gecko) Version/4.0 Mobile Safari/534.30"},

{ "User-Agent":"Mozilla/5.0 (compatible; MSIE 10.0; Windows Phone 8.0; Trident/6.0; IEMobile/10.0; ARM; Touch; NOKIA; Lumia 520)"},

{ "User-Agent":"Mozilla/5.0 (BB10; Touch) AppleWebKit/537.10+ (KHTML, like Gecko) Version/10.0.9.2372 Mobile Safari/537.10+"},

{ "User-Agent":"Mozilla/5.0 (Linux; Android 4.4.2; GT-I9505 Build/JDQ39) AppleWebKit/537.36 (KHTML, like Gecko) Version/1.5 Chrome/28.0.1500.94 Mobile Safari/537.36"}

]

#城市入口页面

#我只抓的青岛本地

#其它城市或全国城市可通过这个页面抓取城市列表http://m.anjuke.com/cityList

url = 'http://m.anjuke.com/qd/xiaoqu/'

req = requests.get(url)

cookie = req.cookies.get_dict()

#链接数据库

conn = MySQLdb.connect('localhost', '*****', '******', '***', charset='utf8')

cursor = conn.cursor()

sql = "insert into xiaoqu (name, lat, lng, address, district) values (%s, %s, %s, %s, %s)"

sql_v = []

page = etree.HTML(req.text)

districtHTML = page.xpath(u"//div[@class='listcont cont_hei']")[0]

#采集目标城市的各行政区域url

#当然如果不想区分行政区可以直接抓“全部” 即上面url中的所有小区及分页

districtUrl = {}

i = 0

for a in districtHTML:

if i==0:

i = 1

continue

districtUrl[a.text] = a.get('href')

#开始采集

total_all = 0

for k,u in districtUrl.items():

p = 1 #分页

while True:

header_i = random.randint(0, len(headers)-1)

url_p = u.rstrip('/') + '-p' + str(p)

r = requests.get(url_p, cookies=cookie, headers=headers[header_i])

page = etree.HTML(r.text) #这里转换大小写要按情况...

communitysUrlDiv = page.xpath(u"//div[@class='items']")[0]

total = len(communitysUrlDiv)

i = 0

for a in communitysUrlDiv:

i+=1

r = requests.get(a.get('href'), cookies=cookie, headers=headers[header_i])

#抓取时发现有少量404页会直接导致程序报错退出- -!

#唉 说明代码写的还不够健壮啊

#加了if判断和try, 错误时可以跳过或做一些简单处理和调试...

if r.status_code == 404:

continue

page = etree.HTML(r.text)

try:

name = page.xpath(u"//h1[@class='f1']")[0].text

except:

print a.get('href')

print r.text

raw_input()

#有少量小区未设置经纬度信息

#只能得到它的地址了

try:

latlng = page.xpath(u"//a[@class='comm_map']")[0]

lat = latlng.get('lat')

lng = latlng.get('lng')

address = latlng.get('address')

except:

lat = ''

lng = ''

address = page.xpath(u"//span[@class='rightArea']/em")[0].text

sql_v.append((name, lat, lng, address, k))

print "\r\r\r",

print u"正在下载 %s 的数据,第 %d 页,共 %d 条,当前:".encode('gbk') %(k.encode('gbk'),p, total) + string.rjust(str(i),3).encode('gbk'),

time.sleep(0.5) #每次抓取停顿

#执行插入数据库

cursor.executemany(sql, sql_v)

sql_v = []

time.sleep(5) #每页完成后停顿

total_all += total

print ''

print u"成功入库 %d 条数据,总数 %d".encode('gbk') % (total, total_all)

if total < 500:

break

else:

p += 1

#及时关闭数据库 做个好孩子 任务完成~

cursor.close()

conn.close()

print u'所有数据采集完成! 共 %d 条数据'.encode('gbk') % (total_all)

raw_input()

注释我觉得已经写的很详细了,在cmd中显示,字符串当然要转一下码。

以下是运行状态和得到的数据截图。

本文原创发布php中文网,转载请注明出处,感谢您的尊重!

php 仿安居客源码_python抓取安居客小区数据的程序代码相关推荐

  1. python爬取京东图书_Python抓取京东图书评论数据

    Python抓取京东图书评论数据 来源:中文源码网    浏览: 次    日期:2018年9月2日 [下载文档:  Python抓取京东图书评论数据.txt ] (友情提示:右键点上行txt文档名- ...

  2. python足球大数据分析_Python 抓取欧洲足球联赛数据进行大数据分析

    摘要: 背景 Web Scraping 在大数据时代,一切都要用数据来说话,大数据处理的过程一般需要经过以下的几个步骤 数据的采集和获取 数据的清洗,抽取,变形和装载 数据的分析,探索和预测 数据的展 ...

  3. 用nodejs配合python破解X-Ca-Signature,抓取博客积分数据

    世界上最稀缺的资源是时间. 在某一瞬间我惊恐得发现,一生三万天,已过三分之一,念及年少不更事,蹉跎而过,觉得心中有愧.至今无建树,脑袋里想起一句话,"不因虚度年华而悔恨,也不因碌碌无为而羞耻 ...

  4. python爬取图片源码_python抓取百度图片源码

    #!/usr/bin/python # -*- coding:utf-8 -*- import httplib2 import urllib.request import json #import u ...

  5. 用python,selenium抓取博客积分

    世界上最稀缺的资源是时间. 在某一瞬间我惊恐得发现,一生三万天,已过三分之一,念及年少不更事,蹉跎而过,觉得心中有愧.至今无建树,脑袋里想起一句话,"不因虚度年华而悔恨,也不因碌碌无为而羞耻 ...

  6. 抓取安居客二手房经纪人数据,python爬虫自动翻页

    为什么80%的码农都做不了架构师?>>>    和链接不一样,安居客网站里面没有找到总页数,可能在json里面有,只是我没有找到. 基于此能不能做网页的循环爬取呢. 能否判断页面读取 ...

  7. python获取网页图片_python抓取网页中的图片示例

    python抓取网页中的图片示例 代码如下: #coding:utf8 import re import urllib def getHTML(url): page = urllib.urlopen( ...

  8. Project 1 :Python爬虫源码实现抓取淘宝指定商品所有评论并保存到文件

    学习python一个多月,掌握了一些基础,因为开淘宝店的原因,平时会抓取一些淘宝数据,尝试用简单的语言写一些python爬虫,关键信息都注释在源码内.这是我的第一个爬虫程序,基于python3.6-p ...

  9. python—简单数据抓取三(简单IP地址代理、利用蘑菇代理实现IP地址代理刷新本地ip地址、利用蘑菇代理实现IP地址代理抓取安居客信息并实现多线程)

    学习目标: python学习二十三 -数据抓取三. 学习内容: 1.简单IP地址代理 2.利用蘑菇代理实现IP地址代理刷新本地ip地址 3.利用蘑菇代理实现IP地址代理抓取安居客信息并实现多线程 1. ...

  10. 结束 txt进程_Python多进程抓取拉钩网十万数据

    转载:Python多进程抓取拉钩网十万数据 准备 安装Mongodb数据库 其实不是一定要使用MongoDB,大家完全可以使用MySQL或者Redis,全看大家喜好.这篇文章我们的例子是Mongodb ...

最新文章

  1. 地铁框架保护的原理_地铁屏蔽门是如何保证通讯的稳定?
  2. python graphics画圆_求高手解答·· graphics画圆出现报错!
  3. android 跳转权限管理的代码,Android权限管理
  4. 开发基于深度学习的人脸识别【考勤/签到】系统
  5. worklist 设备对接,pe 为例
  6. 【VScode】ubuntu系统的 VScode 调不出中文输入法
  7. Android adb环境变量配置
  8. 将文件中的单词及翻译导入数据库
  9. 演绎与归纳,双管齐下
  10. java:文本框的简单使用
  11. 多可系统如何设置登录IP限制
  12. Java中protected的用法
  13. java 删除重复文件
  14. android热补丁原理完bb霜,answered
  15. 温州中学高考2021成绩查询,2021年温州高考各高中成绩及本科升学率数据排名及分析...
  16. 2018年世界计算机销售排名,2018年第二季全球笔记本电脑出货量排名
  17. Ubuntu下 .Desktop文件设置
  18. 2020年最新人工智能算法工程师学习资料大全!!!
  19. 云服务器搭建crm系统,云服务器搭建crm网站教程
  20. 我的世界服务器修改物品模型,我的世界17w46a发布 马的模型修改新的功能指令...

热门文章

  1. linux 爱数备份,爱数安全备份专家
  2. 超全面的后端开发C/C++面经整理分享含详细参考答案 包括简历分享
  3. java工程师项目经验_java初级工程师项目经验简历范文
  4. Windows下连接Linux的ssh工具有哪些
  5. python web开发实战pdf 百度网盘_python web开发实战 pdf
  6. PASCAL VOC2012数据集介绍
  7. 利用青龙面板自动化跑聚看点脚本
  8. 1.Matlab图像的读取和显示
  9. 检索 COM 类工厂中 CLSID 为 {000209FF-0000-0000-C000-000000000046} 的组件时失败,原因是出现以下错误: 8000401a
  10. C# installshield使用教程