本文的文字及图片来源于网络,仅供学习、交流使用,不具有任何商业用途,如有问题请及时联系我们以作处理。
基本开发环境
Python 3.6
Pycharm
相关模块的使用
requests
parsel
csv
re
安装Python并添加到环境变量,pip安装需要的相关模块即可。

一、明确需求

爬取内容:

招聘标题
公司
薪资
城市区域
工作经验要求、学历要求、招聘人数、发布时间、公司福利
岗位职责、任职要求
二、请求网页,先获取所有招聘信息的详情url地址

使用开发者工具发现网页加载出来的内容是乱代码的,这也意味着等会再爬取的时候,是需要转码的,这样看是看不出自己想要的内容网页是否有返回数据,可以复制网页中的数据,在网页源代码里面搜索。

没有结果,那么我们就可以搜索详情链接的ID

里面不仅有ID 还有详情url地址。用正则表达式匹配出ID,然后再拼接url,如果匹配出url地址的话,需要再转一次。

特别声明:
因为网站原因,每一个招聘详细页面url地址,仅仅只是ID的变化,如果ID不是唯一变化值的时候,那取url地址更好。

import requests
import re

def get_response(html_url):
headers = {
‘User-Agent’: ‘Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/81.0.4044.138 Safari/537.36’,
}
response = requests.get(url=html_url, headers=headers)
return response

def get_id(html_url):
response = get_response(html_url)
result = re.findall(’“jobid”:"(\d+)"’, response.text)
print(response.text)
print(result)

if name == ‘main’:
url = ‘https://search.51job.com/list/010000%252C020000%252C030200%252C040000%252C090200,000000,0000,00,9,99,python,2,1.html’
get_id(url)
简单总结

打印 response.text 可以在pycharm里面使用正则匹配规则,可以测试是否有匹配到数据。详情如下图所示

三、解析招聘信息数据,提取内容

每页第一个招聘信息是没有薪资的,没有薪资待遇的,对于没有薪资的招聘信息,我们就自动跳过就好了,所以需要先判断一下。

其次前面有说过,网页查看内容是有乱码的,需要进行转码。

def get_content(html_url):
result = get_id(html_url)
for i in result:
page_url = f’https://jobs.51job.com/shanghai-xhq/{i}.html?s=01&t=0’
response = get_response(page_url)
# 进行转码
response.encoding = response.apparent_encoding
html_data = response.text
selector = parsel.Selector(html_data)
# 薪资
money = selector.css(’.cn strong::text’).get()
# 判断如果有薪资继续提取相关内容
if money:
# 标题
title = selector.css(’.cn h1::attr(title)’).get()
# 公司
cname = selector.css(’.cname a:nth-child(1)::attr(title)’).get()
# 上海-徐汇区 | 5-7年经验 | 本科 | 招1人 | 01-25发布
info_list = selector.css(‘p.msg.ltype::attr(title)’).get().split(’ | ‘)
city = info_list[0] # 城市
exp = info_list[1] # 经验要求
edu = info_list[2] # 学历要求
people = info_list[3] # 招聘人数
date = info_list[4] # 发布时间
# 福利
boon_list = selector.css(’.t1 span::text’).getall()
boon_str = ‘|’.join(boon_list)
# 岗位职责: 任职要求:
position_list = selector.css(’.job_msg p::text’).getall()
position = ‘\n’.join(position_list)
dit = {
‘标题’: title,
‘公司’: cname,
‘城市’: city,
‘经验要求’: exp,
‘学历要求’: edu,
‘薪资’: money,
‘福利’: boon_str,
‘招聘人数’: people,
‘发布时间’: date,
‘详情地址’: page_url,
}
四、保存数据(数据持久化)
关于薪资待遇、公司地址这些就用csv保存,岗位职责和任职要求就保存文本格式吧,这样看起来会稍微舒服一些。

保存csv

f = open(‘python招聘.csv’, mode=‘a’, encoding=‘utf-8’, newline=’’)
csv_writer = csv.DictWriter(f, fieldnames=[‘标题’, ‘公司’, ‘城市’, ‘经验要求’, ‘学历要求’,
‘薪资’, ‘福利’, ‘招聘人数’, ‘发布时间’,
‘详情地址’])

csv_writer.writeheader()
保存txt

txt_filename = ‘岗位职责\’ + f’{cname}招聘{title}信息.txt’
with open(txt_filename, mode=‘a’, encoding=‘utf-8’) as f:
f.write(position)
五、多页数据爬取
‘’’
if name == ‘main’:
‘’’
第一页地址:
https://search.51job.com/list/010000%252c020000%252c030200%252c040000%252c090200,000000,0000,00,9,99,python,2,1.html
第二页地址:
https://search.51job.com/list/010000%252c020000%252c030200%252c040000%252c090200,000000,0000,00,9,99,python,2,2.html
第三页地址:
https://search.51job.com/list/010000%252c020000%252c030200%252c040000%252c090200,000000,0000,00,9,99,python,2,3.html
‘’’
for page in range(1, 11):
url = f’https://search.51job.com/list/010000%252C020000%252C030200%252C040000%252C090200,000000,0000,00,9,99,python,2,{page}.html’
get_content(url)
实现效果

补充代码
正则匹配替换特殊字符

def change_title(title):
pattern = re.compile(r"[/\

Python爬虫新手入门教学:爬取前程无忧招聘信息相关推荐

  1. Python爬虫新手入门教学(十):爬取彼岸4K超清壁纸

    前言 本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,如有问题请及时联系我们以作处理. Python爬虫.数据分析.网站开发等案例教程视频免费在线观看 https://space. ...

  2. Python爬虫新手入门教学(十八):爬取yy全站小视频

    前言 本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,如有问题请及时联系我们以作处理. Python爬虫.数据分析.网站开发等案例教程视频免费在线观看 https://space. ...

  3. Python爬虫新手入门教学(十七):爬取yy全站小视频

    前言 本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,如有问题请及时联系我们以作处理. Python爬虫.数据分析.网站开发等案例教程视频免费在线观看 https://space. ...

  4. Python爬虫新手入门教学(十六):爬取好看视频小视频

    前言 本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,如有问题请及时联系我们以作处理. Python爬虫.数据分析.网站开发等案例教程视频免费在线观看 https://space. ...

  5. Python爬虫新手入门教学(十三):爬取高质量超清壁纸

    前言 本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,如有问题请及时联系我们以作处理. Python爬虫.数据分析.网站开发等案例教程视频免费在线观看 https://space. ...

  6. Python爬虫新手入门教学(十五):爬取网站音乐素材

    前言 本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,如有问题请及时联系我们以作处理. Python爬虫.数据分析.网站开发等案例教程视频免费在线观看 https://space. ...

  7. Python爬虫新手入门教学(十四):爬取有声小说网站数据

    前言 本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,如有问题请及时联系我们以作处理. Python爬虫.数据分析.网站开发等案例教程视频免费在线观看 https://space. ...

  8. Python爬虫新手入门教学(二十):爬取A站m3u8视频格式视频

    前言 本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,如有问题请及时联系我们以作处理. 前文内容 Python爬虫新手入门教学(一):爬取豆瓣电影排行信息 Python爬虫新手入门 ...

  9. Python爬虫新手入门教学(二):爬取小说

    前言 本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,如有问题请及时联系我们以作处理. Python爬虫.数据分析.网站开发等案例教程视频免费在线观看 https://space. ...

  10. Python爬虫新手入门教学(九):多线程爬虫案例讲解

    前言 本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,如有问题请及时联系我们以作处理. Python爬虫.数据分析.网站开发等案例教程视频免费在线观看 https://space. ...

最新文章

  1. DotNetNuke(DNN)网站发布、部署、迁移和重建
  2. 记一次MongoDB性能问题(从MySQL迁移到MongoDB)
  3. NOP (code)_NOP指令作用及解析
  4. mysql truncate table命令使用总结
  5. 没有bug队——加贝——Python 43,44
  6. centos php 环境路径,路径(十四):在本地 CentOS 7 上搭建 Web 开发环境 — PHP
  7. Node JS环境设置– Node.js安装
  8. html php连接mysql数据库连接,PHP如何连接MySQL数据库?附两种方法!
  9. 2021年PMP考试模拟题11(含答案解析)
  10. 项目需求分析答辩总结(含评审结果)——日不落战队
  11. Road_slam论文阅读及理解
  12. Android Push哪家强——分析豌豆荚1400个APP
  13. 都这样了!我还是没法关闭微信朋友圈广告
  14. csr_matrix矩阵
  15. SAS学习笔记5:删除字符串空格-left/right/trim/strip/compress/compbl等函数的比较
  16. 使用virt-v2v转换kvm虚拟化为ovirt需求的ovf
  17. 计算机科学丛书操作系统概念pdf,操作系统概念 (第9版) PDF英文文字版[5.63M]
  18. 76、基于STM32的电动车小车蓄电池/锂电池充电桩系统设计
  19. LaTeX 图片和公式引用
  20. 最新国产半导体芯片行业细分企业汇总

热门文章

  1. VM的下载与安装(一)
  2. 基于FPGA的VGA接口设计(三)
  3. php获取ip地址,记录用户登陆日志
  4. Spring Cloud全家桶主要组件及简要介绍
  5. weblogic11g清理缓存tmp
  6. 【2021年1月】RT-Thread社区简报
  7. Xmind思维导图神器:免费有免费的用法
  8. [swustoj 1095] 挖金子
  9. Vue3+Vite项目使用mockjs模拟数据
  10. 4、电场的概念及点电荷电场强度的计算