爬取某人的微博数据,把某人所有时间段的微博数据都爬下来。

具体思路:

创建driver-----get网页----找到并提取信息-----保存csv----翻页----get网页(开始循环)----...----没有“下一页”就结束,

用了while True,没用自我调用函数

嘟大海的微博:https://weibo.com/u/1623915527

办公室小野的微博:https://weibo.com/bgsxy

代码如下

from selenium import webdriver

from selenium.webdriver.common.keys import Keys

import csv

import os

import time

#只有这2个参数设置,想爬谁的微博数据就在这里改地址和目标csv名称就行

weibo_url = 'https://weibo.com/bgsxy?profile_ftype=1&is_all=1#_0'

csv_name = 'bgsxy_allweibo.csv'

def start_chrome():

print('开始创建浏览器')

driver = webdriver.Chrome(executable_path='C:/Users/lori/Desktop/python52project/chromedriver_win32/chromedriver.exe')

driver.start_client()

return driver

def get_web(url): #获取网页,并下拉到最底部

print('开始打开指定网页')

driver.get(url)

time.sleep(7)

scoll_down()

time.sleep(5)

def scoll_down(): # 滚轮下拉到最底部

html_page = driver.find_element_by_tag_name('html')

for i in range(7):

print(i)

html_page.send_keys(Keys.END)

time.sleep(1)

def get_data():

print('开始查找并提取数据')

card_sel = 'div.WB_cardwrap.WB_feed_type'

time_sel = 'a.S_txt2[node-type="feed_list_item_date"]'

source_sel = 'a.S_txt2[suda-uatrack="key=profile_feed&value=pubfrom_guest"]'

content_sel = 'div.WB_text.W_f14'

interact_sel = 'span.line.S_line1>span>em:nth-child(2)'

cards = driver.find_elements_by_css_selector(card_sel)

info_list = []

for card in cards:

time = card.find_elements_by_css_selector(time_sel)[0].text #虽然有可能在一个card中有2个time元素,我们取第一个就对

if card.find_elements_by_css_selector(source_sel):

source = card.find_elements_by_css_selector(source_sel)[0].text

else:

source = ''

content = card.find_elements_by_css_selector(content_sel)[0].text

link = card.find_elements_by_css_selector(time_sel)[0].get_attribute('href')

trans = card.find_elements_by_css_selector(interact_sel)[1].text

comment = card.find_elements_by_css_selector(interact_sel)[2].text

like = card.find_elements_by_css_selector(interact_sel)[3].text

info_list.append([time,source,content,link,trans,comment,like])

return info_list

def save_csv(info_list,csv_name):

csv_path = './' + csv_name

print('开始写入csv文件')

if os.path.exists(csv_path):

with open(csv_path,'a',newline='',encoding='utf-8-sig') as f: #newline=''避免空行;encoding='utf-8-sig'比utf8牛,保存中文没问题

writer = csv.writer(f)

writer.writerows(info_list)

else:

with open(csv_path,'w+',newline='',encoding='utf-8-sig') as f:

writer = csv.writer(f)

writer.writerow(['发布时间','来源','内容','链接','转发数','评论数','点赞数'])

writer.writerows(info_list)

time.sleep(5)

def next_page_url():

next_page_sel = 'a.page.next'

next_page_ele = driver.find_elements_by_css_selector(next_page_sel)

if next_page_ele:

return next_page_ele[0].get_attribute('href')

else:

return None

driver = start_chrome()

input('请在chrome中登录weibo.com') # 暂停程序,手动登录weibo.com

while True:

get_web(weibo_url)

info_list = get_data()

save_csv(info_list,csv_name)

if next_page_url():

weibo_url = next_page_url()

else:

print('爬取结束')

break

以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持脚本之家。

python爬取微博数据代码_Python selenium爬取微博数据代码实例相关推荐

  1. python爬虫动态加载页面_Python+Selenium爬取动态加载页面(2)

    注: 上一篇<Python+Selenium爬取动态加载页面(1)>讲了基本地如何获取动态页面的数据,这里再讲一个稍微复杂一点的数据获取全国水雨情网.数据的获取过程跟人手动获取过程类似,所 ...

  2. python 批量下载 代码_Python + Selenium +Chrome 批量下载网页代码修改

    Python + Selenium +Chrome 批量下载网页代码修改 主要修改以下代码可以调用 本地的 user-agent.txt 和 cookie.txt 来达到在登陆状态下 批量打开并下载网 ...

  3. python爬取论文代码_Python selenium爬取微信公众号文章代码详解

    需求: 想阅读微信公众号历史文章,但是每次找回看得地方不方便. 思路: 1.使用selenium打开微信公众号历史文章,并滚动刷新到最底部,获取到所有历史文章urls. 2.对urls进行遍历访问,并 ...

  4. Python爬虫:最牛逼的 selenium爬取方式!

    Python爬虫:最牛逼的 selenium爬取方式! 作为一个男人 在最高光的时刻 这是小编准备的python爬虫学习资料,加群:700341555即可免费获取! Python爬虫:最牛逼的 sel ...

  5. python爬取酒店信息_python selenium爬取去哪儿网的酒店信息(详细步骤及代码实现)...

    准备工作 1.pip install selenium 2.配置浏览器驱动.配置其环境变量 Selenium3.x调用浏览器必须有一个webdriver驱动文件 Chrome驱动文件下载chromed ...

  6. python跑一亿次循环_python爬虫爬取微博评论

    原标题:python爬虫爬取微博评论 python爬虫是程序员们一定会掌握的知识,练习python爬虫时,很多人会选择爬取微博练手.python爬虫微博根据微博存在于不同媒介上,所爬取的难度有差异,无 ...

  7. python爬虫微博评论图片_python爬虫爬取微博评论

    原标题:python爬虫爬取微博评论 python爬虫是程序员们一定会掌握的知识,练习python爬虫时,很多人会选择爬取微博练手.python爬虫微博根据微博存在于不同媒介上,所爬取的难度有差异,无 ...

  8. 招聘网python职位_Python+selenium爬取智联招聘的职位信息

    整个爬虫是基于selenium和Python来运行的,运行需要的包 1 mysql,matplotlib,selenium 需要安装selenium火狐浏览器驱动,百度的搜寻. 整个爬虫是模块化组织的 ...

  9. python爬取网站数据步骤_python怎么爬取数据

    在学习python的过程中,学会获取网站的内容是我们必须要掌握的知识和技能,今天就分享一下爬虫的基本流程,只有了解了过程,我们再慢慢一步步的去掌握它所包含的知识 Python网络爬虫大概需要以下几个步 ...

  10. python爬取有道翻译的代码_python实现爬取有道翻译

    声明: 1.图文思路来源于本站UP:轻松学Python.视频跳转链接. 2.爬取时应当robots协议.自觉维护网站权益 3.本代码仅限学习交流使用 4.转载附初始创作者信息 >>> ...

最新文章

  1. Web前端学习第七天·fighting_CSS样式的编写和使用(二)
  2. 三个基本原理和概念 - 计算机图形学、数据加密、数据挖掘
  3. 正则 至少是数字加英文字符_正则表达式-入门
  4. mysql平均值函数保留两位小数点_用sql的avg(score)求完平均值后,保存两位小数的方法(用于查询或视图)...
  5. LiveVideoStack线上交流分享 ( 一 ) —— 解密GPU:视频转码与分析加速
  6. leetcode刷题 82.删除排序链表中的重复元素Ⅱ
  7. 成本管控难题怎么破?BI大神带你一步步拆解分析,节省成本390万
  8. [Pytorch] BCELoss和BCEWithLogitsLoss(Sigmoid-BCELoss合成为一步)
  9. PVSCSI还是LSI logic?VM SCSI控制器驱动的选择
  10. Leetcode之合并区间
  11. LINUX SHELL中大小写转换及注意事项
  12. java第六章十七题_Java语言面试题十七
  13. 微信小程序 一键保存视频到手机相册功能(视频来源为链接)
  14. 分享一批常用的软件(已存网盘),中文Pycharm、MySQL、各类工具(截图、录屏、护眼····)...
  15. 怎么看计算机电源型号,电脑电源铭牌怎么看?台式机电源铭牌知识扫盲 拒绝虚标!...
  16. 五、《图解HTTP》报文首部和HTTP缓存
  17. Ubuntu18.04 LTS 安装 Synopsys VCS及一些问题
  18. 【kafka】Kafka 快速入门
  19. java中JAO_JVM内部细节之一:synchronized关键字及实现细节(轻量级锁Lightweight Locking)...
  20. uva 672 Gangsters( dp )

热门文章

  1. 中国虾养殖和捕捞现状分析,养殖产量成上升趋势「图」
  2. t检验及python代码实现
  3. 网际风全推数据接口_网际风千钧版 飞狐配套全推接口最新版(2013年5月10更新)...
  4. Cisco 防火墙 SSH配置
  5. 电商商品中心类目体系
  6. EXCEL插件《二维码标签工具》
  7. java yml_Spring Boot使用yml格式进行配置的方法
  8. Google 安装印象笔记剪藏插件
  9. 2021特斯拉Model3/ModelY维修手册电路图接线图用户手册资料含国产进口车型
  10. mysql 显示 乱码_MySQL 中文显示乱码