代码地址如下:
http://www.demodashi.com/demo/11643.html

昨天LZ去面试,遇到一个大牛,被血虐一番,发现自己基础还是很薄弱,对java一些原理掌握的还是不够稳固,比如java反射注解,知道一点就是说不出来,很尴尬… 生命不止,学习不止啊

之前那个项目 QNews 用的是的第三方的数据平台,所以访问次数会有限制,这就很无奈。。。

我的博客地址

每天只能请求100次….但是LZ这个穷屌丝也买不起服务器,所以就上网查,有什么别的方法可以获取数据,意外之间发现了jsoup这个强大的框架,就花了上午时间学习了一下,然后下午做了一个小Demo,功能比较单一,请见谅。

其实一开始的时候是想 爬今日头条的数据,但是发现数据总是为空,我估计是上锁了… 然后就把矛头转向了 简书,哈哈哈…果然简书就是好,数据直接就可以爬到了, 好开心啊!!

先演示一波动态图:

话说这个布局就花了我半个小时…

一些基础的我就不说了,就简单说明一下我的数据是如何爬到的。可以直接去看一下我的源码,写的比较仓促,一些细节没有处理好,多多指教。

1. 准备

1. 相关资料

官方文档

中文文档

2. 添加依赖

compile 'org.jsoup:jsoup:1.9.2'

3. 打开简书首页

在单个部分上 右击,然后点击检查选项(我用的是QQ浏览器,其他未尝试),底部就会跳出网页的源码,并且会跟踪到这个item对应的源码。

从上图可以大概了解到每个<li></li>标签里的内容就是我们每个item的信息。

2. 爬数据

1. 获取 Document 对象

    Document document = Jsoup.connect("http://www.jianshu.com/").timeout(10000).get();

这里通过建立与服务器的链接,并设置10s的超时连接来获取 Document 对象

2. 获取跟标签的 Elements 对象

Elements noteList = document.select("ul.note-list");
Elements li = noteList.select("li");

找到文章列表模块,发现 <ul class="note-list></ul> 是我们需要信息的跟标签。通过 select 方法查询节点所有信息。

for (Element element : li) {...
}

下面全部都是 li标签的列表,里面的内容大致相似,我们就可以通过循环来遍历里面的信息。

3. 获取每个部分所有信息

因为信息比较多,我就选择比较有代表性的来将一下。

有个非常简单的方式:直接在你需要获取内容的部分右击,点击 检查,就可以直接追踪到要查询的位置。

1. 标题

就拿标题而言,直接在标题右击–>检查,即可,一目了然。然后我把数据截图一下。

String title = element.select("a.title").text()

通过 select 查询节点信息,然后.text 获取里面文本内容。

2. 头像:

String avatar = element.select("a.avatar").select("img").attr("src")

这个就是先找到头像 节点,然后图片节点,最后通过 attr 获取图片 url

3. 首页链接

String authorLink = element.select("a.blue-link").attr("abs:href")

这里注意 href 元素,他存放的就是跳转链接,不过是相对路径,这个时候就需要通过 attr("abs:href") 获取绝对路径。

其他 就 大同小异,其实我知道也就这么多,也是不断尝试通过打印得出来的,还是比较心酸的,比较没学过 js,不过对 js 挺有兴趣的。

3. 封装

剩下的就是将获取到的数据加载到bean对象中

1. 创建 bean 对象

public class JianshuBean {private String authorName;          // 作者private String authorLink;          // 作者链接private String time;                // 更新时间private String primaryImg;          // 主图private String avatarImg;           // 头像private String title;               // 标题private String titleLink;           // 标题链接private String content;             // 内容private String collectionTagLink;   // 专题链接private String readNum;             // 阅读量private String talkNum;             // 评论private String likeNum;             // 喜欢private String collectionTag;       // 专题// ... get set
}

2. 将获取到的数据添加到集合中

for (Element element : li) {JianshuBean bean = new JianshuBean();bean.setAuthorName(element.select("div.name").text()); // 作者姓名bean.setAuthorLink(element.select("a.blue-link").attr("abs:href")); // 作者首页链接bean.setTime(element.select("span.time").attr("data-shared-at"));   // 发表时间bean.setPrimaryImg(element.select("img").attr("src"));  // 主图bean.setAvatarImg(element.select("a.avatar").select("img").attr("src")); // 头像bean.setTitle(element.select("a.title").text());    // 标题bean.setTitleLink(element.select("a.title").attr("abs:href")); // 标题链接bean.setContent(element.select("p.abstract").text());       // 内容bean.setCollectionTagLink(element.select("a.collection-tag").attr("abs:href")); // 专题链接String[] text = element.select("div.meta").text().split(" ");if (text[0].matches("[0-9]+")) {bean.setReadNum(text[0]);bean.setTalkNum(text[1]);bean.setLikeNum(text[2]);} else {bean.setCollectionTag(text[0]);bean.setReadNum(text[1]);bean.setTalkNum(text[2]);bean.setLikeNum(text[3]);}mBeans.add(bean);
}

再来看一下效果:

项目文件截图:

  • 点击头像查看作者信息
  • 点击图片或文字查看文章内容
  • 点击专题查看专题内容
  • 下拉刷新获取最新内容

希望大家多多支持我,谢谢!
jsoup爬虫简书首页数据做个小Demo

代码地址如下:
http://www.demodashi.com/demo/11643.html

注:本文著作权归作者,由demo大师发表,拒绝转载,转载需要作者授权

jsoup爬虫简书首页数据做个小Demo相关推荐

  1. android jsoup简书,jsoup爬虫简书首页数据做个小Demo

    昨天LZ去面试,遇到一个大牛,被血虐一番,发现自己基础还是很薄弱,对java一些原理掌握的还是不够稳固,比如java反射注解,知道一点就是说不出来,很尴尬... 生命不止,学习不止啊 之前那个项目 Q ...

  2. python爬虫抓取分页_Python爬虫—简书首页数据抓取

    简书 本该昨天完成的文章,拖了一天.可能是没休息好吧,昨天的在思路以及代码处理上存在很多问题,废话不多说,我们一起来看一下简书首页数据的抓取. 抓取的信息 2.2)简书首页文章信息 http://ww ...

  3. python生成文章标题_利用简书首页文章标题数据生成词云

    原标题:利用简书首页文章标题数据生成词云 感谢关注天善智能,走好数据之路↑↑↑ 欢迎关注天善智能,我们是专注于商业智能BI,人工智能AI,大数据分析与挖掘领域的垂直社区,学习,问答.求职一站式搞定! ...

  4. 爬虫36计 之 1.2 爬取文章-简书首页推荐文章

    文章目录 爬取文章-简书首页推荐文章 页面分析 页面源码分析 代码编写 获取第一页的内容 解析第一页面的方法:_parse_li() 获取下一页的方法:_handle_next_page() 实例运行 ...

  5. 基于python爬虫的论文标题_Python3实现爬取简书首页文章标题和文章链接的方法【测试可用】...

    本文实例讲述了Python3实现爬取简书首页文章标题和文章链接的方法.分享给大家供大家参考,具体如下: from urllib import request from bs4 import Beaut ...

  6. Node爬取简书首页文章

    Node爬取简书首页文章 博主刚学node,打算写个爬虫练练手,这次的爬虫目标是简书的首页文章 流程分析 使用superagent发送http请求到服务端,获取HTML文本 用cheerio解析获得的 ...

  7. python关键词 打标签详解_Python学习日记13|利用python制作简书首页热门文章关键词标签云...

    今天是6.16号. 昨天去面越秀金融风险控制部计算机实习生,去面了才知道主要也就是做数据抓取这一块.面试过程中有问到分词,然后自己心虚的说了有接触过分词这一块,面试结果就不去想了,过不过都其实不重要了 ...

  8. 简书推荐作者风云榜(爬取简书app数据)

    一.前言 自处女作<爬取张佳玮138w+知乎关注者:数据可视化>一文分布后,来简书快一个月了(20170831).但一直不怎么熟悉这个平台,因此,这回爬取简书app里的推荐作者并进行简单可 ...

  9. sutton 强化学习 中文版pdf_互联网数据驱动力简书-《数据推动力-创造数据文化》免费pdf分享...

    本书介绍 移动网络.5G发展正如火如荼.每年都有大量的会议(Strata +Hadoop World).畅销书(大数据.信息与噪声.精益分析).商业文章(<数据科学家:21世纪最性感的工作> ...

最新文章

  1. 单帧风景照变延时摄影,分分钟搞定,还能有昼夜变化,这是来自日本的开源动画景观算法...
  2. ***必须要掌握的计算机知识
  3. Python数据类型中的字典-创建和基本操作
  4. 数据库系统概论:第十一章 并发控制
  5. Machine Learning - Andrew Ng on Coursera (Week 3)
  6. python 清空所有对象_Python编程思想(7):列表的增删改操作
  7. linux 高级命令
  8. 延边大学c语言题库,延边大学-SPOC官方网站
  9. Wireshark文档阅读笔记-TCP 3 way handshaking解析与实例
  10. 从714里连续减去6减几次得0_小学数学1—6年级基础知识整理 ,预习复习都能用...
  11. 微信小程序“信用卡还款”项目实践
  12. python3 json文件_Python3读写JSON文件
  13. 【性能测试】JSON工具 对比 fastjson jackson
  14. 计算机视觉教程2-2:详解图像滤波算法(附Python实战)
  15. python cv2统一缩放图片尺寸,将透明背景填充白色
  16. 封闭环境下的人性博弈——长文纪念诺兰的蝙蝠侠三部曲
  17. Git提交项目到GitHub完整流程
  18. panda是删除行_pandas删除包含指定内容的行
  19. Linux桌面i3与i7,i3吊打i7?——你所不知的CPU型号后缀的秘密
  20. 《Blockchained On-Device Federated Learning》精读

热门文章

  1. 4.FreeRTOS学习笔记-消息队列
  2. 关于CSplitterWnd类窗口静态分割总结
  3. 计算机游戏动漫制作自我鉴定,动漫设计专业自我鉴定
  4. 内核中的UDP socket流程(3)(4)——sock_create
  5. Django 文件上传与下载的相关问题
  6. 教学计划计算机,计算机教学计划模板
  7. java jobdetail_spring+quartz定时任务配置---JobDetailBean
  8. 【重难点】【分布式 01】RESTful、RPC 对比、Dubbo、Spring Cloud 对比、Eureka、Zookeeper、Consul、Nacos 对比、分布式锁
  9. 【重难点】【Redis 02】Redis 的持久化、Redis 的主从复制和集群、哨兵
  10. windows下使用DOS命令删除大文件