昨天LZ去面试,遇到一个大牛,被血虐一番,发现自己基础还是很薄弱,对java一些原理掌握的还是不够稳固,比如java反射注解,知道一点就是说不出来,很尴尬... 生命不止,学习不止啊

之前那个项目 QNews 用的是的第三方的数据平台,所以访问次数会有限制,这就很无奈。。。

每天只能请求100次....但是LZ这个穷屌丝也买不起服务器,所以就上网查,有什么别的方法可以获取数据,意外之间发现了jsoup这个强大的框架,就花了上午时间学习了一下,然后下午做了一个小Demo,功能比较单一,请见谅。

其实一开始的时候是想 爬今日头条的数据,但是发现数据总是为空,我估计是上锁了... 然后就把矛头转向了 简书,哈哈哈...果然简书就是好,数据直接就可以爬到了, 好开心啊!! 项目地址

先演示一波动态图:

话说这个布局就花了我半个小时...

一些基础的我就不说了,就简单说明一下我的数据是如何爬到的。可以直接去看一下我的源码,写的比较仓促,一些细节没有处理好,多多指教。

1. 准备

1. 相关资料

2. 添加依赖

compile 'org.jsoup:jsoup:1.9.2'

3. 打开简书首页

在单个部分上 右击,然后点击检查选项(我用的是QQ浏览器,其他未尝试),底部就会跳出网页的源码,并且会跟踪到这个item对应的源码。

从上图可以大概了解到每个

标签里的内容就是我们每个item的信息。

2. 爬数据

1. 获取 Document 对象

Document document = Jsoup.connect("http://www.jianshu.com/")

.timeout(10000)

.get();

这里通过建立与服务器的链接,并设置10s的超时连接来获取 Document 对象

2. 获取跟标签的 Elements 对象

Elements noteList = document.select("ul.note-list");

Elements li = noteList.select("li");

找到文章列表模块,发现

1. 标题

就拿标题而言,直接在标题右击-->检查,即可,一目了然。然后我把数据截图一下。

String title = element.select("a.title").text()

通过 select 查询节点信息,然后.text 获取里面文本内容。

2. 头像:

String avatar = element.select("a.avatar").select("img").attr("src")

这个就是先找到头像 节点,然后图片节点,最后通过 attr 获取图片 url

3. 首页链接

String authorLink = element.select("a.blue-link").attr("abs:href")

这里注意 href 元素,他存放的就是跳转链接,不过是相对路径,这个时候就需要通过 attr("abs:href") 获取绝对路径。

其他 就 大同小异,其实我知道也就这么多,也是不断尝试通过打印得出来的,还是比较心酸的,比较没学过 js,不过对 js 挺有兴趣的。

3. 封装

剩下的就是将获取到的数据加载到bean对象中

1. 创建 bean 对象

public class JianshuBean {

private String authorName; // 作者

private String authorLink; // 作者链接

private String time; // 更新时间

private String primaryImg; // 主图

private String avatarImg; // 头像

private String title; // 标题

private String titleLink; // 标题链接

private String content; // 内容

private String collectionTagLink; // 专题链接

private String readNum; // 阅读量

private String talkNum; // 评论

private String likeNum; // 喜欢

private String collectionTag; // 专题

// ... get set

}

2. 将获取到的数据添加到集合中

for (Element element : li) {

JianshuBean bean = new JianshuBean();

bean.setAuthorName(element.select("div.name").text()); // 作者姓名

bean.setAuthorLink(element.select("a.blue-link").attr("abs:href")); // 作者首页链接

bean.setTime(element.select("span.time").attr("data-shared-at")); // 发表时间

bean.setPrimaryImg(element.select("img").attr("src")); // 主图

bean.setAvatarImg(element.select("a.avatar").select("img").attr("src")); // 头像

bean.setTitle(element.select("a.title").text()); // 标题

bean.setTitleLink(element.select("a.title").attr("abs:href")); // 标题链接

bean.setContent(element.select("p.abstract").text()); // 内容

bean.setCollectionTagLink(element.select("a.collection-tag").attr("abs:href")); // 专题链接

String[] text = element.select("div.meta").text().split(" ");

if (text[0].matches("[0-9]+")) {

bean.setReadNum(text[0]);

bean.setTalkNum(text[1]);

bean.setLikeNum(text[2]);

} else {

bean.setCollectionTag(text[0]);

bean.setReadNum(text[1]);

bean.setTalkNum(text[2]);

bean.setLikeNum(text[3]);

}

mBeans.add(bean);

}

再来看一下效果:

点击头像查看作者信息

点击图片或文字查看文章内容

点击专题查看专题内容

下拉刷新获取最新内容

希望大家多多支持我,谢谢!

android jsoup简书,jsoup爬虫简书首页数据做个小Demo相关推荐

  1. jsoup爬虫简书首页数据做个小Demo

    代码地址如下: http://www.demodashi.com/demo/11643.html 昨天LZ去面试,遇到一个大牛,被血虐一番,发现自己基础还是很薄弱,对java一些原理掌握的还是不够稳固 ...

  2. 【Android】Android开发初学者实现拨打电话的功能,拨打电话app小demo实现

    作者:程序员小冰,GitHub主页:https://github.com/QQ986945193 新浪微博:http://weibo.com/mcxiaobing 首先先给大家看一下最终实现的效果: ...

  3. Android插件化开发之DexClassLoader动态加载dex、jar小Demo

    一.温故动态加载ClassLoader机制 如果对Android的ClassLoader加载机制不熟悉,猛戳Android插件化开发动态加载基础之ClassLoader工作机制 http://blog ...

  4. python爬虫学习(8) —— 关于4399的一个小Demo

    堂弟喜欢各种游戏,在没有网络的情况下,上4399显得很无力. 另外,4399广告好多,,而且加载慢.. 怎么办,,写个爬虫吧,,把4399上的"好玩"游戏爬下来. 1. 分析阶段 ...

  5. 【Android 开发】: Android客户端与服务端之间使用JSON交互数据。

    在前面的两讲中,我们讲解了JSON数据格式的一些基本知识,以及做一些小Demo,这一讲我们在前面的基础上来做一个综合的可扩展的Demo,主要是针对Android客户端解析服务端传递过来的JSON数据. ...

  6. android 模拟滑动app,反编译简书app和小红书app滑动效果sticky粘性头布局的实现CoordinatorLayout+behavior...

    反编译简书app和小红书app滑动效果sticky粘性头布局的实现CoordinatorLayout+behavior 小红书效果: xiaohongshuu.gif 简书效果: jianshug.g ...

  7. Java+Jsoup爬虫小红书

    源码链接:https://pan.baidu.com/s/1oOAxJqSMCyVJPNv-iAYW7A 提取码:1co9 Java+Jsoup爬虫小红书,微博,B站 爬取地址:https://www ...

  8. python爬虫抓取分页_Python爬虫—简书首页数据抓取

    简书 本该昨天完成的文章,拖了一天.可能是没休息好吧,昨天的在思路以及代码处理上存在很多问题,废话不多说,我们一起来看一下简书首页数据的抓取. 抓取的信息 2.2)简书首页文章信息 http://ww ...

  9. 反编译简书app和小红书app滑动效果sticky粘性头布局的实现CoordinatorLayout+behavior

    反编译简书app和小红书app滑动效果sticky粘性头布局的实现CoordinatorLayout+behavior 小红书效果: 简书效果: demo效果图: github地址:https://g ...

最新文章

  1. 【Python】安装配置Anaconda
  2. RabbitMQ系列教程之四:路由(Routing)
  3. spring作业_Spring和石英:多作业计划服务
  4. python定时任务,隔月执行,隔定时执行
  5. (转)淘淘商城系列——商品搜索功能测试
  6. 阶段1 语言基础+高级_1-3-Java语言高级_08-JDK8新特性_第1节 常用函数接口_1_函数式接口的概念函数式接口的定义...
  7. CNN反向传播公式推导
  8. 2019eclipse 中文汉化包 安装教程
  9. 【必看文件含发帖规范】2020年黑马程序员社区总版规发布!
  10. 中国各省市及省会城市名称的由来
  11. 平安科技java机试题_2017年华为优招机试题_平安果_编程题
  12. 计算机课制作海报教案,信息技术作品制作教案
  13. Python | 输出分数形式(Fraction)
  14. IBC和电信管理论坛将在数字转型世界峰会上进行媒体-电信融合项目演示
  15. 【ROS2原理11】C++编程的要点
  16. E.04.08 They Survived Taiwan’s Train Crash. Their Loved Ones Did Not.
  17. 【解决报错问题:selenium.common.exceptions.WebDriverException: Message: An unknown server-side error occurr】
  18. 95后程序员卧底诈骗群只为反诈
  19. 杭电计算机面试都是英语,杭电英语面试问题
  20. Dialog仿iphone风格

热门文章

  1. kubernetes,什么鬼?
  2. 一篇漫画带你了解 Linux 内核长啥样!
  3. Java随机数中的陷阱
  4. go 变量在其中一个函数中赋值 另一个函数_go 学习笔记之仅仅需要一个示例就能讲清楚什么闭包...
  5. mysql dump 影响业务_mysqldump原理3
  6. conv_general_dilated实现
  7. python判断远程文件是否存在
  8. cl: 命令行 error D8021 :无效的数值参数“/Wno-cpp” 和 cl: 命令行 error D8021 :无效的数值参数“/Wno-unused-function”
  9. cuda9.1 tensorflow1.6
  10. Cissp-【第8章 软件开发安全】-2021-3-15(822页-918页)【完】