Spark Streaming揭秘 Day16 数据清理机制

2024-06-07 17:47:55

Spark Streaming揭秘 Day16

数据清理机制

今天主要来讲下Spark的数据清理机制，我们都知道，Spark是运行在jvm上的，虽然jvm本身就有对象的自动回收工作，但是，如果自己不进行管理的，由于运行过程中大量产生对象，内存很快就会耗尽。我们可以认为数据清理就是SparkStreaming自己的"GC"。

从DStream开始

RDD是在DStream中产生的，RDD的操作也是在DStream中进行的，所以DStream会负责RDD数据的生命周期。

在DStream中，数据保存一般会有三个部分

首先，前面也反复提到，在DStream中，数据会按照Batch Duration保存在generatedRDDs，也会按照Batch Duration来进行删除

其次，如果执行了cache操作，还会产生persist的数据

最后，在Driver上也会有元数据的保存，释放RDD时，也要考虑。

JobGenerator

从上面的描述，我们可以知道数据是按照Batch Duration产生，所以也会按照Batch Duration来进行清理，那么研究数据清理机制，就可以从定期器着手。

在定时器的回调方法中，我们可以很明显的看到数据清理的核心方法ClearMetadata

这个方法，最终会调用DStream上的clearMetadata方法。
我们可以看到，这个方法主要进行三方面清理：
1.将数据从generatedRDDs中移除。
2.先清理cache，再清理block，block清理是调用了spark core的功能。
3.对依赖的DStream也会进行清理。

需要注意的是，在这个方法中，允许自定义rememberDuration，这个参数可以设置为Duration的整数倍，可以支持跨Batch清理。

JobScheduler

最后一个问题，清理是被什么时候触发的？

首先，在JobHandler运行结束时，最后会触发JobCompleted事件。

其中，会调用onBatchCompletion操作。

最终，会执行上述提到的ClearMetadata方法。

至此，我们了解了数据清理的主要流程和逻辑。

欲知后事如何，且听下回分解

DT大数据每天晚上20：00YY频道现场授课频道68917580

转载于:https://www.cnblogs.com/dt-zhw/p/5536482.html

Spark Streaming揭秘 Day16 数据清理机制相关推荐

Spark Streaming揭秘 Day9 从Receiver的设计到Spark框架的扩展
Spark Streaming揭秘 Day9 从Receiver的设计到Spark框架的扩展 Receiver是SparkStreaming的输入数据来源,从对Receiver整个生命周期的设计,我们 ...
Spark Streaming揭秘 Day13 数据安全容错(Driver篇)
Spark Streaming揭秘 Day13 数据安全容错(Driver篇) 书接上回,首先我们要考虑的是在Driver层面,有哪些东西需要维持状态,只有在需要维持状态的情况下才需要容错,总的来说, ...
Spark Streaming揭秘 Day14 State状态管理
Spark Streaming揭秘 Day14 State状态管理今天让我们进入下SparkStreaming的一个非常好用的功能,也就State相关的操作.State是SparkStreaming ...
sparkstreaming监听hdfs目录_大数据系列之Spark Streaming接入Kafka数据
Spark Streaming官方提供Receiver-based和Direct Approach两种方法接入Kafka数据,本文简单介绍两种方式的pyspark实现. 1.Spark Streami ...
SkyWalking 数据清理机制(TTL)
版本:7.0.0 描述通过采样率设置,我们可以配置采样的数据量,如80%,50%等,这样做的目的是避免采集过分多的数据.但是,这样会丢失一些信息,如果恰好我们想查看的数据丢失了,就会导致排查问题难度 ...
spark streaming 接收 kafka 数据java代码WordCount示例
1. 首先启动zookeeper 2. 启动kafka 3. 核心代码生产者生产消息的java代码,生成要统计的单词 package streaming;import java.util.Prope ...
Spark Streaming读取Kafka数据的两种方式
Kafka在0.8和0.10之间引入了一种新的消费者API,因此,Spark Streaming与Kafka集成,有两种包可以选择: spark-streaming-kafka-0-8与spark-s ...
DStream实战之Spark Streaming接收socket数据实现WordCount 31
需求现在想要通过socket发送数据, 然后Spark Streaming接收数据并且统计socket发送的每个单词的个数. 1. 架构图 2. 实现流程安装并启动生产者首先在linux服务器上 ...
Flume+Kafka+Spark Streaming实现大数据实时流式数据采集
近年来,随着企业信息化建设的飞速发展,大数据应用的问题越来越备受关注.很多企业投入大量的人力.物力和财力建设企业大数据平台,平台建设工作涵盖数据采集.数据处理.数据存储.数据服务.数据展示以及数据质量 ...

最新文章

热门文章