简介:本文翻译自 Altinity 针对 ClickHouse 的系列技术文章。面向联机分析处理(OLAP)的开源分析引擎 ClickHouse,因其优良的查询性能,PB级的数据规模,简单的架构,被国内外公司广泛采用。本系列技术文章,将详细展开介绍 ClickHouse。

前言

本文翻译自 Altinity 针对 ClickHouse 的系列技术文章。面向联机分析处理(OLAP)的开源分析引擎 ClickHouse,因其优良的查询性能,PB 级的数据规模,简单的架构,被国内外公司广泛采用。

阿里云 EMR-OLAP 团队,基于开源 ClickHouse 进行了系列优化,提供了开源 OLAP 分析引擎 ClickHouse 的云上托管服务。EMR ClickHouse 完全兼容开源版本的产品特性,同时提供集群快速部署、集群管理、扩容、缩容和监控告警等云上产品功能,并且在开源的基础上优化了 ClickHouse 的读写性能,提升了 ClickHouse 与 EMR 其他组件快速集成的能力。访问 ClickHouse - E-MapReduce - 阿里云 了解详情。

译者:何源(荆杭),阿里云计算平台事业部高级产品专家

ClickHouse 聚合函数和聚合状态

ClickHouse 可能有一个独特的功能——聚合状态(除了聚合函数外)。你可以参考  和  组合子的文档。

简而言之,许多数据库使用概率数据结构,例如 HyperLogLog(简称 HLL)。它用于唯一/去重计算,你可以在Spark、ElasticSearch、Flink、Postgres、BigQuery 和 Redis 等服务中看到它的效果。但通常你只能在聚合函数中应用此函数一次,例如查询每月唯一用户数——得到一个数字,这样就知足了。由于 HLL 结构没有对应的内部格式,因此无法重用预聚合或部分聚合的数据。而在 ClickHouse 中,你可以这样做,因为 HLL 结构是一致的。

ClickHouse 的速度非常快,其基本思路是处理原始数据而不是预聚合数据。但是让我们做个实验。例如,我们需要为上个月的唯一用户数计算一些指标。

设想:每天预聚合,然后汇总所有结果。这就是所谓的存储空间方法——以后你可以只汇总最后 30 个测量值来计算上个月的统计数据,或者只汇总最后 7 个测量值来计算上周的统计数据。

创建我们的预聚合表:

create table events_unique (date Date, group_id String, client_id String, event_type String, product_id String, value AggregateFunction(uniq, String)
) ENGINE = MergeTree(date, (group_id, client_id, event_type, product_id, date), 8192);

这里将我的聚合声明为 AggregateFunction(uniq, String)。我们关注的是一些独特的指标,这些指标是在 String 列上计算的(为了进一步优化,你可能应该使用 FixedString 或二进制数据)。

让我们将数据插入预聚合表:

INSERT INTO events_unique
SELECT date, group_id, client_id, event_type, product_id, uniqState(visitor_id) AS value FROM events GROUP BY date, group_id, client_id, event_type, product_id;

进行冒烟测试,确认其可以正常运行:

SELECT uniqMerge(value) FROM events_unique GROUP BY product_id;

现在让我们比较原始表和预聚合表的查询性能。原始查询:

SELECT uniq(visitor_id) AS c FROM events WHERE client_id = ‘aaaaaaaa’ AND event_type = ‘click’ AND product_id = ‘product1’ AND date >= ‘2017–01–20’ AND date < ‘2017–02–20’;┌──────c─┐
│ 457954 │
└────────┘
1 rows in set. Elapsed: 0.948 sec. Processed 13.22 million rows, 1.61 GB (13.93 million rows/s., 1.70 GB/s.)

预聚合表的结果:

SELECT uniqMerge(value) AS c FROM events_unique WHERE client_id = ‘aaaaaaaa’ AND event_type = ‘click’ AND product_id = ‘product1’ AND date >= ‘2017–01–20’ AND date < ‘2017–02–20’;┌──────c─┐
│ 457954 │
└────────┘
1 rows in set. Elapsed: 0.050 sec. Processed 39.39 thousand rows, 8.55 MB (781.22 thousand rows/s., 169.65 MB/s.)

结果表明,我们的处理时间缩短到 1/20。

在实践中,将物化视图与 AggregatingMergeTree 引擎结合使用,会比使用单独的表更方便。

总结

ClickHouse 可让你将聚合状态存储在数据库中,而不仅仅是存储在业务应用中,这有望带来颇具吸引力的性能优化和新用例。有关更多详细信息,请查看关于 AggregatingMergeTree 引擎的丰富文档。

后续

您已经了解了在 ClickHouse 中处理实时更新相关内容,本系列还包括其他内容:

  • 在 ClickHouse 中处理实时更新
  • 使用新的 TTL move,将数据存储在合适的地方
  • 在 ClickHouse 物化视图中使用 Join
  • ClickHouse 聚合函数和聚合状态(本文)
  • ClickHouse 中的嵌套数据结构

原文链接
本文为阿里云原创内容,未经允许不得转载。

【ClickHouse 技术系列】- ClickHouse 聚合函数和聚合状态相关推荐

  1. 【ClickHouse 技术系列】- ClickHouse 中的嵌套数据结构

    简介:本文翻译自 Altinity 针对 ClickHouse 的系列技术文章.面向联机分析处理(OLAP)的开源分析引擎 ClickHouse,因其优良的查询性能,PB级的数据规模,简单的架构,被国 ...

  2. 【ClickHouse 技术系列】- 在 ClickHouse 中处理实时更新

    简介:本文翻译自 Altinity 针对 ClickHouse 的系列技术文章.面向联机分析处理(OLAP)的开源分析引擎 ClickHouse,因其优良的查询性能,PB级的数据规模,简单的架构,被国 ...

  3. ClickHouse 聚合函数的执行过程

    基本的概念 Block:数据块,ClickHouse进行数据读.写的基本单元,每一个Block实例,不仅包含数据域,还包含了每个列的meta信息. Chunk:数据块,保存实际数据的单元,Block中 ...

  4. ClickHouse 聚合函数

    count 返回记录条数. 如 SELECT count() FROM table 注:如果求 COUNT(DISTINCT x) ,则使用 uniq 函数 any(x) 返回遇到的第一个值 备注:待 ...

  5. ClickHouse技术分享第二弹(英文讲义)

    前言 以下是今天为公司小伙伴们做的ClickHouse技术分享的讲义.由于PPT太难做了,索性直接用Markdown来写,搭配Chrome上的Markdown Preview Plus插件来渲染,效果 ...

  6. Clickhouse MergeTree系列(Replacing、Summing等)表引擎使用说明

    目录 1. ReplacingMergeTree 1.1 使用场景 1.2 执行SQL 1.3 说明 2. SummingMergeTree 2.1 使用场景 2.2 执行SQL 2.3 说明 2.4 ...

  7. 擎创技术流 | ClickHouse实用工具—ckman教程(7)

    ​ ​一期一会的"ckman"教程又跟大家见面了,本期分享的重点主要针对上期后台陆续收到的问题展开,解答完问题后再带入一些关于"ckman"升级的相关讲解.感兴 ...

  8. 擎创技术流 | ClickHouse实用工具—ckman教程(5)

    哈喽~友友们,又到了一期一会的技术分享时刻了,本期继续以视频形式与大家分享,话不多说,我们直接上干货,建议收藏分享马住 戳↓↓↓链接,一键回看前期内容: 擎创技术流 | ClickHouse实用工具- ...

  9. 擎创技术流 | ClickHouse实用工具—ckman教程(6)

    哈喽~小伙伴们,今天依旧是每一周一期的技术分享~ 关于"ckman"的技术分享已经第6期了,大家是不是跟小编一样收获颇丰?新知识虽然新鲜有趣,但也别忘了回顾旧知识巩固基础噢~↓↓↓ ...

最新文章

  1. 面试官:Java中 serialVersionUID 的作用是什么?举个例子说明
  2. 魔兽War3按键精灵Ⅱ(2012-9-4)
  3. sftp进入指定目录_CentOS7服务搭建----搭建SFTP(安全文件传送协议)服务器
  4. 笔记本显示器仅计算机,将笔记本电脑(仅一个HDMI接口)连接到双屏幕(谨慎使用)的解决方案...
  5. 【数据竞赛】从0梳理1场数据挖掘赛事!
  6. mysql8安装后初始化密码
  7. Exception in thread main java.lang.NullPointerException一例解决
  8. springboot 跨域_SpringBoot跨域加SpringSecurity就失效
  9. php编程模式,PHP编程之-设计模式简单实例
  10. 5.Knockout.Js(自定义绑定)
  11. 游戏筑基开发之C语言编程技巧
  12. Python datetime 格式化字符串:strftime()
  13. go mod tidy报错verifying module: invalid GOSUMDB: malformed verifier id
  14. HTML超链接引用到地图,HTML超链接
  15. Visual Paradigm创建Java类图时如何绘制实线箭头?
  16. python web py入门(3)-模板
  17. 我看考研(一)——为什么考研之考研的理由的重要性
  18. Jenkins定时发布项目
  19. 解析SCUT FIR Pedestrian Dataset数据
  20. 从新版电视剧《笑傲江湖》看到的颠覆思维

热门文章

  1. 删除目录文件html代码,ASP创建目录、删除目录,删除文件代码范例
  2. 动词变名词的变化规则_动词第三人称单数的变化规则及练习(含语音)
  3. mt4 指标 涨跌幅 颜色k线_通达信精选指标——彩色K线指标
  4. netpref 使用_使用PerfView监测.NET程序性能(转发)
  5. 【LeetCode笔记】160. 相交链表(Java、链表)
  6. java支持多线程吗_Java多线程之一
  7. 中国工程院2021年院士增选有效候选人都来自哪些单位?
  8. 定了!这个专业研究生扩招,博士生待遇要提高!已有多所高校新增…
  9. 区块链跟银行有什么关系?
  10. 十大应用在数学的计算机语言