【ClickHouse 技术系列】- ClickHouse 聚合函数和聚合状态

简介:本文翻译自 Altinity 针对 ClickHouse 的系列技术文章。面向联机分析处理(OLAP)的开源分析引擎 ClickHouse,因其优良的查询性能,PB级的数据规模,简单的架构,被国内外公司广泛采用。本系列技术文章,将详细展开介绍 ClickHouse。

前言

本文翻译自 Altinity 针对 ClickHouse 的系列技术文章。面向联机分析处理(OLAP)的开源分析引擎 ClickHouse,因其优良的查询性能,PB 级的数据规模,简单的架构,被国内外公司广泛采用。

阿里云 EMR-OLAP 团队,基于开源 ClickHouse 进行了系列优化,提供了开源 OLAP 分析引擎 ClickHouse 的云上托管服务。EMR ClickHouse 完全兼容开源版本的产品特性,同时提供集群快速部署、集群管理、扩容、缩容和监控告警等云上产品功能,并且在开源的基础上优化了 ClickHouse 的读写性能,提升了 ClickHouse 与 EMR 其他组件快速集成的能力。访问 ClickHouse - E-MapReduce - 阿里云 了解详情。

译者:何源(荆杭),阿里云计算平台事业部高级产品专家

ClickHouse 聚合函数和聚合状态

ClickHouse 可能有一个独特的功能——聚合状态(除了聚合函数外)。你可以参考  和  组合子的文档。

简而言之,许多数据库使用概率数据结构,例如 HyperLogLog(简称 HLL)。它用于唯一/去重计算,你可以在Spark、ElasticSearch、Flink、Postgres、BigQuery 和 Redis 等服务中看到它的效果。但通常你只能在聚合函数中应用此函数一次,例如查询每月唯一用户数——得到一个数字,这样就知足了。由于 HLL 结构没有对应的内部格式,因此无法重用预聚合或部分聚合的数据。而在 ClickHouse 中,你可以这样做,因为 HLL 结构是一致的。

ClickHouse 的速度非常快,其基本思路是处理原始数据而不是预聚合数据。但是让我们做个实验。例如,我们需要为上个月的唯一用户数计算一些指标。

设想:每天预聚合,然后汇总所有结果。这就是所谓的存储空间方法——以后你可以只汇总最后 30 个测量值来计算上个月的统计数据,或者只汇总最后 7 个测量值来计算上周的统计数据。

创建我们的预聚合表:

create table events_unique (date Date, group_id String, client_id String, event_type String, product_id String, value AggregateFunction(uniq, String)
) ENGINE = MergeTree(date, (group_id, client_id, event_type, product_id, date), 8192);

这里将我的聚合声明为 AggregateFunction(uniq, String)。我们关注的是一些独特的指标,这些指标是在 String 列上计算的(为了进一步优化,你可能应该使用 FixedString 或二进制数据)。

让我们将数据插入预聚合表:

INSERT INTO events_unique 
SELECT date, group_id, client_id, event_type, product_id, uniqState(visitor_id) AS value FROM events GROUP BY date, group_id, client_id, event_type, product_id;

进行冒烟测试,确认其可以正常运行:

SELECT uniqMerge(value) FROM events_unique GROUP BY product_id;

现在让我们比较原始表和预聚合表的查询性能。原始查询:

SELECT uniq(visitor_id) AS c FROM events WHERE client_id = ‘aaaaaaaa’ AND event_type = ‘click’ AND product_id = ‘product1’ AND date >= ‘2017–01–20’ AND date < ‘2017–02–20’;┌──────c─┐
│ 457954 │
└────────┘
1 rows in set. Elapsed: 0.948 sec. Processed 13.22 million rows, 1.61 GB (13.93 million rows/s., 1.70 GB/s.)

预聚合表的结果:

SELECT uniqMerge(value) AS c FROM events_unique WHERE client_id = ‘aaaaaaaa’ AND event_type = ‘click’ AND product_id = ‘product1’ AND date >= ‘2017–01–20’ AND date < ‘2017–02–20’;┌──────c─┐
│ 457954 │
└────────┘
1 rows in set. Elapsed: 0.050 sec. Processed 39.39 thousand rows, 8.55 MB (781.22 thousand rows/s., 169.65 MB/s.)

结果表明,我们的处理时间缩短到 1/20。

在实践中,将物化视图与 AggregatingMergeTree 引擎结合使用,会比使用单独的表更方便。

总结

ClickHouse 可让你将聚合状态存储在数据库中,而不仅仅是存储在业务应用中,这有望带来颇具吸引力的性能优化和新用例。有关更多详细信息,请查看关于 AggregatingMergeTree 引擎的丰富文档。

后续

您已经了解了在 ClickHouse 中处理实时更新相关内容,本系列还包括其他内容:

  • 在 ClickHouse 中处理实时更新
  • 使用新的 TTL move,将数据存储在合适的地方
  • 在 ClickHouse 物化视图中使用 Join
  • ClickHouse 聚合函数和聚合状态(本文)
  • ClickHouse 中的嵌套数据结构

原文链接
本文为阿里云原创内容,未经允许不得转载。 

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/news/511807.shtml

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

【ClickHouse 技术系列】- ClickHouse 中的嵌套数据结构

简介&#xff1a;本文翻译自 Altinity 针对 ClickHouse 的系列技术文章。面向联机分析处理&#xff08;OLAP&#xff09;的开源分析引擎 ClickHouse&#xff0c;因其优良的查询性能&#xff0c;PB级的数据规模&#xff0c;简单的架构&#xff0c;被国内外公司广泛采用。本系列技…

太强了!这款开源终端工具可查询 IP 信息~

作者 | JackTian来源 | 杰哥的IT之旅在 Linux 下&#xff0c;有dig、nslookup、traceroute等多种非常实用的网络调试工具。dig&#xff1a;是常用的域名查询工具&#xff0c;可以用来测试域名是否正常。nslookup&#xff1a;是常用的域名查询工具&#xff0c;也就是查 DNS 信息…

顺序写磁盘比随机写内存_深入理解 linux磁盘顺序写、随机写

一、前言随机写会导致磁头不停地换道&#xff0c;造成效率的极大降低&#xff1b;顺序写磁头几乎不用换道&#xff0c;或者换道的时间很短。本文来讨论一下两者具体的差别以及相应的内核调用。二、环境准备三、fio介绍通过fio测试&#xff0c;能够反映在读写中的状态&#xff0…

为余势负天工背,云原生内存数据库Tair助力用户体验优化

简介&#xff1a;作为双11大促承载流量洪峰的利器&#xff0c;Tair支撑了电商交易核心体验场景。不仅在数十亿QPS的峰值下保持着亚毫秒级别的顺滑延迟&#xff0c;同时在电商交易核心体验场景上也做出了技术创新。 作者 | 漠冰 来源 | 阿里技术公众号 作为双11大促承载流量洪峰…

【视频特辑】数据分析师必备,快速制作一张强大好用的大宽表

简介&#xff1a;随着企业数字化进程的逐步推进&#xff0c;在日常经营过程当中会沉淀下越来越多的数据信息。 每当想做数据分析的时候&#xff0c;就会发现想要的指标分散在不同的数据源、数据集、数据表当中。 Quick BI的数据关联功能&#xff0c;可以帮助数据分析师快速将指…

读取硬盘前的准备工作有哪些?

作者 | 闪客sun来源 | 低并发编程读取硬盘数据到内存中&#xff0c;是操作系统的一个基础功能。读取硬盘需要有块设备驱动程序&#xff0c;而以文件的方式来读取则还有要再上面包一层文件系统。把读出来的数据放到内存&#xff0c;就涉及到内存中缓冲区的管理。上面说的每一件事…

【视频特辑】提效神器,如何用Quick BI高效配置员工的用数权限

简介&#xff1a;随着企业数字化进程逐步加速&#xff0c;企业所产生和积累的数据资源日益增多。每当员工的用数权限发生变动&#xff0c;管理员都需要进行复杂繁琐的重复性配置流程&#xff0c;不仅耗时耗力还容易出错。 如何能便捷地对员工用数权限进行高效管理&#xff1f;试…

python苦逼_自学Python编程的第六天(最后代码有更好的请告诉我)----------来自苦逼的转行人...

2019-09-16-23:09:06自学Python的第六天,也是写博客的第六天今天学的内容是有关dict字典的用法看视频加上练习,目前还没遇到有难点,但是感觉很不好的样子没有难点以后突然出现一个有关字典的程序感觉要炸,还是得继续掌握看最后的代码吧,有更好的请告诉我我是一条快乐的分割线一…

让容器跑得更快:CPU Burst 技术实践

简介&#xff1a;让人讨厌的 CPU 限流影响容器运行&#xff0c;有时人们不得不牺牲容器部署密度来避免 CPU 限流出现。我们设计的 CPU Burst 技术既能保证容器运行服务质量&#xff0c;又不降低容器部署密度。CPU Burst 特性已合入 Linux 5.14&#xff0c;Anolis OS 8.2、Aliba…

实时数仓Hologres首次走进阿里淘特双11

简介&#xff1a;这是淘特在阿里巴巴参与的第二个双11大促&#xff0c;大促期间累计超过上千万消费者在此买到心仪的商品&#xff0c;数百万家商家因为淘特而变得不同&#xff0c;未来&#xff0c;淘特也将会继续更好的服务于下沉市场&#xff0c;让惠民走近千万家。 2021年11…

调用某个按钮事件_Event 对象之事件句柄 (Event Handlers)

所谓的Event 对象代表事件的状态&#xff0c;比如事件在其中发生的元素、键盘按键的状态、鼠标的位置、鼠标按钮的状态。事件通常与函数结合使用&#xff0c;函数不会在事件发生前被执行&#xff01;事件句柄HTML 4.0 的新特性之一是能够使 HTML 事件触发浏览器中的行为&#x…

Cluster 集群能支撑的数据有多大?

作者 | 码哥字节来源 | 码哥字节本文将对集群的节点、槽指派、命令执行、重新分片、转向、故障转移、消息等各个方面进行深入拆解。目的在于掌握什么是 Cluster &#xff1f;Cluster 分片原理&#xff0c;客户端定位数据原理、故障切换&#xff0c;选主&#xff0c;什么场景使用…

All in one:如何搭建端到端可观测体系

简介&#xff1a;一文看懂可观测&#xff01; 作者&#xff1a;西杰 & 白玙 可观测的前生今世 系统的可观测与故障可分析作为系统运维中重要的衡量标准&#xff0c;随着系统在架构、资源单位、资源获取方式、通信方式演进过程&#xff0c;遇到了巨大挑战。而这些挑战&am…

链路分析 K.O “五大经典问题”

简介&#xff1a;链路分析是基于已存储的全量链路明细数据&#xff0c;自由组合筛选条件与聚合维度进行实时分析&#xff0c;可以满足不同场景的自定义诊断需求。 作者&#xff1a;涯海 链路追踪的 “第三种玩法” 提起链路追踪&#xff0c;大家会很自然的想到使用调用链排查…

Kubernetes 上容器的启动顺序如何把控?

作者 | AddoZhang来源 | 云原生指北为什么要做容器启动顺序控制&#xff1f;我们都知道 Pod 中除了 init-container 之外&#xff0c;是允许添加多个容器的。类似 TektonCD 中 task 和 step 的概念就分别与 pod 和 container 对应&#xff0c;而 step 是按照顺序执行的。此外还…

input失去焦点验证格式_vue2多文本框的表单校验(3)-失去焦点触发校验

vue2多文本框的表单校验(3)-失去焦点触发校验第一步,在 子组件中blur 事件中派发 blurblur"blur2($event.target.value)" input"inputAction($event.target.value)"v-bind:name"nam" :value"value" class"inf-input" :class…

一文说清linux system load

简介&#xff1a;双十一压测过程中&#xff0c;常见的问题之一就是load 飙高&#xff0c;通常这个时候业务上都有受影响&#xff0c;比如服务rt飙高&#xff0c;比如机器无法登录&#xff0c;比如机器上执行命令hang住等等。本文就来说说&#xff0c;什么是load&#xff0c;loa…

KubeDL 0.4.0 - Kubernetes AI 模型版本管理与追踪

简介&#xff1a;欢迎更多的用户试用 KubeDL&#xff0c;并向我们提出宝贵的意见&#xff0c;也期待有更多的开发者关注以及参与 KubeDL 社区的建设&#xff01; 作者&#xff1a;陈裘凯&#xff08; 求索&#xff09; 前言 KubeDL 是阿里开源的基于 Kubernetes 的 AI 工作负…

上云一时爽,遇坑泪两行

如今&#xff0c;企业的数字化转型进程已经进入了“快车道”&#xff0c;各行各业基于自身业务发展与变革的需要&#xff0c;为整体数字化转型带来了更多要求。企业纷纷依托云原生、低代码、大数据、人工智能等技术手段积极加入这场没有硝烟的战争。 对于传统企业而言&#xf…

读研期间一定得看论文吗_读研期间各阶段的目标和任务,你明确吗?

读研期间一般都要经历上课、论文材料的收集、论文的开题、发表小论文、毕业论文的答辩、找工作或考博士等几个关键环节。在校期间&#xff0c;我们不仅要完成以上的全部工作&#xff0c;还需要不断地学习正确的价值观和人生观&#xff0c;学会科学的思考。如何让自己的研究生生…