Hive谓词下推

Hive谓词下推

    • 1、情景描述
    • 2、Hive谓词下推
      • 2.1、什么是谓词下推
      • 2.2、Hive谓词下推
    • 3、谓词下推规则
    • 4、谓词下推场景分析


1、情景描述


在实际数仓开发中,我们经常会遇到多表关联,这个时候就会涉及到where与on的使用

Hive中的where与on在HQL中的区别为:

  • 相同点
    • where与on都是用作筛选条件
  • 不同点
    • on会显示所有匹配条件的值,不匹配条件的数据补NULL;where只显示满足条件的数据
    • on作用不同类型的多表连接时结果不同;where只起连接作用,不同类型的多表连接时结果相同

首先,我们来看一个例子:使用a表最新分区数据关联b表:

写法一:

select * from a join b on a.id=b.id where a.dt='20231101'

写法二:

select * from a join b on a.id=b.id and a.dt='20231101'

写法三:

select * from (select * from a where dt='20231101') t join b on t.id=b.id

三种写法的结果是等同的,也没有问题。如果需要以a表作为主表,关联查询b表,只需要修改连接类型为左外连接就可以了

但三种写法存在效率上的差异!

写法一与写法三都为高效写法,Hive只会取指定分区的数据进行join

写法二则效率较低,Hive先会查出所有数据进行join,然后再去过滤指定分区的数据

这可以通过explain执行计划证明:

图片后面补充


从执行计划可以得出,写法一的分区数据在一开始扫描时候就已经过滤了。而写法二会拿所有的数据进行查询join,最后再进行过滤

这种将过滤表达式提前执行的过程我们称为谓词下推

2、Hive谓词下推

2.1、什么是谓词下推

谓词下推(Predicate Pushdown,PPD)是指将过滤表达式尽可能移动至靠近数据源的位置,以使真正执行时能直接跳过无关的数据。简而言之,就是在合适的场景下,优先执行过滤条件

2.2、Hive谓词下推

在Hive生成物理执行计划中,有一个配置项用于管理谓词下推优化是否开启:

set hive.optimize.ppd=true;

需要注意的是,Hive的PPD控制参数默认开启

3、谓词下推规则


Hive官网谓词下推介绍:https://cwiki.apache.org/confluence/display/Hive/OuterJoinBehavior

基本概念:

  • 保留行表(Preserved Row table): 外连接中的表必须返回所有行。对于左外连接,左表是保留行表;对于右外连接,右表是保留行表;对于全外连接,两个表都是保留行表
  • 空供应表(Null Supplying table): 该表的不匹配行中的列使用空值填充。对于左外连接,左表数据全部返回,左表在右表中无法匹配的数据的列用NULL表示;对于右外连接,刚好相反;对于全外连接,左表和右表都会用NULL来填充无法匹配的数据
  • JOIN中的谓词(During Join predicate): join on子句中的谓词。例如,在R1 join R2 on R1.x = 5中,谓词R1.x = 5是JOIN中的谓词
  • JOIN后的谓词(After Join predicate): where子句中的谓词。例如,在R1 join R2 on R1.m = R2.n where R1.x = 5中,谓词R1.x = 5是JOIN后的谓词

官网对谓词下推规则的概括:

  • 在JOIN期间谓词不能被推过保留行表
  • JOIN后的谓词不能被推过空供应表

总结就是:

  • 保留行表的谓词写在join中不能下推,需要用where
  • 空供应表的谓词写在join后不能下推,需要用on
  • 在join关联情况下,过滤条件无论在join中还是where中谓词下推都生效
  • 在full join关联情况下,过滤条件无论在join中还是where中谓词下推都不生效

因此,可以得到如下谓词下推规则表:

item[inner] joinleft [outer] joinright [outer] joinfull [outer] join
left tableright tableleft tableright tableleft tableright tableleft tableright table
wherePPDPPDPPDNot PPDNot PPDPPDNot PPDPPD
onPPDPPDNot PPDPPDPPDNot PPDNot PPDNot PPD

4、谓词下推场景分析


Hive谓词下推规则表中各场景分析案例详见文章:传送门


本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/news/135110.shtml

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

【ARM Coresight OpenOCD 系列 2 -- OpenOCD 脚本语法详细介绍】

请阅读【ARM Coresight SoC-400/SoC-600 专栏导读】 文章目录 1.1 swj-dp.tcl 介绍1.1.1 source [find target/swj-dp.tcl]1.1.2 swj-dp.tcl catch 命令介绍1.1.3 mem_helper.tcl 文件介绍1.1.4 变量名检查1.1.5 设置大小端模式1.1.6 设置 flash 烧录用到的 ram 空间1.1.7 设置…

一文1700字使用Postman搞定各种接口token实战(建议收藏)

现在许多项目都使用jwt来实现用户登录和数据权限,校验过用户的用户名和密码后,会向用户响应一段经过加密的token,在这段token中可能储存了数据权限等,在后期的访问中,需要携带这段token,后台解析这段token才…

Gradle笔记 四 Gradle的核心 TASK

文章目录 Task任务入门任务的行为任务的依赖方式任务执行常见的任务(*)项目报告相关任务调试相关选项性能选项守护进程选项日志选项其它(*) 任务定义方式任务类型任务的执行顺序动态分配任务任务的关闭与开启任务的超时任务的查找任务的规则任务的 onlyI…

Flutter转换png图片为jpg图片

1.需求 在xxx产品需求中,需要将png图片转为jpg图片。 2.引用库 image: ^4.1.3 Dart图像库提供了以各种图像文件格式加载、保存和操作图像的功能。 该库可以与dart:io和dart:html一起用于命令行、Flutter和web应用程序。 注:4.0是该库先前版本的主要修订…

信息科技风险管理:合规管理、技术防控与数字化

信息科技对金融业务发展所起的作用是举足轻重的。近年来,金融机构在战略规划中相继引入科技引领的概念。作为金融机构信息科技从业人员,我们笃信信息科技是一个非常有用的工具,一个兼具产品思维和管理思维、拥有高质增效能力的工具。 这个工…

Flink之状态管理

Flink状态管理 状态概述状态分类 键控、按键分区状态概述值状态 ValueState列表状态 ListStateMap状态 MapState归约状态 ReducingState聚合状态 Aggregating State 算子状态概述列表状态 ListState联合列表状态 UnionListState广播状态 Broadcast State 状态有效期 (TTL)概述S…

mini-imagenet数据集下载-阿里云网盘不限速下载

mini-imagenet数据集下载-阿里云网盘不限速下载 提取码:m2mk Mini-ImageNet 数据集是 ImageNet 数据集的一个小型子集,用于计算机视觉和深度学习研究。它通常包含一组经过手动筛选和采样的图像,这些图像属于来自 ImageNet 大型数据集的少数类…

电机调速程序

/******************************************************************** * 名称 : 电机调速 * 功能 : 通过P1.0口来控制直流电机的旋转的快慢 /***********************************************************************/ #include <reg52.h> #define uchar unsigned …

换服还是掀桌?哪条才是程序员的出路?

站在时代的风口浪尖&#xff0c;猪都能起飞。 大数据互联网正是时代的宠儿&#xff0c;IT行业的发展也正如火如荼。 人人都眼红程序员的高薪资&#xff0c;认为他们吃着时代的红利。 但是三百六十行&#xff0c;行行出社畜。”996“也好&#xff0c;甚至"007"也罢…

php生成个性二维码

本篇引用 QRcode PHP QR Code download | SourceForge.net 无需composer即可生成 下载后的类文件是一个压缩包&#xff0c;里边包含很多文件和演示demo&#xff0c;我们只需要里的phpqrcode.php这一个文件就可以生成二维码了。它是一个多个类的集合文件&#xff0c;我们只用…

OpenAI开发者大会掀起风暴:GPT模型价格狂降50%,应用商店即将亮相,AI技术将引爆全球!

OpenAI首届开发者大会召开了&#xff01; 关键信息&#xff1a; GPT-4升级版GPT-4 Turbo来了&#xff0c;上下文窗口达到128k&#xff0c;为GPT-4的4倍&#xff1b;OpenAI还降低了几乎所有模型的API使用价格&#xff0c;整体便宜了一半多&#xff1b;GPT-4系列的多模态能力向B…

竞赛选题 深度学习手势识别 - yolo python opencv cnn 机器视觉

文章目录 0 前言1 课题背景2 卷积神经网络2.1卷积层2.2 池化层2.3 激活函数2.4 全连接层2.5 使用tensorflow中keras模块实现卷积神经网络 3 YOLOV53.1 网络架构图3.2 输入端3.3 基准网络3.4 Neck网络3.5 Head输出层 4 数据集准备4.1 数据标注简介4.2 数据保存 5 模型训练5.1 修…

ZYNQ_project:key_beep

通过按键控制蜂鸣器工作。 模块框图&#xff1a; 时序图&#xff1a; 代码&#xff1a; /*1位按键消抖 */ module key_filter (input wire sys_clk ,input wire sys_rst_n ,input wire key_in ,output …

LightDB23.4 支持普通表修改为list分区表

功能介绍 为了兼容Oracle数据库的功能&#xff0c;在LightDB23.4版本上支持修改普通表为List分区表。这个功能只在LightDB的Oracle兼容模式下生效。 使用示例 进入Oracle兼容模式的数据库 lightdboracle_test# show lightdb_dblevel_syntax_compatible_type ;lightdb_dblev…

AM@向量代数@向量基本概念和向量线性运算

文章目录 abstract向量的基本概念向量向量的坐标分解式和坐标&#x1f47a;向量的模向量的长度(大小)&#x1f47a;零向量单位向量&#x1f47a;方向向量非零向量的单位向量正规化向量夹角&#x1f47a; 向量方向角和向量间夹角投影几何描述向量的线性运算向量的加减运算向量的…

Linux中固定ip端口和修改ip地址

一&#xff0c;更改虚拟网络编辑器 1&#xff0c;首先启动VMware&#xff0c;选择自己要更改ip或固定ip的虚拟机&#xff0c;并找到虚拟网络配编辑器&#xff0c;点击进入 2&#xff0c;进入之后需要点击右下角获取管理员权限后才能修改&#xff0c;有管理员权限之后图片如下 …

C++笔记

模板 &#xff08;泛型编程&#xff09; 函数模板 语法&#xff1a; template <typename 形参名&#xff0c;typename 形参名&#xff0c;......> 返回类型 函数名(参数列表) {函数体 }定义函数模板时typename关键字可以替换成class&#xff0c;效果一样。 template&l…

技术分享 | app自动化测试(Android)--元素定位方式与隐式等待

元素定位是 UI 自动化测试中最关键的一步&#xff0c;假如没有定位到元素&#xff0c;也就无法完成对页面的操作。那么在页面中如何定位到想要的元素&#xff0c;本小节讨论 Appium 元素定位方式。 Appium的元素定位方式 定位页面的元素有很多方式&#xff0c;比如可以通过 I…

python使用selenium做自动化,最新版Chrome与chromedriver不兼容

目前Chrome版本是118.0.5993.118 下方是版本对应的下载地址&#xff1a; chrome版本118&#xff1a; https://download.csdn.net/download/qq_35845339/88510476 chrome版本119&#xff1a; chromedriverlinux64https://edgedl.me.gvt1.com/edgedl/chrome/chrome-for-testin…

各种NoSQL数据库

NoSQL数据库是一类非关系型数据库&#xff0c;它们在数据存储和检索方面与传统的关系型数据库不同。不同类型的NoSQL数据库适用于不同的使用场景&#xff0c;因为它们具有各自的特点。以下是一些主要类型的NoSQL数据库及其特性和使用场景&#xff1a; 键值存储数据库 代表性数据…