ES查询流程

在ES中查询分为两类:1.基于文档ID查询,2.按照非文档ID查询。

基于文档id查询

1.基于文档ID查询

当执行如下查询时:

GET /megacorp/employee/1

ES在执行上述查询的具体过程如下:

1、客户端向 Node 1 发送获取请求,此时Node1为协调者节点。
2、协调者节点使用文档的 _id 来确定文档属于分片 0 。分片 0 的副本分片存在于所有节点第的三个节点上。 在这种情况下,它将请求转发到 Node 2 。
3、Node 2 将文档返回给 Node 1 ,然后将文档返回给客户端。
在处理读取请求时,协调结点在每次请求的时候都会通过轮询所有的副本分片来达到负载均衡。在文档被检索时,已经被索引的文档可能已经存在于主分片上但是还没有复制到副本分片。 在这种情况下,副本分片可能会报告文档不存在,但是主分片可能成功返回文档。 一旦索引请求成功返回给用户,文档在主分片和副本分片都是可用的。

按照非文档ID查询

先看一个同时包含分页,排序,字段值过滤的查询流程。
在这里插入图片描述

1.基于其他条件查询

基于其他条件进行文档检索的过程分为:查询和获取。

查询

由于不确定被检索的文档在多个分片中的分布情况,所以会在所有分片上进行文档查询,所以当一个索引的主分片比较多的时候,检索性能反而不高。
具体检索的过程如下:

1.客户端发送检索请求,此时ES集群中的某个节点会接受到这个请求,接受请求的节点,被称为协调者节点,如图中Node1。
2.协调者节点将检索请求发送到所有主分片/从分片上,如图上Node2中的R0和Node3中的R1,各个主从分/从分片在所在节点本地执行检索请求。此时检索的结果仅仅是符合条件的文档ID和对应排序字段的值,默认情况下,这个排序字段为相关性评分_score(评分是在查询的时候计算的)。
3.各个分片所在的节点将检索的结果返回给协调节点。

获取
经过查询过程,协调者节点获得了目标文档的ID和文档中对应的排序字段值。基于这些结果数据,接下来会执行数据获取的操作:
1.协调者节点根据排序逻辑和分页逻辑,从结果集数据中筛选最终需要的文档ID。协调者节点根据结果文档ID,计算出文档所在的分片信息,然后向某个或某些个目标分片(如图中Node1的R0和Node2的R1)发送 multi-get request请求,获取文档的全部信息。
2.目标分片将文档数据返回给协调者节点。
3.协调者节点将获取到的结果文档数据,返回给客户端。
上述取回数据的过程和关系型数据库中的普通索引回表过程类似。

2.深度分页查询问题

在分布式系统中,对于分页查询的场景,我们需要了解一下深度分页的性能问题,这是在分布式系统中,比较常见的一个问题。在讨论深度分页问题前,我们先熟悉一下分布式系统中的分页问题。
分页查询通常会伴随着排序问题,如果不按照某个指标进行排序的话,那么分页就没有意义了,如果不进行排序,那么如何区分第一个和第二页的内容呢?
当向分布式系统提交一个分页查询时,该查询请求会被转发到分布式系统中的各个子节点上,在每个子节点中执行该查询,但是我们需要知道,每个子节点的查询结果只是在该节点上的一个局部结果,并不是全局结果,全局结果是所有子节点查询结果的一个综合结果。只有每个局部结果数据集比较"完整"才能保证全局结果的正确性。
这里的完整怎么理解呢?
假如我们把学生考试成绩存储在一个有3个节点的分布式系统中,此时我们需要获取成绩排名第5到第10的学生信息,那么此时的查询流程如下:
1.每个节点需要查询出当前节点,所拥有数据集中学生成绩排名前10的学生信息。
2.汇总30名学生信息,然后从30名学生中找出考试成绩排名在第5到第10名的6位学生。

这里我们会发现,我们的查询请求只需要6名学生信息,但是查询过程却需要对30名学生信息进行处理。具体可以参考下图:

通过上图我们可以发现,考试成绩排名在第5到第10的6名学生信息,在3个节点中的分布并不是在第5到第10的存储位置,有可能分布在第1到第10的任何位置,所以为了保证全局数据的准确性,每个子节点要获取考试成绩是前10名的 10个学生的信息才可以。
上面的查询需求翻译成查询语句就是:按照考试成绩排序后的学生信息集合中 ,查询从考试成绩第5名开始的后5位学生信息。或者是:在分页大小为5的查询中,获取第2页数据。此时各个子节点需要查询的数据量其实是:pagesize*pagenum
在ES中的查询语句如下:

GET /_search
{"from": 5,"size": 5
}

此时我们在回到上面的问题,在分布式系统中执行深度分页查询时(页码比较大),会导致子节点的系统资源被大量占用,查询性能迅速下降。
实际上, “深分页” 不太符合人的行为。当2到3页过去以后,人会停止翻页,或者改变搜索标准,试想一下你在搜索引擎搜索信息时,通常只会看前2页的搜索结果

3、多个字段查询

当在Elasticsearch中进行多个字段作为条件的查询时,查询的流程如下:
针对一个分片进行理解就好了

  1. 查询语句中包含多个字段的查询条件时,Elasticsearch会使用倒排索引来快速定位匹配的文档。倒排索引是一种以词项为基础的索引结构,它将文档的内容映射到词项上,提供了更高效的文本搜索和检索能力。
  2. Elasticsearch会根据查询条件中的每个字段,独立地在倒排索引中进行匹配。每个字段的匹配结果将返回与之关联的文档集合。注意,这个阶段还会把排序字段返回。
  3. 接下来,Elasticsearch会对每个字段的匹配结果进行交集操作。交集操作将返回同时满足所有字段条件的文档集合。如果存在多个字段的匹配结果,Elasticsearch会使用布尔查询(Boolean Query)来组合这些条件。
  4. 最后,根据查询语句中的排序条件(如果有的话),Elasticsearch会对结果进行排序。排序操作会增加查询的复杂性和计算成本,因此在使用排序功能时应该权衡好性能和需求。

需要注意的是,Elasticsearch中的查询流程可以根据查询语句的具体结构和查询需求进行调整和优化。例如,可以通过使用布尔查询(Boolean Query)来组合多个查询条件,或者使用过滤器(Filter)来优化特定条件的过滤等。
总之,Elasticsearch通过使用倒排索引和布尔查询等机制,可以高效地处理多个字段作为条件的查询请求,并返回满足条件的文档集合。

4、范围查询

Elasticsearch中处理数值范围查询,可以通过使用range查询来实现。range查询允许你指定一个字段的范围条件,并返回符合该条件的文档。
以下是一个示例查询,展示如何使用range查询来处理数值范围:

bash复制代码GET /my_index/_search  
{  "query": {  "range": {  "price": {  "gte": 100,  "lte": 200  }  }  }  
}

上述查询将在名为"my_index"的索引中执行一个范围查询,针对"price"字段的值在100到200之间的文档进行匹配。gte表示大于等于(greater than or equal),lte表示小于等于(less than or equal)。
Elasticsearch会利用倒排索引来快速定位满足条件的文档。对于数值类型的字段,Elasticsearch会将数值映射到倒排索引中,以便进行范围比较。它会查找满足条件的价格词汇,并返回与这些词汇关联的文档集合。

5、排序

般都是首先通过一些条件过滤出一部分的id
再通过文档id查询正排索引,得到排序字段的值,进行排序。或者分组。
特别是分组,甚至不需要读取存储在es中的原,仅通过正排索引就能得到结果
为什么不开启正排索引的字段,无法进行排序
不开启正排索引的字段无法进行排序的原因主要是因为正排索引是用于支持文档内容查找和排序的索引。
正排索引将文档ID与文档内容关联起来,使得可以通过文档ID直接定位到文档内容,从而实现基于文档内容的排序操作。如果未开启正排索引,则无法建立文档ID与文档内容的关联关系,因此无法进行基于文档内容的排序。
如果仅仅通过倒排索引,那么一个索引值首先就会对应多个id,如果要排序,就要全量从磁盘中获取文档的全部数据,那么再进行排序就很困难, 因为数据量很大,很难将数据都放到内存中进行排序。
另外,正排索引的建立和维护相对简单,可以快速响应排序请求,提高查询效率。而如果未开启正排索引,则需要对所有文档进行扫描,效率低下,无法满足实时排序的需求。
总之,为了实现基于文档内容的排序操作,需要开启正排索引。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/news/229236.shtml

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

【注解和反射】--05 反射的性能对比、反射操作泛型和注解

反射 05 性能对比分析 下面对比了通过普通new方式、反射方式及关闭Java语言安全检测的反射方式三种情况下,程序的性能(所需时间)。 package com.duo.reflection;import java.lang.reflect.InvocationTargetException; import java.lang.reflect.Method;//性能测试…

WPF——命令commond的实现方法

命令commond的实现方法 属性通知的方式 鼠标监听绑定事件 行为:可以传递界面控件的参数 第一种: 第二种: 附加属性 propa:附加属性快捷方式

CCNP课程实验-OSPF-CFG

目录 实验条件网络拓朴需求 配置实现基础配置1. 配置所有设备的IP地址 实现目标1. 要求按照下列标准配置一个OSPF网络。 路由协议采用OSPF,进程ID为89 ,RID为loopback0地址。3. R4/R5/R6相连的三个站点链路OSPF网络类型配置成广播型,其中R5路…

springboot使用EasyExcel导出数据

springboot使用EasyExcel导出数据 简介:本文主要描述使用EasyExcel导出数据的简单流程,事实上企业需求一般都比较简单,就是表单数据输出到Excel即可,如果数据量大的话,为了避免占用内存过高或者OOM,使用多…

Android Studio好用的插件推荐

目录 一、插件推荐 二、如何下载 1.点击File—>Settings ​2.点击Plugins然后进行搜索下载 三、Android Studio 模板 一、插件推荐 这个插件可以为您自动生成Parcelable代码。Parcelable是一种用于在Android组件之间传递自定义对象的机制,但手动编写Parcela…

[python]用python获取EXCEL文件内容并保存到DBC

目录 关键词平台说明背景所需库实现过程方法1.1.安装相关库2.代码实现 关键词 python、excel、DBC、openpyxl 平台说明 项目Valuepython版本3.6 背景 在搭建自动化测试平台的时候经常会提取DBC文件中的信息并保存为excel或者其他文件格式,用于自动化测试。本文…

Flowable-源码分析-2启动

引擎启动流程如图 // ProcessEngineFactoryBean.getObjectpublic ProcessEngine getObject() throws Exception {// 如果 processEngine 为空if (processEngine null) {// 初始化表达式管理器initializeExpressionManager();// 初始化事务外部管理initializeTransactionExtern…

Linux---用户相关操作

1. 创建用户 命令说明useradd创建(添加)用户 useradd命令选项: 选项说明-m自动创建用户主目录,主目录的名字就是用户名-g指定用户所属的用户组,默认不指定会自动创建一个同名的用户组 创建用户效果图: 查看所有用户信息的文件效果图: 说明: useradd 命令的使用…

嵌入式中的门电路详讲

NOT门电路 NOT(非门)是数字逻辑电路中的一种基本逻辑门,也称为反相器。它执行的是逻辑非操作,即将输入信号取反。NOT门具有一个输入和一个输出。 A输入,B输出,以下是真值表: A B 0 1 1 0 AND门电路 AND(与门)是数字逻辑电路中的一种基本逻辑门,用于执行逻辑与操作。…

【运维笔记】mvware centos挂载共享文件夹

安装mvware-tools 这里用的centos安装 yum install open-vm-tools 设置共享文件夹 依次点击:选项-共享文件夹-总是启用-添加,安装添加向导操作添加自己想共享的文件夹后。成功后即可在文件夹栏看到自己共享的文件夹 挂载文件夹 临时挂载 启动虚拟机&…

Javaweb考前复习冲刺(不断更新版)

Javaweb考前复习冲刺 第一章: JavaWeb 入门 JavaWeb是指:以Java作为后台语言的项目工程。 javaweb项目创建的过程: 首先集成Tomcat服务器环境新建dynamic web project部署工程运行 路由含义: ​ http://localhost:8080/工程…

Leetcode刷题笔记题解(C++):224. 基本计算器

思路: step 1:使用栈辅助处理优先级,默认符号为加号。 step 2:遍历字符串,遇到数字,则将连续的数字字符部分转化为int型数字。 step 3:遇到左括号,则将括号后的部分送入递归&#x…

一个简单的光线追踪渲染器

前言 本文参照自raytracing in one weekend教程,地址为:https://raytracing.github.io/books/RayTracingInOneWeekend.html 什么是光线追踪? 光线追踪模拟现实中的成像原理,通过模拟一条条直线在场景内反射折射,最终…

秋招上岸记录咕咕咕了。

思考了一下,感觉并没有单独写这样一篇博客的必要。 能够写出来的,一些可能会对人有帮助的东西都做进了视频里面,未来会在blbl发布,目前剪辑正在施工中(?) 另外就是,那个视频里面使…

作为一个的软件测试工程师,想拿到自己想要的薪资,需要具备哪些能力?

如果只是想成为一名低薪的测试工程师,只要掌握功能测试就可以。 但是如果想成为一名高薪的测试工程师,那就要打造你的不可替代性。 可是,你可能会说:“我现在就是个普通职员啊,我就是个普通人,我目前还没有…

前端js实现将异步封装成promise然后用async await转同步

(一)需求背景: 哈喽 大家好啊,今天遇到一个问题,需要将异步请求转换成同步 (二)相关代码: function getInfo() {return new Promise((resolve,reject)> {setTimeout(()> {re…

CSS的基本选择器及高级选择器(附详细示例以及效果图)

Hi i,m JinXiang ⭐ 前言 ⭐ 本篇文章主要介绍HTML中CSS的基础选择及高级选择器(详解)以及部分理论知识 🍉欢迎点赞 👍 收藏 ⭐留言评论 📝私信必回哟😁 🍉博主收将持续更新学习记录获&#xf…

JVM学习之运行时数据区

运行时数据区 概述 内存 内存是非常重要的系统资源,是硬盘和CPU的中间桥梁,承载着操作系统和应用程序的实时运行。JVM内存布局规定了Java在运行过程中内存申请,分配,管理的策略,保证了JVM高效稳定运行。不同的JVM对于…

STL容器之string(上)

目录 什么是STL string类 string类常见接口 string类的常见构造函数 string类对象的容器操作 string类对象的访问及遍历操作 string类对象的修改操作 拓展 从本期开始,我们将正式学习C中的STL,美国的麦克阿瑟将军说过:“C不能没有STL就…

mipi dsi协议DBI/DPI接口

MIPI dsi协议中的DBI/DPI接口主要用于主机和display设备之间的数据传输,说的更通俗一点就是DSI RX控制器和实际的显示面板之间的接口;dsi 协议spec中对DBI/DPI有描述: DSI协议中对DBI 接口模式命名为command mode operation,对DP…