Elasticsearch的scroll(游标)的使用技巧
zhezhongyun 2025-09-06 16:07 11 浏览
1. 介绍
1.1 介绍
我们都知道使用ES搜索文档的时候可以通过from和size进行文档数据的“翻页”处理,但是如果你的索引里面的文档超过了10000个的话,再使用这样的方式去实现数据翻页就会得到如下的错误:
Result window is too larg e, from + size must be less than or equal to: [10000] but was [11000]
意思是说from + size的和不能超过10000,这下麻烦了~~
2. 原因
原来这个from和size的设计初衷是为了适应那种类似某度、某歌那样的网页搜索引擎的,而那种搜索引擎的结果集一般情况下不会有人想去看10000条以后的文档的,所以设计from + size是完全够用的。
但是作为一般系统的全文搜索引擎的应用场景这10000的上限显然是不合理的,福哥通过查询官方文档发现了一个专门用来做数据翻页的功能——scroll,ES官方设计了这个scroll功能可以针对查询结果进行数据翻页。
需要注意的是,如果我们的使用情况是类似某度、某歌那样的搜索引擎的话,还是使用from + size效率更高哦~~
3. 终端
3.1 Curl
使用Curl实现scroll比较直观,我们通过查询用户索引tfapi_utf8users来给大家演示如何使用scroll进行分页。
3.1.1 data.json
这是查询的数据,福哥放到了一个data.json文件里面。
{
"query": {
"match": {
"mName": "同福"
}
},
"size": 2
}
3.1.2 scroll_id
提交查询并且拿到scroll_id,这个scroll_id要在查询下一页的时候使用的。
curl -X POST -H 'Content-Type: application/json' -d '@data.json' 'http://localhost:9200/tfapi_utf8users/_search?scroll=1m&pretty=true'
3.1.3 scroll
现在我们通过scroll_id去翻页下一部分内容。
{
"scroll": "1m",
"scroll_id": "DnF1ZXJ5VGhlbkZldGNoBQAAAAAAO4uKFnNpWFlnVF9GUjVlRmxSMHIzSFBDencAAAAAADuLixZzaVhZZ1RfRlI1ZUZsUjByM0hQQ3p3AAAAAAA7i4wWc2lYWWdUX0ZSNWVGbFIwcjNIUEN6dwAAAAAAO4uNFnNpWFlnVF9GUjVlRmxSMHIzSFBDencAAAAAADuLjhZzaVhZZ1RfRlI1ZUZsUjByM0hQQ3p3"
}
可以看到ES返回了下一页的结果了!
需要注意的是,我们每次查询下一页的时候都需要从上一页结果里面获取最新的scroll_id而不能始终使用第一页结果里面的scroll_id,直到查不到文档为止。
4. PHP
4.1 elasticsearch-php
使用elasticsearch-php库实现scroll功能,elasticsearch-php库提供了scroll方法,可以先通过search方法获得第一个scroll_id,然后循环用scroll方法查询后面的数据。
$builder = \Elasticsearch\ClientBuilder::create();
$builder->setHosts(array("127.0.0.1:9200"));
$client = $builder->build();
// query
$resp = $client->search(array(
'index' => "tfapi_utf8users",
'scroll'=>"1m",
'size'=>2,
'body' => array(
'query' => array(
'match' => array(
'mName' => "同福"
)
)
)
));
// cycle to scroll
while(isset($resp['hits']['hits'])
&& is_array($resp['hits']['hits'])
&& count($resp['hits']['hits']) > 0){
// data
foreach($resp['hits']['hits'] as $item){
}
// scroll next
$scrollId = $resp['_scroll_id'];
$resp = $client->scroll(array(
'scroll_id'=>$scrollId,
'scroll'=>"1m",
));
}
5. 注意事项
5.1 文档数量size
根据官方的说法,虽然我们设置了size参数规定了每次返回结果集的数量,但是实际的返回结果有可能会超过这个size规定的数量。
5.2 跳页
根据scroll的工作方式我们可以知道,如果文档数量很多,然后用户想要直接翻到第n页的话,我们也只能一页一页的滚动过去。
显然这不是一个很好的方案,也就是说它并不能实现传统意义上的数据翻页功能,类似MySQL的limit功能或者MongoDB的skip()+limit()功能。
6. 总结
今天福哥带着童鞋们针对使用ES搭建的搜索引擎功能实现查询结果的数据翻页的技巧做了一个系统的学习,相信大家在自己开发全文搜索功能的时候就会有感觉了~~
https://m.tongfu.net/home/35/blog/513351.html
相关推荐
- perl基础——循环控制_principle循环
-
在编程中,我们往往需要进行不同情况的判断,选择,重复操作。这些时候我们需要对简单语句来添加循环控制变量或者命令。if/unless我们需要在满足特定条件下再执行的语句,可以通过if/unle...
- CHAPTER 2 The Antechamber of M de Treville 第二章 特雷维尔先生的前厅
-
CHAPTER1TheThreePresentsofD'ArtagnantheElderCHAPTER2TheAntechamber...
- CHAPTER 5 The King'S Musketeers and the Cardinal'S Guards 第五章 国王的火枪手和红衣主教的卫士
-
CHAPTER3TheAudienceCHAPTER5TheKing'SMusketeersandtheCardinal'SGuard...
- CHAPTER 3 The Audience 第三章 接见
-
CHAPTER3TheAudienceCHAPTER3TheAudience第三章接见M.DeTrévillewasatt...
- 别搞印象流!数据说明谁才是外线防守第一人!
-
来源:Reddit译者:@assholeeric编辑:伯伦WhoarethebestperimeterdefendersintheNBA?Here'sagraphofStea...
- V-Day commemorations prove anti-China claims hollow
-
People'sLiberationArmyhonorguardstakepartinthemilitaryparademarkingthe80thanniversary...
- EasyPoi使用_easypoi api
-
EasyPoi的主要特点:1.设计精巧,使用简单2.接口丰富,扩展简单3.默认值多,writelessdomore4.springmvc支持,web导出可以简单明了使用1.easypoi...
- 关于Oracle数据库12c 新特性总结_oracle数据库12514
-
概述今天主要简单介绍一下Oracle12c的一些新特性,仅供参考。参考:http://docs.oracle.com/database/121/NEWFT/chapter12102.htm#NEWFT...
- 【开发者成长】JAVA 线上故障排查完整套路!
-
线上故障主要会包括CPU、磁盘、内存以及网络问题,而大多数故障可能会包含不止一个层面的问题,所以进行排查时候尽量四个方面依次排查一遍。同时例如jstack、jmap等工具也是不囿于一个方面的问题...
- 使用 Python 向多个地址发送电子邮件
-
在本文中,我们将演示如何使用Python编程语言向使用不同电子邮件地址的不同收件人发送电子邮件。具体来说,我们将向许多不同的人发送电子邮件。使用Python向多个地址发送电子邮件Python...
- 提高工作效率的--Linux常用命令,能够决解95%以上的问题
-
点击上方关注,第一时间接受干货转发,点赞,收藏,不如一次关注评论区第一条注意查看回复:Linux命令获取linux常用命令大全pdf+Linux命令行大全pdf为什么要学习Linux命令?1、因为Li...
- linux常用系统命令_linux操作系统常用命令
-
系统信息arch显示机器的处理器架构dmidecode-q显示硬件系统部件-(SMBIOS/DMI)hdparm-i/dev/hda罗列一个磁盘的架构特性hdparm-tT/dev/s...
- 小白入门必知必会-PostgreSQL-15.2源码编译安装
-
一PostgreSQL编译安装1.1下载源码包在PostgreSQL官方主页https://www.postgresql.org/ftp/source/下载区选择所需格式的源码包下载。cd/we...
- Linux操作系统之常用命令_linux系统常用命令详解
-
Linux操作系统一、常用命令1.系统(1)系统信息arch显示机器的处理器架构uname-m显示机器的处理器架构uname-r显示正在使用的内核版本dmidecode-q显示硬件系...
- linux网络命名空间简介_linux 网络相关命令
-
此篇会以例子的方式介绍下linux网络命名空间。此例中会创建两个networknamespace:nsa、nsb,一个网桥bridge0,nsa、nsb中添加网络设备veth,网络设备间...
- 一周热门
- 最近发表
-
- perl基础——循环控制_principle循环
- CHAPTER 2 The Antechamber of M de Treville 第二章 特雷维尔先生的前厅
- CHAPTER 5 The King'S Musketeers and the Cardinal'S Guards 第五章 国王的火枪手和红衣主教的卫士
- CHAPTER 3 The Audience 第三章 接见
- 别搞印象流!数据说明谁才是外线防守第一人!
- V-Day commemorations prove anti-China claims hollow
- EasyPoi使用_easypoi api
- 关于Oracle数据库12c 新特性总结_oracle数据库12514
- 【开发者成长】JAVA 线上故障排查完整套路!
- 使用 Python 向多个地址发送电子邮件
- 标签列表
-
- HTML 教程 (33)
- HTML 简介 (35)
- HTML 实例/测验 (32)
- HTML 测验 (32)
- JavaScript 和 HTML DOM 参考手册 (32)
- HTML 拓展阅读 (30)
- HTML文本框样式 (31)
- HTML滚动条样式 (34)
- HTML5 浏览器支持 (33)
- HTML5 新元素 (33)
- HTML5 WebSocket (30)
- HTML5 代码规范 (32)
- HTML5 标签 (717)
- HTML5 标签 (已废弃) (75)
- HTML5电子书 (32)
- HTML5开发工具 (34)
- HTML5小游戏源码 (34)
- HTML5模板下载 (30)
- HTTP 状态消息 (33)
- HTTP 方法:GET 对比 POST (33)
- 键盘快捷键 (35)
- 标签 (226)
- HTML button formtarget 属性 (30)
- opacity 属性 (32)
- transition 属性 (33)