参考:elasticsearch中best fields策略dis_max和tie_breaker详解

概念

  • 常规multi-field搜索结果分析

  • dis_max参数设置

一、为帖子数据增加content字段

POST /forum/article/_bulk
{ "update": { "_id": "1"} }
{ "doc" : {"content" : "i like to write best elasticsearch article"} }
{ "update": { "_id": "2"} }
{ "doc" : {"content" : "i think java is the best programming language"} }
{ "update": { "_id": "3"} }
{ "doc" : {"content" : "i am only an elasticsearch beginner"} }
{ "update": { "_id": "4"} }
{ "doc" : {"content" : "elasticsearch and hadoop are all very good solution, i am a beginner"} }
{ "update": { "_id": "5"} }
{ "doc" : {"content" : "spark is best big data solution based on scala ,an programming language similar to java"} }

二、多字段搜索(multi-field搜索)

1、搜索title或content中包含java或solution的帖子

GET /forum/article/_search
{"query": {"bool": {"should": [{ "match": { "title": "java solution" }},{ "match": { "content":  "java solution" }}]}}
}

2、结果分析

期望的排在第一位是doc5,结果是doc2,doc4排在了前面。原因如下:

计算每个document的relevance score的方式是:每个query的分数,乘以matched query数量,除以总query数量

算一下doc4的分数

{ "match": { "title": "java solution" }},针对doc4,是有一个分数的,假设是1.1

{ "match": { "content":  "java solution" }},针对doc4,也是有一个分数的,假设是1.2

所以是两个分数加起来是2.3,matched query数量 = 2,总query数量 = 2,计算的分数就是2.3 * 2 / 2 = 2.3

算一下doc5的分数

{ "match": { "title": "java solution" }},针对doc5,是没有分数的

{ "match": { "content":  "java solution" }},针对doc5,是有一个分数,假设是2.3

matched query数量 = 1,总query数量 = 2,计算的分数就是2.3 * 1 / 2 = 1.15

通过计算发现:doc4两个field匹配到一个关键词,分数反而高,doc5一个field匹配到两个关键词,分数反而低了,这样不符合我们的预期。

三、best fields策略(dis_max参数设置)

best fields策略,就是说,搜索到的结果中,如果某一个field中匹配到了尽可能多的关键词,那么就应被排在前面;而不是尽可能多的field匹配到了少数的关键词排在前面。

dis_max语法,直接取多个query中,分数最高的那一个query的分数即可。

{ "match": { "title": "java solution" }},针对doc4,是有一个分数的,1.1

{ "match": { "content":  "java solution" }},针对doc4,也是有一个分数的,1.2

取最大分数,1.2

{ "match": { "title": "java solution" }},针对doc5,是没有分数的

{ "match": { "content":  "java solution" }},针对doc5,是有一个分数的,2.3

取最大分数,2.3

所以doc5就可以排在更前面的地方,符合我们的需要。

语法:

GET /forum/article/_search
{"query": {"dis_max": {"queries": [{ "match": { "title": "java solution" }},{ "match": { "content":  "java solution" }}]}}
}

另一种写法:结果是一样的。

GET /forum/article/_search
{"query": {"dis_max": {"tie_breaker": 0.7,"boost": 1.2,"queries": [{"bool": {"should": [{"match": {"title": "java solution"}},{"match": {"content": "java solution"}}]}}]}}

tie_breaker的使用原因

dis_max,只是取分数最高的那个query的分数而已,完全不考虑其他query的分数,这种一刀切的做法,可能导致在有其他query的影响下,score不准确的情况,这时为了使用结果更准确,最好还是要考虑到其他query的影响,使用tie_breaker将其他query的分数也考虑进去

tie_breaker参数的意义,将其他query的分数乘以tie_breaker,然后综合考虑后与最高分数的那个query的分数综合在一起进行计算,这样做除了取最高分以外,还会考虑其他的query的分数。tie_breaker的值,设置在在0~1之间,是个小数就行,没有固定的值

elasticsearch中best fields策略dis_max和tie_breaker详解相关推荐

  1. 通过Server 2019中的组策略部署桌面墙纸 详解组策略环回处理

    通过Server 2019中的组策略部署桌面墙纸 https://jingyan.baidu.com/article/3d69c551a338d6b1ce02d715.html 1 2 3 4 5 6 ...

  2. mcrypt cbc php7,PHP7.1中使用openssl替换mcrypt的实例详解

    在php开发中,使用mcrypt相关函数可以很方便地进行AES加.解密操作,但是PHP7.1中废弃了mcrypt扩展,所以必需寻找另一种实现.在迁移手册中已经指出了用openssl代替mcrypt,但 ...

  3. Elasticsearch 多语言及中文分词与检索详解

    文章目录 1. 自然语言与查询 Recall 2. 混合多语言的挑战 3. 分词的挑战 4. 中文分词方法的演变 - 字典法 5. 中文分词方法的演变 - 基于统计法的机器学习算法 6. 中文分词器现 ...

  4. 【夯实Spring Cloud】Spring Cloud中的Eureka服务注册与发现详解

    本文属于[夯实Spring Cloud]系列文章,该系列旨在用通俗易懂的语言,带大家了解和学习Spring Cloud技术,希望能给读者带来一些干货.系列目录如下: [夯实Spring Cloud]D ...

  5. Linux服务端开发——Linux中stat函数和stat命令使用详解

    这篇文章主要介绍了Linux中stat函数和stat命令使用详解,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧 stat函数和s ...

  6. P2P 中的 NAT 穿越(打洞)方案详解

    P2P 中的 NAT 穿越(打洞)方案详解 转载自 : P2P 中的 NAT 穿越(打洞)方案详解 内容概述 P2P 即点对点通信,或称为对等联网,与传统的服务器客户端模式(如下图"P2P ...

  7. oracle中的exists 和 not exists 用法详解

    from:http://blog.sina.com.cn/s/blog_601d1ce30100cyrb.html oracle中的exists 和 not exists 用法详解 (2009-05- ...

  8. R语言中如何计算C-Statistics?几种计算方法详解

    R语言中如何计算C-Statistics?几种计算方法详解 目录 R语言中如何计算C-Statistics? #包导入 #数据加载编码

  9. python中的class怎么用_对python 中class与变量的使用方法详解

    python中的变量定义是很灵活的,很容易搞混淆,特别是对于class的变量的定义,如何定义使用类里的变量是我们维护代码和保证代码稳定性的关键. #!/usr/bin/python #encoding ...

最新文章

  1. Sublime Text使用教程【转】
  2. Java两个列表根据属性去重_java8 如何对list操作 根据某一个字段进行判断去重对另一个字段进行累加 最终返回list?...
  3. ceph常用命令-pool相关命令
  4. java课堂作业(一)
  5. cmd下pip安装mysql_Windows下使用pip安装mysql-python
  6. mysql net 指令_MySQL命令
  7. LinkedList线程安全问题
  8. DevOps:软件架构师行动指南2.2 云的特性
  9. HAL中通过jni调用java方法的问题
  10. InfoGAN 翻译
  11. STM32F103单片机驱动蜂鸣器
  12. 线性代数(一)矩阵和方程组
  13. telegram协议构架能实现朋友圈或者新浪微博功能么?
  14. 微信、tim文件访问失败解决方法
  15. php面向对象之多态
  16. 软件工程项目作业之网上书店项目
  17. 基于docker 搭建Prometheus+Grafana监控
  18. about unit test in android ppt,选修5 unit4Learning about language.ppt
  19. 天下霸图修改_天下霸图2 简单修改心得
  20. cardboard/daydream unity配置

热门文章

  1. c++ 内容检索小程序
  2. python优化、进化算法、启发式算法
  3. 2013acm南京站
  4. Godaddy教程:支付宝/信用卡续费域名(图文)
  5. ndnSIM-2.8 缓存容量设置分析(setCsSize)
  6. 东野圭吾梦幻花读后感_《梦幻花》读后感 东野圭吾 读于2016.11.13
  7. KMM(Kotlin Multiplatform Mobile)环境搭建
  8. 【转载】C#string.Formart的字符串格式化
  9. 【MySQL8入门到精通】基础篇-Windows安装及卸载MySQL
  10. 一台电脑同时访问外网和内网