一、概述

需求:

  最近在做一个新闻项目,有这样一个需求,如下:

  1. 用户根据视频内容手动创建标签,标签个数不限
  2. 在视频详情页提供根据标签推荐视频功能,即按本视频的标签进行搜索,标签匹配多的排在前面,匹配少的排在后面
 
经过分析、调研,以单字段存储标签,尝试了下面的几种方案,这里一并写出
不可行方案:
  1. 字段为keyword类型,数据以数组存储,未找到可实现此功能的检索方式
  2. 字段为text类型,多个标签以空格隔开或者数组存储,使用match搜索,数据评分不准确
  3. 字段为text类型,多个标签以空格隔开或者数组存储,使用match结合match_phrase搜索,数据评分扔不准确
可行方案:

1. 字段为text类型,指定分词器为whitespace,以空格分隔标签

"mediaTag" : {
"type" : "text",
"analyzer": "whitespace"
}

2. 字段为text类型,指定分词器为pattern,指定标签分隔字符,以逗号分隔

PUT /es_medias_test2
{
"settings": {
"analysis": {
"analyzer": {
"comma": {  //自定义分词器名称
"type": "pattern",
"pattern": ","
}
}
}
},
"mappings": {
"esmedias": {
"properties": {
"mediaTag": {
"type": "text",
"analyzer": "comma"
}
}
}
}
}

二、可行方案测试(以可行方案一为例)

2. 创建索引
PUT /es_medias_test2
{
"settings": {
"index": {
"number_of_shards": "1",
"number_of_replicas": "0"
}
},
"mappings": {
"esmedias": {
"properties": {
"mediaTag" : {
"type" : "text",
"analyzer": "whitespace"
}
}
}
}
}
2. 添加数据
POST /es_medias_test2/_bulk
{"create":{"_index":"es_medias_test2","_type":"esmedias","_id":"o3kyp3YB_f4AQBwwbA7Q"}}
{"mediaTag":"美国 英国"}
{"create":{"_index":"es_medias_test2","_type":"esmedias","_id":"lHk0p3YB_f4AQBwwvxBz"}}
{"mediaTag":"英国 美国"}
{"create":{"_index":"es_medias_test2","_type":"esmedias","_id":"-Xk1p3YB_f4AQBwwNRBt"}}
{"mediaTag":"美国 法国 英国"}
{"create":{"_index":"es_medias_test2","_type":"esmedias","_id":"AXlYp3YB_f4AQBww9zDT"}}
{"mediaTag":"china 美国 英国"}
{"create":{"_index":"es_medias_test2","_type":"esmedias","_id":"13k1p3YB_f4AQBwwBxDw"}}
{"mediaTag":"美国 英国 士大夫"}
{"create":{"_index":"es_medias_test2","_type":"esmedias","_id":"PXk1p3YB_f4AQBwwfxGI"}}
{"mediaTag":"美国"}
{"create":{"_index":"es_medias_test2","_type":"esmedias","_id":"G3k1p3YB_f4AQBwwahEM"}}
{"mediaTag":"英国 船"}
{"create":{"_index":"es_medias_test2","_type":"esmedias","_id":"G3lap3YB_f4AQBwwNTEX"}}
{"mediaTag":"china 美国"}
{"create":{"_index":"es_medias_test2","_type":"esmedias","_id":"FXlLp3YB_f4AQBwwUCRf"}}
{"mediaTag":"china 美国 法国"}
 
4. 测试
GET /es_medias_test2/_search
{
"query": {
"match": {
"mediaTag": "美国 英国"
}
}
}

返回结果符合预期

{
  "took" : 1,
  "timed_out" : false,
  "_shards" : {
    "total" : 1,
    "successful" : 1,
    "skipped" : 0,
    "failed" : 0
  },
  "hits" : {
    "total" : 10,
    "max_score" : 1.8475795,
    "hits" : [
      {
        "_index" : "es_medias_test2",
        "_type" : "esmedias",
        "_id" : "-Xk1p3YB_f4AQBwwNRBt",
        "_score" : 1.8475795,
        "_source" : {
          "mediaTag" : "美国 法国 英国"
        }
      },
      {
        "_index" : "es_medias_test2",
        "_type" : "esmedias",
        "_id" : "FXlLp3YB_f4AQBwwUCRf",
        "_score" : 1.5141833,
        "_source" : {
          "mediaTag" : "china 美国 法国"
        }
      },
      {
        "_index" : "es_medias_test2",
        "_type" : "esmedias",
        "_id" : "o3kyp3YB_f4AQBwwbA7Q",
        "_score" : 0.66557413,
        "_source" : {
          "mediaTag" : "美国 英国"
        }
      },
      {
        "_index" : "es_medias_test2",
        "_type" : "esmedias",
        "_id" : "xXkyp3YB_f4AQBwwpw6Y",
        "_score" : 0.66557413,
        "_source" : {
          "mediaTag" : "美国 英国"
        }
      },
      {
        "_index" : "es_medias_test2",
        "_type" : "esmedias",
        "_id" : "lHk0p3YB_f4AQBwwvxBz",
        "_score" : 0.66557413,
        "_source" : {
          "mediaTag" : "英国 美国"
        }
      },
      {
        "_index" : "es_medias_test2",
        "_type" : "esmedias",
        "_id" : "13k1p3YB_f4AQBwwBxDw",
        "_score" : 0.5578373,
        "_source" : {
          "mediaTag" : "美国 英国 士大夫"
        }
      },
      {
        "_index" : "es_medias_test2",
        "_type" : "esmedias",
        "_id" : "AXlYp3YB_f4AQBww9zDT",
        "_score" : 0.39778596,
        "_source" : {
          "mediaTag" : "china,美国 英国"
        }
      },
      {
        "_index" : "es_medias_test2",
        "_type" : "esmedias",
        "_id" : "G3k1p3YB_f4AQBwwahEM",
        "_score" : 0.39778596,
        "_source" : {
          "mediaTag" : "英国 船"
        }
      },
      {
        "_index" : "es_medias_test2",
        "_type" : "esmedias",
        "_id" : "PXk1p3YB_f4AQBwwfxGI",
        "_score" : 0.33188638,
        "_source" : {
          "mediaTag" : "美国"
        }
      },
      {
        "_index" : "es_medias_test2",
        "_type" : "esmedias",
        "_id" : "G3lap3YB_f4AQBwwNTEX",
        "_score" : 0.26778817,
        "_source" : {
          "mediaTag" : "china 美国"
        }
      }
    ]
  }
}


最新文章

  1. RAC异机恢复
  2. storm入门(二):关于storm中某一段时间内topN的计算入门
  3. hdu.1254.推箱子(bfs + 优先队列)
  4. SAP 系统管理内容
  5. mysql 触发器的使用(备忘)
  6. java 乱码详解_jsp中pageEncoding、charset=UTF -8"、request.setCharacterEncoding("UTF-8")
  7. PIE使用阴影后的背景透明方法
  8. 【Scala】Scala之Methods
  9. 《Thinking in Java》 And 《Effective Java》啃起来
  10. [算法&数据结构]深度优先搜索(Depth First Search)
  11. 【Topcoder 8572】TheLuckySum
  12. k64 datasheet学习笔记50---GPIO
  13. sublime text 中 .vue文件中的scss语法无法高亮bug怎么解决
  14. tile38 一款开源的geo 数据库
  15. linux 如何删除文件夹下面的文件和文件夹,只保留两个文件
  16. android touch事件分发流程
  17. B. Eight Point Sets
  18. 【转载】Apache Jena TDB CRUD operations
  19. 字符串的公共前缀对Mysql B+树查询影响回溯分析
  20. jenkins job构建后汇总结果到同一个文本文档中去

热门文章

  1. CentOS6.5&7更改开机启动时的CentOS标题
  2. PHP后台基本语法使用笔记
  3. 以前一个个文件删数据的我,今天终于找到了释放C盘空间的办法
  4. C#Excel导出注意事项
  5. go语言数据类型值--整型和浮点型
  6. python之Bug之字符串拼接bug
  7. spring + quartz 分布式自定义注解
  8. Python中排序方法sort、函数sorted的key参数的作用分析
  9. 剑指offer二刷——数组专题——斐波那契数列
  10. 【题解】The Last Hole! [CF274C]