梳理es中的几个基本概念
来源:互联网 发布:淘宝买airpods靠谱吗 编辑:程序博客网 时间:2024/05/16 07:33
全文搜索引擎会用某种算法对要建索引的文档进行分析
从文档中提取出若干Token(词元), 这些算法称为Tokenizer(分词器),
这些Token会被进一步处理, 比如转成小写等, 这些处理算法被称为Token Filter(词元处理器), 被处理后的结果被称为Term(词)。
文档中包含了几个这样的Term被称为Frequency(词频)。
引擎会建立Term和原文档的Inverted Index(倒排索引), 这样就能根据Term很快到找到源文档了。
文本被Tokenizer处理前可能要做一些预处理, 比如去掉里面的HTML标记, 这些处理的算法被称为Character Filter(字符过滤器)。
这整个的分析算法被称为Analyzer(分析器)。
0 0
- 梳理es中的几个基本概念
- 梳理es中的几个概念
- Java 入门中的几个基本概念
- ES基本概念
- ES-基本概念
- 第一节 C语言编程中的几个基本概念
- 高性能网络编程中的几个基本概念
- Javascript基本概念梳理
- 聚类分析:基本概念梳理
- 机器学习基本概念梳理
- OpenGL ES基本概念介绍
- OpenGL ES 2.0基本概念
- OpenGL ES基本概念
- OpenGL ES基本概念介绍
- OpenGL ES 2.0基本概念
- OpenGL ES 2.0基本概念
- OpenGL ES基本概念介绍
- OpenGL ES 2.0基本概念
- JavaScript中的hosting机制
- JavaScript作用域
- LeetCode--No.141--Linked List Cycle
- 如何写简单易懂的技术博客
- C++学习笔记:int sprintf ( char * str, const char * format, ... );
- 梳理es中的几个基本概念
- 安卓开发,从相册或者相机中选择一张图片并裁剪,上传和下载。
- 梳理es中的几个概念
- runTime(二)应用 Method Swizzling
- es中的mapping
- 使用Spring框架对接Twitter(二)
- SpringMVC创建用户信息(一)
- SpringMVC日期处理(二)
- SpringMVC错误提示(三)