Solr部署配置(二)中文分词设置
来源:互联网 发布:雅思写作书籍推荐知乎 编辑:程序博客网 时间:2024/05/01 01:29
一、IKAnalyzer
1、把IKAnalyzer4.0.jar,IKAnalyzer.cfg,stopword.dic放到solr目录下的lib中
2、schema.xml文件中添加
<!-- IKAnalyzer --><fieldType name="text_ik" class="solr.TextField" > <analyzer class="org.wltea.analyzer.lucene.IKAnalyzer"/> <!-- <analyzer type="index"> <tokenizer class="org.wltea.analyzer.solr.IKTokenizerFactory" isMaxWordLength="false"/> <filter class="solr.StopFilterFactory" ignoreCase="true" words="stopwords.txt"/> <filter class="solr.WordDelimiterFilterFactory" generateWordParts="1" generateNumberParts="1" catenateWords="1" catenateNumbers="1" catenateAll="0" splitOnCaseChange="1"/> <filter class="solr.LowerCaseFilterFactory"/> <filter class="solr.EnglishPossessiveFilterFactory" protected="protwords.txt"/> <filter class="solr.RemoveDuplicatesTokenFilterFactory"/> </analyzer> <analyzer type="query"> <tokenizer class="org.wltea.analyzer.solr.IKTokenizerFactory" isMaxWordLength="false"/> <filter class="solr.StopFilterFactory" ignoreCase="true" words="stopwords.txt"/> <filter class="solr.WordDelimiterFilterFactory" generateWordParts="1" generateNumberParts="1" catenateWords="1" catenateNumbers="1" catenateAll="0" splitOnCaseChange="1"/> <filter class="solr.LowerCaseFilterFactory"/> <filter class="solr.EnglishPossessiveFilterFactory" protected="protwords.txt"/> <filter class="solr.RemoveDuplicatesTokenFilterFactory"/> </analyzer> --></fieldType>
solr配置字段
<dynamicField name="*_ik_s" type="text_ik" indexed="true" stored="true"/>
二、mmseg4j
与solr4结合有问题,实验中只有一个doc进行了分词,查文档需改源码,暂时放弃使用
1、将mmseg4j-all-1.9.0.jar拷贝到solr目录下的lib目录,注:1.9.0版本为与solr4.0适应版本,但依然存在兼容性问题,可从wiki的issue中找到解决方法及jar包
2、在$SOLR_HOME下建立dic目录,将data里的.dic文件拷贝到dic目录
3、solrconfig.xml文件中添加
<fieldType name="text_mmseg" class="solr.TextField" positionIncrementGap="100"> <analyzer> <tokenizer class="com.chenlb.mmseg4j.solr.MMSegTokenizerFactory" mode="complex" dicPath="dic" /> <filter class="solr.LowerCaseFilterFactory"/> </analyzer></fieldType>
- Solr部署配置(二)中文分词设置
- Solr学习(二)-- 配置中文分词
- solr配置中文分词
- solr-中文分词配置
- solr 配置中文分词
- Solr 6.6.0 中文分词 (二)
- Solr学习(二)为Solr加入中文分词器
- Solr中文分词配置(IKAnalyzer)
- solr配置中文分词器
- Solr 配置中文分词smartcn
- solr配置ik中文分词
- solr 中文分词器配置
- solr配置中文分词器
- Solr中文分词配置(IKAnalyzer)
- Solr配置中文分词器
- 【solr】Solr中文分词配置(IKAnalyzer)
- (二)solr-4.5.1中文分词器(IK-Analyzer)配置
- Apache Solr 4.9 和 IKAnalyzer中文分词配置(上)
- u_boot 的构建和并烧写到开发板
- java中关键字volatile的作用
- Linux下的wget命令
- C++ primer第一章习题
- 常用的.htaccess的配置
- Solr部署配置(二)中文分词设置
- 1.1 最长平台
- c# 测试IP是否连通
- 操作系统_再识(kobject,kset,子系统层次结构)
- 用tftp的方式在u_boot下 烧写uImage内核
- OperationalError: FATAL: Ident authentication failed for user “postgres”
- 安全运营(SOC)概述
- 关于list容器与vector容器中的erase操作
- 操作系统_再识(linux设备管理文件系统-devfs与udev)