solr 定时全量索引 增量索引与dataimporter.properties 配置
来源:互联网 发布:samba端口 编辑:程序博客网 时间:2024/04/19 14:06
1.在进行增量索引前,首先要弄懂几个必要的属性,以及数据库建表事项,和dataimporter.properties
data-config.xml里面的数据
<!-- transformer 格式转化:HTMLStripTransformer 索引中忽略HTML标签 ---><!-- query:查询数据库表符合记录数据 --->
<!-- deltaQuery:增量索引查询主键ID ---> 注意这个只能返回ID字段
<!-- deltaImportQuery:增量索引查询导入数据 --->
<!-- deletedPkQuery:增量索引删除主键ID查询 ---> 注意这个只能返回ID字段
数据库配置注意事项
1.如果只涉及添加,与修改业务,那么数据库里只需额外有一个timpstamp字段就可以了,默认值为当前系统时间,CURRENT_TIMESTAMP(笔者的数据为mysql的)2.如果还涉及删除业务,那么数据里就需额外再多添加一个字段isdelete,int类型的用0,1来标识,此条记录是否被删除,当然也可以用其他字段标识,ture或false都可以
dataimporter.properties
这个配置文件很重要,它是用来记录当前时间与上一次修改时间的,通过它能够找出,那些,新添加的,修改的,或删除的记录
下面为笔者当时测试时的一个演示,其中添加,修改,删除,都涉及了
<dataConfig> <!--- 此段话配置的是一个MySQL的数据源,(数据源也可以配置在solrconfig.xml中) ---> <dataSource name="mydb" type="JdbcDataSource" driver="com.mysql.jdbc.Driver" url="jdbc:mysql://localhost/test" user="root" password="ninemax"/><document> <!-- 下面分别来介绍属性(如有错误,欢迎指出) --> <!-- pk="ID" 这个很有必要,因为其中的增量索引查询主键ID时需要 --> <!-- dataSource="mydb" 这个引用名字是引用上面数据源的名字 --> <!-- name="myinfo" 这个名字必须唯一,存在多个实体时 --> <!-- query="select * from myinfo WHERE isdelete=0 query查询是指 查询出表里所有的符合条件的数据,因为笔者测试的有删除业务,所以 where 后面有一个限定条件isdelete=0,意思为查询未被删除的数据 (注意这个query查询只对第一次全量导入有作用,对增量导入不起作用) --> <!-- deltaQuery="select ID from myinfo where my_date > '${dataimporter.last_index_time}'" deltaQuery的意思是,查询出所有经过修改的记录的ID 可能是修改操作,添加操作,删除操作产生的 (此查询只对增量导入起作用,而且只能返回ID值) --> <!-- deletedPkQuery="select ID from myinfo where isdelete=1" 此操作值查询那些数据库里伪删除的数据的ID(即isdelete标识为1的数据) solr通过它来删除索引里面对应的数据 (此查询只对增量导入起作用,而且只能返回ID值) --> <!-- deltaImportQuery="select * from myinfo where ID='${dataimporter.delta.ID}'"次查询是获取以上两步的ID,然后把其全部数据获取,根据获取的数据对索引库进行更新操作,可能是删除,添加,修改(此查询只对增量导入起作用,可以返回多个字段的值,一般情况下,都是返回所有字段的列) --> <entity pk="ID" dataSource="mydb" name="myinfo" query="select * from myinfo WHERE isdelete=0 " deltaQuery="select ID from myinfo where my_date > '${dataimporter.last_index_time}'" deletedPkQuery="select ID from myinfo where isdelete=1" deltaImportQuery="select * from myinfo where ID='${dataimporter.delta.ID}'" > <!-- 此条记录有必要说一下,ID指定大写的,与上面语句中的对应起来----> <field column="ID" name="id"/> <field column="name" name="name"/> <field column="address" name="address"/> <field column="age" name="age"/> <field column="my_date" name="my_date"/> <field column="isdelete" name="isdelete"/> </entity> </document> </dataConfig>
dataimporter.properties 配置
参考:官方文档:http://wiki.apache.org/solr/DataImportHandler#Scheduling
googlecode 找到:https://code.google.com/p/solr-dataimport-scheduler/
1.复制solr-4.2.11\solr-4.2.1\dist目录下solr-dataimporthandler-4.2.1.jar 和solr-dataimporthandler-extras-4.2.1.jar到
D:\program\tomcat6\webapps\solr\WEB-INF\lib目录下
2.从https://code.google.com/p/solr-dataimport-scheduler/downloads/list 下载apache-solr-dataimportscheduler-1.0-with-source.jar到
D:\program\tomcat6\webapps\solr\WEB-INF\lib目录下
3.取出apache-solr-dataimportscheduler-1.0-with-source.jar内的dataimport.properties到D:\program\tomcat6\solrapp\solr\conf
conf文件夹是没有的,要新建
4.修改D:\program\tomcat6\webapps\solr\WEB-INF\web.xml,加入
<listener> <listener-class>org.apache.solr.handler.dataimport.scheduler.ApplicationListener</listener-class> </listener>
5.修改dataimport.properties内容:
################################################## ## dataimport scheduler properties ## ################################################### to sync or not to sync# 1 - active; anything else - inactivesyncEnabled=1# which cores to schedule# in a multi-core environment you can decide which cores you want syncronized# leave empty or comment it out if using single-core deployment#syncCores=game,resourcesyncCores=collection1# solr server name or IP address# [defaults to localhost if empty]server=localhost# solr server port# [defaults to 80 if empty]port=8080# application name/context# [defaults to current ServletContextListener's context (app) name]webapp=solr# URL params [mandatory]# remainder of URLparams=/dataimport?command=delta-import&clean=false&commit=true# schedule interval# number of minutes between two runs# [defaults to 30 if empty]interval=1# 重做索引的时间间隔,单位分钟,默认7200,即1天; # 为空,为0,或者注释掉:表示永不重做索引reBuildIndexInterval=2# 重做索引的参数reBuildIndexParams=/dataimport?command=full-import&clean=true&commit=true# 重做索引时间间隔的计时开始时间,第一次真正执行的时间=reBuildIndexBeginTime+reBuildIndexInterval*60*1000;# 两种格式:2012-04-11 03:10:00 或者 03:10:00,后一种会自动补全日期部分为服务启动时的日期reBuildIndexBeginTime=03:10:00
- solr 定时全量索引 增量索引与dataimporter.properties 配置
- Solr全量索引、增量索引和定时增量索引配置
- solr全量索引、增量索引以及定时索引
- solr 定时创建全量索引和增量索引
- [搜索] Solr (三) 全量索引与增量索引
- solr定时增量索引
- solr定时增量索引
- 转:solr 从数据库导入数据,全量索引和增量索引(实例&配置&原理)
- Solr全量索引
- Solr全量索引
- 3.solr5全量索引和增量索引配置
- solr6.0 -MySQL定时增量、全量更新索引
- solr配置增量更新和定时更新数据库索引
- solr 从数据库导入数据,全量索引和增量索引
- solr 从数据库导入数据,全量索引和增量索引
- solr 从数据库导入数据,全量索引和增量索引
- solr配置自动增量更新索引
- solr5全量索引配置
- Linux Shell 简介
- ifconfig 网络配置
- /etc/host.conf 文件内容解析
- linux 中软硬链接文件
- wc 计算命令
- solr 定时全量索引 增量索引与dataimporter.properties 配置
- tar 解压缩命令
- tar解压缩命令
- umask 权限掩码
- file 查看文件类型
- 修改linux最短密码长度
- linux 查看内核版本的几个方法
- fuser 命令
- linux 挂载U盘