如何增量导入MYSQL数据库中的数据
来源:互联网 发布:类似于prisma的软件 编辑:程序博客网 时间:2024/05/15 22:36
<dataConfig> <dataSource type="JdbcDataSource" driver="com.mysql.jdbc.Driver" url="jdbc:mysql://127.0.0.1/goods" user="root" password="root"/> <document name="goods"> <entity name="book" transformer="ClobTransformer" pk="bid" query="select bid,bname,author,price,currprice,discount,press,publishtime,edition,pagenum,wordnum, printtime,booksize,paper from t_book" deltaImportQuery ="select * from t_book where bid='${dih.delta.bid}'" deltaQuery = "select bid from t_book where updatetime > '${dih.last_index_time}'"> <field column="bid" name="id" /> <field column="bname" name="bname"/> <field column="author" name="bauthor"/> <field column="price" name="bprice"/> <field column="currprice" name="bcurrprice"/> <field column="discount" name="bdiscount"/> <field column="press" name="bpress"/> <field column="publishtime" name="bpublishtime"/> <field column="edition" name="bedition"/> <field column="pagenum" name="bpagenum"/> <field column="updatetime" name ="bupdatetime" /> </entity> </document> </dataConfig><!--data-config.xml中必要属性的设置transformer 格式转化:HTMLStripTransformer 索引中忽略HTML标签query:查询数据库表符合记录数据deltaQuery:增量索引查询主键ID 注意这个只能返回ID字段 deltaImportQuery:增量索引查询导入的数据 deletedPkQuery:增量索引删除主键ID查询 注意这个只能返回ID字段如果需要关联子表查询,可能需要用到parentDeltaQuery-->
说明:
增量索引的原理是从数据库中根据deltaQuery指定的SQL语句查询出所有需要
增量导入的数据的ID号。
然后根据deltaImportQuery指定的SQL语句返回所有这些ID的数据,即为这
次增量导入所要处理的数据。
核心思想是:通过内置变量“
Solr增量索引配置
一、开始增量索引前的准备工作。
1、认识data-config.xml中相关属性
<!-- transformer 格式转化:HTMLStripTransforme表示 索引中将忽略HTML标签 ---> <!-- query: 查询数据库表符合记录数据 ---> <!-- deltaQuery:增量索引 查询主键ID ---> 注意这个query只返回ID字段 <!-- deltaImportQuery:增量索引 查询导入的数据 ---> <!-- deletedPkQuery:增量索引 删除主键ID查询 ---> 注意这个只返回ID字段
最主要的是我们要知道这样一个事实: last_index_time是DataImportHandler的一个默认字段,(可查看conf目录下的dataimporter.properties文件)
我们可以在任何SQL中引用,该字段用于表明上次做full import或者是delta import(增量导入)的最后一次时间。
2、数据库配置注意事项
1)、如果只涉及添加与修改业务,那么数据库里只需添加一个类型为timpstamp,默认值为当前系统时间的字段 :CURRENT_TIMESTAMP(mysql)
2)、如果还涉及删除业务,那么数据里就需额外再多添加一个字段isdelete,int类型的用0,1来标识,此条记录是否被删除,当然也可以用其他字段标识,ture或false都可以
3、dataimporter.properties / {corename}_dataimporter.properties
在C:\solr-tomcat\solr\item\conf中查看是否存在文件dataimporter.properties,如果没有,则新建该文件。
这个配置文件很重要,它是用来记录索引的最新一次修改时间的,通过该配置文件可以找出新增的、修改的或者删除的记录。相关实例:
<dataConfig> <!--- 此段话配置的是一个MySQL的数据源,(数据源也可以配置在solrconfig.xml中) ---> <dataSource name="activityDB" type="JdbcDataSource" driver="com.mysql.jdbc.Driver" url="jdbc:mysql://localhost/test" user="swang6" password="swang6"/> <document> <entity pk="ID" dataSource="activityDB" name="myentity" query="select * from myentity WHERE is delete=0" deltaQuery="select ID from myentity where my_date >'${dih.last_index_time}'" deletedPkQuery="select ID from myentity where isdelete=1" deltaImportQuery="select * from myentity where ID='${dih.delta.id}"> <!-- ID指定大写的,与上面语句中的对应起来----> <field column="ID" name="id"/> <field column="name" name="name"/> <field column="address" name="address"/> <field column="age" name="age"/> <field column="my_date" name="my_date"/> <field column="isdelete" name="isdelete"/> </entity> </document> </dataConfig>
<!-- pk="ID" 必须,因为其中的增量索引查询主键ID时需要 --> <!-- dataSource="acitvityDB" 这个引用名字是引用上面数据源的名字 --> <!-- name="myentity" 存在多个实体时,这个名字必须唯一 --> <!-- query:用于全量导入而非增量导入 query="select * from myentity WHERE isdelete=0 query查询是指查询出表里所有的符合条件的数据,因为笔者测试的有删除业务,所以 where后面有一个限定条件isdelete=0,意思为查询未被删除的数据 --> <!-- deltaQuery : 用于增量导入且只返回ID deltaQuery="select ID from myentity where my_date > '${dih.last_index_time}'" deltaQuery的意思是,查询出所有经过修改的记录的ID 可能是修改操作,添加操作,删除操作产生的 --> <!-- deletedPkQuery : 用于增量导入且只返回ID deletedPkQuery="select ID from myentity where isdelete=1" 此操作只查询那些数据库里伪删除的数据的ID(即isdelete标识为1的数据) solr通过它来删除索引里面对应的数据 --> <!-- deltaImportQuery: 增量导入起作用,可以返回多个字段的值,一般情况下,都是返回所有字段的列 deltaImportQuery="select * from myentity where ID='${dih.delta.ID}'" deltaImportQuery查询是获取以上两步的ID,然后把其全部数据获取,根据获取的数据 对索引库进行更新操作,可能是删除,添加,修改 -->
注:如果有必要,则可以在schema.xml中添加一个timestamp的field
做了以上配置后,可以设置linux的cron job或者Spring 的TaskSchuduler或者Cron Job后,可以定时发url:
http://localhost:8983/solr/dataimport?command=delta-import去做增量索引。更多关于Solr做增量索引的说明文档:http://wiki.apache.org/solr/DataImportHandler
当然也可以用Solr自带的Scheduler来做增量索引:
http://wiki.apache.org/solr/DataImportHandler#Scheduling
- 如何增量导入MYSQL数据库中的数据
- Solr-6.5.1从mysql数据库增量导入数据
- mysql 增量数据导出导入
- Sqoop1.4.4使用增量导入模式将MySQL数据库中数据导入到HDFS中
- 获取数据库中的增量数据
- mysql数据库中的数据导入sqlite
- 如何将Excel中的数据导入数据库
- 如何把MYSQL中的数据导入EXCEL
- solr全量导入/增量导入mysql的数据
- MySQL 数据库增量数据恢复案例
- MySQL 数据库增量数据恢复案例
- 实战!MySQL 数据库增量数据恢复
- 数据库mysql导入数据
- MySQL如何导入导出数据库、数据库中的表?
- MySQL如何导入数据库
- MYSQL如何导入数据?
- solr增量导入数据
- Sqoop数据增量导入
- MySQL server has gone away
- validation插件
- CodeForces 628A Tennis Tournament
- OpenWrt路由器WIFI开启13信道
- iOS socket
- 如何增量导入MYSQL数据库中的数据
- Swift - whose view is not in the window hierarchy 问题解决方法
- 个性化编译openwrt(编译前更改lan.ipaddr,ssid,timezone,root密码 增加13信道)
- toad
- 详细探究Spark的shuffle实现
- Xcode7及swift2.0更新后toInt()无法使用解决办法
- JSON c语言开发指南
- TQ2440,学习笔记之链接器脚本
- 基于友善之臂ARM-tiny4412--uboot源码分析