MySql模糊匹配、全文检索、中文分词相关

来源:互联网 发布:华东交大软件学院吧 编辑:程序博客网 时间:2024/05/25 08:12
因为要做一个对数据库进行简单匹配查询的搜索框,所以对 MySql 进行关键字匹配查询作了一些了解。


书上给出的匹配查询一般是这两种。
(1)精确匹配,使用等号(=).
例如:select * from table where item = ‘$value”;


(2)模糊匹配,使用 like ‘%$value%’。


例如:select * from table where item like ‘%$value%’;


在一般情况下,这两种查询就能完成任务了,甚至在使用多个关键字的时候也可以变通地使用 like ‘%$value_A%’ or like ‘%$value_B%’… 这样的组合语句完成,但如果数据库较大,


内容较多的时候就不得不考虑使用全文搜索了,因为使用 like 进行模糊匹配效率十分低下。


而MySQL对“全文搜索(又称:全文索引)”字段做了索引来优化搜索,同时MySQL使用自然语言来智能地对结果评级,以去掉不相关的项目。


“全文搜索”在 MySQL 中是一个 FULLTEXT 类型索引。FULLTEXT 索引用于 MyISAM 表。曾尝试在 InnoDB 表中创建FullText 索引出错。


修改表方法:


所以如果表所用的引擎非 MyISAM 可以先备份 MySql, 然后在 PHPMyAdmin 中使用操作菜单来更改表的引擎为 MyISAM。接下来在需要进行“全文搜索”的字段点击“全文搜索”创建。


如果已经确定了表的引擎是 MyISAM,也可直接在命令行模式下使用以下命令:


ALTER TABLE 表名 ADD FULLTEXT INDEX (表字段);


拥有了数据和索引,就可以使用MySQL的全文搜索了,最简单的“全文搜索”是带有MATCH…AGAINST语句的SELECT查询:


SELECT 表字段 FROM 表名 WHERE MATCH (全文搜索表字段) AGAINST (’搜索字符串’);


更多资料:


不过,MySQL对中文“全文搜索”的支持饱受争议,看这篇讨论( http://topic.csdn.net/t/20050118/19/3735846.html )就知道了,另外也有很多变通的方法,效率应该不会好到哪去。也有


人拿 dvBBS (http://www.phpx.com/happy/viewthread.php?tid=124691) 的实现方法进行了分析 ,这应该才算得是真正意义上的“全文搜索”,因为这些实现方法要考虑“中文分词技术”





当然,也发现了一个国人自己开发的插件[插件一 http://www.hightman.cn/ ][插件二 http://www.chedong.com/tech/lucene.html#demo ][ 插件三 http://www.jesoft.cn/ ],支持中文分


词,如果你不知道什么是中文分词,Google (谷歌)中国的博客网志的这篇《数学之美 系列二 — 谈谈中文分词》http://www.googlechinablog.com/2006/04/blog-post_10.html 可以对它


有个比较清楚的了解。


另外一篇《MYSQL-中文检索匹配与正则表达式》http://blog.chinaunix.net/u1/41728/showart_361500.html 也附上,以备不时之需。


其实我需要使用的查询在用 like 的状况下就能解决掉,因为数据量总体来说不会太大,所以不会出现很大的问题。不过,我还是准备改用“全文搜索”,毕竟功能放在那里。这篇文章中涉


及比较深 入的三篇文章(…插件..、..dvBBS…、…正则表达式…)都没怎么看,还是一句话,用到的时候再翻翻。


另外一个比较奇怪的问题就是,关于MySQL 全文搜索的文章大都是 2005 - 2006 年间的,一篇 2007 年的也没看着,邪乎!


主要参考了以下文章:
http://www.linwan.com/database/7/118546027646510.html
http://publish.it168.com/2005/0921/20050921026101.shtml?positioncode=1546


http://www.googlechinablog.com/2006/04/blog-post_10.html
http://topic.csdn.net/t/20050118/19/3735846.html


http://hi.baidu.com/monobao/blog/item/c561ddea4dd86ed3d539c98f.html 
原创粉丝点击