SCWS分词学习之一

来源:互联网 发布:淘宝企业店铺运营 编辑:程序博客网 时间:2024/06/15 03:30
 SCWS – 简易中文分词系统

        SCWS 在概念上并无创新成分,采用的是自行采集的词频词典,并辅以一定程度上的专有名称、人名、地名、数字年代等规则集,经小范围测试大概准确率在 90% ~ 95% 之间,已能基本满足一些中小型搜索引擎、关键字提取等场合运用。 SCWS 采用纯 C 代码开发,以 Unix-Like OS 为主要平台环境,提供共享函数库,方便植入各种现有软件系统。此外它支持 GBK,UTF-8,BIG5 等汉字编码,切词效率高。

系统平台:Windows/Unix

开发语言:C

使用方式:PHP扩展

演示网址:http://www.ftphp.com/scws/demo.php

开源官网:http://www.ftphp.com/scws/

晴枫附注:作为PHP扩展,容易与现有的基于PHP架构的Web系统继续集成,是其一大优势。

SCWS(Simple Chinese Words Segmentation 简易中文分词系统)采用了最传统的,基于词频的机械分词算法,它的辞典更新很频繁,最新版本的辞典已经包含了28万的词汇,词库够大,标称速度可以达到1.2MB/s,最重要的是,开源,无授权问题。

由于是C开发的,看着有些繁琐,基本过程是:

(1)加载词库

(2)可选加载规则

(3)分词

原创粉丝点击