SCWS分词学习之一
来源:互联网 发布:淘宝企业店铺运营 编辑:程序博客网 时间:2024/06/15 03:30
SCWS – 简易中文分词系统
SCWS 在概念上并无创新成分,采用的是自行采集的词频词典,并辅以一定程度上的专有名称、人名、地名、数字年代等规则集,经小范围测试大概准确率在 90% ~ 95% 之间,已能基本满足一些中小型搜索引擎、关键字提取等场合运用。 SCWS 采用纯 C 代码开发,以 Unix-Like OS 为主要平台环境,提供共享函数库,方便植入各种现有软件系统。此外它支持 GBK,UTF-8,BIG5 等汉字编码,切词效率高。
系统平台:Windows/Unix
开发语言:C
使用方式:PHP扩展
演示网址:http://www.ftphp.com/scws/demo.php
开源官网:http://www.ftphp.com/scws/
晴枫附注:作为PHP扩展,容易与现有的基于PHP架构的Web系统继续集成,是其一大优势。
SCWS(Simple Chinese Words Segmentation 简易中文分词系统)采用了最传统的,基于词频的机械分词算法,它的辞典更新很频繁,最新版本的辞典已经包含了28万的词汇,词库够大,标称速度可以达到1.2MB/s,最重要的是,开源,无授权问题。
由于是C开发的,看着有些繁琐,基本过程是:
(1)加载词库
(2)可选加载规则
(3)分词
- SCWS分词学习之一
- scws分词
- SCWS中文分词
- SCWS 中文分词
- scws中文分词组件
- scws中文分词组件
- scws中文分词组件
- scws中文分词组件
- scws中文分词组件
- scws中文分词组件
- 中文分词软件SCWS
- scws 分词简单实例
- SCWS 中文分词
- 中文分词思想scws
- phpcms 安装 SCWS分词扩展
- scws简易中文分词系统
- PHP中文分词扩展 SCWS
- scws的学习笔记
- C#日期控件datetimepicker保存空值方法
- 浅析C++类在内存中分配的大小问题
- ADO.NET中不常用的功能
- ubuntu 10.04 下的crontab学习
- 使用JAVA开发系统托盘程序
- SCWS分词学习之一
- C++简单笔试题
- js获取时间
- 常用maven命令
- Maven编译时跳过Test
- Docbook学习
- sip学习的网页博客
- Linux性能指标
- connect: network is unreachable