中文分词工具

1、NLPIR分词系统（又名ICTCLAS)

http://ictclas.nlpir.org/

中国科学院计算技术研究所在多年研究工作积累的基础上，研制出了汉语词法分析系统ICTCLAS(Institute of Computing Technology, Chinese Lexical Analysis System)，主要功能包括中文分词；词性标注；命名实体识别；新词识别；同时支持用户词典。

2、开源 Java 中文分词器 Ansj

https://github.com/ansjsun/ansj_seg

Ansj 是一个开源的 Java 中文分词工具，基于中科院的 ictclas 中文分词算法，比其他常用的开源分词工具（如mmseg4j）的分词准确率更高。可用于人名识别、地名识别、组织机构名识别、多级词性标注、关键词提取、指纹提取等领域，支持行业词典、用户自定义词典。

3、mmseg4j

http://blog.chenlb.com/2013/01/mmseg4j-1-9-0-release-support-solr-lucene-4.html

mmseg4j是mmseg的Java版本，用Chih-Hao Tsai 的MMSeg算法实现的中文分词器，并实现lucene的analyzer和solr的TokenizerFactory以方便在Lucene和Solr中使用。 MMSeg 算法有两种分词方法：Simple和Complex，都是基于正向最大匹配。Complex加了四个规则过虑。

原载: 蜗牛博客

网址: http://www.snailtoday.com/

发表评论

蜗牛之路

最新

暧昧帖

发表评论点击这里取消回复。

最新

推荐

暧昧帖

发表评论 点击这里取消回复。

发表评论点击这里取消回复。