python 3.x 结巴(jieba)分词基础知识
来源:互联网 发布:文档电子目录软件 编辑:程序博客网 时间:2024/05/21 09:46
# -*- coding: utf-8 -*-
from __future__ import unicode_literals
import sys
sys.path.append("../")
import jieba
import jieba.posseg
import jieba.analyse
#分词
seg_list = jieba.cut("我来到北京清华大学",cut_all=True)
print("Full Mode:", "/ ".join(seg_list)) #全模式
seg_list = jieba.cut("我来到北京清华大学",cut_all=False)
print("Default Mode:", "/ ".join(seg_list))#精确模式
seg_list = jieba.cut("他来到了网易杭研大厦") #默认是精确模式
print(", ".join(seg_list))
seg_list = jieba.cut_for_search("小明硕士毕业于中国科学院计算所,后在日本京都大学深造") #搜索引擎模式(适用于搜索引擎)
print(", ".join(seg_list))
#添加词典(自定义词典的添加)
jieba.load_userdict("d:/data/dict.txt")
seg_list = jieba.cut("他是创新办主任,也是云计算方面的专家") #默认是精确模式(词典内容:创新办 3 云计算 5 台中 2格式说明:三行两列,且TXT格式必须为utf8)
print(", ".join(seg_list))
#调整词典
print('/'.join(jieba.cut('如果放到post中将出错。', HMM=False)))
jieba.suggest_freq(('中', '将'), True)
print('/'.join(jieba.cut('如果放到post中将出错。', HMM=False)))
print('/'.join(jieba.cut('「台中」正确应该不会被切开', HMM=False)))
jieba.suggest_freq('台中', True)
print('/'.join(jieba.cut('「台中」正确应该不会被切开', HMM=False)))
#关键词提取
s = '''
此外,公司拟对全资子公司吉林欧亚置业有限公司增资4.3亿元,增资后,吉林欧亚置业注册
资本由7000万元增加到5亿元。吉林欧亚置业主要经营范围为房地产开发及百货零售等业务。
目前在建吉林欧亚城市商业综合体项目。2013年,实现营业收入0万元,实现净利润-139.13万元。
'''
for x, w in jieba.analyse.extract_tags(s, topK=20, withWeight=True):
print('%s %s' % (x, w))
#textrank
for x, w in jieba.analyse.textrank(s, withWeight=True):
print('%s %s' % (x, w))
#词性标注
words = jieba.posseg.cut("我爱北京天安门")
for word, flag in words:
print('%s %s' % (word, flag))
#Tokenize
result = jieba.tokenize(u'永和服装饰品有限公司')
for tk in result:
print("word %s\t\t start: %d \t\t end:%d" % (tk[0],tk[1],tk[2]))
result = jieba.tokenize(u'永和服装饰品有限公司', mode='search')
for tk in result:
print("word %s\t\t start: %d \t\t end:%d" % (tk[0],tk[1],tk[2]))
from __future__ import unicode_literals
import sys
sys.path.append("../")
import jieba
import jieba.posseg
import jieba.analyse
#分词
seg_list = jieba.cut("我来到北京清华大学",cut_all=True)
print("Full Mode:", "/ ".join(seg_list)) #全模式
seg_list = jieba.cut("我来到北京清华大学",cut_all=False)
print("Default Mode:", "/ ".join(seg_list))#精确模式
seg_list = jieba.cut("他来到了网易杭研大厦") #默认是精确模式
print(", ".join(seg_list))
seg_list = jieba.cut_for_search("小明硕士毕业于中国科学院计算所,后在日本京都大学深造") #搜索引擎模式(适用于搜索引擎)
print(", ".join(seg_list))
#添加词典(自定义词典的添加)
jieba.load_userdict("d:/data/dict.txt")
seg_list = jieba.cut("他是创新办主任,也是云计算方面的专家") #默认是精确模式(词典内容:创新办 3 云计算 5 台中 2格式说明:三行两列,且TXT格式必须为utf8)
print(", ".join(seg_list))
#调整词典
print('/'.join(jieba.cut('如果放到post中将出错。', HMM=False)))
jieba.suggest_freq(('中', '将'), True)
print('/'.join(jieba.cut('如果放到post中将出错。', HMM=False)))
print('/'.join(jieba.cut('「台中」正确应该不会被切开', HMM=False)))
jieba.suggest_freq('台中', True)
print('/'.join(jieba.cut('「台中」正确应该不会被切开', HMM=False)))
#关键词提取
s = '''
此外,公司拟对全资子公司吉林欧亚置业有限公司增资4.3亿元,增资后,吉林欧亚置业注册
资本由7000万元增加到5亿元。吉林欧亚置业主要经营范围为房地产开发及百货零售等业务。
目前在建吉林欧亚城市商业综合体项目。2013年,实现营业收入0万元,实现净利润-139.13万元。
'''
for x, w in jieba.analyse.extract_tags(s, topK=20, withWeight=True):
print('%s %s' % (x, w))
#textrank
for x, w in jieba.analyse.textrank(s, withWeight=True):
print('%s %s' % (x, w))
#词性标注
words = jieba.posseg.cut("我爱北京天安门")
for word, flag in words:
print('%s %s' % (word, flag))
#Tokenize
result = jieba.tokenize(u'永和服装饰品有限公司')
for tk in result:
print("word %s\t\t start: %d \t\t end:%d" % (tk[0],tk[1],tk[2]))
result = jieba.tokenize(u'永和服装饰品有限公司', mode='search')
for tk in result:
print("word %s\t\t start: %d \t\t end:%d" % (tk[0],tk[1],tk[2]))
阅读全文
0 0
- python 3.x 结巴(jieba)分词基础知识
- python 结巴分词(jieba)学习
- python 结巴分词(jieba)学习
- python 结巴分词(jieba)学习
- python 结巴分词(jieba)学习
- python 结巴分词(jieba)学习
- python 结巴分词(jieba)学习
- python 结巴分词(jieba)学习
- python 结巴分词(jieba)学习
- python 结巴分词(jieba)学习
- python中文分词工具:结巴分词jieba
- jieba(结巴)—— Python 中文分词
- python下结巴分词(jieba)学习笔记
- python结巴分词、jieba加载停用词表
- jieba(结巴)分词种词性简介
- jieba(结巴)分词种词性简介
- jieba(结巴)分词种词性简介
- 搜索引擎–Python下的分词插件 jieba 结巴分词
- DD-WRT路由上配置openvpn
- Error:java.util.concurrent.ExecutionException: com.android.tools.aapt2.Aapt2Exception: AAPT2 error:
- anaconda安装
- python学习之路-函数
- dede织梦系统自定义表单在线报名微信支付功能
- python 3.x 结巴(jieba)分词基础知识
- Webpack使用
- 数据库索引原理理解0
- 归并排序
- 基于jQuery简单实用的Tabs选项卡插件
- ps入门级案例集锦
- JQuery 动画实例:下拉列表框展开收起
- 在ubuntu16.04中安装python3.6.3和pip3.6
- utc date 转 本地时间(java)