HMM算法-viterbi算法的实现及与分词、词性标注、命名实体识别的引用
来源:互联网 发布:系统矩阵不可逆 编辑:程序博客网 时间:2024/05/01 23:28
转自:http://www.hankcs.com/nlp/hmm-and-segmentation-tagging-named-entity-recognition.html
HMM(隐马尔可夫模型)是用来描述隐含未知参数的统计模型,举一个经典的例子:一个东京的朋友每天根据天气{下雨,天晴}决定当天的活动{公园散步,购物,清理房间}中的一种,我每天只能在twitter上看到她发的推“啊,我前天公园散步、昨天购物、今天清理房间了!”,那么我可以根据她发的推特推断东京这三天的天气。在这个例子里,显状态是活动,隐状态是天气。
2014年11月23日更新:
我已利用HMM角色标注实现了中国人名、翻译人名、日本人名、地名、机构名等命名实体的识别,请参考此目录命名实体识别。
HMM描述
任何一个HMM都可以通过下列五元组来描述:
例子描述
这个例子可以用如下的HMM来描述:
求解最可能的天气
求解最可能的隐状态序列是HMM的三个典型问题之一,通常用维特比算法解决。维特比算法就是求解HMM上的最短路径(-log(prob),也即是最大概率)的算法。
稍微用中文讲讲思路,很明显,第一天天晴还是下雨可以算出来:
定义V[时间][今天天气] = 概率,注意今天天气指的是,前几天的天气都确定下来了(概率最大)今天天气是X的概率,这里的概率就是一个累乘的概率了。
因为第一天我的朋友去散步了,所以第一天下雨的概率V[第一天][下雨] = 初始概率[下雨] * 发射概率[下雨][散步] = 0.6 * 0.1 = 0.06,同理可得V[第一天][天晴] = 0.24 。从直觉上来看,因为第一天朋友出门了,她一般喜欢在天晴的时候散步,所以第一天天晴的概率比较大,数字与直觉统一了。
从第二天开始,对于每种天气Y,都有前一天天气是X的概率 * X转移到Y的概率 * Y天气下朋友进行这天这种活动的概率。因为前一天天气X有两种可能,所以Y的概率有两个,选取其中较大一个作为V[第二天][天气Y]的概率,同时将今天的天气加入到结果序列中
比较V[最后一天][下雨]和[最后一天][天晴]的概率,找出较大的哪一个对应的序列,就是最终结果。
这个例子的Python代码:
输出:
NLP应用
具体到分词系统,可以将天气当成“标签”,活动当成“字或词”。那么,几个NLP的问题就可以转化为:
词性标注:给定一个词的序列(也就是句子),找出最可能的词性序列(标签是词性)。如ansj分词和ICTCLAS分词等。
分词:给定一个字的序列,找出最可能的标签序列(断句符号:[词尾]或[非词尾]构成的序列)。结巴分词目前就是利用BMES标签来分词的,B(开头),M(中间),E(结尾),S(独立成词)
命名实体识别:给定一个词的序列,找出最可能的标签序列(内外符号:[内]表示词属于命名实体,[外]表示不属于)。如ICTCLAS实现的人名识别、翻译人名识别、地名识别都是用同一个Tagger实现的。
小结
HMM是一个通用的方法,可以解决贴标签的一系列问题。
自己根据以上内容的一些个人体会:
1、HMM算法是一个D*D*N的问题;
2、前一隐状态的概率全部求出来,根据前一隐状态的概率依次求取后一隐状态的各个概率,后一序列中的每一个状态的最大值作为当前序列隐状态的概率,并记录前一隐状态到当前隐状态的路径,一个动态规划实现最短路径,viterbi算法。基于统计的方法,实现最大概率路径。
建模公式:y为状态(标签),x为显状态(词)一个转移概率矩阵,一个发射概率矩阵。
- HMM算法-viterbi算法的实现及与分词、词性标注、命名实体识别的引用
- 【命名实体识别】HMM-Viterbi角色标注中国人名识别
- 中文词性标注与viterbi算法
- 哈工大ltp,分词,词性标注,命名实体识别技术的特征提取
- HMM的viterbi算法
- nlp-形式语言与自动机-ch07-自动分词、命名实体识别与词性标注
- HMM的Viterbi算法C#实现
- hmm------java代码实现的viterbi算法
- 基于一阶 HMM 标注序列算法的分词算法解析
- HMM的应用与Forward算法、Viterbi算法
- 中文词性标注以及命名实体识别
- 使用Stanford CoreNLP的Python封装包处理中文(分词、词性标注、命名实体识别、句法树、依存句法分析)
- 统计自然语言处理梳理一:分词、命名实体识别、词性标注
- python实现的基于hmm模型的词性标注系统
- 基于一阶HMM的中文词性标注(Java实现)
- 词性标注的python实现-基于平均感知机算法
- 词性标注的python实现-基于平均感知机算法
- 使用隐马尔科夫模型Viterbi算法解决词性标注问题
- iOS App审核 因IPv6遭到拒绝
- golang中sort包用法
- 对象在内存中是如何体现的
- 使用 linux respin 制作自定义 Ubuntu ISO镜像
- 尤其是新手,如何学习一门编程语言
- HMM算法-viterbi算法的实现及与分词、词性标注、命名实体识别的引用
- Kafka集群安装使用
- jsp页面引入本地图片问题
- spark性能优化-基础
- json格式和JavaScript的关系
- scroll、offset和client的区别
- 南阳理工acm37 回文字符串
- 关于InfoPlist的配置
- android导入项目时的错误整理