传统向量空间模型的缺陷

来源:互联网 发布:c语言中括号 编辑:程序博客网 时间:2024/05/22 05:27

     传统向量空间模型的缺点:

     1、它基于关键字的文档处理方法,依据的是词频信息,两个文档的相似度取决于共同词汇的数量,无法分辨自然语言的语义模糊性。

     2、它假设词与词之间是相互独立的,一个关键字唯一代表一个概念或语义单元,而实际情况是文档存在很多的一词多义和同义词现象,因此这种假设很难满足实际情况。

     3、文档中词与词往往存在一定的关联性,信息检索的本质就是语义的检索,孤立的用关键字来表示文档内容,通过简单的词汇模式匹配进行检索,忽视上下文语境的影响作用,会影响到信息检索的结果的查准率和查全率。