余弦方法计算相似度算法实现
来源:互联网 发布:wlan流量和数据流量 编辑:程序博客网 时间:2024/05/29 06:51
(1)余弦相似性
通过测量两个向量之间的角的余弦值来度量它们之间的相似性。0度角的余弦值是1,而其他任何角度的余弦值都不大于1;并且其最小值是-1。从而两个向量之间的角度的余弦值确定两个向量是否大致指向相同的方向。所以,它通常用于文件比较。
详见百科介绍(点击打开链接)
(2)算法实现的中未使用权重(IDF ---逆文档频率),使用词项的出现次数作为向量空间的值。
import java.util.HashMap;import java.util.Iterator;import java.util.Map;public class SimilarDegreeByCos{/* * 计算两个字符串(英文字符)的相似度,简单的余弦计算,未添权重 */ public static double getSimilarDegree(String str1, String str2) { //创建向量空间模型,使用map实现,主键为词项,值为长度为2的数组,存放着对应词项在字符串中的出现次数 Map<String, int[]> vectorSpace = new HashMap<String, int[]>(); int[] itemCountArray = null;//为了避免频繁产生局部变量,所以将itemCountArray声明在此 //以空格为分隔符,分解字符串 String strArray[] = str1.split(" "); for(int i=0; i<strArray.length; ++i) { if(vectorSpace.containsKey(strArray[i])) ++(vectorSpace.get(strArray[i])[0]); else { itemCountArray = new int[2]; itemCountArray[0] = 1; itemCountArray[1] = 0; vectorSpace.put(strArray[i], itemCountArray); } } strArray = str2.split(" "); for(int i=0; i<strArray.length; ++i) { if(vectorSpace.containsKey(strArray[i])) ++(vectorSpace.get(strArray[i])[1]); else { itemCountArray = new int[2]; itemCountArray[0] = 0; itemCountArray[1] = 1; vectorSpace.put(strArray[i], itemCountArray); } } //计算相似度 double vector1Modulo = 0.00;//向量1的模 double vector2Modulo = 0.00;//向量2的模 double vectorProduct = 0.00; //向量积 Iterator iter = vectorSpace.entrySet().iterator(); while(iter.hasNext()) { Map.Entry entry = (Map.Entry)iter.next(); itemCountArray = (int[])entry.getValue(); vector1Modulo += itemCountArray[0]*itemCountArray[0]; vector2Modulo += itemCountArray[1]*itemCountArray[1]; vectorProduct += itemCountArray[0]*itemCountArray[1]; } vector1Modulo = Math.sqrt(vector1Modulo); vector2Modulo = Math.sqrt(vector2Modulo); //返回相似度return (vectorProduct/(vector1Modulo*vector2Modulo)); } /* * */ public static void main(String args[]) { String str1 = "gold silver truck"; String str2 = "Shipment of gold damaged in a fire"; String str3 = "Delivery of silver arrived in a silver truck"; String str4 = "Shipment of gold arrived in a truck"; String str5 = "gold gold gold gold gold gold"; System.out.println(SimilarDegreeByCos.getSimilarDegree(str1, str2)); System.out.println(SimilarDegreeByCos.getSimilarDegree(str1, str3)); System.out.println(SimilarDegreeByCos.getSimilarDegree(str1, str4)); System.out.println(SimilarDegreeByCos.getSimilarDegree(str1, str5)); }}
- 余弦方法计算相似度算法实现
- 余弦方法计算相似度算法实现
- 余弦方法计算相似度算法--Python实现 Java实现
- tfidf算法+余弦相似度算法计算文本相似度
- java 余弦相似度计算简易实现
- 余弦计算相似度度量
- 余弦计算相似度度量
- 余弦计算相似度度量
- 余弦计算相似度度量
- 余弦计算相似度度量
- TF-IDF提取关键词并用余弦算法计算相似度
- Python简单实现基于VSM的余弦相似度计算
- Java实现余弦定理计算文本相似度
- Java实现余弦定理计算文本相似度
- Python简单实现基于VSM的余弦相似度计算
- Python简单实现基于VSM的余弦相似度计算
- Python简单实现基于VSM的余弦相似度计算
- Python简单实现基于VSM的余弦相似度计算
- iPhone开发 地图线路
- oracle with子句
- 大型网站系统架构分析
- IOS开发NSBundle对象使用详解
- Extjs4 Grid 的详细设置模版
- 余弦方法计算相似度算法实现
- 黑马程序员——day10异常总结
- 【翻译】异常和异常处理(windows平台)
- 摘录的一些 C++ 代码
- windows media player 的详细开发资料
- 根据已知日期计算星期几
- SQL FOREIGN KEY 约束
- 【MFC】打开文件的流程
- 第一个只出现一次的字符