文件名称:文件查重
介绍说明--下载内容均来自于网络,请自行研究使用
我使用的是面向局部敏感的最小哈希签名的方法进行文档查重。设计采用了集合的思想,因为是要在一个文件夹中查找相似的文档,决定采用shingling 来表示一篇文档,运用了K-shingles技术,将一篇文档看成是一个字符串,k-shingle就是这篇文档中出现过的任何长度为k的一个字符串,在进行处理之前会去掉文档中不必要的标点符号,空格,和换行。对于k的取值,若是一般的文档则取5就够了,若是文档较长的话取9是相对而言比较安全的。(I used a locally sensitive minimum Hashi signature method for document retrieval. The design uses a collection of ideas, because it is to find a similar document in a folder, decided to use shingling to represent a document, using K-shingles technology, a document as a string of any length is k-shingle in this document as a string of K, in before processing will remove punctuation, unnecessary document spaces and newlines. For the value of K, if the general document is 5 enough, if the document is longer, it is relatively safe to take 9.)
相关搜索: 文档查重
(系统自动生成,下载前可以参看下载内容)
下载文件列表
文件名 | 大小 | 更新时间 |
---|---|---|
文件查重 | ||
文件查重\物联1401-陈淑芳-201408080123.docx | 42759 | 2017-05-11 |