搜索资源列表

  1. ShinglingSimhash

    0下载:
  2. 网页查重算法Shingling和Simhash研究.对初学者很有用。-Web search algorithms Shingling and Simhash of weight. Useful for beginners.
  3. 所属分类:数据结构常用算法

    • 发布日期:2024-09-20
    • 文件大小:291840
    • 提供者:fsdaf
  1. BloomFilter

    0下载:
  2. 大型网页去重算法之一,bloomfliter算法,基于shingling算法进行改良,可处理海量网页数据。-One of large Web pages De-emphasis algorithms: bloomfliter algorithm.Based on the shingling algorithm and be improved, which can handle massive web data.
  3. 所属分类:JSP源码/Java

    • 发布日期:2024-09-20
    • 文件大小:1024
    • 提供者:杜骊英
  1. Similar-items-finding

    0下载:
  2. shingling算法实现,比较弱,但是思想是对的,对新手可以有些帮助-shingling algorithm is relatively weak, but the idea is right, can help the novice
  3. 所属分类:JSP源码/Java

    • 发布日期:2024-09-20
    • 文件大小:164864
    • 提供者:zhang
  1. 文件查重

    0下载:
  2. 我使用的是面向局部敏感的最小哈希签名的方法进行文档查重。设计采用了集合的思想,因为是要在一个文件夹中查找相似的文档,决定采用shingling 来表示一篇文档,运用了K-shingles技术,将一篇文档看成是一个字符串,k-shingle就是这篇文档中出现过的任何长度为k的一个字符串,在进行处理之前会去掉文档中不必要的标点符号,空格,和换行。对于k的取值,若是一般的文档则取5就够了,若是文档较长的话取9是相对而言比较安全的。(I use
  3. 所属分类:其他小程序

    • 发布日期:2024-09-20
    • 文件大小:39936
    • 提供者:lala_

源码中国 www.ymcn.org