资源列表
[搜索引擎] Spider-Java
说明:网络爬虫的简要介绍及一点源代码,分享给想要学习爬虫的人-The web crawler brief introduction and point-source code<吴柏秀> 在 2025-01-08 上传 | 大小:13kb | 下载:0
[搜索引擎] NwebCrawler
说明: NwebCrawler是用C#写的一款多线程网络爬虫程序,它的实现原理是先输入一个或多个种子URL到队列中,然后从队列中提取URL(先进先出原则),分析此网页寻找相应标签并获得其href属性值,爬取有用的链接网页并存入网页库中,其中用爬取历史来记录爬过的网页,这样避免了重复爬取。提取URL存入队列中,进行下一轮爬取。所以NwebCrawler的搜索策略为广度优先搜索。采用广度优先策略有利于多个线程并行爬取而且抓取的封闭性很强。-Nwe<sunshine> 在 2025-01-08 上传 | 大小:14kb | 下载:0