ScholarMate
客服热线:400-1616-289

面向BitTorrent种子文件获取的网络爬虫技术研究

苏马婧; 叶麟; 史建焘
中国知网
-

摘要

分析了当前主题爬虫在面向BT种子文件获取应用上存在的问题,从提高BT种子获取速率、提高覆盖率和降低种子获取延时的角度出发,提出了基于Hash的去重机制,给出了爬虫自动登录的实现方法,设计了AJAX页面解析引擎,提出批量抓取和增量抓取相结合的数据抓取机制、历史数据和更新数据相结合的数据存储机制。通过设计并实现一个基于爬虫方式的BT种子文件获取系统证明了这几种方法能使系统整体性能平均提高30%~50%。这些技术和方法也可应用于其他主题爬虫。

关键词

BitTorrent BT种子爬虫 去重机制 自动登录 AJAX解析 BitTorrent Torrent Crawler Duplicate Deletion Automatic Login AJAX Parsing