基于遗传算法的聚焦爬虫搜索策略

被引:5
作者
曾广朴
范会联
机构
[1] 长江师范学院数学与计算机学院
关键词
聚焦爬虫; 遗传算法; 小生境; 主题相关度;
D O I
暂无
中图分类号
TP391.3 [检索机];
学科分类号
摘要
为了提高聚焦爬虫的搜索效率,提出一种结合内容评价和链接结构搜索策略的优点并利用小生境遗传算法进行全局寻优的搜索策略。改进遗传算子和小生境遗传算法,将待搜索的网页URL作为遗传个体,采用概率变迁规则和小生境淘汰运算引导搜索方向。实验结果证明,与聚焦爬虫的其他实现技术相比,该策略在抓取主题相关网页时具有更高的查准率和查全率。
引用
收藏
页码:167 / 169
页数:3
相关论文
共 5 条