提出了一种基于网页框架和规则的网页去除噪音的新方法,该方法根据网页中HTML标签将网页分成若干部分,对各个table的长宽比属性进行比较,去掉长宽比很大的部分,并对其余table中的内容进行分析,根据内部是否存在和段落文字有关的标签或等来区分主题内容和噪音内容,在此基础上去除噪音内容。对来自CWT200G语料的132 559个网页进行测试后的结果表明,该方法可以有效地去除网页噪音,使索引文件减少约75%,大大地提高了检索速度,准确度也得到一定提高。 更多 还原 AbstractFilter('ChDivSummary', 'ChDivSummaryMore', 'ChDivSummaryReset'); 关键词: 信息检索;网页噪音;页面框架; 基金资助: 国家自然科学基金资助项目(60373095); 专辑: 信息科技 专题: 互联网技术 分类号: TP393.092 在线公开时间: 2007-11-12(知网平台在线公开时间,不代表文献的发表时间) 观看视频: 手机阅读 原版阅读 CAJ下载 PDF下载 AI 辅助阅读 个人成果免费下载 学位论文投稿 下载:388 页码:276-278 页数:3 大小:182K 相关服务推荐 CNKI学术情报 > 智能审校 > 论文智能排版 > 学术评价支撑平台 > 引文网络 参考文献 引证文献 共引文献 同被引文献 二级参考文献 二级引证文献 相关文献推荐 相似文献 读者推荐 相关基金文献 关联作者 相关视频 批量下载 CAJ下载 PDF下载 原版阅读