基于DOM模型扩展的Web信息提取

被引：18

作者：

顾韵华

田伟

机构：

[1] 南京信息工程大学计算机与软件学院

来源：

计算机科学 | 2009年 / 36卷 / 11期

关键词：

文档对象模型; Web信息提取; 影响度因子; DOM树扩展;

D O I：

暂无

中图分类号：

TP391.1 [文字信息处理];

学科分类号：

081203 ; 0835 ;

摘要：

提出了一种基于DOM模型扩展的Web信息提取方法。将Web页面表示为DOM树结构,对DOM树结点进行语义扩展并计算其影响度因子,依据结点的影响度因子进行剪枝,进而提取Web页面信息内容。该方法不要求对网页的结构有预先认识,具有自动和通用的特点。提取结果除可以直接用于Web浏览外,还可用于互联网数据挖掘、基于主题的搜索引擎等应用中。

引用

页码：235 / 237+289 +289

页数：4

共 6 条

[1] 基于Web部件的个性化网站创建技术 [J].