基于统计分布与集合论的文本分类方法

被引：2

作者：

邓擘

樊孝忠

杨立公

机构：

[1] 北京理工大学计算机科学技术学院

来源：

北京理工大学学报 | 2006年 / 07期

基金：

高等学校博士学科点专项科研基金;

关键词：

文本分类; 特征词; 词频; 文本频; 统计分布;

D O I：

10.15918/j.tbit1001-0645.2006.07.007

中图分类号：

TP391.1 [文字信息处理];

学科分类号：

081203 ; 0835 ;

摘要：

指出基于TfIdf的常用文本特征提取方法在文本分类问题中的缺陷,进而提出使用特征词的分布状态、词频和文本频三者相结合的方式提取文本特征的观点,给出了计算特征词权重的新方法,提出了新的文本分类方法.试验表明,该方法能够最大限度保留文本的特征,并且可有效避免向量空间模型中的维数灾难问题,能应用于大规模文本分类.

引用

页码：589 / 592+597 +597

页数：5