基于支持向量机的PU中文文本分类器构建

被引:8
作者
王宗尧 [1 ]
刘金岭 [2 ]
机构
[1] 淮阴工学院管理工程学院
[2] 淮阴工学院计算机与软件工程学院
关键词
支持向量机; PU分类; 文本分类; 正例; 可信反例;
D O I
10.14132/j.cnki.1673-5439.2015.06.015
中图分类号
TP391.1 [文字信息处理];
学科分类号
摘要
在PU文本分类中,针对文本分类中可信反例获取困难,使文本分类器性能低下的问题,提出了一种基于支持向量机的PU文本分类器的构建。该方法采用改进的特征词权值提取方法进行特征词提取,利用OBPCZ算法从未标识文本数据集中尽可能多地移除正例,从而获得更多的可信反例。结合支持向量机和改进的Rocchio构建了高效的文本分类器。实验表明,该方法比目前其它的面向PU学习的文本分类方法具有更高的分类质量。
引用
收藏
页码:100 / 105
页数:6
相关论文
共 12 条
  • [1] 基于降维的短信文本语义分类及主题提取
    刘金岭
    [J]. 计算机工程与应用, 2010, 46 (23) : 159 - 161+174
  • [2] 基于语义信息的中文短信文本相似度研究
    刘金岭
    宋连友
    范玉虹
    [J]. 计算机工程, 2012, 38 (13) : 58 - 60+70
  • [3] 一种基于聚类的PU主动文本分类方法
    刘露
    彭涛
    左万利
    戴耀康
    [J]. 软件学报, 2013, 24 (11) : 2571 - 2583
  • [4] Building text classifiers using positive and unlabeled examples. Liu,Bing,,Yang Dai,Xiaoli Li,Wee Lee,Philip S. Yu. Proceedings of the 3rd IEEE International Conference on Data Mining . 2003
  • [5] A novel reliable negative method based on clustering for learning from positive and unlabeled examples. Zhang BZ,Zuo WL. Proc.of the AIRS 2008 . 2008
  • [6] Learning to Classify Texts Using Positive and Unlabeled Data. X. Li,,B. Liu. Proceedings of the 18th International Joint Conference on Artificial Intelligence . 2003
  • [7] Estimating the support of a high-dimensional distribution. Scholkopf B,platt J C,shawe-Taylor J,et al. Technical Report MSR-TR-99-87, Microsoft Research . 1999
  • [8] Text classification from positive and unlabeled examples. Denis F R,Gilleron M. IPMU . 2002
  • [9] On-line learning for active pattern recognition. Park, Jong-Min,Hu, Yu Hen. IEEE Signal Processing Letters . 1996
  • [10] SVM based adaptive learning method for text classification from positive and unlabeled documents
    Peng, Tao
    Zuo, Wanli
    He, Fengling
    [J]. KNOWLEDGE AND INFORMATION SYSTEMS, 2008, 16 (03) : 281 - 301