• 中国计算机学会会刊
  • 中国科技核心期刊
  • 中文核心期刊

J4 ›› 2010, Vol. 32 ›› Issue (7): 89-92.doi: 10.3969/j.issn.1007130X.2010.

• 论文 • 上一篇    下一篇

文本分类中基于概率主题模型的噪声处理方法

林洋港,陈恩红   

  1. (中国科学技术大学计算机科学与技术学院,安徽 合肥 230027)
  • 收稿日期:2009-01-13 修回日期:2009-05-18 出版日期:2010-06-25 发布日期:2010-06-25
  • 通讯作者: 林洋港 E-mail:cheneh@ustc.edu.cn
  • 作者简介:林洋港(1983),男,福建诏安人,硕士生,研究方向为信息检索;陈恩红,教授,博士生导师,研究方向为数据挖掘、信息检索、语义计算等。
  • 基金资助:

    国家自然科学基金资助项目(60775037);国家863计划资助项目(2009AA01Z123)

A Probabilistic Topic Model Based Noise Processing Method for Text Classification

LIN Yanggang,CHEN Enhong   


  1. (School of Computer Science and Technology,University of Science and Technology of China,Hefei 230027,China)
  • Received:2009-01-13 Revised:2009-05-18 Online:2010-06-25 Published:2010-06-25
  • Contact: LIN Yanggang E-mail:cheneh@ustc.edu.cn

摘要:

训练集中文本质量的好坏直接决定着文本分类的结果。实际应用中训练集的构建不可避免地会产生噪声样本,从而影响文本分类方法的实际应用效果。为此,针对文本分类中的噪声问题,本文提出一种基于概率主题模型的噪声处理方法,首先对训练集中的每个样本计算其类别熵,根据类别熵对噪声样本进行过滤;然后利用主题模型进行数据平滑,进一步减弱噪声样本的影响。这种方法不但能够减弱噪声样本对分类结果的影响,同时还保持了训练集的原有规模。在真实数据上的实验表明,该方法对噪声样本的分布具有较好的鲁棒性,在噪声比例较大的情况下仍能保持较好的分类结果。

关键词: 噪声数据, 文本分类, 概率主题模型, 类别熵

Abstract:

The performance of text classification depends directly on the quality of training corpus.In practical applications,noise samples are unavoidable in the training corpus and thus influence the effect of the text classification approach.To this end,a novel probabilistic topic model based noise processing method is proposed for text classification.In our method,the  noise samples are filtered according to the class entropy.Then the data is smoothed using the generative process of the topic model to further weaken the influence of noise samples,meanwhile the original size of the training corpus is kept.The experimental results of the real world data show that the method proposed is robust to the distribution of noise samples,and has a relative good performance on the data sets with a high noise ratio.

Key words: noisy data;text classification;probabilistic topic model;class entropy