国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:康雁, 杨其越, 李浩, 梁文韬, 李晋源, 崔国荣, 王沛尧
单位:云南大学 软件学院, 昆明 650500
关键词:文本分类,CHI方法,特征提取,K-means算法,自适应算法
基金:国家自然科学基金(61762092,61762089);云南省软件工程重点实验室开放基金(2017SE204)。
传统的文本分类方法仅使用一种模型进行分类,容易忽略不同类别特征词出现交叉的情况,影响分类性能。为提高文本分类的准确率,提出基于主题相似性聚类的文本分类算法。通过CHI和WordCount相结合的方法提取类特征词,利用K-means算法进行聚类并提取簇特征词构成簇特征词库。在此基础上,通过Adaptive Strategy算法自适应地选择fasttext、TextCNN或RCNN模型进行分类,得到最终分类结果。在AG News数据集上的实验结果表明,该算法可较好地解决不同类别特征词交叉的问题,与单独使用的fasttext、TextCNN、RCNN模型相比,其文本分类性能显著提升。
来源:2020年第3期
《计算机工程》期刊编辑部