国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:牛壮,李凤莲,张雪英,樊宇宙,魏鑫
单位:太原理工大学 信息与计算机学院,山西 晋中 030600
关键词:非平衡数据集,聚类算法,欠抽样,去冗余,多决策树预测模型
基金:山西省自然科学基金(201801D121138);山西省重点研发计划(201803D31045);山西省科技重大专项(20181102008)。
欠抽样方法在非平衡数据集分类时,未充分考虑数据分布变化对分类结果造成的影响。为此,提出一种基于聚类融合去冗余的改进欠抽样方法。采用聚类算法得到多数类样本高密度分布区域的聚类中心,将多数类样本划分为不同子集,通过计算各子集的相似度冗余系数对多数类样本进行去冗余删除,以达到欠抽样的目的。对15个不同平衡率的数据集欠抽样后,利用代价敏感混合属性多决策树模型进行分类。实验结果表明,在不降低非平衡数据集分类准确率的前提下,该方法能够提高少数类样本的正类率及预测模型的G-mean值。
来源:2019年第6期
《计算机工程》期刊编辑部