国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:位雅, 张正军, 何凯琳, 唐莉
单位:1. 南京理工大学 数学与统计学院, 南京 210094;2. 景德镇学院 信息工程学院, 江西 景德镇 333000
关键词:聚类,密度峰值,相对密度,密度因子,聚类距离,自然最近邻
基金:国家自然科学基金(61773014)。
密度峰值聚类算法在处理密度不均匀的数据集时易将低密度簇划分到高密度簇中或将高密度簇分为多个子簇,且在样本点分配过程中存在误差传递问题。提出一种基于相对密度的密度峰值聚类算法。引入自然最近邻域内的样本点信息,给出新的局部密度计算方法并计算相对密度。在绘制决策图确定聚类中心后,基于对簇间密度差异的考虑,提出密度因子计算各个簇的聚类距离,根据聚类距离对剩余样本点进行划分,实现不同形状、不同密度数据集的聚类。在合成数据集和真实数据集上进行实验,结果表明,该算法的FMI、ARI和NMI指标较经典的密度峰值聚类算法和其他3种聚类算法分别平均提高约14、26和21个百分点,并且在簇间密度相差较大的数据集上能够准确识别聚类中心和分配剩余的样本点。
来源:2023年第6期
《计算机工程》期刊编辑部