国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:李国和, 杨绍伟, 吴卫江, 郑艺峰
单位:1. 中国石油大学(北京) a. 石油数据挖掘北京市重点实验室;b. 地球物理与信息工程学院, 北京 102249;2. 闽南师范大学 a. 数据科学与智能应用福建省高等学校重点实验室;b. 计算机学院, 福建 漳州 363000
关键词:缺失值,预充填,聚类,递归充填,平方误差
基金:国家自然科学基金(61701213);国家油气重点专项子课题(G-5800-08-ZS-WX);中国石油大学(北京)克拉玛依校区科研启动基金(RCYJ2016B-03-001);福建省教育厅中青年基金(JA15300)。
在大数据应用中,多数建模方法是在完备数据集基础上进行的,但在数据采集过程或存储过程中容易出现数据缺失的现象,导致无法建模。为此,提出一种基于聚类的递归充填方法。使用同类簇的均值对不完备数据进行预填充,形成初始完备数据集,针对得到的完整数据进行聚类,并运用同类簇的均值修正初始充填值。根据充填效果误差判定充填稳定性,并进行多次递归聚类修正充填值,直到前后两次充填较为稳定或迭代次数超过阈值时停止迭代。实验结果表明,与均值充填、K最近邻充填、聚类充填及粗糙集不完备数据分析等方法相比,该方法能够进行更为精准的充填,使得最终充填更加接近真实数据。
来源:2019年第9期
《计算机工程》期刊编辑部