国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:李洁, 朱洪亮, 陈玉玲, 辛阳
单位:1. 北京邮电大学 网络空间安全学院, 北京 100876;2. 贵州大学 贵州省公共大数据重点实验室, 贵阳 550025
关键词:关联规则,频繁项集,哈希存储,事务加权,并行计算
基金:国家重点研发计划(2017YFB0802300);贵州省科技重大专项(20183001);贵州省公共大数据重点实验室开放课题(2018BDKFJJ008,2018BDKFJJ020)。
Apriori算法能够挖掘事物之间的关联关系,但传统Apriori算法每计算一次候选集的支持度,都需要遍历原始事务数据库,多次扫描数据库导致其效率较低。为此,提出一种基于哈希存储与事务加权的改进算法。通过哈希存储的去重特性对事务进行去重,以减少冗余计算。将项目与项集的映射存储到哈希结构中,避免计算候选集的支持度时多次扫描事务数据库。同时开启多个线程,并行计算候选集的支持度,从而提高Apriori算法的运行效率。在开源数据集上的实验结果表明,当数据集中事务条数以及重复事务数越多时,该算法相较于传统Apriori算法的性能提升越明显,其运行时间与FP-Growth算法相近但避免了FP-Growth算法内存占用过大的问题。
来源:2020年第11期
《计算机工程》期刊编辑部