国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:许伟佳, 秦永彬, 黄瑞章, 陈艳平
单位:1. 贵州大学 计算机科学与技术学院, 贵阳 550025;2. 公共大数据国家重点实验室, 贵阳 550025
关键词:多源文本主题模型,文本聚类,狄利克雷多项分配,特征划分,Gibbs采样
基金:国家自然科学基金联合基金重点项目(U1836205);国家自然科学基金重大研究计划项目(91746116);贵州省科技厅重大专项(黔科合重大专项字2017-3002号);贵州省科学技术基金重点项目(黔科合基础2020-1Z055号)。
针对传统主题模型在挖掘多源文本数据集信息时存在主题发现效果不佳的问题,设计一种基于狄利克雷多项式分配(DMA)与特征划分的多源文本主题模型。以DMA模型为基础,放宽对预先输入的主题数量的限制,为每个数据源分配专有的主题分布参数,使用Gibbs采样算法估计每个数据源的主题数量。同时,对每个数据源分配专有的噪音词分布参数以及主题-词分布参数,采用特征划分方法区分每个数据源的特征词和噪音词,并学习每个数据源的用词特征,避免噪音词集对模型聚类的干扰。实验结果表明,与传统主题模型相比,该模型能够保留每个数据源特有的词特征,具有更好的主题发现效果及鲁棒性。
来源:2021年第7期
《计算机工程》期刊编辑部