国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:武娇, 洪彩凤, 顾永春, 顾兴全, 金世举
单位:1. 中国计量大学 理学院, 杭州 310018;2. 中国计量大学 标准化学院, 杭州 310018
关键词:稀疏表示分类,K近邻,字典学习,线性回归分类,文本分类
基金:国家自然科学基金(61302190)。
文本表示的高维性会增加文本分类时的计算复杂度。针对该问题,构建基于类邻域字典的线性回归分类模型。采用K近邻方法构造各类别的类邻域字典,根据对测试样本的不同表示,分别提出基于级联类邻域字典和基于类邻域字典的线性回归分类算法。此外,为缓解噪声数据对分类性能的影响,通过度量测试样本与各个类别之间的相关度裁剪噪声类数据。实验结果表明,该模型对长文本和短文本均能够得到较高的分类精度和计算效率,同时,噪声类裁剪策略使其对包含较多类别数的文本语料也具有较好的分类性能。
来源:2021年第8期
《计算机工程》期刊编辑部