国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:李娇, 范浩东, 洪旭东, 许镇义, 樊旭, 黄俊
单位:1. 安徽工业大学计算机科学与技术学院, 安徽 马鞍山 2430322. 合肥综合性国家科学中心人工智能研究院, 安徽 合肥 2300943. 安徽省工业互联网智能应用与安全工程研究中心, 安徽 马鞍山 243032
关键词:深度学习,多标签图像分类,标签视觉原型,字典学习,注意力机制
基金:国家自然科学基金(61806005); 安徽省工业互联网智能应用与安全工程研究中心开放基金(IASII22-03); 安徽省高校优秀青年人才支持计划项目(gxyqZD2022032); 安徽高校协同创新项目(GXXT-2022-052)
目前众多的多标签图像分类研究将标签语义信息和标签共现概率作为先验知识引导学习多标签分类模型, 但这类方法大多依赖额外的语义信息, 难以处理不同模态间的信息不匹配问题, 且标签共现概率的计算也容易受到数据不平衡和噪声的影响。提出一种基于标签视觉原型学习的多标签图像分类方法, 仅利用图像本身的视觉信息, 通过生成标签视觉原型的方式构建多标签分类器。该方法不仅减轻了对先验知识的依赖, 还充分利用了图像自身的视觉信息, 有效提升了分类性能。首先, 设计基于类特定激活图的注意力模块, 引导模型关注图像中与类别更加相关的区域, 并生成类特定特征表示; 然后, 通过捕获每个标签的视觉原型表示, 构建标签视觉原型字典, 充分发挥视觉特征信息与图像分类任务的适配性; 最后, 以该字典作为多标签分类器, 重构输入图像的视觉特征, 进而获取标签的预测概率。实验结果表明, 该方法在3个标准多标签图像分类数据集上的分类准确率较同类方法得到了提升。
来源:2026年第4期
《计算机工程》期刊编辑部