国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:白雪冰, 车进, 吴金蔓, 陈玉敏
单位:1. 宁夏大学前沿交叉学院, 宁夏 中卫 7550002. 宁夏大学宁夏沙漠信息智能感知重点实验室, 宁夏 银川 7500213. 宁夏大学电子与电气工程学院, 宁夏 银川 750021
关键词:图像描述,区域型视觉特征,网格型视觉特征,Transformer模型,端到端训练
基金:国家自然科学基金(62366042); 宁夏自然科学基金(2023AAC03127)
现有图像描述方法只利用区域型视觉特征生成描述语句, 忽略了网格型视觉特征的重要性, 并且均为两阶段方法, 从而影响了图像描述的质量。针对该问题, 提出一种基于Transformer视觉特征融合的端到端图像描述方法。首先, 在特征提取阶段, 利用视觉特征提取器提取出区域型视觉特征和网格型视觉特征; 其次, 在特征融合阶段, 通过视觉特征融合模块对区域型视觉特征和网格型视觉特征进行拼接; 最后, 将所有的视觉特征送入语言生成器中以生成图像描述。该方法各部分均基于Transformer模型实现, 实现了一阶段方法。在MS-COCO数据集上的实验结果表明, 所提方法能够充分利用区域型视觉特征与网格型视觉特征的优势, BLEU-1、BLEU-4、METEOR、ROUGE-L、CIDEr、SPICE指标分别达到83.1%、41.5%、30.2%、60.1%、140.3%、23.9%, 优于目前主流的图像描述方法, 能够生成更加准确和丰富的描述语句。
来源:2024年第8期
《计算机工程》期刊编辑部