国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:李雅红, 周海英, 徐少伟
单位:中北大学 大数据学院, 太原 030051
关键词:图像描述模型,注意力机制,编码器和解码器,对象关系,网状转换器
基金:国家自然科学基金(61672473)。
针对图像描述生成模型缺乏空间关系信息且图像特征利用不充分的问题,结合对象关系网状转换器,提出一种改进的图像描述模型。利用Faster R-CNN提取图像的外观和边界框特征,并将提取的特征输入到改进的转换器中经过编解码生成图像描述。通过将对象外观和边界框特征合并为关系特征的方式对编码器自我注意力层的注意力权值进行改进,以强化目标间的关联性。将编码器和解码器的连接设计为网状结构,从而充分利用图像特征。实验结果表明,与基于单一注意力的Top-down基线模型相比,该模型的BLUE@1和CIDEr评价指标值分别提高了7.6和3.7个百分点,显著提升了描述语句的准确性。
来源:2021年第5期
《计算机工程》期刊编辑部