国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:邹品荣, 肖锋, 张文娟, 张万玉, 王晨阳
单位:1. 西安工业大学 兵器科学与技术学院, 西安 710021;2. 西安工业大学 计算机科学与工程学院, 西安 710021;3. 西安工业大学 基础学院, 西安 710021
关键词:视觉问答,注意力机制,图注意网络,关系推理,多模态学习,特征融合
基金:国家自然科学基金(61572392,62171361);陕西省科技计划项目(2020GY-066);陕西省自然科学基础研究项目(2021JM-440);西安市未央区科技计划项目(201925)。
视觉问答(VQA)是计算机视觉和自然语言处理领域中典型的多模态问题,然而传统VQA模型忽略了双模态中语义信息的动态关系和不同区域间丰富的空间结构。提出一种新的多模块协同注意力模型,对视觉场景中对象间关系的动态交互和文本上下文表示进行充分理解,根据图注意力机制建模不同类型对象间关系,学习问题的自适应关系表示,将问题特征和带关系属性的视觉关系通过协同注意编码,加强问题词与对应图像区域间的依赖性,通过注意力增强模块提升模型的拟合能力。在开放数据集VQA 2.0和VQA-CP v2上的实验结果表明,该模型在“总体”、“是/否”、“计数”和“其他”类别问题上的精确度明显优于DA-NTN、ReGAT和ODA-GCN等对比方法,可有效提升视觉问答的准确率。
来源:2022年第2期
《计算机工程》期刊编辑部