国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:刘凯, 任洪逸, 李蓥, 季怡, 刘纯平
单位:苏州大学计算机科学与技术学院,江苏 苏州 215006
关键词:跨模态交互,注意力机制,医学视觉问答,特征融合,特征增强
基金:国家自然科学基金(62376041); 江苏省研究生科研与实践创新计划(SJCX21_1341)
医学视觉问答(Med-VQA)需要对医学图像内容与问题文本内容进行理解与结合,因此设计有效的模态表征及跨模态的融合方法对Med-VQA任务的表现至关重要。目前,Med-VQA方法通常只关注医学图像的全局特征以及单一模态内注意力分布,忽略了图像的局部特征所包含的医学信息与跨模态间的交互作用,从而限制了图像内容理解。针对以上问题,提出一种交叉模态注意力特征增强的Med-VQA模型(CMAG-MVQA)。基于U-Net编码有效增强图像局部特征,从交叉模态协同角度提出选择引导注意力方法,为单模态表征引入其他模态的交互信息,同时利用自注意力机制进一步增强选择引导注意力的图像表征。在VQA-RAD医学问答数据集上的消融与对比实验表明,所提方法在Med-VQA任务上有良好的表现,相比于现有同类方法,其在特征表征上性能得到较好改善。
来源:2025年第6期
《计算机工程》期刊编辑部