国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:苏建华, 池云仙, 许云峰, 高凯
单位:河北科技大学信息科学与工程学院, 河北 石家庄 050091
关键词:意图识别,多模态融合,跨注意力机制,自注意力机制,文本交互引导
基金:河北省自然科学基金(F2022208006); 河北省教育厅科研项目(QN2024196)
意图识别是自然语言理解的一项重要任务, 传统的意图识别研究主要关注于特定任务的单模态意图识别。然而, 在现实世界的场景中, 人类的意图是复杂的, 需要通过整合诸如语言、语调、表情和动作等信息来判断。提出以注意力为主的多模态融合的意图识别方法, 用于在真实世界的多模态场景中进行意图识别。为了能够捕捉和融合不同模态之间的长距离依赖关系, 自适应地调整各模态信息的重要性和提供更丰富的表示, 对每个模态特征分别使用自注意力机制。通过在每个模态的特征中添加明确的模态标识, 使模型能够区分并有效融合不同模态的信息, 提升整体理解和决策能力。考虑到在跨模态交互时文本模态信息的重要性, 使用以跨注意力机制为核心、以文本为主导其他模态辅助交互引导的多模态融合, 旨在促进文本与视觉、听觉模态之间的交互。最后对多模态意图识别的MIntRec和MIntRec2.0基准数据集进行了实验评估。结果显示, 该方法在准确性、精确度、召回率和F1值等指标上均优于现有的多模态学习方法, 比目前最好的基线方法提升0.1~0.5百分点。
来源:2026年第3期
《计算机工程》期刊编辑部