国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:李泽鸣, 王树良, 尚子贺, 盛明
单位:北京理工大学计算机学院, 北京 100081
关键词:多模态文档,多模态检索增强生成,文档问答,生成驱动检索,布局感知建模,多模态推理
基金:国家自然科学基金(42371480); 国家自然科学基金(62306033)
传统检索增强生成(RAG)方法主要面向纯文本场景, 其检索与生成机制难以有效建模多模态文档中普遍存在的视觉元素、空间布局与结构语义, 在图文混合、长文档及跨文档推理任务中表现受限。为此, 多模态检索增强生成(MRAG)通过联合建模文本、图像与版式结构, 在生成过程中引入多模态证据检索与调度, 已然发展为视觉富文档问答与推理的核心技术范式。本文系统综述MRAG在文档问答任务中的研究进展。首先, 围绕多模态文档理解的实际需求, 分析MRAG在多模态对齐、长上下文建模、证据可追溯性及系统鲁棒性等面临的关键挑战。其次, 立足MRAG系统支持生成过程的方式, 分别从嵌入范式、文档检索范围、布局感知机制与多模态检索策略4个维度, 梳理对比代表性方法, 聚焦讨论不同设计选择对生成稳定性、推理精度与系统复杂度的影响。再次, 总结现有多模态文档问答数据集与评测体系的特点与不足, 分析当前评测在多模态证据粒度与推理可解释性方面的局限。最后, 指出MRAG正由面向静态相似度匹配的检索机制, 演进为以生成与推理需求为中心的动态证据规划范式, 应通过多模态、多粒度协同建模, 持续提升复杂文档问答系统的可靠性与可解释性。
来源:2026年第4期
《计算机工程》期刊编辑部