国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:孙仁科, 许靖昊, 皇甫志宇, 李仲年, 许新征
单位:1. 中国矿业大学计算机科学与技术学院, 江苏 徐州 2211162. 矿山数字化教育部工程研究中心, 江苏 徐州 221116
关键词:零样本学习,视觉-语言预训练模型,零样本迁移,多模态,计算机视觉
基金:国家自然科学基金(61976217); 国家自然科学基金(62306320); 江苏省自然科学基金(BK20231063)
近年来随着人工智能(AI)技术在计算机视觉与自然语言处理等单模态领域表现出愈发优异的性能, 多模态学习的重要性和必要性逐渐展现出来, 其中基于视觉-语言预训练模型的零样本迁移(ZST)方法得到了国内外研究者的广泛关注。得益于预训练模型强大的泛化性能, 使用视觉-语言预训练模型不仅能提高零样本识别任务的准确率, 而且能够解决部分传统方法无法解决的零样本下游任务问题。对基于视觉-语言预训练模型的ZST方法进行概述, 首先介绍了零样本学习(FSL)的传统方法, 并对其主要形式加以总结; 然后阐述了基于视觉-语言预训练模型的ZST和FSL的区别及其可以解决的新任务; 其次介绍了基于视觉-语言预训练模型的ZST方法在样本识别、目标检测、语义分割、跨模态生成等下游任务中的应用情况; 最后对现有的基于视觉-语言预训练模型的ZST方法存在的问题进行分析并对未来的研究方向进行展望。
来源:2024年第10期
《计算机工程》期刊编辑部