国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:孙圆, 王康平, 赵鸣博
单位:东华大学信息科学与技术学院, 上海 201620
关键词:服装检索,图文对比学习,预训练模型,跨模态检索,提示学习
基金:国家自然科学基金面上项目(NNSF61971121)
随着多模态学习的不断发展, 图像检索领域也面临新的机遇和挑战。现有的服装检索模型大多基于卷积神经网络或者Transformer的单模态模型实现, 忽略了图像对应的丰富文本信息, 模型能学习到的特征相对单一。为此, 提出一种基于多提示和图文对比学习的服装检索方法。引入图像文本多提示学习, 引导多模态大模型FashionCLIP学习服装的多维高语义多模态特征, 为提高模型的检索能力以及充分挖掘多模态模型的检索潜力, 分两阶段优化模型。第一阶段冻结图像和文本编码器, 通过图像文本交叉熵损失函数优化文本提示; 第二阶段冻结文本提示和文本编码器, 通过三元组损失、分类损失和图像文本交叉熵损失函数优化图像提示和图像编码器。在淘宝直播多模态视频商品检索数据集WAB上的域内检索和跨域检索实验结果表明: 该方法在域内检索的均值平均精度(mAP)和Rank-1相对于传统方法至少提升6.1和3.5百分点, 在跨域检索的mAP和Rank-1相对于传统方法至少提升8.4和6.4百分点, 检索性能得到了显著提升, 证明了图文对比学习在服装检索领域的潜力。
来源:2026年第2期
《计算机工程》期刊编辑部