国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:李田芳, 普园媛, 赵征鹏, 徐丹, 钱文华
单位:1. 云南大学信息学院, 云南 昆明 650504;2. 云南省高校物联网技术及应用重点实验室, 云南 昆明 650500
关键词:图像翻译,生成对抗网络,对比学习语言-图像预训练模型,自适应实例归一化,对比学习
基金:国家自然科学基金 (61163019,61271361,61761046,U1802271,61662087,62061049);云南省科技厅项目(2014FA021,2018FB100);云南省科技厅应用基础研究计划重点项目(202001BB050043,2019FA044);云南省重大科技专项计划项目(202002AD080001);云南省中青年学术技术带头人后备人才(2019HB121)。
现有的图像翻译方法大多依赖数据集域标签来完成翻译任务,这种依赖往往限制了它们的应用范围。针对完全无监督图像翻译任务的方法能够解决域标签的限制问题,但是普遍存在源域信息丢失的现象。为了解决上述2个问题,提出一种基于对比学习语言-图像预训练(CLIP)的无监督图像翻译模型。首先,引入CLIP相似性损失对图像的风格特征施加约束,以在不使用数据集域标签的情况下增强模型传递图像风格信息的能力和准确性;其次,对自适应实例归一化(AdaIN)进行改进,设计一个新的双空间自适应归一化(DSAdaIN)模块,在特征的风格化阶段添加网络的学习和自适应交互过程,以加强对内容源域信息的保留;最后,设计一个鉴别器对比损失来平衡对抗网络损失的训练和优化过程。在多个公开数据集上的实验结果表明,与StarGANv2、StyleDIS等模型相比,该模型可在准确传递图像风格信息的同时保留一定的源域信息,且在定量评估指标FID分数和KID分数上分别提升了近3.35和0.57×102,实现了较好的图像翻译性能。
来源:2024年第5期
《计算机工程》期刊编辑部