国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:马静, 车进, 孙末贤
单位:1. 宁夏大学电子与电气工程学院, 宁夏 银川 7500002. 宁夏大学研究生院, 宁夏 银川 750000
关键词:生成对抗网络,文本生成图像,XLNet,CBAM,对比损失
基金:国家自然科学基金(62366042)
文本生成图像任务中的文本编码器不能深度挖掘文本信息, 导致后续生成的图像语义不一致。针对该问题, 提出一种DXC-GAN文本生成图像方法。引入Transformer系列中的XLNet(Xtra Long Network)预训练模型替换原始文本编码器, 捕获大量文本的先验知识, 实现对上下文信息的深度挖掘。添加CBAM(Convolutional Block Attention Module)注意力模块, 使生成器更加关注图像中的重要信息, 从而解决生成图像细节不完整和空间结构错误问题。在判别器中引入对比损失, 与模型中匹配感知梯度惩罚和单向输出结合, 使得相同语义图像之间更加接近, 不同语义图像之间更加疏远, 从而增强文本与生成图像之间的语义一致性。实验结果表明: 与DF-GAN相对比, DXC-GAN在CUB数据集上的IS(Inception Score)与FID(Fréchet Inception Distance)分别提升了4.42%和17.96%;在Oxford-102数据集上, IS为3.97, FID为37.82;相较于DF-GAN, DXC-GAN在鸟类图像生成方面有效避免了多头少脚等畸形问题, 同时在花卉图像生成上也显著减少了花瓣残缺等图像质量问题; 此外, DXC-GAN还增强了文本与图像的对齐性, 显著提升了图像的完整度和生成效果。
来源:2026年第2期
《计算机工程》期刊编辑部