国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:姬莉霞, 周洪鑫, 肖士杰, 陈允峰, 张晗
单位:1. 郑州大学网络空间安全学院,河南 郑州 4500002. 四川大学计算机学院,四川 成都 6100653. 河南众诚信息科技股份有限公司,河南 郑州 450000
关键词:扩散模型,图像生成,生成式模型,邻域注意力,Transformer骨干网络
基金:河南省重大科技专项(231100210200); 河南省重点研发与推广专项(232102210128)
生成扩散模型是一种能够学习数据生成过程的模型,它可以根据输入的高斯噪声,逐步去噪生成新的数据样本,因此被广泛应用于图像生成领域。近期,有研究发现扩散模型性能取决于网络复杂度而非U-Net的归纳偏置,因此可以利用Transformer作为骨干网络,使得扩散模型能够继承对Transformer的最新研究成果。然而,Transformer的引入又会导致模型体积增大、训练速度减慢。针对使用Transformer骨干网络的扩散模型训练速度慢、生成的图像细节信息不佳的问题,提出一种基于邻域注意力架构的扩散模型,该模型引入带有邻域注意力的Transformer骨干网络,利用邻域注意力机制的稀疏全局注意力模式,指数级扩展了扩散模型对图像的感知范围,使模型用较小的代价关注到了全局信息。通过注意力扩展层的渐进式膨胀变化,在模型训练阶段捕获到更多的视觉信息,使得模型生成的图像具有更好的全局性。实验结果表明,所提模型生成的图像有较优的全局细节,生成效果优于当前的SOTA模型。
来源:2025年第8期
《计算机工程》期刊编辑部