计算机工程

北大核心,CA,INSPEC,JST,Pж(AJ)

国内刊号:31-1289/TP

国际刊号:1000-3428

计算机工程杂志2025年第8期:一种基于邻域注意力的扩散模型训练方法研究

发布日期:

作者:姬莉霞, 周洪鑫, 肖士杰, 陈允峰, 张晗

单位:1. 郑州大学网络空间安全学院,河南 郑州 4500002. 四川大学计算机学院,四川 成都 6100653. 河南众诚信息科技股份有限公司,河南 郑州 450000

关键词:扩散模型,图像生成,生成式模型,邻域注意力,Transformer骨干网络

基金:河南省重大科技专项(231100210200); 河南省重点研发与推广专项(232102210128)

生成扩散模型是一种能够学习数据生成过程的模型,它可以根据输入的高斯噪声,逐步去噪生成新的数据样本,因此被广泛应用于图像生成领域。近期,有研究发现扩散模型性能取决于网络复杂度而非U-Net的归纳偏置,因此可以利用Transformer作为骨干网络,使得扩散模型能够继承对Transformer的最新研究成果。然而,Transformer的引入又会导致模型体积增大、训练速度减慢。针对使用Transformer骨干网络的扩散模型训练速度慢、生成的图像细节信息不佳的问题,提出一种基于邻域注意力架构的扩散模型,该模型引入带有邻域注意力的Transformer骨干网络,利用邻域注意力机制的稀疏全局注意力模式,指数级扩展了扩散模型对图像的感知范围,使模型用较小的代价关注到了全局信息。通过注意力扩展层的渐进式膨胀变化,在模型训练阶段捕获到更多的视觉信息,使得模型生成的图像具有更好的全局性。实验结果表明,所提模型生成的图像有较优的全局细节,生成效果优于当前的SOTA模型。

来源:2025年第8期

《计算机工程》期刊编辑部

查看计算机工程杂志2025年第8期

联系我们

  • 地址:上海市嘉定区澄浏公路63号
  • 电话:(021) 67092217
  • E-mail:ecice06@ecict.com.cn

咨询工作人员