计算机工程

北大核心,CA,INSPEC,JST,Pж(AJ)

国内刊号:31-1289/TP

国际刊号:1000-3428

计算机工程杂志2026年第2期:基于模态仿射融合的语音控制说话人脸视频对抗生成

发布日期:

作者:陈诗航, 孙玉宝

单位:南京信息工程大学计算机学院, 江苏 南京 210044

关键词:说话人脸生成,视频生成,唇形同步,音频驱动生成,空间注意力,通道注意力

基金:国家自然科学基金(U2001211); 国家自然科学基金(62276139)

语音生成说话人脸视频是当前一个研究热点, 涉及音频和视觉两个模态的处理, 需要着重解决说话时唇部运动和输入音频对齐的问题。针对该问题提出一种端到端的语音控制说话人脸视频生成对抗模型, 主要包括模态仿射融合的生成器、视觉质量判别器和唇形同步判别器, 基于仿射融合的生成器通过模态仿射融合模块(MAFBlock), 在人脸特征解码过程中添加音频信息, 有效地融合音频信息和人脸信息, 使得音频能够更好地控制说话人脸视频生成。引入空间注意力和通道注意力机制, 增强模型对于局部区域的关注。基于双判别器提高模型生成质量和唇形同步率, 唇形同步判别器用于约束唇部运动, 对音频和唇形进行相似性判断, 在不改变整体轮廓和脸部细节的前提下更精细地控制唇部动作生成, 视觉质量判别器判断生成图片的真实性, 提高生成图片质量。在两个视听数据集上与多个现有的代表性模型进行对比实验, 结果表明: 该模型在LRS2验证集上具有8.128的LSE-C分数和6.112的LSE-D分数, 相比于Baseline分别提升了4.3%和4.4%;在LRS3验证集上具有7.963的LSE-C分数和6.259的LSE-D分数, 相比于Baseline分别提升了6.2%和6.9%。

来源:2026年第2期

《计算机工程》期刊编辑部

查看计算机工程杂志2026年第2期

联系我们

  • 地址:上海市嘉定区澄浏公路63号
  • 电话:(021) 67092217
  • E-mail:ecice06@ecict.com.cn

咨询工作人员