计算机工程

北大核心,CA,INSPEC,JST,Pж(AJ)

国内刊号:31-1289/TP

国际刊号:1000-3428

计算机工程杂志2025年第1期:基于Squeezeformer的多颗粒度多方面发音质量评测方法

发布日期:

作者:费涛, 艾山·吾买尔, 杜文旭, 朱翠翠

单位:1. 新疆大学软件学院, 新疆 乌鲁木齐 8300172. 新疆大学计算机科学与技术学院, 新疆 乌鲁木齐 830017

关键词:Squeezeformer模型,发音质量评测,预训练模型,特征融合,皮尔逊相关系数

基金:中央引导地方科技发展专项资金项目(202204120018)

口语发音质量评测相对于发音错误检测和诊断(MDD)任务, 不仅需要原始的数据特征, 还需要许多流畅度、准确度、完整度等特征辅助进行实现, 所以对口语发音质量评测的研究远远少于对MDD的研究。目前对于口语发音质量评测的研究都是对语音评分某一项指标单方面进行评分。设计将Transformer替换Squeezeformer的改进模型Squeezeformer-MR对基线模型进行改进, Squeezeformer-MR使用多个残差连接增强了前后特征信息的传递。实验中, 在参数设置上保持与基线模型一致, 使用最稳定的24层嵌入层时, 音素级、词级和句子级方面的综合评分的皮尔逊相关系数(PCC)相比基线模型分别提升了1.96%、6.37%和1.08%。在初次改进的基础上, 使用WavLM和HuBERT预训练模型对训练集提取相应的特征, 将提取到的预训练特征以拼接方式添加到原GOP特征中进行特征融合, 使用融合特征以相同方式进行训练, 得到的音素级、词级和句子级方面综合评分的PCC相比基线模型分别提升了2.45%、7.10%和1.89%。

来源:2025年第1期

《计算机工程》期刊编辑部

查看计算机工程杂志2025年第1期

联系我们

  • 地址:上海市嘉定区澄浏公路63号
  • 电话:(021) 67092217
  • E-mail:ecice06@ecict.com.cn

咨询工作人员