计算机工程

北大核心,CA,INSPEC,JST,Pж(AJ)

国内刊号:31-1289/TP

国际刊号:1000-3428

计算机工程杂志2026年第1期:融合最大池化的Conformer中文语音识别

发布日期:

作者:胡从刚, 杨立鹏, 孙永奇, 陈华龙, 韩可可

单位:1. 北京交通大学先进轨道交通自主运行全国重点实验室, 北京 1000442. 北京交通大学计算机科学与技术学院, 北京 1000443. 中国铁道科学研究院集团有限公司, 北京 100081

关键词:语音识别,细粒度局部特征,Conformer模型,最大池化,逐通道卷积

基金:中央高校基本科研业务费专项资金(2024JBGP008); 新一代人工智能国家科技重大专项(2021ZD0113002)

语音识别旨在通过先进的算法与信号处理技术, 赋予机器理解人类语音的能力, 使得人与机器之间的交流更加便捷、顺畅。目前, 大多数端到端语音识别的研究工作主要围绕Conformer模型进行优化。针对Conformer编码器对语音细粒度局部特征提取能力不足的问题, 提出一种融合最大池化(MP)的Conformer中文语音识别模型。首先, 将编码器卷积模块中门控线性单元的输出在时间维度上进行MP, 以提取多帧语音信号对应一个字符的细粒度局部特征。然后, 将池化后的特征与逐通道卷积(DWC)提取的粗粒度局部特征以逐元素相加的方式进行融合, 以增加语音局部特征的信息量, 从而提高Conformer模型的语音识别准确率。最后, 在公开的中文数据集Aishell-1上的实验结果表明: 采用贪心搜索方式进行解码, 所提模型可以将基线模型的字错误率(CER)从5.58%降低至5.32%;采用注意力重打分方式进行解码, 所提模型可以将基线模型的CER从5.06%降低至4.92%。

来源:2026年第1期

《计算机工程》期刊编辑部

查看计算机工程杂志2026年第1期

联系我们

  • 地址:上海市嘉定区澄浏公路63号
  • 电话:(021) 67092217
  • E-mail:ecice06@ecict.com.cn

咨询工作人员