国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:胡从刚, 杨立鹏, 孙永奇, 陈华龙, 韩可可
单位:1. 北京交通大学先进轨道交通自主运行全国重点实验室, 北京 1000442. 北京交通大学计算机科学与技术学院, 北京 1000443. 中国铁道科学研究院集团有限公司, 北京 100081
关键词:语音识别,细粒度局部特征,Conformer模型,最大池化,逐通道卷积
基金:中央高校基本科研业务费专项资金(2024JBGP008); 新一代人工智能国家科技重大专项(2021ZD0113002)
语音识别旨在通过先进的算法与信号处理技术, 赋予机器理解人类语音的能力, 使得人与机器之间的交流更加便捷、顺畅。目前, 大多数端到端语音识别的研究工作主要围绕Conformer模型进行优化。针对Conformer编码器对语音细粒度局部特征提取能力不足的问题, 提出一种融合最大池化(MP)的Conformer中文语音识别模型。首先, 将编码器卷积模块中门控线性单元的输出在时间维度上进行MP, 以提取多帧语音信号对应一个字符的细粒度局部特征。然后, 将池化后的特征与逐通道卷积(DWC)提取的粗粒度局部特征以逐元素相加的方式进行融合, 以增加语音局部特征的信息量, 从而提高Conformer模型的语音识别准确率。最后, 在公开的中文数据集Aishell-1上的实验结果表明: 采用贪心搜索方式进行解码, 所提模型可以将基线模型的字错误率(CER)从5.58%降低至5.32%;采用注意力重打分方式进行解码, 所提模型可以将基线模型的CER从5.06%降低至4.92%。
来源:2026年第1期
《计算机工程》期刊编辑部