国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:王月昊, 周若华
单位:北京建筑大学电气与信息工程学院 北京 100044
关键词:语音唤醒,低资源,模型量化,小样本学习,人机交互
基金:国家自然科学基金(11590774)
语音唤醒作为实现人机交互的关键技术, 一直是语音领域的研究热点。随着深度学习技术的发展, 其研究方法的重心已从传统的大词汇连续语音识别(LVCSR)技术逐渐转向基于神经网络的技术, 然而如何在小型设备上实现高效唤醒并利用有限的样本数据进行模型训练仍是低资源语音唤醒系统设计面临的挑战。首先, 定义了语音唤醒中的低资源概念, 区分了语音唤醒和语音识别以及相关术语, 介绍了经典的语音唤醒模型及其适配场景, 阐述了低资源语音唤醒的国内外研究现状。其次, 从语音唤醒系统的结构组成的角度分别说明了声学特征提取与声学模型的主流技术和优化策略。然后, 对语音唤醒模型的轻量化方法展开分析并对其优缺点进行比较, 总结了数据低资源语音唤醒中常见的小样本学习、零样本学习、迁移学习等解决方法, 并介绍了常见语音唤醒数据集和评价指标。最后, 探讨并展望了低资源语音唤醒技术未来的研究方向。
来源:2025年第2期
《计算机工程》期刊编辑部