国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:陈玺, 杨雅婷, 董瑞
单位:1. 中国科学院新疆理化技术研究所, 乌鲁木齐 830011;2. 中国科学院大学, 北京 100049;3. 新疆民族语音语言信息处理实验室, 乌鲁木齐 830011
关键词:汉维翻译,神经机器翻译,预训练语言模型,BERT模型,两段式微调策略
基金:国家自然科学基金“融合复杂形态特征的多语言神经机器翻译研究”(U1703133);国家重点研发计划“维吾尔语、哈萨克语到汉语的机器翻译研究”(2017YFC0822505-04);新疆高层次引进人才项目(新人社函[2017]699号);中国科学院“西部之光”人才培养计划A类项目“以和田墨玉为例的维汉翻译关键技术研究”(2017-XBQNXZ-A-005)。
针对训练汉维机器翻译模型时汉语-维吾尔语平行语料数据稀疏的问题,将汉语预训练语言BERT模型嵌入到汉维神经机器翻译模型中,以提高汉维机器翻译质量。对比不同汉语BERT预训练模型编码信息的嵌入效果,讨论BERT不同隐藏层编码信息对汉维神经机器翻译效果的影响,并提出一种两段式微调BERT策略,通过对比实验总结出将BERT模型应用在汉维神经机器翻译中的最佳方法。在汉维公开数据集上的实验结果显示,通过该方法可使机器双语互译评估值(BLEU)提升1.64,有效提高汉维机器翻译系统的性能。
来源:2021年第12期
《计算机工程》期刊编辑部