国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:庄紫薇, 朱俊国
单位:1. 昆明理工大学信息工程与自动化学院, 云南 昆明 6505002. 昆明理工大学云南省人工智能重点实验室, 云南 昆明 650500
关键词:自然语言处理,机器学习,深度学习,文本检错,越南语
基金:云南省科技厅面上项目(202101AT070077)
文本检错是自然语言处理的研究方向之一, 目标是自动检测输入文本中错误单词的位置和类型, 该任务不仅在文本处理的各种下游环节中应用广泛, 而且关系到日常生活中方方面面。目前, 针对英文、中文的文本检错模型已经能够达到较高的准确率, 然而, 因越南语语料资源稀缺、人工标注数据不足, 面向越南语的文本检错任务深受训练样本匮乏和低质量的困扰。此外, 还存在不同场景来源的文本包含错误类型不同, 以及错误类型数量不均衡的情况, 导致通用文本检错模型无法学习到特定错误类型的检测方法, 检错能力较弱。基于上述问题, 首先, 提出一种面向多源文本的越南语文本检错语料库构建方法, 利用越南语光学字符识别(OCR)、越南语语音识别和越南语-英语翻译数据集构建初始语料库, 并根据多源越南语检错语料生成方法得到错误语料, 通过检错语料自动标注算法获得带标签的训练数据。其次, 提出融入多源信息特征的越南语文本检错序列标注模型, 在多语言来自变换器的双向编码器表征量(BERT)编码端融入场景特征, 使模型能够根据当前输入文本场景适应错误类型。实验结果表明, 该方法相比基线模型, F0.5值和F1值提升了1.91和1.80百分点, 并进一步验证了模型各组件的必要性以及数据集构建方法的有效性。
来源:2025年第5期
《计算机工程》期刊编辑部