计算机工程

北大核心,CA,INSPEC,JST,Pж(AJ)

国内刊号:31-1289/TP

国际刊号:1000-3428

计算机工程杂志2023年第3期:融合ELECTRA和文本局部信息的中文语法错误检测方法

发布日期:

作者:陈柏霖, 王天极, 任丽娜, 黄瑞章

单位:1. 贵州大学 公共大数据国家重点实验室, 贵阳 550025;2. 贵州大学 计算机科学与技术学院, 贵阳 550025;3. 贵州轻工职业技术学院, 贵阳 550025

关键词:ELECTRA预训练语言模型,局部信息,中文语法错误检测,卷积神经网络,残差门控机制

基金:国家自然科学基金(62066007)。

语法错误检测是自然语言处理领域的一项基本任务,其目标是自动识别文本中存在的错别字、语法及语序错误等。与其他语言相比,中文语法灵活多变且缺乏时态、语态等标志性信息,因此,文本的局部信息对于中文语法错误检测具有重要作用。传统的机器学习方法难以检测文本中存在的语法错误,而现有深度学习方法在纠错过程中不能充分利用文本的局部信息,导致语法错误检测效果不佳。建立一种融合ELECTRA和文本局部信息的中文语法错误检测模型ELECTRA-GCNN-CRF。将语法错误检测视为序列标注任务,使用ELECTRA预训练语言模型对文本进行表征。采用卷积神经网络提取文本的局部位置和语义信息,并引入残差门控机制,降低无效信息带来的影响。通过CRF模型学习标签间的内在关联关系,输出符合标注规则的语法错误标签序列。在NLPTEA中文语法错误检测数据集上的实验结果表明,ELECTRA-GCNN-CRF在检测层、识别层和定位层上的F1值较对比基线模型分别平均提高了0.94、3.74和5.03个百分点,该模型能够有效提升语法错误检测效果。

来源:2023年第3期

《计算机工程》期刊编辑部

查看计算机工程杂志2023年第3期

联系我们

  • 地址:上海市嘉定区澄浏公路63号
  • 电话:(021) 67092217
  • E-mail:ecice06@ecict.com.cn

咨询工作人员