国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:叶俊民, 徐松, 罗达雄, 王志锋, 陈曙
单位:华中师范大学 a. 计算机学院;b. 教育信息技术学院, 武汉 430070
关键词:真词错误,混淆词集,n-gram概率统计模型,上下文语境,中文固定搭配
基金:国家社会科学基金(17BTQ061)。
在线学习社区中的中文真词错误会给中文文本语义的理解带来困难,从而影响基于在线学习社区文本的学习分析效果。为此,提出一种针对在线学习社区短文本的真词错误检测与修复方法。构建混淆词集和混淆词对应的固定搭配知识库,基于n-gram概率统计模型、上下文语境模型和固定搭配知识库,分别计算每一个混淆词的n-gram得分、上下文语境得分和固定搭配得分,对其加权求和作为判断原文是否出错的依据,并将最高得分的混淆词作为修复意见。实验结果表明,该方法召回率、准确率与修复率分别为85.6%、86.3%、92.9%,能准确有效检测与修复学习社区中的中文真词错误。
来源:2019年第8期
《计算机工程》期刊编辑部