国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:于尊瑞, 毛震东, 王泉, 张勇东
单位:1. 中国科学技术大学 信息科学技术学院, 合肥 230000;2. 北京百度网讯科技有限公司, 北京 100000
关键词:问题生成,预训练语言模型,关键词分类,自注意力掩码,嵌入向量
基金:国家自然科学基金(U19A2057)。
问题生成任务是指根据给定的文本段落和答案来自动生成对应的问题。针对现有问题生成方法存在的误差累积现象以及问题生成任务固有的“一对多”情况,提出一种带有关键词感知功能的问题生成方法。在预训练语言模型的基础上,实现关键词分类模型与问题生成模型的网络结构设计。输入文本段落中蕴含关键词,为使所生成的问题中包含同样的关键词以保证问题与段落的语义一致性,利用关键词分类模型提取出文本段落中的关键词,将关键词与非关键词的区分特征融入问题生成模型的输入中,该特征作为问题生成过程的全局信息,用以消除问题生成模型仅依赖局部最优解的弊端,减少误差累积与“一对多”情况的发生。在SQuAD数据集上的实验结果表明,该方法能够提升问题生成的质量,其BLEU-4指标值可达24,优于带有复制机制、带有语义监督的问题生成模型,目前已经借助百度百科数据平台实现了大规模工业应用。
来源:2022年第2期
《计算机工程》期刊编辑部