国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:冯桫, 刘井平, 蒋海云, 肖仰华
单位:复旦大学 计算机科学技术学院, 上海 200433
关键词:属性值抽取,机器阅读理解模型,知识图谱,众包,序列标注
基金:上海市科技创新行动计划(19511120400)。
由于互联网语料的高噪音特性,传统的属性值抽取方法存在人工成本增加及训练集缺乏等问题。提出一种新的实体属性值抽取方法。利用机器阅读理解模型,从互联网语料中抽取出高质量的候选属性值,通过高效的众包验证机制调整各候选属性值的权重,得到最终抽取结果。实验结果表明,与OpenTag、QANET等模型相比,该机器阅读理解模型有效提升了候选属性值抽取的准确性,抽取准确率提升10%左右,同时通过众包验证方法,能够以较低的众包成本提高属性值抽取的整体性能。
来源:2021年第5期
《计算机工程》期刊编辑部