国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:杨红菊, 靳新宇
单位:1. 山西大学 计算机与信息技术学院, 太原 030006;2. 山西大学 计算智能与中文信息处理教育部重点实验室, 太原 030006
关键词:事件抽取,实体关系抽取,角色重叠,RoBERTa模型,多标签分类
基金:国家自然科学基金(61976128);山西省高等学校科技创新计划项目(2019L0103);山西省1331工程项目。
信息提取的目的是从自然语言文件中找到具体信息,现有研究在信息抽取的实体关系和事件抽取任务中仅解决事件论元重叠和实体关系重叠的问题,未考虑两个任务共有的角色重叠问题,导致抽取结果准确率降低。提出一个两阶段的通用模型用于完成实体关系抽取和事件抽取子任务。基于预训练语言模型RoBERTa的共享特征表示,分别对实体关系/事件类型和实体关系/事件论元进行预测。将传统抽取触发词任务转化为多标签抽取事件类型任务,利用多尺度神经网络进一步提取文本特征。在此基础上,通过抽取文本相关类型的事件论元,根据论元角色的重要性对损失函数重新加权,解决数据不平衡、实体关系抽取和事件抽取中共同存在论元角色重叠的问题。在千言数据集中事件抽取和关系抽取任务测试集上的实验验证了该模型的有效性,结果表明,该模型的F1值分别为83.1%和75.3%。
来源:2023年第2期
《计算机工程》期刊编辑部