国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:李华昱, 张智康, 闫阳, 岳阳
单位:中国石油大学(华东)计算机科学与技术学院, 山东 青岛 266580
关键词:命名实体识别,多模态,领域,知识图谱,跨模态特征融合,注意力机制
基金:山东省自然科学基金面上项目(ZR2020MF140); 中国石油大学(华东)研究生创新基金(22CX04035A)
针对特定领域中文命名实体识别存在的局限性, 提出一种利用学科图谱和图像提高实体识别准确率的模型, 旨在利用领域图谱和图像提高计算机学科领域短文本中实体识别的准确率。使用基于BERT-BiLSTM-Attention的模型提取文本特征, 使用ResNet152提取图像特征, 并使用分词工具获得句子中的名词实体。通过BERT将名词实体与图谱节点进行特征嵌入, 利用余弦相似度查找句子中的分词在学科图谱中最相似的节点, 保留到该节点距离为1的邻居节点, 生成最佳匹配子图, 作为句子的语义补充。使用多层感知机(MLP)将文本、图像和子图3种特征映射到同一空间, 并通过独特的门控机制实现文本和图像的细粒度跨模态特征融合。最后, 通过交叉注意力机制将多模态特征与子图特征进行融合, 输入解码器进行实体标记。在Twitter2015、Twitter2017和自建计算机学科数据集上同基线模型进行实验比较, 结果显示, 所提方法在领域数据集上的精确率、召回率和F1值分别可达88.56%、87.47%和88.01%, 与最优基线模型相比, F1值提高了1.36个百分点, 表明利用领域知识图谱能有效提升实体识别效果。
来源:2024年第8期
《计算机工程》期刊编辑部