国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:朱红, 王阔然, 朱彤
单位:1. 中国矿业大学(北京)人工智能学院, 北京 1000832. 中国矿业大学(北京)档案馆, 北京 100083
关键词:实体对齐,知识图谱,相似性度量,对比学习,预训练模型
基金:2022年度北京市档案局科研项目
实体对齐旨在发现不同知识图谱中相同对象的不同实例, 但图谱之间的异构性导致等价实例结构及表征不一致, 从而影响实体对齐准确性。提出一种实体主信息与多侧面信息表征相联合的异构图谱实体相似性度量方法, 并用于实体对齐任务。实体主信息包括实体名称及描述, 侧面信息包括实体属性、关系及关联实体描述等信息。针对图谱间等价实体结构异构带来的对齐干扰, 提出了一种结合实体多侧面信息语义表征的相似性度量方法UnMuSIR-SM&EA用于实体对齐。为提升信息同义词的表示一致性, 引入表示学习模型以获取实体各信息的语义表征, 为解决表示学习模型嵌入空间各向异性带来的同义词度量尺度不一致问题, 设计了一种基于实体主信息对比学习的微调方法, 优化实体信息的语义表征。实验结果表明, 该方法在结构差异较大的数据集DISZH-EN上的Hits@1达到了95.2%, 比基于侧面信息的模型BERT-INT高出了16.8百分点; 在DBP15K的DBP15KZH-EN、DBP15KJA-EN和DBP15KFR-EN数据子集上的Hits@1分别达到了95.7%、96.0%和98.9%;在DBP-WD数据集上的Hits@1达到了99.4%。所提模型在实体对齐任务上具有优异的效果。
来源:2025年第3期
《计算机工程》期刊编辑部