国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:唐卓然, 柳毅
单位:广东工业大学计算机学院, 广东 广州 510006
关键词:注意力机制,依存关系,词汇融合,图注意力网络,中文命名实体识别
基金:广东省重点领域研发计划(2021B0101200002)
命名实体识别是自然语言处理领域的重要基础任务, 为关系抽取、构建知识图谱等众多下游任务提供有价值的数据支撑。针对中文命名实体识别存在分词错误、实体边界模糊和上下文依赖的难点, 以及现有方法不能充分利用词汇信息和有效提取文本内部特征等问题, 提出一种基于词汇融合和依存关系的中文命名实体识别模型。首先, 获取输入文本中每个字符的自匹配词生成词汇特征向量, 并根据字符在它的自匹配词上的位置得到词边界信息, 利用双仿射注意力机制将字符向量与词汇特征向量进行融合, 将词汇信息和词边界信息融入模型的编码过程, 从而使模型获得良好的实体识别能力; 然后, 根据依存句法建立输入文本的依存图结构, 利用图注意力网络(GAT)捕获输入文本内部依存关系特征, 增强文本内部的语义依赖信息, 同时有利于区分实体边界; 最后, 使用条件随机场(CRF)计算文本的标签。实验结果表明, 该模型在CCKS2017、OntoNote4.0和MSRA数据集上分别获得了92.10%、80.76%和95.66%的F1值, 优于对比模型。
来源:2024年第10期
《计算机工程》期刊编辑部