国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:施竣潇, 陈艳平, 穆肇南
单位:1. 文本计算与认知智能教育部工程研究中心, 贵州 贵阳 5500252. 贵州大学公共大数据国家重点实验室, 贵州 贵阳 5500253. 贵州大学计算机科学与技术学院, 贵州 贵阳 550025
关键词:谓语中心词识别,多尺度卷积,ChineseBERT预训练语言模型,跨度长度信息,多尺度跨度关联信息
基金:国家自然科学基金(62166007); 贵州省自然科学基金(黔科合基础-ZK[2022]027); 贵州省教育厅青年科技人才成长项目(黔教合KY字[2022]205号)
针对谓语中心词识别模型中存在缺失跨度长度信息和多尺度跨度关联信息等问题, 提出一种融合多尺度跨度特征的汉语谓语中心词识别模型。首先, 使用ChineseBERT预训练语言模型和双向长短期记忆(BiLSTM)网络提取文本中包含上下文信息的字符向量序列; 其次, 利用线性神经网络对字符向量进行初步识别, 形成跨度遮蔽矩阵; 然后, 将字符向量序列二维化表示为跨度信息矩阵, 使用多尺度卷积神经网络(MSCNN)对跨度信息矩阵进行运算, 提取跨度的多尺度关联信息; 最后, 采用特征嵌入神经网络嵌入跨度的长度信息, 丰富跨度的特征向量以识别谓语中心词。实验结果表明, 该模型能够有效融合跨度的多尺度关联信息和长度信息, 提升谓语中心词识别的性能, 相比于同类模型中性能最优的谓语中心词识别模型的F1值提升了0.43个百分点。
来源:2024年第10期
《计算机工程》期刊编辑部