国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:杨振宇, 王磊, 马博, 杨雅婷, 董瑞, 艾孜麦提·艾瓦尼尔, 王震
单位:1. 中国科学院新疆理化技术研究所, 乌鲁木齐 830011;2. 中国科学院大学, 北京 100049;3. 新疆民族语音语言信息处理实验室, 乌鲁木齐 830011
关键词:关系抽取,语义相似度,语义编码,远程监督,跨语言
基金:国家自然科学基金本地青年人才培养专项(U2003303);国家重点研发计划(2018YFC0823002);新疆维吾尔自治区天山创新项目(2020D14045);“天山青年”计划优秀青年科技人才项目(2019Q031);中国科学院青年创新促进会项目(科发人函字[2019]26号);中国科学院西部青年学者B类项目(2019-XBQNXZ-B-008)。
远程监督是关系抽取领域重要的语料扩充技术,可以在少量已标注语料的基础上快速生成伪标注语料。但是传统的远程监督方法主要应用于单语种文本,维吾尔语等低资源语言并不能使用这类方法得到伪标注语料。针对上述问题,提出一种针对维汉的跨语言远程监督方法,在无语料的情况下利用现有的汉语语料进行维语语料的自动扩充。将远程监督视为文本语义相似度计算问题而不是简单的文本查找,从实体语义和句子语义2个层面判断维语和汉语句子对是否包含同一关系,若为同一关系则将已有的汉语标注转移到维语句子上,实现维语语料从零开始的自动扩充。此外,为有效捕获实体的上下文和隐藏语义信息,提出一种带有门控机制的交互式匹配方法,通过门控单元控制编码层、注意力层之间的信息传递。人工标记3 500条维语句子和600条汉语句子用于模拟远程监督过程并验证模型的性能。实验结果表明,该方法F1值达到73.05%,并且成功构造了包含97 949条维语句子的关系抽取伪标注数据集。
来源:2023年第2期
《计算机工程》期刊编辑部