国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:何志磊, 高盛祥, 朱恩昌, 余正涛
单位:1. 昆明理工大学信息工程与自动化学院, 云南 昆明 6505002. 昆明理工大学云南省人工智能重点实验室, 云南 昆明 650500
关键词:跨语言摘要,低资源语言,语言差异,连续文本,泛化性
基金:国家自然科学基金(U23A20388); 国家自然科学基金(U21B2027); 云南省重点研发计划(202303AP140008); 云南省重点研发计划(202302AD080003); 昆明理工大学"双一流"科技专项(202402AG050007); 云南省基础研究项目(202301AT070393); 昆明理工大学"双一流"创建联合专项(202201BE070001-021)
跨语言摘要(CLS)旨在用目标语言(如中文)的文本对源语言(如缅甸语)的文本核心内容进行概括和总结。CLS实质上是机器翻译(MT)和单语摘要(MS)的联合任务, 需要模型同时具备这两方面的能力。在面向越南语、缅甸语等低资源语言场景时, CLS训练数据稀缺, 且中文与缅甸语、越南语属于不同的语系, 语言差异较大, 导致当前的CLS方法泛化性较差。为此, 以缅-中、越-中为研究对象, 提出一种语言关系增强的CLS方法。首先将输入序列转化为连续词对; 然后计算源语言和目标语言之间的连续词对之间的关系; 最后引入MT和MS的联合训练方法, 有效地捕捉目标语言和源语言之间的关系, 提高模型的泛化性和对连续文本的处理能力。在自建数据集上进行实验, 结果表明, 相较其他基线模型, 该方法在ROUGE-1、ROUGE-2和ROUGE-L评价指标上分别提升了5、1、4百分点。
来源:2025年第8期
《计算机工程》期刊编辑部