计算机工程

北大核心,CA,INSPEC,JST,Pж(AJ)

国内刊号:31-1289/TP

国际刊号:1000-3428

计算机工程杂志2025年第6期:不同基本单元信息融合的藏文短文本摘要生成

发布日期:

作者:夏吾吉, 黄鹤鸣, 樊永红, 更藏措毛, 范玉涛

单位:1. 青海师范大学计算机学院, 青海 西宁 8100082. 藏语智能信息处理及应用国家重点实验室, 青海 西宁 810008

关键词:基本单元,信息融合,词向量,数据集构建,藏文短文本摘要生成

基金:国家自然科学基金(62066039); 国家自然科学基金(62166034); 青海省自然科学基金(2022-ZJ-925); 藏语智能信息处理及应用国家重点实验室自主项目(2022-SKL-007)

藏文文本摘要能使用户快速有效地理解藏文文本内容。然而, 公开的、多领域的大规模藏文摘要数据集的稀缺, 使得藏文文本摘要生成的发展面临挑战; 此外, 藏文文本摘要生成研究借用中文和英文等以词作为基本单元的文本摘要生成技术构建模型, 但由于藏文受分词技术的限制, 直接以词作为文本摘要生成的基本单元, 对性能的影响较大。针对上述问题, 构建包含10 523条文本-摘要对的多领域藏文短文本摘要数据集TB-SUM, 在研究藏文文本构成单元的基础上, 提出适用于藏文文本摘要生成的不同基本单元融合方法, 并构建融合不同基本单元的藏文文本摘要生成模型Fusion_GloVe_GRU_Atten, 利用全局词向量表示(GloVe)模块实现藏文文本向量化后通过双向门控循环单元(Bi-GRU)模块对输入向量进行编码, 利用注意力机制获取输入向量的完整语义信息, 使解码器更加关注与当前单词相关的编码器输出, 同时将GRU作为解码器生成藏文摘要。在数据集TB-SUM和Ti-SUM上的实验结果表明, 以音节和词的融合作为模型训练的基本单元, 以音节作为测试的基本单元时, Fusion_GloVe_GRU_Atten模型生成短文本摘要效果更好, 能得到更高的ROUGE (Recall-Oriented Understudy for Gisting Evaluation)分数。

来源:2025年第6期

《计算机工程》期刊编辑部

查看计算机工程杂志2025年第6期

联系我们

  • 地址:上海市嘉定区澄浏公路63号
  • 电话:(021) 67092217
  • E-mail:ecice06@ecict.com.cn

咨询工作人员