国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:许柏炎, 蔡瑞初, 梁智豪
单位:广东工业大学 计算机学院, 广州 510006
关键词:代码注释生成,指针网络,自然语言生成,结构信息,复制机制
基金:国家自然科学基金(61876043);广东省自然科学基金(2014A030306004,2014A030308008);广东特支计划(2015TQ01X140);NSFC-广东联合基金(U1501254);广州市珠江科技新星专项(201610010101);广州市科技计划项目(201902010058)。
现有代码注释生成方法的复制机制未考虑源代码复杂多变的语法结构,导致存在准确率和鲁棒性不高等问题。通过改进指针网络使其支持结构化数据输入,提出一种语法辅助复制机制,以用于代码注释自动生成。该机制包含节点筛选策略和去冗余生成策略2个部分。节点筛选策略基于语法信息引入掩盖变量以过滤无效节点,从而降低指针网络对复杂语法的学习成本。去冗余生成策略基于时间窗口对节点概率进行动态调整,可解决代码自动注释中关键信息缺失的问题。实验结果表明,在WikiSQL数据集上,相比基准方法,该机制的BLEU、ROUGE-2和ROUGE-L指标值分别提升14.5%、10.3%和5.5%,在ATIS数据集上,上述指标值分别提升2.8%、6.6%和2.5%,验证了该机制的有效性以及引入语法信息的必要性。
来源:2021年第4期
《计算机工程》期刊编辑部