国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:王春东, 赵智航, 杨伟杰, 方顺尧
单位:1. 天津理工大学计算机科学与工程学院, 天津 3003842. 计算机病毒防治技术国家工程实验室, 天津 300384
关键词:深度神经网络,文本分类,对抗样本生成,字形替换,相似度评估
基金:国家重点研发计划"区块链"重点专项(2023YFB2703903); 国家重点研发计划"科技助力经济2020"重点专项(SQ2020YFF0413781)
随着海量数据的积累以及计算能力的不断提高, 深度神经网络(DNN)已广泛应用于图像识别、文本分类等各个领域。然而, 有研究表明, 基于DNN的文本分类模型经常受到攻击者恶意构造的对抗样本攻击, 攻击者可以通过删除和修改原始文本、插入混淆语句以及加入标点符号等方式使得模型分类结果发生改变。现有的对抗样本生成方法大多以牺牲隐蔽性为代价, 采用多类型替换池杂糅的方式来提高攻击准确率, 无法兼顾攻击成功率和对抗样本的隐蔽性。为解决此问题, 提出一种针对对抗样本隐蔽性进行设计的中文对抗样本生成方法WordReproduction, 通过汉字本身词性并结合字词级维度来计算汉字的显著性得分, 在关键字词替换模块中利用形近字向量空间、字形拆分候选池和词语倒置3种字形替换方法, 分别对关键字和词进行替换, 并根据汉字的形态特征设计字形相似度评估算法, 更好地量化对抗样本与原文之间的相似程度。实验结果表明, WordReproduction方法生成的对抗样本在攻击成功率和字形相似度上均优于基线方法, 在情感分类场景的Transformer模型上, 相比WordHandling方法, WordReproduction的攻击成功率和字形相似度得分分别提高了51.64百分点和0.53, 其生成的对抗样本不仅能够误导模型的分类结果, 而且具有较高的隐蔽性, 使得人类阅读者很难察觉。
来源:2026年第1期
《计算机工程》期刊编辑部