国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:段丹丹, 唐加山, 温勇, 袁克海
单位:1. 南京邮电大学 理学院, 南京 210023;2. 圣母大学 心理学系, 美国 南本德 46556
关键词:中文短文本分类,基于Transformer的双向编码器表示,Softmax回归模型,TextCNN模型,word2vec模型
基金:南京邮电大学横向科研项目(2018外095)。
针对现有中文短文本分类算法通常存在特征稀疏、用词不规范和数据海量等问题,提出一种基于Transformer的双向编码器表示(BERT)的中文短文本分类算法,使用BERT预训练语言模型对短文本进行句子层面的特征向量表示,并将获得的特征向量输入Softmax回归模型进行训练与分类。实验结果表明,随着搜狐新闻文本数据量的增加,该算法在测试集上的整体F1值最高达到93%,相比基于TextCNN模型的短文本分类算法提升6个百分点,说明其能有效表示句子层面的语义信息,具有更好的中文短文本分类效果。
来源:2021年第1期
《计算机工程》期刊编辑部