国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:赵宏, 陈志文, 郭岚, 安冬
单位:兰州理工大学 计算机与通信学院, 兰州 730050
关键词:视频内容描述,视频理解,ViT模型,语义引导,长短期记忆网络,注意力机制
基金:国家自然科学基金“基于深度学习的广谱恶意域名检测方法研究”(62166025);甘肃省重点研发计划“监控视频内容理解和描述文本生成以及在重点行业的示范应用”(21YF5GA073)。
现有视频内容描述模型生成的视频内容描述文本可读性差且准确率不高。基于ViT模型提出一种语义引导的视频内容描述方法。利用ReNeXt和ECO网络提取视频的视觉特征,以提取的视觉特征为输入、语义标签的概率预测值为输出训练语义检测网络(SDN)。在此基础上,通过ViT模型对静态和动态视觉特征进行全局编码,并与SDN提取的语义特征进行注意力融合,采用语义长短期记忆网络对融合特征进行解码,生成视频对应的描述文本。通过引入视频中的语义特征能够引导模型生成更符合人类习惯的描述,使生成的描述更具可读性。在MSR-VTT数据集上的测试结果表明,该模型的BLEU-4、METEOR、ROUGE-L和CIDEr指标分别为44.8、28.9、62.8和51.1,相比于当前主流的视频内容描述模型ADL和SBAT,提升的得分总和达到16.6和16.8。
来源:2023年第5期
《计算机工程》期刊编辑部