国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:狄新凯, 杨海钢
单位:1. 中国科学院空天信息创新研究院, 北京 100094;2. 中国科学院大学, 北京 100049
关键词:卷积神经网络,稀疏性,现场可编程门阵列,并行加速器,数字信号处理器,加法树
基金:国家自然科学基金(61876172);北京市科委重大科研计划项目(Z171100000117019)。
为消除卷积神经网络前向计算过程中因模型参数的稀疏性而出现的无效运算,基于现场可编程门阵列(FPGA)设计针对稀疏化神经网络模型的数据流及并行加速器。通过专用逻辑模块在输入通道方向上筛选出特征图矩阵和卷积滤波器矩阵中的非零点,将有效数据传递给由数字信号处理器组成的阵列做乘累加操作。在此基础上,对所有相关的中间结果经加法树获得最终输出特征图点,同时在特征图宽度、高度和输出通道方向上做粗颗粒度并行并寻找最佳的设计参数。在Xilinx器件上进行实验验证,结果表明,该设计实现VGG16卷积层综合性能达到678.2 GOPS,性能功耗比为69.45 GOPS/W,其性能与功耗指标较基于FPGA的稠密网络加速器和稀疏网络加速器有较大提升。
来源:2021年第7期
《计算机工程》期刊编辑部