国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:彭允, 王玉冰, 梁磊, 宋悦, 邱橙, 雷宇鑫, 贾鹏, 缪国庆, 秦莉, 王立军
单位:1. 中国科学院长春光学精密机械与物理研究所发光学及应用国家重点实验室, 吉林 长春 1300332. 中国科学院大学材料与光电研究中心, 北京 100049
关键词:Winograd,卷积加速算子,硬件加速,异构采样,现场可编辑逻辑门阵列
基金:吉林省科技发展计划(20230201033GX); 长春市优秀青年科技人才(23YQ18); 国家自然科学基金(62090054); 国家重点研发计划(2022YFB2803500); 吉林省国际合作项目(20230502005GH); 中国工程院院地合作项目(JL2023-16)
近年来,人工智能在大模型、自动驾驶、机器人等领域得到广泛应用。神经网络作为人工智能的核心,具备大数据处理、学习适应复杂模式和完成各种任务的功能。神经网络通常利用卷积运算提取输入数据的局部特征,帮助其学习并理解图像、声音等数据的结构和模式。然而,在一次卷积运算过程中涉及密集的乘累加运算,占据了绝大部分的卷积运算时间,成为了神经网络实时部署的技术瓶颈。从硬件层面加速卷积运算,提出一种Winograd异构采样窗口卷积加速算子,采用异构4×2采样窗口提升数据利用率,采用流水线、定点化等手段设计Winograd硬件加速模块,提出基于池化融合的ReLU模块。在现场可编辑逻辑门阵列(FPGA)上进行原型验证实验,实验结果表明,所提算子对比单路原始滑窗卷积共获得86.4倍的加速比,对比三路滑窗卷积获得28.8倍的加速比,读写数据量减少为原来的11.07%,资源消耗比同类型Winograd卷积加速算子低,对比快速傅里叶变换(FFT)有明显优势,具备大规模集成和构建卷积神经网络的能力。
来源:2025年第9期
《计算机工程》期刊编辑部