国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:魏铭康, 李嘉楠, 韩林, 高伟, 赵荣彩, 王洪生
单位:1. 郑州大学计算机与人工智能学院, 河南 郑州 4500002. 国家超级计算郑州中心(郑州大学), 河南 郑州 450000
关键词:模型量化,模型部署,模型压缩,推理加速,深度学习编译器
基金:河南省重大科技专项(221100210600)
随着各大厂商对大模型应用部署需求的激增, 深度学习编译器TVM(Tensor Virtual Machine)的单一量化方式精度下降, 已无法满足部署需求。设计并构建一种可选粒度的模型量化框架, 具体包括逐层与逐通道量化流程的支持, 以及阈值搜索与自适应舍入优化算法的实现。首先, 基于量化模块“relay.quantize”构建信息标注、阈值校准与量化图实现的框架流程, 并添加粒度属性以显式识别量化方式。其次, 针对预定义校准方法无法确定有效量化信息的问题, 对量化中的阈值校准、权重舍入进行调优, 提高量化后模型精度。实验采用ImageNet数据集对视觉网络进行测试, 针对MobileNetV1新量化方案将8 bit量化后模型精度损失降低到2.3%, 调优后该损失降低到0.7%, 实验结果表明多粒度量化框架可有效降低量化误差。
来源:2025年第5期
《计算机工程》期刊编辑部