国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:孙浩淼, 李宗民, 肖倩, 孙文洁, 张雯欣
单位:1. 中国石油大学(华东)计算机科学与技术学院, 山东 青岛 2665802. 山东石油化工学院大数据与基础科学学院, 山东 东营 257061
关键词:强化学习,深度学习,冰壶检测,小目标检测,蒙特卡洛树搜索
基金:国家重点研发计划(2019YFF0301800); 国家自然科学基金(61379106); 山东省自然科学基金(ZR2013FM036); 山东省自然科学基金(ZR2015FM011)
为满足冰壶智能训练的需求, 结合计算机视觉与深度强化学习(RL)技术, 提出一种新的现场冰壶决策方法AI-Curling。AI-Curling包含冰壶检测(SR-Yolo)以及策略生成(GSP-MCTS) 2个部分。SR-Yolo模块负责感知关键时刻冰壶状态, 提取实景冰壶的位置与种类信息。为提高大场景下的小目标检测精度, 防止不恰当下采样造成的特征损失, 引入浅层细化骨干网络(SRNet), 通过在网络初级阶段增加层级, 捕获更丰富的特征信息。此外, 在多尺度融合网络中, 引入自适应特征优化融合(AFOF)模块, 以增加各层网络有效样本, 避免小尺度目标淹没在复杂背景和噪声中。GSP-MCTS模块通过蒙特卡洛树搜索(MCTS)算法结合策略价值网络的方式, 实现冰壶比赛决策分析。该模块通过引入核函数处理动作空间连续性和执行不确定性, 并在策略价值网络中嵌入全局策略感知模块(GSP), 增强了网络空间感知能力。在实验中, SR-Yolo在常规冰壶数据集Curling上平均精度均值(mAP@0.5)为0.974, 在遮挡较多的复杂冰壶数据集Curling_hard上mAP@0.5为0.723。同时, GSP-MCTS与最新实景冰壶模型Curling MCTS对战获得62%的胜率。实验结果表明, GSP-MCTS具有更好的性能。
来源:2025年第2期
《计算机工程》期刊编辑部