国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:于丹宁, 倪坤, 刘云龙
单位:厦门大学 航空航天学院, 福建 厦门 361102
关键词:部分可观测马尔科夫决策过程,值迭代,卷积神经网络,循环卷积神经网络,智能体规划
基金:国家自然科学基金(61772438,61375077)。
基于卷积神经网络的部分可观测马尔科夫决策过程(POMDP)值迭代算法QMDP-net在无先验知识的情况下具有较好的性能表现,但其存在训练效果不稳定、参数敏感等优化难题。提出基于循环卷积神经网络的POMDP值迭代算法RQMDP-net,使用门控循环单元网络实现值迭代更新,在保留输入和递归权重矩阵卷积特性的同时增强网络时序处理能力。实验结果表明,RQMDP-net在10×10网格地图规划任务中导航准确率高达98.5%,且在36×36网格地图规划任务中相比QMDP-net最多提升5.8个百分点,具有更快的网络收敛速度和更强的导航任务规划能力。
来源:2021年第2期
《计算机工程》期刊编辑部