国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:王少桐, 况立群, 韩慧妍, 熊风光, 薛红新
单位:中北大学计算机科学与技术学院, 山西 太原 030051
关键词:强化学习,移动机器人,后见经验回放,神经网络,样本利用率
基金:国家自然科学基金(62106238); 山西省回国留学人员科研项目(2020-113); 山西省科学成果转化引导专项(202104021301055)
目前强化学习在移动机器人领域表现出了强大的潜力,将强化学习算法与机器人导航相结合,不需要依赖先验知识就可以实现移动机器人的自主导航,但是在机器人强化学习过程中存在样本利用率低且泛化能力不强的问题。针对上述问题,在D3QN算法的基础上提出优势后见经验回放算法用于经验样本的回放。首先计算轨迹样本中轨迹点的优势函数值,选择优势函数最大值的点作为目标点,然后对轨迹样本进行重新标记,将新旧轨迹样本一同放入经验池中增加经验样本的多样性,使智能体利用失败的经验样本学习,更高效地实现到目标点的导航。为评估该方法的有效性,基于Gazebo平台搭建不同的实验环境,并采用TurtleBot3机器人在仿真环境下进行导航训练与迁移测试,结果表明,该算法在训练环境下导航成功率高于当前主流算法,在迁移测试环境中导航成功率可达86.33%,能够有效提高导航样本利用率,降低导航策略学习难度,增强移动机器人在不同环境中的自主导航能力和迁移泛化能力。
来源:2024年第1期
《计算机工程》期刊编辑部