计算机工程

北大核心,CA,INSPEC,JST,Pж(AJ)

国内刊号:31-1289/TP

国际刊号:1000-3428

计算机工程杂志2026年第5期:基于改进TD3算法的移动机器人路径规划

发布日期:

作者:李明明, 潘子豪

单位:西安科技大学通信与信息工程学院, 陕西 西安 710600

关键词:路径规划,深度强化学习,双延迟深度确定性策略梯度,粉红噪声,损失调整近似Actor优先经验回放

基金:国家自然科学基金(62401459)

传统的移动机器人路径规划算法通常需要在有地图的条件下才能有效规划路径。相比之下基于深度强化学习(DRL)的路径规划因其在无地图条件下的导航能力而备受关注。然而, 传统的DRL路径规划算法往往存在样本利用率低、训练速度慢、泛化能力不足等问题。针对上述问题, 对双延迟深度确定性(TD3)策略梯度算法进行改进以提高其在移动机器人路径规划中的性能。首先, 针对TD3算法持续探索空间能力有限的问题, 对其探索策略进行改进, 通过使用具有时间相关性的粉红噪声来增强算法的持续探索空间能力。其次, 结合n步方法和损失调整近似Actor优先(LA3P)经验回放方法, n步方法将经验回放池中的即时奖励扩展为n步的累计折扣奖励, 能够更准确地捕捉长期奖励信号, 而LA3P方法通过对n步经验的高效利用, 提高样本利用率和算法的性能。最后, 通过在Gazebo中搭建了3个不同的环境进行实验, 并和多种算法进行比较。实验结果表明, 改进算法在训练时间、平均成功率、平均距离等方面更具优势, 证明了改进算法的有效性。

来源:2026年第5期

《计算机工程》期刊编辑部

查看计算机工程杂志2026年第5期

联系我们

  • 地址:上海市嘉定区澄浏公路63号
  • 电话:(021) 67092217
  • E-mail:ecice06@ecict.com.cn

咨询工作人员