国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:吴凯峰, 刘磊, 刘晨, 梁成庆
单位:河海大学数学学院, 江苏 南京 211100
关键词:无人机编队,深度强化学习,多智能体深度确定性策略梯度,课程学习,神经网络
基金:河北省自然科学基金面上项目(A2023209002)
多智能体深度确定性梯度(MADDPG)算法由深度确定性策略梯度(DDPG)算法扩展而来, 专门针对多智能体环境设计, 算法中每个智能体不仅考虑自身的观察和行动, 还考虑其他智能体的策略, 以更好地进行集体决策, 这种设计显著提升了其在复杂、多变的环境中的性能和稳定性。基于MADDPG算法框架, 设计算法的网络结构、状态空间、动作空间和奖励函数, 实现无人机编队控制。为解决多智能体算法收敛困难的问题, 训练过程中使用课程强化学习将任务进行阶段分解, 针对每次任务不同, 设计层次递进的奖励函数, 并使用人工势场思想设计稠密奖励, 使得训练难度大大降低。在自主搭建的软件在环(SITL)仿真环境中, 通过消融、对照实验, 验证了MADDPG算法在多智能体环境中的有效性和稳定性。最后进行实机实验, 在现实环境中进一步验证了所设计算法的实用性。
来源:2025年第5期
《计算机工程》期刊编辑部