国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:杨思明, 单征, 丁煜, 李刚伟
单位:1. 数学工程与先进计算国家重点实验室, 郑州 450001;2. 中国人民解放军94162部队, 西安 710600;3. 中国人民解放军78100部队, 成都 610031
关键词:深度学习,强化学习,深度强化学习,逆向强化学习,基于模型的元学习
基金:国家自然科学基金(61971092,61701503)。
深度强化学习是指利用深度神经网络的特征表示能力对强化学习的状态、动作、价值等函数进行拟合,以提升强化学习模型性能,广泛应用于电子游戏、机械控制、推荐系统、金融投资等领域。回顾深度强化学习方法的主要发展历程,根据当前研究目标对深度强化学习方法进行分类,分析与讨论高维状态动作空间任务上的算法收敛、复杂应用场景下的算法样本效率提高、奖励函数稀疏或无明确定义情况下的算法探索以及多任务场景下的算法泛化性能增强问题,总结与归纳4类深度强化学习方法的研究现状,同时针对深度强化学习技术的未来发展方向进行展望。
来源:2021年第12期
《计算机工程》期刊编辑部