国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:周瑞朋, 秦进
单位:贵州大学 计算机科学与技术学院, 贵阳 550025
关键词:强化学习,过度探索,MEG探索,相似度,最佳子策略
基金:国家自然科学基金(61562009);贵州省科学技术基金(黔科合支撑[2020]3Y004号)。
现有强化学习探索策略存在过度探索的问题,导致智能体收敛速度减慢。通过设计一个基于奖励排序的存储表(M表)和ε-greedy改进算法,提出基于最佳子策略记忆的强化探索策略。将奖励值大于零的样本以子策略的形式存入M表,使其基于奖励降序排序,在整个训练过程中,使用与表中相似且奖励值较高的样本以子策略形式替换表中子策略,从而在表中形成一个能有效产生目前最优奖励的动作集合,提高探索的针对性,而不是随机探索。同时,在ε-greedy算法基础上按一定的概率分配,使智能体通过使用M表探索得到MEG探索策略。基于此,智能体在一定概率下将当前状态与M表中子策略匹配,若相似,则将表中与其相似的子策略对应动作反馈给智能体,智能体执行该动作。实验结果表明,该策略能够有效缓解过度探索现象,与DQN系列算法和非DQN系列的A2C算法相比,其在Playing Atari 2600游戏的控制问题中获得了更高的平均奖励值。
来源:2022年第2期
《计算机工程》期刊编辑部