国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:张尊栋, 王岩楠, 周慧娟, 张艺帆
单位:1. 北方工业大学 城市道路交通智能控制技术北京市重点实验室, 北京 100144;2. 华盛顿大学 智能城市交通系统实验室, 美国 西雅图 98195;3. 北京交通大学 轨道交通控制与安全国家重点实验室, 北京 100044
关键词:Q学习,决策机制,网络演化博弈,合作水平,折扣率
基金:“十三五”国家重点研发计划(2018YFB1601000)。
针对博弈决策过程中个体无法获取邻居收益的问题,基于Q学习自我经验学习的特性,提出Q学习演化博弈模型。考虑到不同Q学习决策机制会对网络合作水平产生不同的影响,采用ε-greedy决策机制、Boltzmann决策机制和Max-plus决策机制,针对不同的网络类型、不同的博弈模型参数和不同的强化学习参数进行对比实验,量化分析决策机制对网络合作水平的影响。 实验结果表明:与传统的演化博弈模型相比,Q学习演化博弈模型能够普遍提高网络的合作水平,并且不同的Q学习决策机制会对网络合作水平产生不同的影响,使用ε-greedy决策机制的模型合作水平比另两种模型高约35%和37%;较低的学习率、较高的折扣率以及适中的收益均匀性能够促进网络中个体间的合作,使用ε-greedy决策机制的模型合作水平比在较高学习率和较低折扣率下的合作水平分别高约40%和45%;在较高的探索率下,引入考虑个体全局属性的Max-plus决策机制的网络平均收益比引入另两种决策机制的Q学习模型高约22%和17%。
来源:2023年第6期
《计算机工程》期刊编辑部