国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:黄晓辉, 张雄, 杨凯铭, 熊李艳
单位:华东交通大学 信息工程学院, 南昌 330013
关键词:多智能体,强化学习,值函数,订单派送,神经网络
基金:国家自然科学基金(62062033,62067002,61967006);江西省自然科学基金青年重点项目(20192ACBL21006);江西省自然科学基金面上项目(20212BAB202008)。
因网约车订单派送不合理,导致资源利用率和出行效率降低。基于联合Q值函数分解的框架,提出两种订单派送方法ODDRL和LF-ODDRL,高效地将用户订单请求派送给合适的网约车司机,尽可能缩短乘客等待时间。为捕获网约车订单派送场景中随机需求与供应动态变化关系,把城市定义为一张四边形网格的地图,将每辆车视为一个独立的智能体,构建多智能体马尔可夫决策过程模型,通过最大化熵与累计奖励训练智能体。将多智能体的联合Q值函数转化为易分解函数,使联合Q值函数与单个智能体值函数中的动作具有一致性,同时设计动作搜索函数,结合集中训练、分散执行策略的优点,让每辆车以分布式的方式解决订单匹配问题,而不需要与其他车辆进行协调,从而降低复杂性。实验结果表明,相比Random、Greedy、QMIX等方法,所提ODDRL和LF-ODDRL具有较优的扩展性,其中,在500×500网格上,当乘客数为10、车辆数为2时,相对于QMIX方法接送乘客所产生的总时间分别缩短5%和12%。
来源:2022年第12期
《计算机工程》期刊编辑部