国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:叶宝林, 孙瑞涛, 李灵犀, 吴维敏
单位:1. 嘉兴大学信息科学与工程学院, 浙江 嘉兴 3140012. 浙江理工大学信息科学与工程学院, 浙江 杭州 3100183. 普渡大学埃尔莫尔家族电气与计算机工程学院, 美国 西拉法叶 479074. 浙江大学智能系统与控制研究所工业控制技术国家重点实验室, 浙江 杭州 310027
关键词:交通信号控制,优势演员评论家,交通状态预测,双向长短时记忆网络
基金:国家自然科学基金(61603154); 浙江省自然科学基金(LTGS23F030002); 浙江省尖兵领雁研发攻关计划项目(2023C01174); 嘉兴市应用性基础研究项目(2023AY11034); 工业控制技术国家重点实验室开放课题(ICT2022B52)
现有基于强化学习的交通信号控制方法主要使用历史交通状态和当前时间步的实时交通状态来确定下一个时间步的控制策略, 造成控制策略始终滞后于交通状态一个时间步。为了解决该问题, 提出一种基于融合交通状态预测的深度强化学习优势演员评论家(A2C)的交通信号控制方法。首先, 为了获取未来时间步的交通状态, 以确保制定的控制策略能够更精准地响应实时交通状态下的决策需求, 设计一个长短时记忆(LSTM)网络预测路网未来时间步的交通状态。然后, 为了提高输入深度强化学习模型中数据的准确性和鲁棒性, 设计一个卡尔曼滤波器对采集的历史交通状态数据和LSTM网络预测的未来交通状态数据进行融合。其次, 为了使深度强化学习模型能够更全面地理解交通流量中包含的时间依赖关系, 并实现更高效和稳定的交通信号控制决策, 提出一种融合双向LSTM网络的A2C算法。最后, 基于微观交通仿真(SUMO)平台的仿真测试结果表明, 与传统交通信号控制方法和基于深度强化学习A2C的交通信号控制方法相比, 该方法在低峰、平峰和高峰两种不同交通流量状态下均能够取得更好的交通信号控制效益。
来源:2025年第5期
《计算机工程》期刊编辑部