国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:黄思扬, 蔡瑞初, 乔杰, 郝志峰
单位:1. 广东工业大学计算机学院, 广东 广州 5100062. 汕头大学理学院, 广东 汕头 515063
关键词:强化学习,因果发现,因果强化学习,因果掩码,策略学习
基金:国家自然科学基金(61876043); 国家自然科学基金(61976052); 国家自然科学基金(62206064); 科技创新2030—“新一代人工智能”重大项目(2021ZD0111501); 国家优秀青年科学基金(62122022)
针对序列上连续决策问题, 诸如故障告警根因定位问题, 强化学习(RL)已经成为一种重要的解决方法, 但现有强化学习方法存在样本效率低、探索成本高昂等问题, 阻碍了其广泛应用。研究表明, 引入因果知识为提升强化学习智能体的决策可解释性和样本效率提供了巨大潜力。然而, 现有方法大多停留在隐式建模环境因果关系, 未能直接利用因果结构知识。提出一种两阶段因果强化学习算法, 第一阶段基于观察数据用因果模型对环境变量进行显式建模, 第二阶段基于所学因果结构进一步构造因果掩码来增强策略, 帮助缩小决策空间, 减小探索风险。由于缺乏允许直接因果推理的公共基准环境, 在模拟故障告警环境中设计根因定位任务, 并在不同维度的环境中通过对比实验证明所提算法的有效性和鲁棒性。实验结果表明, 所提算法在累积奖励指标上相比现有的主流强化学习SAC (Soft Actor-Critic)算法, 在低维环境下提升了13%, 在高维环境下提升了79%, 而且仅需少数的探索即可收敛策略, 样本效率在低维和高维环境下分别提升了27%和52%。
来源:2025年第4期
《计算机工程》期刊编辑部