国内刊号:61-1525/N
国际刊号:2097-1915
发布日期:
作者:胡智尧,于淼,田开元
单位:军事科学院战争研究院,北京,100091\
关键词:深度强化学习;多智能体;门控循环单元;时间序列预测;对手建模
基金:国家自然科学基金(62402519)
大量研究表明多智能体强化学习算法在智能体数量变多时难以收敛,但若在获得对手行动信息的前提下进行集中式训练,可克服非平稳环境等挑战,实现更好的学习效果。针对对手连续决策的预测问题,提出了基于门控循环神经网络的时间序列对手建模方法,将对手状态、环境状态、我方智能体行动等数据构建时间序列,利用门控循环单元挖掘对手行动规律,从而捕捉对手智能体连续决策的时序信息;设计了可变长度推理方法,通过评估上述时间序列的可信度,确定模型输入的最佳时间序列长度,避免误用对手陈旧样本数据。实验结果表明,该模型结合可变长度推理方法能实现更强的对手预测能力,可有效从历史时间序列中学习对手智能体如何适应不断变化的环境并预测对手未来行动。与SAM 等现有方法相比,本文所提方法通过评估对手行动的预测可信度来筛选最佳历史序列,在对手行动预测准确率上提升了6%以上。
来源:2025年第6期
《空军工程大学学报》期刊编辑部