空军工程大学学报

北大核心,JST,Pж(AJ),CSCD扩展版,

国内刊号:61-1525/N

国际刊号:2097-1915

空军工程大学学报杂志2021年第4期:基于改进双延迟深度确定性策略梯度法的无人机反追击机动决策

发布日期:

作者:郭万春,解武杰,尹晖,董文瀚

单位:1.空军工程大学航空工程学院, 西安, 710038; 2.空军工程大学教研保障中心, 西安, 710051\

关键词:深度强化学习;近距空战;无人机;双延迟深度确定性策略梯度法

针对近距空战下的自主机动反追击问题,建立了无人机反追击马尔科夫(Markov)决策过程模型;在此基础上,提出了一种采用深度强化学习的无人机反追击自主机动决策方法。新方法基于经验回放区重构,改进了双延迟深度确定性策略梯度(TD3)算法,通过拟合策略函数与状态动作值函数,生成最优策略网络。仿真实验表明,在随机初始位置/姿态条件下,与采用纯追踪法的无人机对抗,该方法训练的智能无人机胜率超过93%;与传统的TD3、深度确定性策略梯度(DDPG)算法相比,该方法收敛性更快、稳定性更高。

来源:2021年第4期

《空军工程大学学报》期刊编辑部

查看空军工程大学学报杂志2021年第4期

联系我们

  • 地址:陕西省西安市灞桥区长乐东路甲字1号
  • 电话:029-84786242
  • E-mail:kgdbjb@163.com

咨询工作人员