郭宇航,王俱博玺,布树辉,韩鹏程,陈子建
摘要: 针对复杂未知威胁环境下固定翼无人机集群的编队保持与协同避险问题,提出了一种基于物理感知注意力的多智能体深度确定性策略梯度(PA-MADDPG)算法。首先,设计了一个物理感知注意力模块,将人工势场法作为物理先验知识与注意力网络相结合,显著提升了集群在复杂动态威胁下的避险鲁棒性与跨规模拓扑泛化能力;其次,设计了一种自适应门控复合稠密奖励函数,有效缓解了长时域任务中稀疏奖励导致的梯度信号不足和多目标冲突问题。此外,提出了一种进化策略同步机制,通过周期性筛选高适应度智能体并将其策略参数同步到其他智能体上,结合优先经验回放机制,加速了训练收敛。仿真结果表明,在静态、动态威胁场景下,采用该算法的集群机间避障率与环境避险率均达到92%以上,任务综合效能较其他算法有明显提升;在动态拓扑泛化场景下,算法的避障与避险率仍保持在82%以上,证实了该算法不仅实现了固定翼无人机集群的高效避险与编队保持,更具备在复杂变阵任务中灵活迁移的强鲁棒性。
中图分类号: