Ouariel的个人博客分享 http://blog.sciencenet.cn/u/Ouariel

博文

基于因果影响检测的多无人机海上协同导航策略优化方法

已有 217 次阅读 2026-8-19 16:19 |系统分类:博客资讯

引用本文

 

柳文章, 陆建华, 任璐, 孙长银. 基于因果影响检测的多无人机海上协同导航策略优化方法. 自动化学报, 2026, 52(5): 10691082 doi: 10.16383/j.aas.c250691

Liu Wen-Zhang, Lu Jian-Hua, Ren Lu, Sun Chang-Yin. Policy optimization method for multi-UAV cooperative maritime navigation based on causal influence detection. Acta Automatica Sinica, 2026, 52(5): 10691082 doi: 10.16383/j.aas.c250691

http://www.aas.net.cn/cn/article/doi/10.16383/j.aas.c250691

 

关键词

 

多无人机协同,近端策略优化,多智能体强化学习,因果影响检测

 

摘要

 

多无人机协同导航是实现高效海上协同作业的重要技术. 然而, 在广阔且动态未知的海域中, 受限的感知能力与自主决策机制使无人机之间的协作关系复杂, 难以获取全局信息. 近年来, 基于集中训练与分散执行范式的多智能体强化学习在协作行为学习方面取得显著进展, 并被广泛应用于海上协同导航任务. 但由于智能体交互往往仅在特定情境下发生, 如何有效提升协作效率与探索能力仍是关键挑战. 为解决上述问题, 提出一种基于因果影响检测的多智能体近端策略优化方法. 该方法以智能体之间的因果影响为衡量准则, 引入基于协作规则设计的内在奖励机制, 利用因果推断与条件互信息来检测智能体之间在行为上的因果影响, 从而引导其优先探索对全局状态具有正向影响的动作, 强化多智能体间的合作. 实验结果表明, 所提方法表现出显著的性能提升, 尤其在海上搜救任务中展现出更高的协同效率, 验证了方法的有效性.

 

文章导读

 

无人机(unmanned aerial vehicle, UAV)通常指通过无线电遥控或自主控制系统操纵的无人飞行器, 因其视野广、机动性强、部署灵活等优势, 已在海上巡逻、海洋环境与水质监测、海上搜救以及海上资源探测等典型海洋任务中发挥着重要作用[1–4]. 然而, 单架无人机在续航能力、载荷规模与任务多样性方面存在先天限制, 难以在复杂海域中独立完成长时间、高强度、多目标的作业需求. 因此, 作为群体智能的重要形式, 多无人机(multi-UAV)协同被视为提升作业效率与系统鲁棒性的有效途径, 而协同导航则是多无人机协同执行海上任务的关键技术之一. 近年来, 多无人机协同导航的控制方法与路径规划策略已成为研究热点, 并在理论与应用层面得到广泛探讨[5–10]. 在海上搜救这一时效性强、环境复杂且风险较高的典型应用场景中, 如何通过无人机间的协同配合以最快速度、最低成本覆盖目标区域并实现高概率目标发现, 成为亟待解决的关键科学与工程问题.

 

受自然界群体行为启发的仿生群体智能方法[11–13], 由于能够通过简单的局部规则涌现出复杂而有序的整体协同行为, 在多无人机协同任务中展现出独特优势. 然而, 在真实海域中, 海况变化、目标分布不确定性以及传感噪声等因素使得系统策略必须具备面对未知扰动和任务变化时的快速适应与在线调整能力, 这一需求超出传统基于规则或优化方法在参数设定、泛化能力与鲁棒性方面的能力边界. 为应对上述挑战, 多智能体强化学习(multi-agent reinforcement learning, MARL)[14–16] 通过交互式试错学习端到端的协同策略, 能够处理部分可观测下多智能体协作系统中的关键问题, 将仿生群体智能的启发式优势与数据驱动的学习能力有效结合起来. 因此, MARL 为实现海上多无人机任务中的高效、鲁棒与可泛化的协同导航提供一条可行的智能化路径.

 

在算法设计与工程实现方面, 许多经典的 MARL 算法被提出, 如值分解网络(value decomposition networks, VDN)[17]Q混合网络(Q mixing network, QMIX)[18]、多智能体深度确定性策略梯度(multi-agent deep deterministic policy gradient, MADDPG)[19]、多智能体近端策略优化(multi-agent proximal policy optimization, MAPPO)[20]、反事实多智能体策略梯度(counterfactual multi-agent policy gradient, COMA)[21]. 随着无人机平台算力与传感能力提升, MARL 被逐步应用于海上搜救等复杂任务场景. 例如, Rashid[22]将强化学习算法用于无人机与水面无人艇组成的联合网络中以实现协同搜救和路径规划. Lei[23]基于IPPO (independent proximal policy optimization)算法, 针对救援无人机、路由无人机以及救援舰艇的轨迹规划与资源调度问题, 提出一种可扩展的MARL算法, 实现异构系统的自适应调节. Lei[24]还针对无人机与水面设备之间的通信问题, 提出一种基于MAPPO的异构车辆多智能体近端策略优化算法. 同样基于MAPPO, Wu[25]结合基于种群的学习机制与高斯混合模型(Gaussian mixture model, GMM)使具有不同探索偏好的智能体能够发掘无人机间的最优协作模式. 文献[26]基于深度Q网络(deep Q-network)提出一种新的网络结构, 实现多无人机之间的最优飞行轨迹规划. 针对未知区域的多无人机协作, Hou[27]提出基于MADDPG的分布式协同搜索并利用卷积神经网络(convolutional neural networks, CNN)处理高维地图数据, 实现对未知区域的协同搜索, 有效避免了碰撞与重复搜索.

 

这些基于集中训练与分散执行(centralized training and decentralized execution, CTDE)框架下的MARL算法通过智能体与环境的持续交互, 收集经验数据从而学习出接近最优的协同策略. 然而, 在完全协作的多智能体系统中, 由于奖励分配机制往往依赖全局奖励信号, 个体难以准确评估自身行为对整体任务的贡献, 导致一些智能体没有做出对团队奖励提升有用的行为却仍能获得和其他智能体相同的团队奖励, 这种现象称为懒惰智能体 (lazy agent)[17, 28]. 此外, 许多MARL算法假设智能体策略相互独立, 从而在优化过程中忽视了其他智能体的决策影响, 这种独立的策略设计进一步限制了智能体间协同行为的学习. 因此, 考虑智能体之间行为的相互影响成为当前MARL领域研究的重要方向. 文献[29–30]为缓解环境的非平稳性问题并实现智能体之间的协作, 在智能体决策时考虑自身行为对其他智能体行为的影响进而提升了算法的性能. 文献[31–33]提出通过互信息(mutual information, MI)来量化智能体行为之间的相关性, 以最大化行为相关性从而增强协作. 然而, 在这些方法中如何有效协调多智能体的同步动作仍然是一个具有挑战性的问题.

 

针对以上问题, 本文从因果推断的角度出发考虑智能体之间的因果影响, 提出一种基于因果影响检测的多智能体近端策略优化(causal influence detection for multi-agent proximal policy optimization, CID-MAPPO)方法. 该方法通过使用条件互信息(conditional mutual information, CMI)方法计算智能体与团队之间的因果影响因子, 并将其纳入内在奖励机制. 这种内在奖励机制能够有效促进关键动作的识别, 从而增强智能体之间的协作能力. 需要指出的是, 现有因果驱动的强化学习方法可大致分为两类: 一是以文献[34]为代表的单智能体因果影响检测方法, 通过衡量动作对状态特征的因果效应加速探索, 但其未涉及多智能体间的联合动作反事实分析, 难以直接应用于多智能体场景; 二是以文献[30]为代表的多智能体因果影响方法, 侧重于检测智能体动作对其他智能体行为的因果影响, 并引入情境门控机制实现选择性协作. 与上述方法不同, 本文的因果影响度量聚焦于个体动作对全局状态转移分布的边际干预效应, 采用高斯与混合高斯分布间的KL (Kullback-Leibler)散度进行分布层面的量化, 从而为信用分配提供更直接的依据. 本文从状态转移分布层面刻画个体动作对系统演化的结构性影响. 该视角强调因果路径而非统计相关性, 从而为协作任务MARL中的信用分配问题提供一种分布级建模方式. 通过在模拟多无人机协同导航任务中的实验验证, 本文所提方法与基准算法相比, 有效提升了多无人机协同导航任务的性能.

1  多无人机协同导航示意图

2  无人机的机体固定坐标系和惯性坐标系

3  具有3个智能体的单步状态转移因果图模型

 

为促进多无人机之间的有效协作并增强探索能力, 本文提出了CID-MAPPO方法. 该方法从因果关系视角度量无人机行为对团队整体的影响, 并在此基础上设计内在奖励机制, 将无人机之间的因果影响显式引入策略更新过程. 通过鼓励无人机优先探索对全局状态具有正向贡献的动作, CID-MAPPO 能够显著提升协作效率与任务表现. 相较于现有基于相关性或经验设计奖励的方法, CID-MAPPO能够更直接地刻画个体行为对团队协作的实际作用, 尤其适用于多智能体强耦合、协作关系复杂的任务场景. 在模拟的多无人机海上救援任务场景中, 本文对所提算法进行了性能验证. 实验结果表明, 与现有主流方法相比, CID-MAPPO 在协作性、稳定性以及综合性能方面均取得了显著提升, 有效验证了方法的可行性与优势.

 

作者简介

 

柳文章

安徽大学人工智能学院讲师. 2021年获得东南大学控制科学与工程专业博士学位. 主要研究方向为深度强化学习, 具身智能系统, 多智能体强化学习, 迁移强化学习. E-mail: wzliu@ahu.edu.cn

 

陆建华

安徽大学人工智能学院硕士研究生. 主要研究方向为多智能体强化学习, 多无人机协同控制. E-mail: jhlu@stu.ahu.edu.cn

 

任璐

安徽大学人工智能学院副教授. 2021年获得东南大学控制科学与工程专业博士学位. 主要研究方向为自主无人系统分布式协同控制, 深度强化学习和多智能体强化学习. E-mail: penny_lu@ahu.edu.cn

 

孙长银

安徽大学人工智能学院教授. 2004年获得东南大学电子工程专业博士学位. 主要研究方向为智能控制, 飞行器控制, 模式识别和优化理论. 本文通信作者. E-mail: cysun@seu.edu.cn



https://blog.sciencenet.cn/blog-3291369-1548659.html

上一篇:基于超宽带信息智能决策的无人机自主精确定位方法
下一篇:仿生多关节管道机器人结构设计与系统控制研究



    
收藏 IP: 221.216.116.*| 热度|

0

该博文允许注册用户评论 请点击登录 评论 (0 个评论)

数据加载中...

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )

GMT+8, 2026-8-24 15:59

Powered by ScienceNet.cn

Copyright © 2007- 中国科学报社

返回顶部