CTACTT的个人博客分享 http://blog.sciencenet.cn/u/CTACTT

博文

2025年度最佳论文奖 | 基于分层强化学习的多无人机协同围捕方法

已有 419 次阅读 2026-8-28 17:23 |个人分类:论文推荐|系统分类:博客资讯

编辑荐语

本期将给大家分享2025年度最佳论文奖获奖文章"基于分层强化学习的多无人机协同围捕方法(Multi-UAV collaborative pursuit method via hierarchical reinforcement learning)". 如您对本期相关内容有好的理解与建议, 欢迎评论区留言.

本文聚焦复杂障碍环境下多无人机协同围捕面临的传统方法建模依赖强、单层强化学习训练困难、人工规则分层策略适配性差等核心难题, 提出一套“底层技能子策略预训练+高层自主策略切换”的分层强化学习解决方案SASHDRL. 研究将围捕任务拆分为导航避障、导航避碰子任务, 采用参数共享MADDPG完成底层子策略训练; 基于DDQN设计自主切换模块, 构建含切换惩罚的稀疏回报函数, 摆脱人工规则约束并缓解局部极小问题. 研究完成任务Dec-POMDP建模与无人机动力学表征, 通过数值仿真、泛化测试及XTDrone仿真平台开展验证, 相较多种基线算法, 该方法学习难度更低、围捕成功率更高、碰撞风险更小. 本工作为动态障碍空域多无人机围捕提供高效、可落地的智能决策框架, 对无人集群空域对抗、安防围捕任务具备重要理论与工程参考价值.

论文介绍

基于分层强化学习的多无人机协同围捕方法

Multi-UAV collaborative pursuit method via hierarchical reinforcement learning

孙懿豪1, 闫超1, 相晓嘉1, 唐邓清1, 周晗1†, 姜杰2

机构: 1. 国防科技大学 智能科学学院; 2. 中国运载火箭技术研究院

引用:

孙懿豪, 闫超, 相晓嘉, 等. 基于分层强化学习的多无人机协同围捕方法. 控制理论与应用, 2025, 42(1): 96 – 108

DOI: 10.7641/CTA.2024.30439

全文链接: 

https://jcta.ijournals.cn/cta_cn/ch/reader/create_pdf.aspx?file_no=ccta230439&flag=1&journal_id=cta_cn&year_id=2025

摘要

针对复杂障碍环境下的动态目标围捕问题, 本文提出一种基于分层强化学习的多无人机协同围捕方法. 该方法包含两个层级的学习过程: 底层的子策略学习和高层的子策略切换. 具体而言, 将协同围捕任务分解为导航避障和导航避碰两个子任务, 独立学习相应的底层子策略, 分别赋予无人机协同围捕目标时所需的避障与避碰技能. 在此基础上, 设计带有切换惩罚的稀疏回报函数训练高层的子策略切换模块, 避免了对人工定义规则的依赖, 实现了底层技能的自动组合. 数值仿真与软件在环实验结果表明, 所提方法能够显著降低围捕策略的学习难度, 相较于基线方法具有最高的围捕成功率.

引言

二十余年来, 得益于无人机系统技术的不断发展与进步, 无人机 (unmanned aerial vehicle, UAV) 凭借其操作简单、响应快速、部署灵活、维护方便等独特优势, 逐渐成为遂行枯燥而恶劣、危险且纵深 (dull, dirty, dangerous, deep, 4D) 任务的重要平台[1] . 与单体无人机相比,多无人机系统自主性更强、抗毁性更好、鲁棒性更佳、容错性更优, 在覆盖搜索[2]、集群对抗[3]、协同围捕[4]等领域发挥了关键的作用. 在协同围捕任务中, 多架无人机需要合理的决策, 在保证安全的前提下捕获逃逸的目标. 解决好多无人机协同围捕问题, 对军事领域的无人机空战对抗[5] , 亦或民用领域的城市空中交通 (urban air mobility, UAM)[6] , 均具有重要的实践意义.

针对协同围捕问题, Wishart[7]通过求解哈密顿–雅各比方程 (Hamilton-Jacobi equation), 得到了在最简单情形下追击者捕获目标的条件, 但在面临更为复杂的障碍约束环境时, 该微分方程通常不具备平滑的解析解. Yuan等[8]提出了一种基于模糊控制的多机器人围捕方法, 每个追击者根据自身的局部感知信息, 实现了围捕时的目标跟踪与避碰避障. Chen等[9]使用基于一致性的卡尔曼滤波与粒子群优化算法, 分别完成了运动目标的轨迹预测及追击者的围捕势点分配. 然而, 上述方法往往依赖对环境或平台的精确建模. 在实际应用中, 这些精确模型往往难以获取. 此外, 尽管上述方法能在某些特定的场景下表现良好, 但由于环境的动态复杂性, 一旦场景发生变化, 可能需要重新设计控制率, 这严重影响了传统方法的适用范围.

近年来, 深度强化学习(deep reinforcement learning, DRL)[10]在人工智能领域取得了巨大的进展, 受到学术界和工业界的广泛关注. 在强化学习中, 智能体以试错的方式与环境不断交互来学习控制策略. 无模型强化学习方法可以不依赖复杂的环境模型, 甚至无需相关先验知识, 适用于未知动态环境下的序贯决策. 目前, 已有研究人员将DRL方法应用于解决多无人机/机器人协同围捕问题. Singh等[11]采用多智能体深度确定性策略梯度方法(multi-agent deep deterministic policy gradient, MADDPG) 直接训练追击者的围捕策略, 在无障碍物且不考虑追击者间碰撞的简单环境下, 围捕成功率接近100%, 但其未考虑围捕过程中追击者之间的避碰与避障问题. Zhang等[12]将深度强化学习与改进的人工势场法相结合, 提出了一种分布式的多机器人协同围捕方法, 该方法在围捕表现上优于传统的强化学习与人工势场法, 但其假设追击者与目标均以恒定速度运动, 这不太符合现实需求. De Souza等[13]在训练追击者的策略网络时, 通过缩小捕获半径, 增大目标相对于追击者的运动速度, 使智能体逐渐学会复杂的围捕策略, 但其设定所有追击者状态是全程可知的, 未引入智能体感知能力的约束.

为此, 本文聚焦复杂障碍环境下的多无人机围捕问题, 提出了一种基于子策略自主切换的分层深度强化学习方法(sub-policy autonomous switching based hierarchical DRL, SASHDRL). 该方法使用基于技能 (skilled-based) 的分层强化学习 (hierarchical DRL, HDRL)[14–15]作为基本框架, 相较于传统的不分层强化学习方法, 该方法具有以下优势: 1) 学习子策略比学习总任务难度更小, 分层有助于降低学习问题的复杂程度; 2) 借助分层架构, 智能体能更快学习底层子策略并用其构建更复杂的高层策略, 有助于提升探索效率, 加速方法收敛; 3) 智能体在不同任务环境中学习不同的子策略, 方法的任务适应性更强; 4) 通过分析高层策略对底层子策略的调用, 方法能够提供清晰、可解释的学习过程. 具体而言, 方法通过将协同围捕任务分解为智能体导航避障、导航避碰两个关联性极强的子任务(技能), 分而治之, 有效降低了围捕策略的学习难度, 提高了任务适应性. 此外, 设计与任务相关的稀疏回报函数, 并引入子策略切换惩罚, 训练子策略切换模块. 该模块能够基于当前态势灵活选择最佳子策略, 缓解了基于技能的HDRL在技能组合时潜在的局部极小问题. 仿真实验结果表明, 所提方法在围捕成功率、碰撞率、适应性等方面具有显著优势.

结论

针对复杂障碍环境下多无人机对运动目标的围捕问题, 提出了一种基于分层深度强化学习的多无人机围捕方法SASHDRL. 首先在强化学习背景下, 对无人机协同围捕任务进行形式化描述, 建立Dec-POMDP模型. 采用基于技能的分层强化学习框架, 分别设计并实现了底层和高层策略的学习算法, 先用稠密回报训练出导航避障与导航避碰两个子策略, 分别实现了无人机围捕过程中的避障与避碰; 再用与任务相关的稀疏回报训练子策略切换模块, 负责根据当前态势选择合适的底层子策略, 有效缓解了稠密回报导致的局部极小问题. 最后, 开展了数值仿真与软件在环实验.结果表明, SASHDRL算法能够在复杂障碍环境下高效完成协同围捕任务, 具有较好的实用性和泛化能力. 在未来的研究中, 希望进一步挖掘HDRL强大的策略学习能力, 将本文方法拓展适配至无显式目标分配的多追击者围捕多目标的复杂三维场景.

作者简介

孙懿豪  博士研究生, 主要研究方向为无人机集群分布式决策技术;

闫   超  副研究员, 博士, 主要研究方向为无人机集群控制;

相晓嘉  研究员, 博士生导师, 主要研究方向为无人系统技术;

唐邓清  副研究员, 博士, 主要研究方向为无人机感知技术;

周   晗  副教授, 博士, 主要研究方向为无人系统协同控制;

姜   杰  中国科学院院士, 博士生导师, 主要研究方向为导航制导与控制、运载火箭总体设计.

期刊介绍

《控制理论与应用》(Control Theory & Applications)是经国家科学技术部批准, 教育部主管, 由华南理工大学和中国科学院数学与系统科学研究院联合主办的全国性一级学术刊物, 1984年创刊, 月刊, 国内外公开发行. 《控制理论与应用》是中国科学引文数据库首批统计源期刊之一,中文核心期刊,入选中国精品科技期刊顶尖学术论文F5000项目,中国科协自动化学科领域高质量科技期刊目录以及中国科协百篇优秀科技论文遴选计划,2021年入选广东省高质量科技期刊建设项目,2022-2024年连续获得基金委资助(科技活动专项)。

期刊封面2.jpg目录2.jpg

【收录】

目前被美国《工程索引》(Ei Compendex)、SCOPUS、CSCD、美国的《化学文摘》(CA)、英国《科学文摘》(Inspec)、德国《数学文摘》、俄罗斯《文摘杂志》(AJ)、《日本科学技术振兴机构中国文献数据库》等国内外检索系统收录。

官网:https://jcta.ijournals.cn/cta_cn/ch/index.aspx

知网优先发表:https://navi.cnki.net/knavi/journals/KZLY/detail

投稿:https://jcta.ijournals.cn/cta_cn/ch/author/login.aspx

微信:控制理论与应用

视频号:控制理论与应用

科学网博客:http://blog.sciencenet.cn/u/CTACTT

小红书:控制理论与应用(ID:8742781006)

Email:aukzllyy@scut.edu.cn   

Tel:020-8711 1464

公众号二维码.jpg

欢迎扫码关注控制理论与应用公众号

【2024-2026年期刊合集】

2026年第43卷第7期

2026年第43卷第6期

2026年第43卷第5期

2026年第43卷第4期

2026年第43卷第3期

2026年第43卷第2期

2026年第43卷第1期(“非线性系统与控制”专刊)

2025年第42卷第12期(“智能决策与预测控制”专刊)

2025年第42卷第11期(“新一代智能优化理论方法与应用暨纪念郑大钟教授诞辰90周年”专刊)

2025年第42卷第10期

2025年第42卷第9期

2025年第42卷第8期

2025年第42卷第7期

2025年第42卷第6期

2025年第42卷第5期

2025年第42卷第4期

2025年第42卷第3期

2025年第42卷第2期

2025年第42卷第1期



https://blog.sciencenet.cn/blog-3633987-1549997.html

上一篇:2025年度最佳论文奖 | 切换拓扑下多智能体的动态事件触发固定时间一致性控制
下一篇:2025年度最佳论文奖 | 空间机器人预设性能约束下的鲁棒跟踪控制



    
收藏 IP: 218.192.172.*| 热度|

0

该博文允许注册用户评论 请点击登录 评论 (0 个评论)

数据加载中...

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )

GMT+8, 2026-9-3 15:02

Powered by ScienceNet.cn

Copyright © 2007- 中国科学报社

返回顶部